{"as_of":"2026-08-07T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3be7781c7f266735aeb465e154958f6d05f8a3db53e6b6afdad9d48256a89366","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:33:25.016687Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13690/citation-record","integrity":"/paper/2506.13690/integrity","json":"/paper/2506.13690/citation-record.json","paper":"/paper/2506.13690"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.784818Z","title":"Mas- tering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.784818Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:5822ad9d7191ef290df285fa8750d2695c77947ac7d757f886cb3ff99fc8dfca","observation_id":"c032ebbc-9c2e-46ee-a361-fe1d88d5b00b","resolution":{"observed_at":"2026-08-07T00:33:24.784818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.815439Z","title":"Czarnecki, Michaël Mathieu, Andrew Dudzik, Junyoung Chung, David H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.815439Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:ebe1ad5ae82c111dcc9147930c2e1049b5a65d0605390b0433972cedb8a557be","observation_id":"5293bb1b-0cb6-4997-8349-c0e0c202749c","resolution":{"observed_at":"2026-08-07T00:33:24.815439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T00:33:24.820678Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.820678Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:0a5783877986a2c905fec9beac3997d6b74c3fd87e363a069fd509b3d0f3d0a6","observation_id":"efaa988e-376d-495e-b48f-edcb56b3070a","resolution":{"observed_at":"2026-08-07T00:33:24.820678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:28.714154Z","title":"Autonomous navigation of stratospheric balloons using reinforcement learning","venue":null,"work_id":"d4517ee4-28d8-42f1-8ff9-6fb4641f81f9","year":2020},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.824827Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:f523b1c2f74126846354c5bd5308db17f45269c845ab87a043361eed372d550a","observation_id":"1550dea7-2e6d-4b8a-8c3e-723b6dcf7f3e","resolution":{"observed_at":"2026-08-07T00:33:28.860074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:28.521201Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":"a74f4a61-dbbb-4fd7-982d-cda1f94903b3","year":2022},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.834321Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:eb467d12c60ad757bff1fcaa1a08f226176e97d6ae5f1cad98f985ae4ed6c48c","observation_id":"e134d38b-7f0c-48d9-8251-0e86ca64c058","resolution":{"observed_at":"2026-08-07T00:33:28.618915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:28.304875Z","title":null,"venue":null,"work_id":"e306126a-aec2-44d2-b8ec-a5ed24ee2d85","year":2022},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.838471Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:cdfcb88ef921b875d363afe6fc3d664c9de4897ad64c6fb4ce3ce7318c9b66a7","observation_id":"b97099db-f115-465c-869a-d62877af7863","resolution":{"observed_at":"2026-08-07T00:33:28.416804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:28.065941Z","title":"Hierarchical solution of markov decision processes using macro-actions","venue":null,"work_id":"907a27b0-19d9-410e-8459-4aa19fc31c34","year":1998},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.847801Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:6d1d73c80b6637e43a87c3713331bdd3f14bed9d03f2174df89d6555d3ef6b40","observation_id":"89f20de9-1747-46ab-b6b9-641b87c887f6","resolution":{"observed_at":"2026-08-07T00:33:28.120610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.851769Z","title":"Fikes and Nils J","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.851769Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:4db58de6487df863cc9e07fba1bc7bec1d920f2e57d766a037bcd5cb31c614ef","observation_id":"d911cf51-915f-40ee-a8f0-d1eec8604439","resolution":{"observed_at":"2026-08-07T00:33:24.851769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:27.967896Z","title":null,"venue":null,"work_id":"5d75cf78-bae6-4fe1-a291-396945422bf6","year":2007},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.855868Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:083bb3d177dd8c4fd1e8dfdb5c19f2d6051294665364219ceb9a2bba338b514d","observation_id":"6d934cc5-c425-4162-9b9f-d21b743f5ae3","resolution":{"observed_at":"2026-08-07T00:33:28.020322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:27.737268Z","title":"Durugkar, Clemens Rosenbaum, Stefan Dernbach, and Sridhar Mahadevan","venue":null,"work_id":"414dbf36-ba72-485d-b99f-8f4bd71ce3aa","year":2016},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.859868Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:5b50504134a54f331be87b96e2e65855674650d225460daab39a8e949b3217fc","observation_id":"10a3d0ce-5480-461f-abac-770f3db7d5b3","resolution":{"observed_at":"2026-08-07T00:33:27.845972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:27.505184Z","title":"Rainbow: Combining improve- ments in deep reinforcement learning","venue":null,"work_id":"5005750d-36da-4d7d-859a-2680681aef3d","year":2018},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.863690Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:5bb1184befca863a8169e5d6d5b9acfc2fa75398a26313be53937daf1a158cfe","observation_id":"bd294195-f6c9-4baa-9985-dd1a27100afa","resolution":{"observed_at":"2026-08-07T00:33:27.642436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:27.205278Z","title":"Learning macro-actions in reinforcement learning","venue":null,"work_id":"e2852064-61e1-4829-b00f-a1d009252917","year":1998},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.867588Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:5cb6fccfb9cd122e96e23eba1a3237cf1d6bc077edd0dfc291e5a0cf691f72f8","observation_id":"43c626f0-e847-4ef6-b22b-87cd80632f26","resolution":{"observed_at":"2026-08-07T00:33:27.346950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:27.024744Z","title":"Macro-actions in reinforcement learning: An empirical analysis","venue":null,"work_id":"b20e795c-8b75-4dee-99c1-90d9c0b8f74d","year":1998},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.871801Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:5d3b70cfefcb1875d9190547c6945754afb9500b3c4bfecd27e835cea92f5a9d","observation_id":"f83086f3-342b-4f35-96e1-961be60390b2","resolution":{"observed_at":"2026-08-07T00:33:27.134155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.849397Z","title":"Meta learning shared hierarchies","venue":null,"work_id":"99c23995-de9b-419e-aea4-e5b828425696","year":2018},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.876353Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:79464905689ae0fe80f69a69c0c95e899929bff4881341b7a151b92c15c10974","observation_id":"aff8175a-875f-48c2-adaf-321be739ae24","resolution":{"observed_at":"2026-08-07T00:33:26.896757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11930","last_updated":"2024-12-16T16:15:36Z","snapshot_observed_at":"2026-08-04T00:53:58.206318Z","submitted_at":"2024-12-16T16:15:36Z","title":"Hierarchical Meta-Reinforcement Learning via Automated Macro-Action Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11930","snapshot_observed_at":"2026-08-07T00:33:24.881222Z","title":"Hierarchical meta-reinforcement learning via automated macro-action discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.881222Z"},"links":{"cited_paper":"/paper/2412.11930","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:824249d35d8dc9a53eb2234f4fbd2dad00863e45d8ec160e0df24b7eb289acc4","observation_id":"e1bf3579-d282-4194-b486-5fac2345c4ce","resolution":{"observed_at":"2026-08-07T00:33:24.881222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.684751Z","title":"Deep reinforcement learning for decentralized multi-robot exploration with macro actions","venue":null,"work_id":"0b7d80e8-e221-486d-b28f-31fb47664c6f","year":2022},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.885488Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:627ce356d0b9ad20beafe8d562445a4315f9e49792f896b2be561d0ad1dcf8d0","observation_id":"dacd4186-125f-479b-aaf4-cf4c4eaf1a89","resolution":{"observed_at":"2026-08-07T00:33:26.767158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.486314Z","title":"Macro-Action-Based Multi-Agent/Robot Deep Reinforcement Learning under Partial Observability","venue":null,"work_id":"3448005b-852f-47e9-b892-891ef1407d98","year":2022},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.890230Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:c0b7df367e5772e38d5f989166ef86a635f83185516fb538b665c37a500992b2","observation_id":"70379299-e73c-4cc0-9a69-730e3e2b758f","resolution":{"observed_at":"2026-08-07T00:33:26.537499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.314921Z","title":"Unlocking new strategies: Intrinsic exploration for evolving macro and micro actions","venue":null,"work_id":"1f9229cf-00bb-4d3c-8fab-e8a58291f6dd","year":2024},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.893857Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:1f8e8bed252e2b630f1968f5b4e3bc8c2b27781899e4d5c6c2a0686c753ead4d","observation_id":"cd121df8-6703-47da-97dd-62af7a387c5c","resolution":{"observed_at":"2026-08-07T00:33:26.359326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01478","last_updated":"2022-04-28T12:43:25Z","snapshot_observed_at":"2026-07-30T11:51:12.115920Z","submitted_at":"2019-08-05T05:59:40Z","title":"Reusability and Transferability of Macro Actions for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.01478","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.01478","snapshot_observed_at":"2026-08-07T00:33:25.223550Z","title":"Reusability and Transferability of Macro Actions for Reinforcement Learning","venue":"cs.NE","work_id":"3116822e-ed7c-48db-9dce-dca050079034","year":2019},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.897577Z"},"links":{"cited_paper":"/paper/1908.01478","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:69eaedfa72ee1a767639793cf8dde21df364c16058c75a9ba9a51391449fc106","observation_id":"08dc6753-272d-4a80-9ee9-df5b85750ee3","resolution":{"observed_at":"2026-08-07T00:33:25.228396Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13242","last_updated":"2021-06-23T19:38:24Z","snapshot_observed_at":"2026-07-06T09:15:43.828805Z","submitted_at":"2020-04-28T02:13:12Z","title":"Efficient Black-Box Planning Using Macro-Actions with Focused Effects","version":3},"cited_work":{"arxiv_id":"2004.13242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.13242","snapshot_observed_at":"2026-08-07T00:33:25.191988Z","title":"Efficient Black-Box Planning Using Macro-Actions with Focused Effects","venue":"cs.AI","work_id":"4ab57df5-983a-4104-902c-e5749ac9e4de","year":2020},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.901782Z"},"links":{"cited_paper":"/paper/2004.13242","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:caa053ec9582d6607e3277503993cb71366ea9f29b5760d832f6c460d457a817","observation_id":"ebba5e75-b913-477f-9a69-37e3efbe2511","resolution":{"observed_at":"2026-08-07T00:33:25.197756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.251757Z","title":"Learning macro-actions for arbitrary planners and domains","venue":null,"work_id":"f6d4a514-0fef-4060-a1c5-595d93ece97a","year":2007},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.906030Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:82ff2449b10287056e441b8e744b0e4f83e14273dd5770a820ecb306bc80f4c1","observation_id":"fa82daaf-83d0-41d2-a3f4-192602222500","resolution":{"observed_at":"2026-08-07T00:33:26.275840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.174748Z","title":"Modeling and planning with macro-actions in decentralized pomdps","venue":null,"work_id":"1220f179-c21e-4b17-8263-5f19b32aff72","year":2019},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.909481Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:61e742304e537170a4818bb5d667990006a31db0a42cc6d0ba2e48e8d186bbf7","observation_id":"e5866fb1-179f-47e0-9711-492435eb9a86","resolution":{"observed_at":"2026-08-07T00:33:26.202469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.03813","last_updated":"2021-07-01T06:04:09Z","snapshot_observed_at":"2026-07-06T10:12:32.314726Z","submitted_at":"2020-11-07T17:18:45Z","title":"MAGIC: Learning Macro-Actions for Online POMDP Planning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.03813","snapshot_observed_at":"2026-08-07T00:33:24.917700Z","title":"Magic: Learning macro-actions for online pomdp planning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.917700Z"},"links":{"cited_paper":"/paper/2011.03813","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:78635889aa7249667ff3855bfc1ad78046e68a0db5c40ef62640b269fff534a0","observation_id":"33e48015-0851-484f-b36e-d3619ed0a3b5","resolution":{"observed_at":"2026-08-07T00:33:24.917700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18300","last_updated":"2025-04-25T12:19:35Z","snapshot_observed_at":"2026-08-07T15:59:13.523536Z","submitted_at":"2025-04-25T12:19:35Z","title":"Deep Reinforcement Learning Based Navigation with Macro Actions and Topological Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18300","snapshot_observed_at":"2026-08-07T00:33:24.924438Z","title":"Deep reinforcement learning based navigation with macro actions and topological maps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.924438Z"},"links":{"cited_paper":"/paper/2504.18300","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:c5d6a28b3b73ae12a0654b94a212ce2edebb1a2b6d6b3bb594eb07cf0e42b5e6","observation_id":"d8b605d1-db0b-4be6-8d9c-0fecf3c76f89","resolution":{"observed_at":"2026-08-07T00:33:24.924438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.928615Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.928615Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:ebc7c8ee0a411926ddf3250a3fe233e40c80dea44bf054393537212309183cfc","observation_id":"7b78c45f-3d47-4264-aa80-9701fb320388","resolution":{"observed_at":"2026-08-07T00:33:24.928615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:26.024839Z","title":"Bellemare, Will Dabney, and Rémi Munos","venue":null,"work_id":"8b99319c-4fc3-43cb-98b3-121f70656cc5","year":2017},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.932262Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:b420e2456d93f00624172cf56007bbb3c4edcb1775e9e3dd47e4da7ca7f52621","observation_id":"2dd9f7fc-0919-41ec-8840-80b3e8c53152","resolution":{"observed_at":"2026-08-07T00:33:26.074752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:25.880419Z","title":null,"venue":null,"work_id":"1e7ff28d-c22e-4c91-aa3e-0f35574019b2","year":2018},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.936341Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:aec5727a6c7edf22774a4cc5a769d306f3918929bf2676a9c7e2a6fe70330802","observation_id":"3938a167-c961-4f21-bd21-b3c6b175e0e0","resolution":{"observed_at":"2026-08-07T00:33:25.914748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T00:33:24.940102Z","title":"Schaul, John Quan, Ioannis Antonoglou, and D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.940102Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:7ee5074a03c7216b2a7c8ae04fa63273f64db7580cd5286479b1effc43430ba8","observation_id":"e52ef023-d402-4c67-9239-969339b33889","resolution":{"observed_at":"2026-08-07T00:33:24.940102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.944182Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.944182Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:4e91750e6ea1bbcb1841497ceb7bbf3b664d95a0209b5190e4d8e35338c88959","observation_id":"23c92e8c-3033-433a-b610-33cdbee5ce27","resolution":{"observed_at":"2026-08-07T00:33:24.944182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.948639Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.948639Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:5afef57cab0bedf24a6fc1f1710e6f8e8fa179ed359414c12f45d2504a88cd1f","observation_id":"32133ac0-1f1e-44bb-ac77-14e07dfc6df8","resolution":{"observed_at":"2026-08-07T00:33:24.948639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.10295","last_updated":"2019-07-09T09:57:23Z","snapshot_observed_at":"2026-07-06T05:49:17.299252Z","submitted_at":"2017-06-30T17:56:19Z","title":"Noisy Networks for Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.10295","snapshot_observed_at":"2026-08-07T00:33:24.952368Z","title":"Piot, Jacob Menick, Ian Osband, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.952368Z"},"links":{"cited_paper":"/paper/1706.10295","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:6a0bc8625f803f1c2a85eb2cb6620880590a675f271ea3a1433cd74373c0a796","observation_id":"da0d07e9-62a7-43c6-8d8d-cbae40b1b60c","resolution":{"observed_at":"2026-08-07T00:33:24.952368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:25.642325Z","title":"Meta-gradient reinforcement learning","venue":null,"work_id":"de192d11-6174-4b1f-bd53-9533b288fe19","year":2018},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.956996Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:f8362d4d319113f83c65b52a30091b99ef1355e7808e272de5990d81d1402bc1","observation_id":"783e554d-9d9f-441d-8ac5-76e368f69599","resolution":{"observed_at":"2026-08-07T00:33:25.665399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:25.549343Z","title":"Universal value function approxima- tors","venue":null,"work_id":"aa4986fc-fc2e-4acd-abf6-5aaadeab5ca2","year":2015},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.967341Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:56fa7d7f8c70b855c3b65b23a3ce63059d41d2a1b7c557374418e49a4491f4f7","observation_id":"73968742-7555-49a2-9de1-b2ba74f34a83","resolution":{"observed_at":"2026-08-07T00:33:25.559712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:24.972757Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.972757Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:bf731a25dff9426b78cbf486fed3a3a9829397c0274c86a60aa30b0443016d58","observation_id":"288709fa-0c4b-49f7-b2d3-d811e4c5cf4f","resolution":{"observed_at":"2026-08-07T00:33:24.972757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T00:33:24.980907Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.980907Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:2c67cef36fd5b022ed6364cc4f6b6c43d55781517171079b0227a9682166a417","observation_id":"a756d7de-1916-4c1b-a497-9b7424264729","resolution":{"observed_at":"2026-08-07T00:33:24.980907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10998","last_updated":"2017-05-31T09:08:36Z","snapshot_observed_at":"2026-08-04T21:12:35.368296Z","submitted_at":"2017-05-31T09:08:36Z","title":"The Atari Grand Challenge Dataset","version":1},"cited_work":{"arxiv_id":"1705.10998","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.10998","snapshot_observed_at":"2026-08-07T00:33:25.050649Z","title":"The Atari Grand Challenge Dataset","venue":"cs.AI","work_id":"566030a4-acd9-43e8-be16-ac412e75950e","year":2017},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:24.996820Z"},"links":{"cited_paper":"/paper/1705.10998","citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:1c67461e408037470c107e2f53c51ff60667397f0e61b60e413897cc4b469412","observation_id":"4a619404-64c9-49f3-990e-b2e22582241b","resolution":{"observed_at":"2026-08-07T00:33:25.057740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:25.500348Z","title":"Gym-minigrid: Minimalistic gridworld environment for openai gym","venue":null,"work_id":"8ffde57d-c739-4be9-a126-5bb3b09239ca","year":2018},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:25.001724Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:88427ff896d23d31fa3bb0c4f769c5dcb596fa871cc87f98703e905542948942","observation_id":"75bbc518-cc62-4693-b51f-183392014552","resolution":{"observed_at":"2026-08-07T00:33:25.504282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:25.484759Z","title":"- Perform a standard TD update with the MASP penalty, updating θ → θ′ using Σ fixed","venue":null,"work_id":"5018820e-3754-40fb-a18b-f881911c93fa","year":null},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:25.005793Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:4e6d7c6f4c5dcb110b15f5371a4b04d58d08ba0166a19940f7d142d2414a018e","observation_id":"bfe23e56-c531-443b-a03e-b43f469d379a","resolution":{"observed_at":"2026-08-07T00:33:25.489509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:25.442466Z","title":"- Evaluate the performance of the updated θ′ using a meta-objective (the standard TD loss)","venue":null,"work_id":"0e6e489e-ff7e-4332-89d9-4c0698e3ad4d","year":null},"citing_paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:25.016687Z"},"links":{"citing_paper":"/paper/2506.13690"},"observation_digest":"sha256:33f4dc179edeb71ab4b4ac15d504242dc2a5832e9c5018352b68c95146b9ce68","observation_id":"e3f33879-12df-4e55-8281-c15b9750d088","resolution":{"observed_at":"2026-08-07T00:33:25.449892Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13690","last_updated":"2025-06-16T16:52:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:25:15.453757Z","submitted_at":"2025-06-16T16:52:49Z","title":"Meta-learning how to Share Credit among Macro-Actions"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.13690."}