{"as_of":"2026-08-05T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab735cea613e14c022f686f396b38fd3e4fceb1c756e653382257d35f4f2f499","coverage":[{"denominator":284,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T11:33:20.892688Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":229,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:39:57.880351Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":19,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:f16d028596cab1514bea68c730a239ee3f5f9534009e52ded4b5d3dfaf6317f4","observation_id":"b1bc3922-d0e6-40bc-89f5-08672e92a0da","resolution":{"observed_at":"2026-05-12T23:19:17.449574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-07-06T11:15:20.397336Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:c99f20253302bdb57f60e3f68041daf2ac507ac1a6abdc9ca4bb962a3cff0444","observation_id":"67458dd5-8f57-4ddb-bd19-04980927a21b","resolution":{"observed_at":"2026-05-18T15:11:11.344917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:52890e6375039eee114bf2ba5f4635c161377104ee8eb44a5f0cacc49447c081","observation_id":"ccee5352-07a0-494c-b973-e2f5fc11e219","resolution":{"observed_at":"2026-05-13T08:51:55.877106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T04:42:52.627166Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2210.00030"},"observation_digest":"sha256:5373b47478ef4057f09ee53435d3ad9a52b879d2b9a9e8300b2faacaa4b62686","observation_id":"03bee1b7-29d0-421c-a60e-cd7edc4a9e25","resolution":{"observed_at":"2026-05-15T04:42:52.738375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:5a1abe78310879d5a6eff5e10959772b504a00b006829e20d0298c62303569c5","observation_id":"94e12715-8977-40b8-aea8-de7e1433cefa","resolution":{"observed_at":"2026-05-13T13:48:36.515834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T17:40:27.827493Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2306.08543"},"observation_digest":"sha256:0128e33f2fc5ed61e2f5ba05b02f0edecae57d1614fc36986d1aa6120b3fe356","observation_id":"230da3f9-9d98-4a05-adfa-58a638b57531","resolution":{"observed_at":"2026-05-12T17:40:27.920802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2310.17245","last_updated":"2026-04-13T15:52:28Z","snapshot_observed_at":"2026-07-06T16:38:48.736281Z","submitted_at":"2023-10-26T08:45:23Z","title":"CROP: Conservative Reward for Model-based Offline Policy Optimization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-24T06:37:57.104233Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2310.17245"},"observation_digest":"sha256:d892b2e45d2ae685567709fe1f1905ac88944167abf771a25571aac3907e76bb","observation_id":"15b3fab1-a780-4cf7-982b-c213faa7ef53","resolution":{"observed_at":"2026-05-24T06:39:01.288888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T09:47:54.977716Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2310.17596"},"observation_digest":"sha256:0a12d2f2f8e08a720f8817fc0692849aedd66b08401e6619346657a58c6c3a89","observation_id":"00bd38f2-6fad-4a31-85ac-22977eb76bed","resolution":{"observed_at":"2026-05-17T09:47:55.083411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2311.01468","last_updated":"2023-10-30T19:29:00Z","snapshot_observed_at":"2026-08-02T18:45:20.640717Z","submitted_at":"2023-10-30T19:29:00Z","title":"Remember what you did so you know what to do next","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-25T08:20:54.753641Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2311.01468"},"observation_digest":"sha256:d18467331c3a7277eb390a9a5db741beac62469bda8dd61dc0289dd7b6e8ac44","observation_id":"a0d5459e-2f70-4cd1-ad06-11e95c3c0290","resolution":{"observed_at":"2026-05-25T08:25:33.818549Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T23:46:30.198761Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2406.02523"},"observation_digest":"sha256:aa1234d2f194a614327fb212fd52916f15379660cc01e6a82e7fc13a2cd1238e","observation_id":"bcddf5fb-13ae-4edb-898a-605610b07764","resolution":{"observed_at":"2026-05-12T23:46:30.288548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2410.11282","last_updated":"2026-05-16T04:55:03Z","snapshot_observed_at":"2026-08-02T20:12:37.951422Z","submitted_at":"2024-10-15T05:05:44Z","title":"Multi-Objective-Optimization Assisted Data Collection Framework for IoUT Based on Offline Reinforcement","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T19:09:56.559531Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2410.11282"},"observation_digest":"sha256:ba6f034cc6ad1ed18e18b73f1aae1aa76e0950a3b5f1c62550a8659cf767bee8","observation_id":"04116204-3098-4c78-a6b0-3049b13ff9de","resolution":{"observed_at":"2026-05-23T19:13:21.908396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2411.08126","last_updated":"2026-05-21T14:13:15Z","snapshot_observed_at":"2026-08-03T04:28:54.097241Z","submitted_at":"2024-11-12T19:09:41Z","title":"A Tale of Two Cities: Pessimism and Opportunism in Offline Dynamic Pricing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T17:38:17.004171Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2411.08126"},"observation_digest":"sha256:0304ed96bb515a31f9d6164d45e98596a90dab4601d4f5faa01061e735c554ef","observation_id":"f19f4684-9397-4f86-867c-52b14d28a2b1","resolution":{"observed_at":"2026-05-23T17:43:17.889714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2501.16098","last_updated":"2026-04-22T11:50:40Z","snapshot_observed_at":"2026-08-02T11:55:05.513491Z","submitted_at":"2025-01-27T14:47:19Z","title":"Meta-Offline and Distributional Multi-Agent RL for Risk-Aware Decision-Making","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T05:08:26.606825Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.16098"},"observation_digest":"sha256:ed5e1e4646b8abae8bc5b0b6958d31eb9565c83aaf4f8608101d824286d75e80","observation_id":"97fa3e47-0c49-4e9f-b1ee-8f7439296c38","resolution":{"observed_at":"2026-05-23T05:12:34.919542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2502.16156","last_updated":"2025-02-22T09:17:02Z","snapshot_observed_at":"2026-07-06T20:40:57.414593Z","submitted_at":"2025-02-22T09:17:02Z","title":"A Review of Causal Decision Making","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T02:47:21.582667Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2502.16156"},"observation_digest":"sha256:5beb8e18ce2329f033a0c1e7793dc2af920338c385b86d7b5907ae92bd85a5b0","observation_id":"37b2b7a1-cb1f-4ef4-9fc1-0ed1aa40400c","resolution":{"observed_at":"2026-05-23T02:47:26.265952Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2504.11944","last_updated":"2026-05-13T09:05:56Z","snapshot_observed_at":"2026-07-06T21:10:18.015145Z","submitted_at":"2025-04-16T10:23:44Z","title":"VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T19:34:33.263674Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2504.11944"},"observation_digest":"sha256:e32f298a38cf61687efa88e307d7145071641809bf909e3df3aa8ffcc7277337","observation_id":"0aa23041-a176-4a0e-8f20-38976287eb82","resolution":{"observed_at":"2026-05-22T19:35:03.977055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2505.17506","last_updated":"2026-05-12T07:45:35Z","snapshot_observed_at":"2026-07-06T21:29:02.122081Z","submitted_at":"2025-05-23T06:00:01Z","title":"Offline Constrained Reinforcement Learning under Partial Data Coverage","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T14:18:48.007454Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.17506"},"observation_digest":"sha256:ecb0d1c78d0292b913567bca20e6521b120ed6e62f2b7a711b75819f6d734a2d","observation_id":"b9da10df-a74c-4cec-83fd-3d14da4f5134","resolution":{"observed_at":"2026-05-19T14:22:24.068643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2506.05762","last_updated":"2026-05-14T17:01:38Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T05:41:33Z","title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T10:48:28.980868Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.05762"},"observation_digest":"sha256:f599cfb9de60852cedba932adb9da5bdb4342a387d907b3ce83a769857b15069","observation_id":"b21890e2-3a96-40fe-b354-5b868aa601e0","resolution":{"observed_at":"2026-05-19T10:52:15.246580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2506.10137","last_updated":"2026-04-19T14:49:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T19:32:41Z","title":"Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T09:15:45.511104Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.10137"},"observation_digest":"sha256:6cfc24dec828bd554c2ce038c38c07d03c2a6c18e1ffc5b1dc0a9f09b7889c2f","observation_id":"2fbac1f2-4a0e-47b7-a636-c258239421ce","resolution":{"observed_at":"2026-05-19T09:17:14.217433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-02T08:39:49.062624Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:8044f06b18bf20f642770718ddba9fc53f6a158a86e07bf63353883bf31b68f8","observation_id":"1a90a0e5-82de-450c-8ab6-40cc06427cbe","resolution":{"observed_at":"2026-05-21T23:40:46.464894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T11:39:57.880351Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02458","last_updated":"2025-09-02T16:09:02Z","snapshot_observed_at":"2026-08-05T11:39:57.280530Z","submitted_at":"2025-09-02T16:09:02Z","title":"Generative Sequential Notification Optimization via Multi-Objective Decision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:39:57.880351Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2509.02458"},"observation_digest":"sha256:8366e508fd8cde77df9286a1ecaaadb38ca5b094c98d6650ad5835f81cb56ed2","observation_id":"dfd9504e-4c08-4393-b1a9-432863d59bce","resolution":{"observed_at":"2026-08-05T11:39:57.880351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T23:04:16.944975Z","title":", author Kumar, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.06853","last_updated":"2025-09-08T16:21:11Z","snapshot_observed_at":"2026-08-04T23:04:07.886673Z","submitted_at":"2025-09-08T16:21:11Z","title":"Reinforcement learning meets bioprocess control through behaviour cloning: Real-world deployment in an industrial photobioreactor","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T23:04:16.944975Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2509.06853"},"observation_digest":"sha256:916cd86891cff6bd2bbc1c0d9354a5da7561da26a7a038de4654793b4952d60a","observation_id":"722d2c77-9226-4913-90dc-3c73ee52b394","resolution":{"observed_at":"2026-08-04T23:04:16.944975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T10:30:59.055699Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.19305","last_updated":"2026-06-02T14:25:30Z","snapshot_observed_at":"2026-08-05T10:30:58.593853Z","submitted_at":"2025-09-04T08:50:31Z","title":"Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:30:59.055699Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2509.19305"},"observation_digest":"sha256:160c03a4cbd21941991952928c65c7f7042d947dc8cf4b9607528b6b98e3a54a","observation_id":"55c5924b-a1cb-4929-8e47-abb71b374845","resolution":{"observed_at":"2026-08-05T10:30:59.055699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T14:58:36.786424Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-04T14:58:34.574750Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.786424Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:d34eea38eb4874a48f9e54b894acf79190bb5976528521116d5fe8b8735b976c","observation_id":"54cacf35-c3c2-465d-a4e0-e4b79061e6bc","resolution":{"observed_at":"2026-08-04T14:58:36.786424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T13:00:07.505888Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-04T12:59:59.479449Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:07.505888Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:4860bb44355b9e5107e52969ceee344de4b41c5ce5e2d62f3e128e86c0bf6898","observation_id":"5fa3a69c-1c3a-49d6-abe8-1b2a4bd32e81","resolution":{"observed_at":"2026-08-04T13:00:07.505888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T12:56:15.017647Z","title":"Levine, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.01475","last_updated":"2026-07-16T23:20:03Z","snapshot_observed_at":"2026-08-04T12:56:09.817417Z","submitted_at":"2025-10-01T21:36:04Z","title":"Comparative Field Deployment of Reinforcement Learning and Model Predictive Control for Residential HVAC","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T12:56:15.017647Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.01475"},"observation_digest":"sha256:9207036a8ae22426b22a4355a9335e8035d994f03f6a1a25e53bae0b452984a9","observation_id":"aab9c65b-3ee7-438f-8ac7-dcbd634937b6","resolution":{"observed_at":"2026-08-04T12:56:15.017647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2510.01479","last_updated":"2026-05-17T15:36:55Z","snapshot_observed_at":"2026-07-06T22:31:24.978726Z","submitted_at":"2025-10-01T21:43:04Z","title":"Density-Ratio Weighted Behavioral Cloning: Learning Control Policies from Corrupted Datasets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T20:52:08.062450Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.01479"},"observation_digest":"sha256:4680a17430f9b4b9dc42b666baf351b10d519f6946a65628dd4789121bb80820","observation_id":"f6adef32-a557-4f37-a420-a78dad14b28b","resolution":{"observed_at":"2026-05-21T20:54:21.637716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T10:51:10.090896Z","title":"Levine, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.08350","last_updated":"2026-05-25T16:01:35Z","snapshot_observed_at":"2026-08-04T10:51:07.857836Z","submitted_at":"2025-10-09T15:37:56Z","title":"DeepEN: A Deep Reinforcement Learning Framework for Personalized Enteral Nutrition in Critical Care","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:51:10.090896Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.08350"},"observation_digest":"sha256:5b465da47b52692abafc090e50a50c301f92028f18fd2520a6b00fda40de121f","observation_id":"c5fa8801-c96a-4919-94b8-24471e516dac","resolution":{"observed_at":"2026-08-04T10:51:10.090896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2510.23026","last_updated":"2026-04-14T00:17:25Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-27T05:45:59Z","title":"Mixed-Density Diffuser: Efficient Planning with Non-Uniform Temporal Resolution","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T04:56:47.744306Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.23026"},"observation_digest":"sha256:ec094cf16691433b58576879defa287b480f561ca09c86b016313b4c5b9bb058","observation_id":"99e667d1-68b0-491c-a0f1-a3dc85b2110e","resolution":{"observed_at":"2026-05-18T05:00:54.923049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T08:03:19.816134Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.23216","last_updated":"2026-06-02T10:40:21Z","snapshot_observed_at":"2026-08-04T08:03:02.093431Z","submitted_at":"2025-10-27T11:06:00Z","title":"Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T08:03:19.816134Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.23216"},"observation_digest":"sha256:85f02c46678d121669b52a056fd9c8c97f56c8ac29d273a9c72e961467b99dd5","observation_id":"4e107a36-59c2-43d5-bbd7-e9b6dba8b038","resolution":{"observed_at":"2026-08-04T08:03:19.816134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T07:54:31.568689Z","title":"Offline reinforcement learning: Tuto- rial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.24108","last_updated":"2026-07-08T06:19:04Z","snapshot_observed_at":"2026-08-04T07:54:29.769176Z","submitted_at":"2025-10-28T06:26:36Z","title":"Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T07:54:31.568689Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.24108"},"observation_digest":"sha256:d48ee87eb6b951400d217040180c9a97dda9f393ffa3bd65bdd8c5552912153c","observation_id":"fc706218-b02e-4a30-8c44-20b76a4c55d4","resolution":{"observed_at":"2026-08-04T07:54:31.568689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2511.08236","last_updated":"2026-04-15T13:24:47Z","snapshot_observed_at":"2026-08-03T00:34:25.833956Z","submitted_at":"2025-11-11T13:35:10Z","title":"Stability of Certainty-Equivalent Adaptive LQR for Linear Systems with Unknown Time-Varying Parameters","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T23:57:37.299127Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2511.08236"},"observation_digest":"sha256:f11ed6d7982c933c36396a3b903b762704b76cbf91ad989868ad4e89d7c70505","observation_id":"9bd99190-6207-4cd0-b160-27a68062b4ac","resolution":{"observed_at":"2026-05-18T00:00:31.574994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:f24d2f0cad8483230b323b3487fec0d553b655aba94a8aef2206769036556c11","observation_id":"a8beca63-e9f0-4739-8ca2-675a1853e085","resolution":{"observed_at":"2026-05-12T10:34:59.242880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T19:26:22.911048Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.00919","last_updated":"2026-05-28T21:17:41Z","snapshot_observed_at":"2026-08-03T19:26:19.396753Z","submitted_at":"2025-11-30T14:54:03Z","title":"Outcome-Aware Spectral Feature Learning for Instrumental Variable Regression","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T19:26:22.911048Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2512.00919"},"observation_digest":"sha256:296b7f460807c5e5c0f58e38777b277ea44514ad613d94a460698ed48266b58e","observation_id":"381624a3-fd54-42a8-8cf0-9789245ee286","resolution":{"observed_at":"2026-08-03T19:26:22.911048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2512.04341","last_updated":"2026-05-01T06:11:28Z","snapshot_observed_at":"2026-07-31T11:39:06.488911Z","submitted_at":"2025-12-04T00:07:08Z","title":"Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:16.923948Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2512.04341"},"observation_digest":"sha256:ee45a7029a586fb3a8c11e52c48abd9dd341aca837de2df1f1f2fadca5fdd977","observation_id":"1355548b-b4e1-4464-aea1-bf78080d6e00","resolution":{"observed_at":"2026-05-17T01:48:51.134138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2512.18662","last_updated":"2026-04-09T10:12:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-21T09:21:04Z","title":"Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T20:45:30.382235Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2512.18662"},"observation_digest":"sha256:6172e100944f6254971ebb32c47eb625cc84e4d635acb32ee01822a771b9d617","observation_id":"ebe15c9c-7834-4c68-9801-01c5c0da807e","resolution":{"observed_at":"2026-05-16T20:48:32.649055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2512.20220","last_updated":"2026-04-25T10:30:49Z","snapshot_observed_at":"2026-07-06T22:39:52.837578Z","submitted_at":"2025-12-23T10:20:11Z","title":"Generalisation in Multitask Fitted Q-Iteration and Offline Q-learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T20:19:28.727598Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2512.20220"},"observation_digest":"sha256:c8ad44924df942850a50f53405233656fa7a6a315f2c9780715f257bda0e1189","observation_id":"a3c0d4c6-a65e-4d8d-8583-62085bf3c4cf","resolution":{"observed_at":"2026-05-16T20:21:13.582594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2601.11505","last_updated":"2026-04-22T03:54:41Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-16T18:38:33Z","title":"MetaboNet: The Largest Publicly Available Consolidated Dataset for Type 1 Diabetes Management","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T13:20:02.622343Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2601.11505"},"observation_digest":"sha256:40a24b7b4d47f61e49ae45a116fbb60aa4f82b9848460a65c5bdfa975ff2d558","observation_id":"7238425d-08c9-4eeb-9a6b-7d30bc83d945","resolution":{"observed_at":"2026-05-16T13:20:57.304198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T09:02:27.089561Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.15158","last_updated":"2026-06-03T13:13:08Z","snapshot_observed_at":"2026-08-03T09:02:20.300747Z","submitted_at":"2026-01-21T16:36:19Z","title":"Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:27.089561Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2601.15158"},"observation_digest":"sha256:8a3e62a5b42d7292e244a90b7a20714f2668bb49ba58d64b5b90f4f92899d22c","observation_id":"c40be30f-8a3a-46cb-a4b7-fc4eb8cfabb1","resolution":{"observed_at":"2026-08-03T09:02:27.089561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2601.23154","last_updated":"2026-05-16T14:56:10Z","snapshot_observed_at":"2026-07-06T22:43:45.998263Z","submitted_at":"2026-01-30T16:40:40Z","title":"On Safer Reinforcement Learning for Sedation and Analgesia in Intensive Care","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T13:36:12.920714Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2601.23154"},"observation_digest":"sha256:a2406496ee56429e5d21efece8fdb646c7589a436de49ace671e5f9ae1635bcf","observation_id":"9312abe6-38bd-44c6-844d-7373ed5e7670","resolution":{"observed_at":"2026-05-21T13:40:12.613570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2602.02236","last_updated":"2026-05-16T21:10:57Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T15:41:53Z","title":"Adaptive Control in Autonomous Driving via Real-Time Recurrent RL","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T13:47:12.875888Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.02236"},"observation_digest":"sha256:18cf3ffdbd7ab7b5c15d7b075a660907aca2b5d6ac4fa6787ddd85597dd45db8","observation_id":"92aec2ef-d032-4ea3-ab13-04374749dbd1","resolution":{"observed_at":"2026-05-21T13:50:12.734085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T04:18:40.519980Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.05459","last_updated":"2026-07-09T11:55:11Z","snapshot_observed_at":"2026-08-05T12:35:28.908640Z","submitted_at":"2026-02-05T09:08:17Z","title":"Beyond Success Rates: Trainability and Extractability for Offline GCRL","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:18:40.519980Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.05459"},"observation_digest":"sha256:110aee831ab6eee6b3b3dc9a566679f461a8f4fb5b5598495c2e953a3f8c548e","observation_id":"91a39f13-16cc-4343-b581-d8828b6e1951","resolution":{"observed_at":"2026-08-03T04:18:40.519980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T04:05:23.006057Z","title":"Offline rein- forcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-03T04:05:20.203602Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.006057Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:4e457dad096092838f1db2c37cbc995ab05053b68e11660df47cd61f8a31cce4","observation_id":"ee16f694-368e-4cf0-927c-23755537ff15","resolution":{"observed_at":"2026-08-03T04:05:23.006057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2602.06470","last_updated":"2026-06-17T03:51:53Z","snapshot_observed_at":"2026-08-03T04:00:15.683476Z","submitted_at":"2026-02-06T07:55:26Z","title":"Improve Large Language Model Systems with User Logs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T14:34:01.332088Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.06470"},"observation_digest":"sha256:f26cd85312d1ae147b90e5a632b1396516672a5a5a1fe36b9c98fa154c673b3a","observation_id":"f1abecfe-8b5f-49e6-8acd-95049ea199a3","resolution":{"observed_at":"2026-05-21T14:34:12.906138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T04:00:18.374520Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.06470","last_updated":"2026-06-17T03:51:53Z","snapshot_observed_at":"2026-08-03T04:00:15.683476Z","submitted_at":"2026-02-06T07:55:26Z","title":"Improve Large Language Model Systems with User Logs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:00:18.374520Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.06470"},"observation_digest":"sha256:8d9f9e94920607f8e4244ed84353e24a3d1f24b6a46bd3202ab2807216ec8cf5","observation_id":"1b07d353-ac51-4c15-8b1d-c3ca0c98df48","resolution":{"observed_at":"2026-08-03T04:00:18.374520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2602.06603","last_updated":"2026-04-29T10:13:20Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T11:02:06Z","title":"The hidden risks of temporal resampling in clinical reinforcement learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:16.379996Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.06603"},"observation_digest":"sha256:328cbfe213ebc3b2bb2f5fe8a49a7201d7d4aca3ef367bffb786250bb5980d7f","observation_id":"9ec55555-4e6d-4a27-af2b-968df06fa147","resolution":{"observed_at":"2026-05-16T07:07:29.666521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2602.07399","last_updated":"2026-05-22T10:22:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T06:31:53Z","title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T07:00:01.741166Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.07399"},"observation_digest":"sha256:db4c8ab32c4410cc8027c8d98400cda9c96c5e74e05184931477d09ec3c5d5c6","observation_id":"6e13b17d-89c0-4158-8e60-67fe2b30ed21","resolution":{"observed_at":"2026-05-25T07:00:26.181856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:2f0c91e6074b48546265f3c96f5b4a77aae5a4cc0727db8aa96a3298724ef524","observation_id":"7ea1ead5-d6a2-43ba-8552-a7b346e8cf69","resolution":{"observed_at":"2026-05-16T03:37:13.947853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T02:53:16.595689Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.595689Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:e30e0346c44af54657333459c96dc02c9a5d9eae9bdbf473f82c527fa04319ba","observation_id":"dfddc979-3e71-4b82-8edf-f7c9a5014c74","resolution":{"observed_at":"2026-08-03T02:53:16.595689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T01:15:34.075775Z","title":"Offline re- inforcement learning: Tutorial, review, and perspectives","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.10430","last_updated":"2026-07-28T07:16:08Z","snapshot_observed_at":"2026-08-05T04:53:44.696427Z","submitted_at":"2026-02-11T02:18:27Z","title":"Breaking the Curse of Repulsion: Remoteness-Aware Control of Negative Off-Policy Updates","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T01:15:34.075775Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.10430"},"observation_digest":"sha256:b1568b483aa203e7b80298aac622eafe7fe79b5d1d9c02daa60dbc69e2f21b9a","observation_id":"65a9af51-c76e-4870-9f5f-d7ca59236381","resolution":{"observed_at":"2026-08-03T01:15:34.075775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:a6fa86f4fe7dee2dc0391a2742d35c0cb86b4f7c42ccb6a26965154a58fcf954","observation_id":"3007d3db-bf77-4310-acdb-f6862a5bc763","resolution":{"observed_at":"2026-05-16T02:30:31.963711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T21:36:19.144684Z","title":"Offline reinforce- ment learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020.(Cited on page 5)","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-04T04:26:49.122167Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.144684Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:7fb0bedc1292053604fa3054e556fce18c21140ce1e3bb967cb30fe4e2fc750b","observation_id":"2755953c-b859-48c9-a2d3-eb29f534a7b7","resolution":{"observed_at":"2026-08-02T21:36:19.144684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T20:29:19.038948Z","title":"Levine, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.23280","last_updated":"2026-05-29T16:05:00Z","snapshot_observed_at":"2026-08-02T20:29:16.307639Z","submitted_at":"2026-02-26T17:53:46Z","title":"Mollified Value Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:29:19.038948Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.23280"},"observation_digest":"sha256:415f0a4af053da5d047d3907a22bbbb3948210860d10993c4ace002eb7a452bd","observation_id":"63fd0a51-1e7f-485e-8265-ec4ca40cff1c","resolution":{"observed_at":"2026-08-02T20:29:19.038948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T20:00:58.981863Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.00374","last_updated":"2026-06-25T19:26:06Z","snapshot_observed_at":"2026-08-02T20:00:56.048666Z","submitted_at":"2026-02-27T23:24:02Z","title":"Conservative Equilibrium Discovery in Offline Game-Theoretic Multiagent Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:00:58.981863Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2603.00374"},"observation_digest":"sha256:e2c8f016026ca35fe8eb6f75dc3466b62619ce4722b9fb2285d60408dcb9e589","observation_id":"5aa4410a-6f85-4c8f-87c6-82e227245baf","resolution":{"observed_at":"2026-08-02T20:00:58.981863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2603.01283","last_updated":"2026-05-14T21:17:55Z","snapshot_observed_at":"2026-08-01T18:55:36.456133Z","submitted_at":"2026-03-01T21:38:39Z","title":"The Informational Cost of Agency: A Bounded Measure of Interaction Efficiency for Deployed Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T17:37:03.704563Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2603.01283"},"observation_digest":"sha256:584e0cb1e7b2fbc558dff1c06c3fb6fea1f3f798bc0440f7b47d1d7ec7b07d62","observation_id":"1205f5df-a97c-4723-8a8c-c8958a5c26a0","resolution":{"observed_at":"2026-05-15T17:40:11.795471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2603.01283","last_updated":"2026-05-14T21:17:55Z","snapshot_observed_at":"2026-08-01T18:55:36.456133Z","submitted_at":"2026-03-01T21:38:39Z","title":"The Informational Cost of Agency: A Bounded Measure of Interaction Efficiency for Deployed Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T11:44:30.880602Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2603.01283"},"observation_digest":"sha256:15189a3755365472e378223ad70ba2563463ae2abdee5176dfd3659ab5d48876","observation_id":"e4dc9d65-5c2b-43e0-83cf-55e578101f71","resolution":{"observed_at":"2026-05-21T11:45:03.184188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T18:34:53.020591Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-02T18:34:45.449070Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:53.020591Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:365ac63897b97e67675912f64d215fadc513248f647f5553b5fb7635f57cfc76","observation_id":"927b2e5c-82e4-448e-bd24-903a4f5f2053","resolution":{"observed_at":"2026-08-02T18:34:53.020591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.02348","last_updated":"2026-02-17T11:12:05Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-02-17T11:12:05Z","title":"Contextual Intelligence The Next Leap for Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T21:54:41.748596Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.02348"},"observation_digest":"sha256:d2ebf5055fe5edcffa014947f4536d6fbc09cee0f66b4da2a8605bf7a3007352","observation_id":"484d1eaa-9c7f-4e61-a1d9-35cb57109e32","resolution":{"observed_at":"2026-05-15T21:56:40.742119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.02438","last_updated":"2026-05-09T18:59:30Z","snapshot_observed_at":"2026-08-03T15:17:23.743228Z","submitted_at":"2026-04-02T18:09:11Z","title":"Mitigating Data Scarcity in Spaceflight Applications for Offline Reinforcement Learning Using Physics-Informed Deep Generative Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T21:35:52.012244Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.02438"},"observation_digest":"sha256:85f1a77684c95204be4eb1b6e1001dd20f15610c1a9d282d9aaac72047f19439","observation_id":"eff3b642-bd4a-4c0b-bf8b-0876ca3c502b","resolution":{"observed_at":"2026-05-13T21:38:18.422160Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.05125","last_updated":"2026-04-06T19:40:26Z","snapshot_observed_at":"2026-07-06T22:53:55.926521Z","submitted_at":"2026-04-06T19:40:26Z","title":"Offline RL for Adaptive Policy Retrieval in Prior Authorization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:13:12.077414Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.05125"},"observation_digest":"sha256:60f3f9d255d125468a7e3f7974e79672f9ee6ab5fe8eea799aa16fa5813a8474","observation_id":"43b1278d-07dc-41e8-b9c4-e289af13e39d","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.05185","last_updated":"2026-04-06T21:29:57Z","snapshot_observed_at":"2026-07-06T22:54:00.211106Z","submitted_at":"2026-04-06T21:29:57Z","title":"Cross-fitted Proximal Learning for Model-Based Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:26:15.890536Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.05185"},"observation_digest":"sha256:4ac0c9ffc0084a9c48bce7629adf67508bd7e006c84153ca60a371af1f87e987","observation_id":"e3d1c6f6-50ae-417f-bde9-799970ac52ac","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.05845","last_updated":"2026-07-21T08:51:57Z","snapshot_observed_at":"2026-08-02T16:46:53.052715Z","submitted_at":"2026-04-07T13:11:12Z","title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:01.560145Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.05845"},"observation_digest":"sha256:6ab7fc0d7e728a69be538195d9d9c27fc5cc67eb54fdb8fca7683d467094f91a","observation_id":"f555d2f8-c58f-405e-90f9-2fe7ec31994a","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T16:46:55.922489Z","title":"Tucker, and Justin Fu","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.05845","last_updated":"2026-07-21T08:51:57Z","snapshot_observed_at":"2026-08-02T16:46:53.052715Z","submitted_at":"2026-04-07T13:11:12Z","title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T16:46:55.922489Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.05845"},"observation_digest":"sha256:ce67a470dc4fa494e01838e8f8e9ca299a4c02caf0bc975e9901ba19bdca05ff","observation_id":"496a6180-c6f7-47f8-a477-02b877343bfe","resolution":{"observed_at":"2026-08-02T16:46:55.922489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.07745","last_updated":"2026-04-09T03:03:06Z","snapshot_observed_at":"2026-08-02T14:47:37.509813Z","submitted_at":"2026-04-09T03:03:06Z","title":"The Cartesian Cut in Agentic AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:45.333038Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.07745"},"observation_digest":"sha256:8023872fecd82a9e9b69385e97712b037c30e2d1dcbcba68ecffe151cc6950ea","observation_id":"ece9362a-9746-4cc6-8f1f-e9be583b0311","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.07784","last_updated":"2026-04-09T04:22:18Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:22:18Z","title":"Automotive Engineering-Centric Agentic AI Workflow Framework","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:32:09.896596Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.07784"},"observation_digest":"sha256:6a9b2471f6a1178de6386fbac06fde9a321d70e5620f67306da9b5ffc95f76fd","observation_id":"fa1ae9dd-14e2-414f-9337-874cb46f0f1a","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.07941","last_updated":"2026-04-16T04:43:04Z","snapshot_observed_at":"2026-08-02T07:24:04.075021Z","submitted_at":"2026-04-09T08:00:37Z","title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:58.515666Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.07941"},"observation_digest":"sha256:8b973d50cf49260f24ce630cff0614d28241cd78e507cf7d436247de8978d391","observation_id":"0af77945-106d-4639-ac7c-86d64126b930","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:08.970164Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.08168"},"observation_digest":"sha256:192e1469e3a89529abd5b64cc6c5c3b08ab5495ec01c4b39d4ad14175c71d6bd","observation_id":"3d9a76c0-e56b-4300-bf6d-9a5535a2e345","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-07-13T00:03:53.609175Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2604.08169","last_updated":"2026-07-02T01:38:10Z","snapshot_observed_at":"2026-08-01T15:14:36.174197Z","submitted_at":"2026-04-09T12:28:22Z","title":"Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T00:03:53.609175Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.08169"},"observation_digest":"sha256:06df7b4e43eb5c1fa8699031ae832d5362fe326eaf8325fa0d8f3e15d1cb2302","observation_id":"0a373dd7-b962-4f43-ad12-48e207303235","resolution":{"observed_at":"2026-07-13T00:03:53.609175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.08960","last_updated":"2026-04-10T05:04:29Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T05:04:29Z","title":"Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:32.839681Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.08960"},"observation_digest":"sha256:a6a75c421354a276289c2cf7390d5c5bd35c61da75e55168e167f495ea7a3f07","observation_id":"bd36e067-e400-4557-8b59-772d7fa4143f","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.11304","last_updated":"2026-04-13T11:02:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T11:02:32Z","title":"BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:49.453068Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.11304"},"observation_digest":"sha256:f87a92dffb099e4991487b790533bdee75989fcaa2b0ba4128a0daf69a796b28","observation_id":"2398f91e-7a7c-475e-b2aa-dddabd2ad32a","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.12005","last_updated":"2026-04-13T19:52:08Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T19:52:08Z","title":"BayMOTH: Bayesian optiMizatiOn with meTa-lookahead -- a simple approacH","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:49:27.948704Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.12005"},"observation_digest":"sha256:d0f939d4479c994b6ae2f9dd8f01d61028bcaf9d415ea36f50de405e4cb5f586","observation_id":"b9ac097e-0099-41dd-a033-d643eff7cd8a","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.12509","last_updated":"2026-04-14T09:32:24Z","snapshot_observed_at":"2026-08-02T22:05:18.175483Z","submitted_at":"2026-04-14T09:32:24Z","title":"Whole-Body Mobile Manipulation using Offline Reinforcement Learning on Sub-optimal Controllers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:06:38.569059Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.12509"},"observation_digest":"sha256:81173660f51110b695f7ab9da6c51e5bb88f06f9387fb7ad505f89bd88a1c971","observation_id":"2845ed5e-633b-4347-9ec5-9ea60ea8840f","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:12:06.985609Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:cdb667c0aeb323e90256ce29c25e730cfcb46862c1191f472f75e85c43e78044","observation_id":"bd406ca3-6f37-4cb6-b64e-3956c9fd2229","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T01:04:12.454268Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:3a9f4ea8a44920cb09e5556110acafe2bcd2a77cbf7509fa70a6596f60541945","observation_id":"7bcef570-679b-42fc-8b85-f4a8fb4c964a","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.13085","last_updated":"2026-04-02T22:53:34Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-04-02T22:53:34Z","title":"Adaptive Memory Crystallization for Autonomous AI Agent Learning in Dynamic Environments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:17.879349Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.13085"},"observation_digest":"sha256:aed2d0c4cfe6d299233340e70a9ca14ebcf35e3433fe7a4edcaf6d14aee04866","observation_id":"50fcafeb-21df-4501-bd37-5801302defcd","resolution":{"observed_at":"2026-05-13T20:58:15.877238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:8e9819cf5d768606052af12be4be1cf9de21eb8108843dec1e82573b8ca634dc","observation_id":"9375ceac-391d-4cb0-ba94-d0dd12ee133c","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.18143","last_updated":"2026-04-24T06:58:50Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:07:33Z","title":"Distributional Off-Policy Evaluation with Deep Quantile Process Regression","version":2},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-10T04:10:14.476158Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.18143"},"observation_digest":"sha256:d1160181248d2c6a5ac77cc04d69030607caf60fcbb1a6786fce2cdc20dfe14a","observation_id":"c20328f3-1783-4651-a5d7-a6900bf00502","resolution":{"observed_at":"2026-05-11T12:06:03.864434Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.18615","last_updated":"2026-04-16T03:57:04Z","snapshot_observed_at":"2026-07-06T23:05:26.398712Z","submitted_at":"2026-04-16T03:57:04Z","title":"Locality, Not Spectral Mixing, Governs Direct Propagation in Distributed Offline Dynamic Programming","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T10:15:19.300542Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.18615"},"observation_digest":"sha256:6719d8801c5877ddab3571b103a648eeee14191d2130862d635f79646903af32","observation_id":"ee3a9c02-7553-43f4-a2f1-5c417f1240b8","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.18972","last_updated":"2026-05-07T18:45:20Z","snapshot_observed_at":"2026-08-02T12:30:32.367952Z","submitted_at":"2026-04-21T01:53:11Z","title":"Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T02:32:58.434291Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.18972"},"observation_digest":"sha256:87b5d543f9cbe967c096cd447f9a47366452a184c8fb7dcbdbc8a5d1e2068484","observation_id":"66be2b28-c73f-4209-96a6-1b8f621754c9","resolution":{"observed_at":"2026-05-11T12:56:20.524933Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.19907","last_updated":"2026-04-21T18:33:15Z","snapshot_observed_at":"2026-07-06T23:06:26.596990Z","submitted_at":"2026-04-21T18:33:15Z","title":"SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T03:22:30.012610Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.19907"},"observation_digest":"sha256:b56e38952562bb4fde8f05d66c75283a45041a4cfe37d85640e1803a07324eec","observation_id":"622e546c-bee0-4bec-abf2-27c776b0011e","resolution":{"observed_at":"2026-05-11T12:31:06.596604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.21209","last_updated":"2026-04-23T02:01:37Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T02:01:37Z","title":"Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T22:40:31.084594Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.21209"},"observation_digest":"sha256:718e0084260d6b2c5471f2bdcefff94c0acb3cf5a9b6df03011956caaa4a4f38","observation_id":"6b03fbc8-db1d-47de-b3e7-a55a697ffad1","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.22558","last_updated":"2026-04-24T13:53:39Z","snapshot_observed_at":"2026-08-05T08:11:55.563542Z","submitted_at":"2026-04-24T13:53:39Z","title":"SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T12:09:24.371878Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.22558"},"observation_digest":"sha256:11d5273e90f8c9ea4c3cc7e39186a12b6d9f6ef913662d5cdd12b3efa8564b45","observation_id":"677ab89e-82ad-4965-934c-1321fc8129f6","resolution":{"observed_at":"2026-05-11T19:21:08.858283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.23022","last_updated":"2026-04-24T21:21:10Z","snapshot_observed_at":"2026-07-06T23:09:19.041332Z","submitted_at":"2026-04-24T21:21:10Z","title":"CASP: Support-Aware Offline Policy Selection for Two-Stage Recommender Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T10:08:10.495654Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.23022"},"observation_digest":"sha256:d3c4f4d9e25ec7a3adebbf0c3c121770d6e94a2a808678b5b4fa573b6bee9f98","observation_id":"1f4eecc5-fb15-4e2d-8f85-64cc30650c2a","resolution":{"observed_at":"2026-05-11T20:11:09.842470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.23308","last_updated":"2026-04-25T13:49:43Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T13:49:43Z","title":"CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T08:30:00.096232Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.23308"},"observation_digest":"sha256:2fe82953d726df95883c4662fd9a708b0ea5b575ae80f1f13517822c5515baaf","observation_id":"ba714bad-9612-4ec0-827e-fdccd0466a5e","resolution":{"observed_at":"2026-05-11T20:36:10.109937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.25898","last_updated":"2026-04-28T17:41:04Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:41:04Z","title":"TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-07T16:41:13.286470Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.25898"},"observation_digest":"sha256:b96ae4d8ff739c3a1d934441cbd66951d1dded3da5ff36d0d6f36ef79c2cb889","observation_id":"bbee5401-b5b1-464d-8f16-28149a27c026","resolution":{"observed_at":"2026-05-11T23:36:25.858078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2604.27411","last_updated":"2026-04-30T04:28:02Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:28:02Z","title":"Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T10:04:49.055655Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2604.27411"},"observation_digest":"sha256:383da02731b4d79ffc2679225c4fc56b5b73d01851c690eea14e517cf5fe31d5","observation_id":"f21a88ff-207b-4f21-8da6-46166ad9f763","resolution":{"observed_at":"2026-05-12T09:41:25.829369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01356","last_updated":"2026-05-02T09:59:24Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T09:59:24Z","title":"Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:58.919333Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01356"},"observation_digest":"sha256:62dca99c86f91977da6dc9504e3df67c8af693d72eea9fa4aedfa61d00d91424","observation_id":"e2f0a9b4-5f25-4933-881b-531dfc2106d7","resolution":{"observed_at":"2026-05-11T16:56:07.792990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01457","last_updated":"2026-05-13T01:42:20Z","snapshot_observed_at":"2026-08-02T14:59:41.829405Z","submitted_at":"2026-05-02T14:12:04Z","title":"CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T14:29:18.385955Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01457"},"observation_digest":"sha256:7153e2f8b226a1ba88e0752de66b47f6b64f4dae339c20b80ded0b3f9ca08ade","observation_id":"f4588942-99a4-4f20-8cbc-39a855788f11","resolution":{"observed_at":"2026-05-11T16:56:07.294277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01457","last_updated":"2026-05-13T01:42:20Z","snapshot_observed_at":"2026-08-02T14:59:41.829405Z","submitted_at":"2026-05-02T14:12:04Z","title":"CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T07:26:08.192587Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01457"},"observation_digest":"sha256:93a9f148433a2fc6122b0729df2ef1ce387c38e5354dc6692d3a1961124fe3a7","observation_id":"2341d5e7-2a7a-472f-b9dc-acb2830fea68","resolution":{"observed_at":"2026-05-13T07:27:29.609753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01457","last_updated":"2026-05-13T01:42:20Z","snapshot_observed_at":"2026-08-02T14:59:41.829405Z","submitted_at":"2026-05-02T14:12:04Z","title":"CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:28.236225Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01457"},"observation_digest":"sha256:070ebab83e72430a16599b072dcdc0f67ffaeabe2d2cb0e95107539d6b166e1f","observation_id":"f4330bf2-3444-4119-9f6e-e87a1b28f2a1","resolution":{"observed_at":"2026-05-14T21:29:28.814472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:87bd98b969b7f6ba5d0c4f87c5182c2d254c16fcd49e7de8747d0a37a7619feb","observation_id":"77ff837d-8b11-4acd-a0e9-0c51d7ed9254","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:16ddc7e6bf887732d9cf210af57b3dbcfa8808d1caa5401bc0ae67109c087e09","observation_id":"8870bb17-d89e-4d6d-8ab0-8a1db1903b7d","resolution":{"observed_at":"2026-07-01T00:45:11.403899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.01862","last_updated":"2026-05-08T03:23:44Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T13:11:28Z","title":"QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-11T01:17:48.643521Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.01862"},"observation_digest":"sha256:975be88401f7bec90a10b1e38f1388731b7476ef54c102c12a67799cfdafe39a","observation_id":"3158d570-c503-4529-9b78-924a554035dc","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.02141","last_updated":"2026-05-04T01:46:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T01:46:35Z","title":"On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T19:35:59.832868Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.02141"},"observation_digest":"sha256:43d6cffd06f002fe3ab8e044a63041ff9f2d354928af74eff6182f1b27c5584d","observation_id":"e9dfcd8b-277f-4cab-a545-739245b88960","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.02552","last_updated":"2026-05-04T13:00:55Z","snapshot_observed_at":"2026-07-06T23:15:37.099197Z","submitted_at":"2026-05-04T13:00:55Z","title":"Recurrent Deep Reinforcement Learning for Chemotherapy Control under Partial Observability","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T18:51:16.753971Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.02552"},"observation_digest":"sha256:7de1b697ccea76e917a7ee4a341d05dd72affa63f0bdde190ce9a9ae5f289b16","observation_id":"21819124-22b2-4451-acd5-dbfc9adc2307","resolution":{"observed_at":"2026-05-11T11:33:22.706378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.03393","last_updated":"2026-05-05T06:08:54Z","snapshot_observed_at":"2026-07-31T05:29:21.522040Z","submitted_at":"2026-05-05T06:08:54Z","title":"Adaptive Estimation and Optimal Control in Offline Contextual MDPs without Stationarity","version":1},"reference_index":256,"source":"arxiv_source","source_observed_at":"2026-05-07T13:27:05.081050Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.03393"},"observation_digest":"sha256:908bd82572845c22a3ad91522787cfe5ebbaf521456cc5f1975e4100eb4797ff","observation_id":"80227e65-b65d-4b0e-b026-5b6025e4d9d6","resolution":{"observed_at":"2026-05-12T08:56:26.425783Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.05123","last_updated":"2026-05-06T16:51:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:51:44Z","title":"Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T17:17:14.300877Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.05123"},"observation_digest":"sha256:229b5205902164d7ad3ddb3e967e35b0cfcbb366e2e91758f2b96355533f609b","observation_id":"02983fbb-34ad-48f1-9e28-c96323e7b9f0","resolution":{"observed_at":"2026-05-11T17:41:09.203353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-08T16:34:18.603134Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:446ee9c9823e297212c4e0715a53616ab48fa7c762f3dcaf47b9951f817a595a","observation_id":"3b597498-b9ec-4847-87a9-2019288c8b0e","resolution":{"observed_at":"2026-05-11T18:11:05.093888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:755926f1ebda1dfb3fba9212db2f29f3f76fb44dbad9e62d13b53aca891851ee","observation_id":"e7b46636-abdd-4eff-9a6b-205ad4755113","resolution":{"observed_at":"2026-06-30T23:25:07.019630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.05544","last_updated":"2026-05-07T00:48:25Z","snapshot_observed_at":"2026-07-06T23:18:07.750358Z","submitted_at":"2026-05-07T00:48:25Z","title":"Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T15:09:00.758071Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.05544"},"observation_digest":"sha256:41956d9e372c17a77ec0d68a6cef9ec8cbfd6793d1158802c5b7c8fe0c0d6f5c","observation_id":"b4d3f5ce-9d80-4686-83d3-f6159a4ab8cf","resolution":{"observed_at":"2026-05-11T18:36:07.666554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.05833","last_updated":"2026-05-07T08:08:56Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:08:56Z","title":"On the Role of Language Representations in Auto-Bidding: Findings and Implications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:01.713604Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.05833"},"observation_digest":"sha256:cf2628fdb471b74c2960bd2e758d522b87e1d1732818e4c7f445049f4b8ca2a1","observation_id":"b2edbc2e-35c9-48d9-a424-0f9c8cb5cdc5","resolution":{"observed_at":"2026-05-11T19:41:09.090854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2005.01643/citation-record","integrity":"/paper/2005.01643/integrity","json":"/paper/2005.01643/citation-record.json","paper":"/paper/2005.01643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Friedman, N","venue":null,"work_id":"b4f13d1c-91fe-4f3c-9585-19f70b43e72b","year":2009},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:f39864e3df679001d05ed3e2611fb5fe093113bfc4c3aa31dd378f519322647e","observation_id":"017d7b1b-83b8-473f-b2f4-b88dc64ca4fa","resolution":{"observed_at":"2026-05-14T10:08:28.783805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":"0e8149b3-cb9a-4833-83a0-14c5ca8a378d","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:31ebe7bed366642392d1e03895e83178388252f975373f0e130d1c18fc05b10b","observation_id":"99c1b101-f61b-4b1d-80b4-89d8e5307477","resolution":{"observed_at":"2026-05-14T10:08:28.804895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.531649Z","title":"International journal of computer vision , volume=","venue":null,"work_id":"0d44db06-23e3-4a2d-b3e3-8c224934b42e","year":2015},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:2cbf6071622aac0621e554079e92a36d9a20b56c15cbc4a0d9bb3638a36bb13a","observation_id":"b0f3a3c4-b6c3-4543-b2fa-4a06c9e36c6c","resolution":{"observed_at":"2026-05-14T10:08:28.794668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.10332","last_updated":"2018-05-16T20:35:34Z","snapshot_observed_at":"2026-07-06T06:35:45.610246Z","submitted_at":"2018-04-27T03:42:55Z","title":"Sim-to-Real: Learning Agile Locomotion For Quadruped Robots","version":2},"cited_work":{"arxiv_id":"1804.10332","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.10332","snapshot_observed_at":"2026-07-03T06:17:42.492578Z","title":"Sim-to-Real: Learning Agile Locomotion For Quadruped Robots","venue":"cs.RO","work_id":"e0d353f4-f934-4d22-af2e-808140cf91c5","year":2018},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1804.10332","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:7a2773479fb60c894f5a34fc008a103fafdda119cc40aaf533b731e293d5da02","observation_id":"f460aca3-0c65-4de5-8e18-5348041e0755","resolution":{"observed_at":"2026-05-11T11:33:21.431688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ff298b1-1d35-4fa6-a224-5cee8a077c65","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:4dd17d1d85acd55d8a253da4f50ec307fbca2079684d3115872d1714fe835d51","observation_id":"5a9fe4aa-5d75-4d04-8414-5000f5573be8","resolution":{"observed_at":"2026-05-14T10:08:28.826478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a454e421-149a-44ab-9c56-693edd52d674","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:10568922f884d9273bf46ee7019c506beb795ef3a49b8f05052860bed88ed464","observation_id":"97e98e5b-5812-48dc-854f-1e1dc3d0f2e6","resolution":{"observed_at":"2026-05-14T10:08:28.914240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , howpublished =","venue":null,"work_id":"5c5a3157-4142-4303-af30-4d05acfeda4f","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:fa8232753fe9904a16b37a2621c56c655b831f252aed7ddae3d06f752a2803c9","observation_id":"6b4362ee-8572-4cad-9520-f98d8095fa38","resolution":{"observed_at":"2026-05-14T10:08:28.796281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , howpublished =","venue":null,"work_id":"1a5cbb22-5407-499c-8a2b-dfc4b3a5f5bf","year":2020},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:50027edfe49bf323aadbc68aeec9b7dae2cd467038010951543d477ec4ebb044","observation_id":"9c5f9cad-cbb0-4bbd-ab2a-6ea4a9015b54","resolution":{"observed_at":"2026-05-14T10:08:28.878462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Journal of Machine Learning Research , volume=","venue":null,"work_id":"d705ca46-15a0-401a-a3d0-ddf6a06d5422","year":2016},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:8f777b911a1bd4d3208a5f0b369c4048f9909f5e501327d40cdccdb82b2b7253","observation_id":"a58eabfc-aa55-4c4c-b1f2-d17bc63f5660","resolution":{"observed_at":"2026-05-14T10:08:28.815645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"61498d13-0414-41d7-8e9f-150f02463a24","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:6d1c963d52f6b03ce30c888fe085bc566c13d1b1cd15eecae97f076e9306cb2c","observation_id":"a567dcbf-dcca-4ac1-b9a6-f694138c7c0a","resolution":{"observed_at":"2026-05-14T10:08:28.782204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature , volume=","venue":null,"work_id":"908546a7-42f4-4972-aec0-bf7714f2d985","year":2017},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:0bc2c9e41309722edf87055ba31873a7cb32a3000bfcade41814242a154b2108","observation_id":"2ada1639-130f-4b50-bf16-62f12eb21ac2","resolution":{"observed_at":"2026-05-14T10:08:28.843852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"358187ca-a1a6-44e8-8b82-c3f50bbbf8c3","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:2e305c49ee77f80a34fe708f3caee38b19903332fb0960f5e55e05e77c24fb19","observation_id":"13869476-25b7-4a9c-ae51-a66f7ae0e377","resolution":{"observed_at":"2026-05-14T10:08:28.792592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:01e66af2e9088e293135dd7f4cfeead150da9791b52a003752f5c27490452269","observation_id":"3bf082b5-83d7-494a-8c1a-68e90153012a","resolution":{"observed_at":"2026-05-11T11:33:21.379465Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"bcdbb967-725f-4941-9704-41e1e0985539","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:061e6b433955d1e8bac363f0af444c12de6a6b9d036a072d576c6c8effc0fda3","observation_id":"47bfc1ba-181f-46e4-ac47-2e6a80d0d836","resolution":{"observed_at":"2026-05-14T10:08:28.880341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":"e3bb9272-e9bc-469f-a9f2-04f6f338ea57","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:8cc0a82d05da1044d811ba1f3a32b2905846706b4abcebc2653e2f81540abbbf","observation_id":"26ad66e4-51fb-45dd-9a7e-bf843c8ce18b","resolution":{"observed_at":"2026-05-14T10:08:28.893011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine learning , volume=","venue":null,"work_id":"ce75fe51-ab31-48f3-9f38-693b375976ef","year":2011},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:8edcea364d80202838916922204047ec7280eaf597aa66a79879c67fc9b996fd","observation_id":"d0e7f085-0968-4e03-81c8-02ce96a8a80a","resolution":{"observed_at":"2026-05-14T10:08:28.858305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural fitted","venue":null,"work_id":"7f4e9759-eef7-494e-a91e-020088ecc337","year":2005},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:7969f86bd80fa3a9132067b192beb9d88dcc4686ca45153e5d9b75c34b15f1e7","observation_id":"587f61a2-a360-4d4e-a784-36deaec4be14","resolution":{"observed_at":"2026-05-14T10:08:28.785474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning , pages=","venue":null,"work_id":"91ac99fd-077c-436b-9076-6e08fe49f6ca","year":2012},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:159ef91307e5b3b6032e11a4fcff6b55231897d14f8caf3bd1ee3b1a9986705a","observation_id":"5ca0840a-1034-4231-a050-8580bf321120","resolution":{"observed_at":"2026-05-14T10:08:28.882117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"7f7af0cf-acaf-4eb0-9dfd-268c7c38cd38","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:2d7c355c7936d884dd98c5ba382396294858904a2f93c9bbffb12a2f0bdc5781","observation_id":"ccb0f885-4128-4a95-80e2-c7e9716d2ee9","resolution":{"observed_at":"2026-05-14T10:08:28.806566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Storkey, A","venue":null,"work_id":"c8cdfadf-18aa-445b-9f7a-548b0ac7da48","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:afd7dd24fc354258efd838b6b0b971e35a508a5465617de1731bceba5840494d","observation_id":"219e78f2-6afc-4d95-84ee-9aa357c4dfa8","resolution":{"observed_at":"2026-05-14T10:08:28.801348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attias , title =","venue":null,"work_id":"8baccd60-9e09-4c1a-bc1f-3f7e20df0367","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:0b6eecd3ecd43586a2343b5967f17d8859aa2374a4ebde7ae9b3fbd82d3d7b26","observation_id":"a078c781-cee4-41f6-a2c9-901dd6f112e5","resolution":{"observed_at":"2026-05-14T10:08:28.900481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1994 , publisher=","venue":null,"work_id":"bccba113-bf5e-4682-8514-120437176dff","year":1994},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a8ce05346128ea153356c07b217518a09d9925bddb099885a606783c5919e5fb","observation_id":"6a747586-201e-4716-9640-7c49e488d92d","resolution":{"observed_at":"2026-05-14T10:08:28.871837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Workshop on Reinforcement Learning (EWRL) , year =","venue":null,"work_id":"c9edea80-a0e7-474e-a69d-9ae5c6969d14","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:de42e065c18228c0fc6129585a82a7b2167d5ad1183d7cd08700cfde8b15d74e","observation_id":"4e9c36e9-1fbb-4ad2-b23d-5b8fdac0c9be","resolution":{"observed_at":"2026-05-14T10:08:28.823151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Artificial Intelligence and Statistics (AISTATS) , pages=","venue":null,"work_id":"31d5a066-1383-4a0b-b32c-2b94bab79d22","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a032dd5bb50c55aa1d7eb2fb001b3420b9a7632cfef9ee029dba89278d038b53","observation_id":"8d1bbd75-fe54-4f35-a35a-4c4ce14afd9b","resolution":{"observed_at":"2026-05-14T10:08:28.824882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Artificial Intelligence and Statistics (AISTATS) , pages=","venue":null,"work_id":"de425a1e-de91-48b4-b7bc-ede824eb5f3b","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:8d6273d5055bad88df48c09288a05333ea4ffc6be187799853745c5787b07daf","observation_id":"2f84cdf3-522d-4602-8c11-9d5228efe85d","resolution":{"observed_at":"2026-05-14T10:08:28.788901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , volume=","venue":null,"work_id":"148edfe2-1c51-4dff-8f89-1d4a46e50db9","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:ad66cf379a9724dfc8ee00d58b1fbe2003e1ab3cd3dfb8e03599a5f6989d9dbf","observation_id":"b6f6b8d3-b0fb-4924-85a5-1ce670763bc9","resolution":{"observed_at":"2026-05-14T10:08:28.862908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3ba496fb-4ee9-4343-bfde-8d2840b53481","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:324b51d2f8ef2e9077de0ddba0ab460bd06509def959de8f0d1caf3bea633500","observation_id":"e069cc26-6dea-498b-b704-a2adb79a9d29","resolution":{"observed_at":"2026-05-14T10:08:28.837165Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b4487a04-c481-493f-8670-eaf39f9c339e","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a6708d595aae4cec286a67c82ff4d59a84d43562056f6149f6447570411d5381","observation_id":"fb2f69b3-6662-4dc3-b153-def1f8c19a91","resolution":{"observed_at":"2026-05-14T10:08:28.840519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"385ee335-fb19-4de8-9080-08088bb9be4e","year":1992},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:9f168f252e8ebd13c911373ee65deba015ea71eed84d12f8bd7a291761186f78","observation_id":"ec825235-2bfb-4f2a-b7f2-e6a52a83d7bf","resolution":{"observed_at":"2026-05-14T10:08:28.902271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cea6ab85-0cba-454e-a984-675da1066b54","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:1af2c36c5fea0d83999f5a38ee874420ece5b9162ef862a05ec7bd8f9abf7a6c","observation_id":"603ea544-8099-4e37-8d22-0eb23adea9cf","resolution":{"observed_at":"2026-05-14T10:08:28.864577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"31989bb2-4f32-4eef-9afc-5d534cf71cd8","year":1998},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:8a0d3c02ad0a64e39b8c5789cc1a1f57a1c1c50c982e839bc43a0868b6ded686","observation_id":"1e79c4ba-f65b-4b64-855f-de687b5cfd38","resolution":{"observed_at":"2026-05-14T10:08:28.861387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"41904ce0-5670-4e34-92fc-7bfe6148e791","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:6f6581aeda3983a3b99922fb086b695ecfaf05ff6963cf76f1eab4126383ccbe","observation_id":"993532ce-941c-4a66-978b-8f7cbe89a558","resolution":{"observed_at":"2026-05-14T10:08:28.920968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Munos, R","venue":null,"work_id":"cc9f9f31-5289-4cc0-8691-61da93f21205","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:949d8f5fc349f7b3de11daa9eda907fb444379e1390699bd4b88fddba0a90458","observation_id":"d6893da3-d4c0-4944-a2c6-836592955515","resolution":{"observed_at":"2026-05-14T10:08:28.922500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Hinton, G","venue":null,"work_id":"a5009171-2132-4fc3-acc4-1a5525a9c1e8","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:957cd805544045b02b923c126625da96ac255c933bda39a420d4fe9e4275d3bd","observation_id":"912ed871-092e-47ce-8d43-7ecfd04754f5","resolution":{"observed_at":"2026-05-14T10:08:28.848813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2165ce89-399f-4948-a75b-fc6b4a718fc3","year":1996},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:5e3e2a05910580d731aeed864a24c9caeecdad5e33d5be0714eda82442c785ea","observation_id":"1dc4f67e-6162-426b-8a9d-3d484bef25bb","resolution":{"observed_at":"2026-05-14T10:08:28.856784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Todorov , booktitle=","venue":null,"work_id":"da2bc139-3fca-42ca-80f1-e0bf708fca9c","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:331716bdc1a6f5ae7b2484e3e3b638603bc33415656ad58bd9e83c58ed285427","observation_id":"5fb240d4-6aa6-4b92-ac65-ea8a613361af","resolution":{"observed_at":"2026-05-14T10:08:28.876791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b747fc54-09e0-4c81-a1f6-44ccd9d09188","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:11959a1a3b0c3607691d57715e49ad6804dec4d60231c376189eb3ec9c49d54c","observation_id":"78f55a18-d894-451f-acc4-ded24097d2a7","resolution":{"observed_at":"2026-05-14T10:08:28.905866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"u lling, K. and Alt \\","venue":null,"work_id":"cb880af0-2885-4610-9ff0-cb2da14eaba8","year":2010},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:ba96f8d19f83af319f6ea94084ccfce824ce3d90bc8ac73909f1f0ad833f87b6","observation_id":"c660bc69-1242-48f4-8ba8-fa80df1f8e7d","resolution":{"observed_at":"2026-05-14T10:08:28.850435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Information Processing Systems (NIPS) , year =","venue":null,"work_id":"e9ca02c5-39bc-4a35-b22e-c6300691015d","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:71ae1f4708af45d9167a5a9be1770692604358b7184aed7d2419657c8e2a85bc","observation_id":"e70eabc4-7b65-4fe4-a2d1-ca0504ef657a","resolution":{"observed_at":"2026-05-14T10:08:28.831704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Todorov , title =","venue":null,"work_id":"da2115e3-1e66-481a-ad0a-ef632473316e","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:9c33316553495a521777445613ccef6ae2b659edb94764835073ce27d6e23087","observation_id":"f40398de-445f-4ccb-943b-c37eb5f6c90f","resolution":{"observed_at":"2026-05-14T10:08:28.894916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Todorov, E","venue":null,"work_id":"3053a1f5-ffae-484c-a1ac-232b8163418c","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:4c68b519b5debe83dc7666d802f8f260a8d7da0ef1c096a7ee100a6ec5a5d16d","observation_id":"99bb6567-2151-4a9d-bb40-6474e727013c","resolution":{"observed_at":"2026-05-14T10:08:28.838993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":"407b8484-cb8b-488c-b6f8-774f02729d05","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:84bf371076963b9e3aa7a618f50932fbb78cd81fdf368d1aa94ad84f44a6d26f","observation_id":"6ca4a406-5c61-427b-badd-3e8d1b9da512","resolution":{"observed_at":"2026-05-14T10:08:28.904264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.01312","last_updated":"2016-03-03T22:59:35Z","snapshot_observed_at":"2026-07-06T04:48:17.238447Z","submitted_at":"2016-03-03T22:59:35Z","title":"Learning Physical Intuition of Block Towers by Example","version":1},"cited_work":{"arxiv_id":"1603.01312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1603.01312","snapshot_observed_at":"2026-07-04T20:52:29.539815Z","title":"arXiv preprint arXiv:1603.01312 , year=","venue":null,"work_id":"72cf66a9-5687-4110-ba6c-67d25121f064","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1603.01312","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:670c88b5603acf322119274edc37d2af123cea2d1828ebd7f6e111c733c4234e","observation_id":"93c6d035-6c80-4c42-82f3-543732fe82fb","resolution":{"observed_at":"2026-07-04T20:52:29.539815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":"977de4d8-7ee0-4c44-a87f-2bf7d9667a8f","year":2017},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:125c7ad7848c985b87f9020ad5419b9b44b73f8cc8d6b3408090ee83dc382cb1","observation_id":"040187be-39b5-4cc2-aae5-a12ec00f5afa","resolution":{"observed_at":"2026-05-14T10:08:28.799695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"4b446edd-5ad4-4373-8840-654c2178faa4","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:206a581b33a1fca9903dc88ef398d9bf8b41f08d4b4b07bbaa167f1ec0210f52","observation_id":"5952dc03-2148-474c-95c3-69e436c1c24c","resolution":{"observed_at":"2026-05-14T10:08:28.910808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"4d3e9d79-5aab-4fd1-834e-44bbc0530b35","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:9d36ae3a1f179c1240109ac69d9d7c6f202d164dd6cbf88390c4e81f0b040ce9","observation_id":"bafe8fe3-fcfe-4e50-91a5-f1239b506e7c","resolution":{"observed_at":"2026-05-14T10:08:28.912657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10571","last_updated":"2020-05-01T07:29:34Z","snapshot_observed_at":"2026-07-06T06:06:35.430311Z","submitted_at":"2017-10-29T07:27:57Z","title":"Certifying Some Distributional Robustness with Principled Adversarial Training","version":5},"cited_work":{"arxiv_id":"1710.10571","doi":"10.48550/arxiv.1710.10571","metadata_source":"arxiv_reference","pith_arxiv_id":"1710.10571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Certifying some distributional robustness with principled adversarial training","venue":"arXiv (Cornell University)","work_id":"f13c7954-0712-439e-8efc-0f9b560646d0","year":2017},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1710.10571","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:efd2e24a7a87541f1254ebca13a1f40de838caf2550b27803201a8ffa86373da","observation_id":"2dd2e29e-31f7-4bdf-90b2-5979171ffdb5","resolution":{"observed_at":"2026-05-11T11:33:21.220075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"8d3912bf-2be3-47f2-9d35-4845ea99a859","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:82acf4717c6c32af645a3d567751c621ff53f5845e8b4670014d4b05e7483818","observation_id":"90c3a46e-8b5f-4284-96ef-cc0390ce4741","resolution":{"observed_at":"2026-05-14T10:08:28.884467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"1705b73c-5451-4197-ba28-e14b74a35cfd","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:6c2843b63f790b2877c4bf7f41f462591e0da012ff8a9ab0a4928524f780e0a0","observation_id":"141421d8-0334-4944-8146-bc7a4b444597","resolution":{"observed_at":"2026-05-14T10:08:28.790566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"international conference on machine learning , pages=","venue":null,"work_id":"09f36b0e-8445-4a7f-9372-ace5248d62ae","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:7f184f358b5649c0013e125bb16208dfd70940357f80300b143d0eeeab83d19c","observation_id":"cee9bcc0-cf40-4469-993e-1ec4336af1ee","resolution":{"observed_at":"2026-05-14T10:08:28.817411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10500","last_updated":"2019-12-23T16:20:53Z","snapshot_observed_at":"2026-07-06T08:39:32.198228Z","submitted_at":"2019-11-24T11:04:56Z","title":"Causality for Machine Learning","version":2},"cited_work":{"arxiv_id":"1911.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.10500","snapshot_observed_at":"2026-07-04T03:09:30.307689Z","title":"arXiv preprint arXiv:1911.10500 , year=","venue":null,"work_id":"9d11d289-898d-4260-84a9-d25b82c31556","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1911.10500","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:b524fb70fb3c8ccad8d64c757e6f0e5b8351e86bc8088be8c658fe80b91d0796","observation_id":"ce7360c0-08ce-4081-8619-f35f2d8f7271","resolution":{"observed_at":"2026-05-11T11:33:21.171791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:47.712205Z","title":"nature , volume=","venue":null,"work_id":"e6b92db6-c2c1-4e28-9c46-8d7bfebba8f1","year":2015},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:4be986bb79776ad2caeb8cfdb0bd3e2f97711136693168705cdef89f98e95599","observation_id":"9900ef4d-f96f-4705-b290-cc233452b690","resolution":{"observed_at":"2026-05-14T10:08:28.798031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":"1812.02648","doi":"10.48550/arxiv.1812.02648","metadata_source":"pith","pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning and the Deadly Triad","venue":"cs.AI","work_id":"de214ead-4cb0-4abd-be3d-ae3389f55e9b","year":2018},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:85d760ca950be4447cdc174decc3d7cdb4edce0ed58b89225f16e505cb11daf5","observation_id":"caac2d98-8701-49eb-a680-2df16cd46c67","resolution":{"observed_at":"2026-05-11T11:33:21.360067Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Artificial Intelligence and Statistics (AISTATS 2010) , year =","venue":null,"work_id":"0911cb49-91b3-4167-a9fe-3a5f25e18c82","year":2010},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:2a1dabaefaad2a64ba88184bdfe45b5e788f25dd53adf042036039738b71fc42","observation_id":"eb374b03-bd38-4bc8-98cd-ab00a9f24897","resolution":{"observed_at":"2026-05-14T10:08:28.819191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"3c6c21cb-adc1-4dea-9231-caa8fedd38fa","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:e6db1029555279944af4ec60b1922c94a4bbf325f7350b9e64c4f27631cffec9","observation_id":"4ccbe37c-eee5-4df8-a45f-1c7119456e51","resolution":{"observed_at":"2026-05-14T10:08:28.873578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title =","venue":null,"work_id":"45b3ef74-f68b-407e-a3a2-edaf6f248e67","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:9a0e84128e8e976b7d050f14453a4217630417428cb5db4ca9827ef0bcfa8cc2","observation_id":"66a5395e-34b2-4c9e-8343-3ffda9795d55","resolution":{"observed_at":"2026-05-14T10:08:28.842175Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title =","venue":null,"work_id":"1bf9483e-4cc6-462f-ba9f-ace2101e52b3","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:e02b0173adcd3a428a1549efe132b6a334121a92b9a1655130dfaf33d625e88c","observation_id":"13cc71b9-6675-4a2b-9dcf-c40b654231b1","resolution":{"observed_at":"2026-05-14T10:08:28.809896Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b47d7228-30d1-464b-8b2c-b009620fbaf7","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:801bcb60e6bdee42533bb3a9e99a889aab4391d3ccfbb433b7b26d4bce1f24df","observation_id":"d09b6329-442d-4aef-8bf6-34e071f6409a","resolution":{"observed_at":"2026-05-14T10:08:28.891283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"bc7a0d11-7388-4150-87d4-1d628f99d231","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:39bbb62aec34f3413c3d71c76c3b3b838730679877958aab5c4e3cbcccff8c4c","observation_id":"1424b93a-f4e8-4d5f-b973-932edeba5784","resolution":{"observed_at":"2026-05-14T10:08:28.803033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 34th International Conference on Machine Learning-Volume 70 , pages=","venue":null,"work_id":"ef18561f-d18e-4cba-b042-13c566cb3af6","year":2017},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:c7823b85944cb2a1cb58a00f64148564090c83663c8f109df4d677a5448d51b5","observation_id":"16608f98-dac3-43af-90cc-87a0ff85e566","resolution":{"observed_at":"2026-05-14T10:08:28.835574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51fe8343-f30e-4636-afc4-df5aa0d4b4e8","year":2012},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:4bb480ba62a2f5853292f37fc1e426a511e35e578cbe9a5c19b126ab05767509","observation_id":"a399f551-3c4a-491c-a470-be7b8f3901d1","resolution":{"observed_at":"2026-05-14T10:08:28.833591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rawlik and M","venue":null,"work_id":"da2eee5b-0186-47d3-9854-d5b1771051b2","year":2013},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:9a0ab87970f0da3ebb417ca566e1f4d277131ae01597b3a9477409c6840ad955","observation_id":"57daec8e-9498-4e2c-a935-6648389f29c9","resolution":{"observed_at":"2026-05-14T10:08:28.813476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toussaint , title =","venue":null,"work_id":"64ee9683-31ba-49e9-834c-2965edd640d6","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:4a13f663c0f726dbd396295812c290387e4ae09b1798e2775989852b96ceaf8e","observation_id":"46df2233-e771-4154-bfb7-14b8d7460186","resolution":{"observed_at":"2026-05-14T10:08:28.889668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty in Artificial Intelligence (UAI) , volume=","venue":null,"work_id":"9055fd9f-403a-40d6-b6d3-952675ce4c4f","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:991c09416be1153427f300ffea268ab3ba3a8bf45c3f44e8e682c6408df7488b","observation_id":"c6db0ca3-0bb1-4885-8ac6-d38fc7522d0a","resolution":{"observed_at":"2026-05-14T10:08:28.898612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kalman , title=","venue":null,"work_id":"87b8b7b6-b018-4554-8cfe-a5830db64459","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:6ec41a782bee454106d5eb32de3174bc1770b9fb81ff4cb3d86e0b2174dfee57","observation_id":"fbd8530c-2ab2-4807-96dc-a0eabad54227","resolution":{"observed_at":"2026-05-14T10:08:28.923972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"ede3dc89-1b21-4359-b25e-03028f6158ce","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:83217d61e9fd3558b65db0260ef51ad536760ab14d05916df90caf1f2dec0874","observation_id":"a9e0edc7-8f05-48a3-9248-b6d61cd039ea","resolution":{"observed_at":"2026-05-14T10:08:28.828059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine learning , volume=","venue":null,"work_id":"86a5aa69-d4cb-427d-a129-f442fed4eb5f","year":1992},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:5cf96b1009f515040a512dc21f1ca3ffd47057221fe76e20acfbb6b85c1ac882","observation_id":"eb548699-f795-4bc5-94e1-f14d8f8a1fd3","resolution":{"observed_at":"2026-05-14T10:08:28.870212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine learning , volume=","venue":null,"work_id":"15236db4-ba67-4457-ba1f-f1c64db32413","year":1992},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a5dcc5c376f6300afcb791fcb69c9dc8a9bb4dab65e41da69b47b3364cfba003","observation_id":"8a8d5695-d1ef-4573-b444-af10c596fc82","resolution":{"observed_at":"2026-05-14T10:08:28.886287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Todorov , title =","venue":null,"work_id":"05eee2c6-9d9d-4ad0-9070-d2498c663f8e","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:ebb479df6a14019b7c12ff1735e58fd255b4e6b8a1bee75fec7f25eebe39d485","observation_id":"9704249c-e542-4a9d-a7cb-a8c861cfc365","resolution":{"observed_at":"2026-05-14T10:08:28.887954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Schaal, S","venue":null,"work_id":"54a91c0c-7d2c-4894-b945-e64cea7badbd","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:ead5efdcdfb8bea4a51a790d10ebe22d10a7b68cbfe37cbe92802bb6f336f169","observation_id":"b010ca1b-f766-4b39-8d6f-169ca18fe369","resolution":{"observed_at":"2026-05-14T10:08:28.866386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neumann , title =","venue":null,"work_id":"ee9febd2-d98d-42d8-ba24-53a9501eb5de","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:e5875e00c52c4eb37f78124b8453764ab2f1523a2fc20c4e2e36c5a01e01b458","observation_id":"efc5bd70-edb7-474d-99b8-22f7cb184ff9","resolution":{"observed_at":"2026-05-14T10:08:28.919341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Levine and V","venue":null,"work_id":"c48b7608-eda6-4f1c-9c22-678534686196","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:356f565f9e895848a1c7ba23211d49079f6dacb8a1e267d74619dc3535e515c1","observation_id":"f81744cf-1c30-4691-a18a-917fbbef84ca","resolution":{"observed_at":"2026-05-14T10:08:28.853691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Machine Learning (ECML) , year =","venue":null,"work_id":"e3d3b39d-744d-47db-b8c6-7bb43bae75dc","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a2c7787bde1d3d6b12a201aad27b959b7e7f0867eed198ded5e50c30942028a1","observation_id":"a598e534-ab2a-4f97-9e34-90854a5948f4","resolution":{"observed_at":"2026-05-14T10:08:28.859868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":"e8227dec-8ca6-45a0-a38c-a390c7088503","year":2005},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a3e251f95fcb39bae36cd54ac4d57cb84a4c98cabf9a787f734f038aeaa6cbca","observation_id":"78de8f95-197e-4cd3-a315-360f03990d38","resolution":{"observed_at":"2026-05-14T10:08:28.845494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , year=","venue":null,"work_id":"3b7fc5b0-a352-4a63-959e-d59395bd3dc5","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:f9c8b943bd3a79d260247a2652d6e78848d691f595459845b9ed6ca5efd2adab","observation_id":"6fe590dc-06d4-43ac-8a85-81f43203b9e2","resolution":{"observed_at":"2026-05-14T10:08:28.868499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , booktitle =","venue":null,"work_id":"74272226-c80a-4142-863f-552b904c0860","year":2018},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:778c1cbbc02c92e1b6459a3847e439e70b1fae4ff297042084ca90e33ef24cc4","observation_id":"ed0b712c-afe7-4c84-8985-147cb7a1b35e","resolution":{"observed_at":"2026-05-14T10:08:28.811747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , booktitle =","venue":null,"work_id":"74de669b-dcb6-42d0-a1c2-0245db55aa6b","year":2020},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:60982222b39c73db61255a354de758417101b547aeb72f883c37551561660d74","observation_id":"d6871d2d-813c-4643-89b0-193b84aef1dc","resolution":{"observed_at":"2026-05-14T10:08:28.852095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , booktitle =","venue":null,"work_id":"db829bd6-034a-4d0c-88ed-1a94df221bf1","year":2017},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:dbc5eb4bc7bc586aec447fe8fd10a042be165686949d7a4fc7dcb487b6849488","observation_id":"729ba718-0073-4eec-9431-996330d01b0c","resolution":{"observed_at":"2026-05-14T10:08:28.915831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Koltun, V","venue":null,"work_id":"999b6b39-0f8f-4b52-856e-d48f6e9f44b1","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:118207383a5a5ec9e567f478b88b4aab566f3de51f20c0760c2b7f8aa6af5097","observation_id":"26624040-4489-4354-a09e-a28f75c6d8f1","resolution":{"observed_at":"2026-05-14T10:08:28.917753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2f67ff28-4c06-4d10-bcef-edf8ed20faf4","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:157e1fb64808a7d14d3f23ce91927f550c9d0d277d1cf5ef578a3799cb62db81","observation_id":"cfe2ece7-d32a-492a-860e-8ea4d23a6c88","resolution":{"observed_at":"2026-05-11T11:33:21.714139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Pong, V","venue":null,"work_id":"d987949d-9855-4f49-90db-0af46575d0de","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:51a7c2c885484b5514d846d73bc0453f779673eb9a4ad334abb6ee6fb5b7aab9","observation_id":"aaca1e55-a15f-4f7b-b26b-f8f5161cdc67","resolution":{"observed_at":"2026-05-11T11:33:21.718120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nachum and M","venue":null,"work_id":"dd3e2aad-9f31-45a2-b24a-2e10c8bae581","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:91eb5c9cd5029f0ff08f4f97567113491440866b0b0eae6aeec85cb2f25c0857","observation_id":"21d6ff20-bd47-40c7-8b7e-8616ebe8846b","resolution":{"observed_at":"2026-05-11T11:33:21.722900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Popovi\\'","venue":null,"work_id":"c706409b-f228-43e4-940e-c786ac78eb36","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:15fd3e15fd99c8516ef09624ffe5a9f4f5504d65ca8c5c42b1fd57f26d6cd98a","observation_id":"6eeb3b54-aa3d-467b-8cf5-c70f27717686","resolution":{"observed_at":"2026-05-11T11:33:21.727855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Levine and V","venue":null,"work_id":"6ea027a5-4f7a-4b90-ac58-2bd85e724734","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:44d1731e154023602c485f4be17fd0f5cdb583f6778731d951756b5b113d4c40","observation_id":"8032c13b-c8d5-4c19-84bb-24042d8689ab","resolution":{"observed_at":"2026-05-11T11:33:21.733754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce7d9afb-069a-427a-9a80-f57f3dcdf524","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:38cc88be2bf4c238a84b201ae5944bd3d2bc553453f84427bc0a6e30cfaa2809","observation_id":"3c51fd4e-d0ac-4f50-9cc8-290fe3fd2209","resolution":{"observed_at":"2026-05-11T11:33:21.739083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wulfmeier and P","venue":null,"work_id":"3c058f8d-7ab5-427f-b090-21b42bbd65f7","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:1b38cf70beaa032f3bc728066d40a23a027f53c6a6c2f73c38ce2a2fb249dd88","observation_id":"524ca5d7-3f8b-4b6d-bff8-fa0e0b30e02b","resolution":{"observed_at":"2026-05-11T11:33:21.745334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e742283-1a73-401a-a297-fff650e576a1","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:c27a167fb002fab092ed0c06fad1afcba75681189fd5c240148027e9c47b7e61","observation_id":"1165a998-d2ed-4e30-a0e0-9ac7b49a63f0","resolution":{"observed_at":"2026-05-11T11:33:21.750548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang and K","venue":null,"work_id":"6d216ac6-ff3c-4db2-bbe1-8709408cb6f9","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:3a5508979fff9faca067b77b9e3d7bd2be493c00402cad8ef02c317e4c42d448","observation_id":"9c2226fe-349c-4ed3-8655-f2ca6791d08e","resolution":{"observed_at":"2026-05-11T11:33:21.755430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang and A","venue":null,"work_id":"e7a2538e-593e-4e92-88cd-a3fa57f65e6f","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:a9e75979af9cb8d5a743f6db6d35e138d9339049928023630b3a0659b3b160db","observation_id":"300e8f57-5b77-440a-93a0-eae67aafc52a","resolution":{"observed_at":"2026-05-11T11:33:21.760387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , volume =","venue":null,"work_id":"ca28fd5a-bdfb-41b4-9d3a-db36dd45dd05","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:d40ce06620c33db8c58ef4773a282b9b090ccc7a62c8bee001cbe59d26b54c0f","observation_id":"fa80f8e7-95c2-40f6-b46a-2f589c87367c","resolution":{"observed_at":"2026-05-11T11:33:21.769769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Javdani and S","venue":null,"work_id":"a919290d-0112-4bc4-9c1a-9bb3b2485459","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:7c82698a16c1ec82fb1530406725cff3c943c14042929d4c74eee9cbaebe24cd","observation_id":"22563612-0b83-411a-a13c-0893c0dd71c3","resolution":{"observed_at":"2026-05-11T11:33:21.777702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , author=","venue":null,"work_id":"631765a7-4310-4213-a040-48eadb614092","year":2018},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:875265841c5f742505aabae06ac3a2a6d19f4d01f16237f9a629725a83a2d0b0","observation_id":"d45f29a8-2cdf-479b-8a03-a289d9d8f81f","resolution":{"observed_at":"2026-05-11T11:33:21.783811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":"79761d1c-c75f-46a9-b773-ac46b9aac478","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:9e73e20738f97936d113565b902d7cf61bd166f3edcd6e3f86c058c60c229df9","observation_id":"7c23d3c6-1c6a-4cfb-a909-5702a7ac3643","resolution":{"observed_at":"2026-05-11T11:33:21.790421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gupta and R","venue":null,"work_id":"dab35957-3025-46a5-a6c8-e18b2c622d0c","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:d0192cf3bab70e2c603652d30f35de6a9e9c9830ebf9a7a3dae90b75f7777613","observation_id":"10602982-8f0f-4abb-8482-4f7918b9b704","resolution":{"observed_at":"2026-05-11T11:33:21.797488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Finn, C","venue":null,"work_id":"e45e8edc-2d5d-4c76-b1de-cef0857f72ce","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:d3a19b8eaf300e95ddade8b2e497a425c9e4c5c6b543c7a261b13c97eb17c520","observation_id":"b6c630a0-7ab4-4352-86cf-a609963390e6","resolution":{"observed_at":"2026-05-11T11:33:21.802664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"32c7872d-5cd8-4676-a272-c2599ccdc3f8","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:1652b8e87b2b70e9f8e6fc0536b90ece1d59c152906b7dad2ff005045b0b4248","observation_id":"5a31aef9-3e84-471c-87be-caa11d9529fd","resolution":{"observed_at":"2026-05-11T11:33:21.808893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , booktitle =","venue":null,"work_id":"0866ac8d-8183-4fb4-998c-82a79b18756d","year":2017},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:d9496a3ab5fc4d8075bd23f11ea4ff940aebde90d3c8dc0115416106dc2b0921","observation_id":"ddf69ec6-8a02-4549-a84a-37bcb3a224f1","resolution":{"observed_at":"2026-05-11T11:33:21.812618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mnih and K","venue":null,"work_id":"96f6b8e1-4d31-4d53-a11a-aa8e9357ad30","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:0673bee177306700fc9264205a98abd2a37839629f9c9871ebd33bc2d361d12a","observation_id":"cc95fd18-d503-4564-ae63-7222ba6dfc59","resolution":{"observed_at":"2026-05-11T11:33:21.816384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"cacc86f4-7f53-4bd1-8b4b-8486f1b03ace","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:39e7a0b4bfd2deafcbf74585cc4b0ab14398a521aa88cc58b0f95f41b3025a43","observation_id":"8d001b6d-35cf-4d9d-ac16-97999581fc78","resolution":{"observed_at":"2026-05-11T11:33:21.825058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Information Processing Systems (NIPS) , year =","venue":null,"work_id":"2394d927-9372-4732-9337-f399decb4adf","year":null},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:0f2d9607cc77b0112c0dedc1175bf3630ebe5f1bf72154eca16902dfa8d5445e","observation_id":"ebbba56a-785d-496a-8e8e-4f57c08e9cab","resolution":{"observed_at":"2026-05-11T11:33:21.831420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":2,"unresolved":15,"verified_exact":2,"verified_fuzzy":77},"total_outbound_references":284},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 284 outbound references and 100 inbound Pith citation observations for arXiv:2005.01643."}