{"as_of":"2026-08-05T22:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:deb4a84df6633c750b4a89709c418bd5b34b9b265b00c75fd84dbfae60c57351","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T23:19:17.322890Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":133,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:31:40.373231Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":332,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-07-06T11:15:20.397336Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:cd57baebe7a1dbb399ea3cf5bef9dcece8830e02555718fd209de103dba73a3a","observation_id":"b03cbe9c-e8f5-4b3c-af90-3dc6ed420c31","resolution":{"observed_at":"2026-05-18T15:11:11.350481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:4b0611ac8b1b607488fb48c054f1a4a29a5aceac92314eca8ab993c057ddd61f","observation_id":"96a97e61-ac58-4ab4-83c0-86c1fe1e232e","resolution":{"observed_at":"2026-05-13T08:51:55.889484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T08:47:05.621624Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2110.06169"},"observation_digest":"sha256:f97817a8b40e71b434c72ccd054dde3eff2aa156b96b047b9ece1274c51e7eff","observation_id":"f0990480-5133-486b-98f6-55088ccd70d6","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:d99f26d4b32427b624302989cfef06a29221c08762282c6396e76db03b596142","observation_id":"eb7e1477-4135-4d10-aa68-f0701e0b9b29","resolution":{"observed_at":"2026-05-13T06:24:50.003323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:d91665e83443bbd0a7a5747d0774e94fca9e14ac53248bbb23b167cda868712a","observation_id":"056b3df7-809a-4f66-9d87-30044f2e8677","resolution":{"observed_at":"2026-05-15T07:55:15.719096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:8b6c5fb7154b2b6bf5c432c40bc022c5bbc30a7208b7285476d31905b62f1aa3","observation_id":"2e383054-929e-49e3-aa6c-3220cb086042","resolution":{"observed_at":"2026-05-13T13:48:36.463593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:59:55.849296Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2308.08998"},"observation_digest":"sha256:6af01b391e627adb2d8d6c414592598c93bbdcd625958e1309b79e297df82242","observation_id":"8121b253-57dc-4d88-9350-1a3797ac843d","resolution":{"observed_at":"2026-05-13T07:59:55.994990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:a4148b651db539881c058d340e09cfcef115e7ce528dac8cc7bebef9b179ff2e","observation_id":"6007e803-a731-4848-9346-735f01200ceb","resolution":{"observed_at":"2026-05-16T08:12:31.498323Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2310.17245","last_updated":"2026-04-13T15:52:28Z","snapshot_observed_at":"2026-07-06T16:38:48.736281Z","submitted_at":"2023-10-26T08:45:23Z","title":"CROP: Conservative Reward for Model-based Offline Policy Optimization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-24T06:37:57.104233Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2310.17245"},"observation_digest":"sha256:e56458f7f217f8223c376f46116b19ab751cd139dc3b93b958145565e37cbb67","observation_id":"b443c3ce-7dc3-4900-abf3-2cee4db9d8d8","resolution":{"observed_at":"2026-05-24T06:39:01.273066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:14.776754Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2409.00588"},"observation_digest":"sha256:d21830007f7f3aa78a94c50b2e1625a4533312b36e6e94f0adeb31e36c8c846d","observation_id":"5a6f5bcd-6534-4829-b82c-b488f681c20d","resolution":{"observed_at":"2026-05-16T08:48:14.822907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T16:06:09.448517Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2411.04983"},"observation_digest":"sha256:8c77de6389d6b183bcd1d7480a50045da2ccb8d59678fe89b6613218d827a0a4","observation_id":"87d777e8-925b-4e41-a35a-3eb5d2dc0e9e","resolution":{"observed_at":"2026-05-17T16:06:09.706298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2411.12173","last_updated":"2024-11-19T02:35:14Z","snapshot_observed_at":"2026-07-06T19:52:20.541067Z","submitted_at":"2024-11-19T02:35:14Z","title":"SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-25T08:33:45.689151Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2411.12173"},"observation_digest":"sha256:feff10863532183a8775ecf342ff349b94285e3f548cbf770f1d88e2fc41c76a","observation_id":"768d8265-374c-461e-99ae-d608acbccdaa","resolution":{"observed_at":"2026-05-25T08:35:32.373740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2502.03752","last_updated":"2026-05-20T06:52:21Z","snapshot_observed_at":"2026-08-01T01:44:15.704911Z","submitted_at":"2025-02-06T03:28:45Z","title":"Self-Improving Skill Learning for Robust Skill-based Meta-Reinforcement Learning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T03:22:25.891899Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2502.03752"},"observation_digest":"sha256:24de12485d6c75628bc95b8176fe52a7442d86407c40bf0185d1cc91980ec063","observation_id":"0b98c64b-e5f3-40c2-a30c-c8984397de76","resolution":{"observed_at":"2026-05-23T03:25:20.960243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2504.11944","last_updated":"2026-05-13T09:05:56Z","snapshot_observed_at":"2026-07-06T21:10:18.015145Z","submitted_at":"2025-04-16T10:23:44Z","title":"VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T19:34:33.263674Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2504.11944"},"observation_digest":"sha256:01c99b5cebbb9543b0abcb622c4b00fa3a99b8e475e3d2a4c8756204827d14ed","observation_id":"f2cadc78-32f1-4156-8ad2-cbb1b08b6c3e","resolution":{"observed_at":"2026-05-22T19:35:03.974184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2506.00560","last_updated":"2026-05-22T14:13:18Z","snapshot_observed_at":"2026-08-01T22:03:38.073077Z","submitted_at":"2025-05-31T13:33:27Z","title":"Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T08:18:07.233257Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.00560"},"observation_digest":"sha256:72350be3de2c9a492221036b5a4fee965909db3e46bebfd8f9711d60590aded0","observation_id":"082498cf-373b-4224-8c6f-e362e0bc2cbc","resolution":{"observed_at":"2026-05-25T08:20:32.161757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2506.05762","last_updated":"2026-05-14T17:01:38Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T05:41:33Z","title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T10:48:28.980868Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.05762"},"observation_digest":"sha256:4c1dd4f49b8de16d14de7780fc6c2242cf52ba509d291d83a5085b08d1c38dd1","observation_id":"08e7d6ac-5f1e-46a2-a11f-46da1e673db4","resolution":{"observed_at":"2026-05-19T10:52:15.282652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:2b231434095346cb31ec3b9ce2c98a6f944f021beea89ef81bed7f07b868b522","observation_id":"5aad7009-083e-488c-9af3-ed08460e21cd","resolution":{"observed_at":"2026-05-19T05:22:06.438696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-02T06:26:17.199293Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:d37d54d9dd51f17ffc045caed05c51fa757d5bc993c2cef46653ddcc932d5cad","observation_id":"def2e6e4-6bb0-4153-ab55-74b75950ddb4","resolution":{"observed_at":"2026-05-19T05:12:05.233681Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T20:31:40.373231Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-05T20:44:28.806636Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.373231Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:4e623ec846f9c610991b5f1a01f9ebac7ba0952c8092656e134c42ec7fd36bd9","observation_id":"a2456204-5759-4069-a0ab-dc1eb6aa0689","resolution":{"observed_at":"2026-08-05T20:31:40.373231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T18:39:04.995300Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-05T18:39:01.436036Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.995300Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:01c47a3f0626059b8e2780510cda153abb86458fced1e0462d39a8a31757473d","observation_id":"2d4a01d8-5431-4ff3-b9cc-a90db187aa92","resolution":{"observed_at":"2026-08-05T18:39:04.995300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T17:23:27.179232Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.16420","last_updated":"2026-06-23T14:55:14Z","snapshot_observed_at":"2026-08-05T17:23:24.045232Z","submitted_at":"2025-08-22T14:30:53Z","title":"Hybrid Sequence Modeling and Reinforced Verification for Controllable Target-Conditioned Decision Making","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:23:27.179232Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.16420"},"observation_digest":"sha256:a0cad472fe9e967d4f3b499f4153c0436886041b0cc8173fc3559c973e1b238b","observation_id":"a6d7480c-c3f4-4d6f-ad19-da06d30e4a35","resolution":{"observed_at":"2026-08-05T17:23:27.179232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T15:52:46.789736Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.19344","last_updated":"2025-08-26T18:05:09Z","snapshot_observed_at":"2026-08-05T15:52:45.678946Z","submitted_at":"2025-08-26T18:05:09Z","title":"Re:Frame -- Retrieving Experience From Associative Memory","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:46.789736Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.19344"},"observation_digest":"sha256:2b506ca2d5e9fd2ff92c2ffd688fc1c02e85307eae3c72f91ba7da2e2ec246c8","observation_id":"a95ed71a-ccb4-4cca-8a15-e917a0b43254","resolution":{"observed_at":"2026-08-05T15:52:46.789736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T13:46:02.304215Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.00347","last_updated":"2025-08-30T04:02:33Z","snapshot_observed_at":"2026-08-05T13:46:01.757434Z","submitted_at":"2025-08-30T04:02:33Z","title":"LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.304215Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2509.00347"},"observation_digest":"sha256:d1f2cd4ee6be8d0131269a1f53d4606b033471b271f7f4dde303b6c78aeb15e4","observation_id":"4d68f3ad-e4fc-40e6-be86-ce3a31ed6f15","resolution":{"observed_at":"2026-08-05T13:46:02.304215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T11:03:47.045375Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.03348","last_updated":"2025-09-03T14:25:36Z","snapshot_observed_at":"2026-08-05T11:03:35.319563Z","submitted_at":"2025-09-03T14:25:36Z","title":"Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T11:03:47.045375Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2509.03348"},"observation_digest":"sha256:7f21e56f3e711028cec9171dff7a1f882559bf0cae02b5786f16ca57c9f2e736","observation_id":"8b32a97b-13a5-429d-8f21-7299b022d80f","resolution":{"observed_at":"2026-08-05T11:03:47.045375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T21:32:56.756509Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.07953","last_updated":"2025-09-09T17:41:29Z","snapshot_observed_at":"2026-08-04T21:32:53.985511Z","submitted_at":"2025-09-09T17:41:29Z","title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:56.756509Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2509.07953"},"observation_digest":"sha256:766d416626de4b860abaa65fc489bb8fe6e7a1577b11106980151bf0ee41c3af","observation_id":"105b4d2d-95fe-4035-8093-997cfb7f6976","resolution":{"observed_at":"2026-08-04T21:32:56.756509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T10:30:59.176386Z","title":"D4rl: Datasets for deep data-driven reinforcement learning,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.19305","last_updated":"2026-06-02T14:25:30Z","snapshot_observed_at":"2026-08-05T10:30:58.593853Z","submitted_at":"2025-09-04T08:50:31Z","title":"Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:30:59.176386Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2509.19305"},"observation_digest":"sha256:e06a09fe10521fe94d40307e062eeb9137014ab6ef941860e8f6de0fe1619101","observation_id":"fbd857a9-8bbf-4418-9d10-9f27dceac450","resolution":{"observed_at":"2026-08-05T10:30:59.176386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2510.01105","last_updated":"2026-05-08T13:22:44Z","snapshot_observed_at":"2026-07-06T22:31:24.978726Z","submitted_at":"2025-10-01T16:50:57Z","title":"Geometric Analysis of Neural Regression Collapse via Intrinsic Dimension","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T10:22:28.096542Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.01105"},"observation_digest":"sha256:84f6ecf6faf008ce1f9e360427b296814e632a3450b4e9951ac4e762654f2083","observation_id":"31d12c3c-6aa9-4e46-b2e8-bcc925e672c5","resolution":{"observed_at":"2026-05-18T10:22:33.167687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T13:00:06.749438Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-04T12:59:59.479449Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:06.749438Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:9a03c276ceb8e901b2a440d6fd78264f73b3f44f60e757e8c51a661aff7efd9c","observation_id":"5456f005-3387-4bba-9222-69cef5bd08d8","resolution":{"observed_at":"2026-08-04T13:00:06.749438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T12:42:57.503906Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.503906Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:2f3c6d3626a4c05144af1a824d8c61a8371a289cb3aa686b983ad760f7876be1","observation_id":"6ff1f605-4b91-41a4-928e-48d7f8e0ade7","resolution":{"observed_at":"2026-08-04T12:42:57.503906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T11:01:29.019869Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:29.019869Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:3d2e48b32f7cd557549a90b9e91fd7bfc758e0c1d8688b9c8c1237336819f54e","observation_id":"b3b4b8d2-937b-461b-9751-b200c71aea67","resolution":{"observed_at":"2026-08-04T11:01:29.019869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2510.09096","last_updated":"2026-05-09T01:16:54Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T07:48:12Z","title":"When a Robot is More Capable than a Human: Learning from Constrained Demonstrators","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T08:32:31.324408Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.09096"},"observation_digest":"sha256:c8e105210879d966ef83c0d139ef667807721de75b803c2cf4eea3460cce9ee0","observation_id":"88ac4429-a9b8-48c8-b863-761caf8642c7","resolution":{"observed_at":"2026-05-18T08:36:07.502681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2511.03828","last_updated":"2026-05-17T20:29:17Z","snapshot_observed_at":"2026-08-01T05:50:04.658635Z","submitted_at":"2025-11-05T19:48:46Z","title":"From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T00:36:32.681470Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2511.03828"},"observation_digest":"sha256:2e269884f6227f3e6080aa5739a94b1a38bbbaf2d1ba11f2d8136a5bc5f8ce56","observation_id":"8b9c1b37-a5b4-4536-ad75-32bf82f10675","resolution":{"observed_at":"2026-05-18T00:40:34.089204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2511.03828","last_updated":"2026-05-17T20:29:17Z","snapshot_observed_at":"2026-08-01T05:50:04.658635Z","submitted_at":"2025-11-05T19:48:46Z","title":"From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T19:02:38.240098Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2511.03828"},"observation_digest":"sha256:5bb383286ec464e3143e1f97626762a532d575c07ef0ddcbe5ebd67d21a89764","observation_id":"5187225d-4763-413e-8056-f61c646e943b","resolution":{"observed_at":"2026-05-21T19:04:19.080330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2511.08425","last_updated":"2026-04-26T02:47:45Z","snapshot_observed_at":"2026-08-02T21:07:23.190283Z","submitted_at":"2025-11-11T16:33:57Z","title":"HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T23:35:58.055724Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2511.08425"},"observation_digest":"sha256:a3207c4687e14b6b708711936652b2dec53390b158132cc210e3986c7361c70c","observation_id":"35d8367b-ce4e-4e4a-b7b2-c7bb1c9c8b11","resolution":{"observed_at":"2026-05-17T23:40:31.687030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2511.17568","last_updated":"2025-11-14T06:11:13Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-14T06:11:13Z","title":"Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T22:38:44.634676Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2511.17568"},"observation_digest":"sha256:61a9abe336f9be71502bf280bbe11767c25675d517f9034845c48dd5b41b2aee","observation_id":"4de086e7-0914-4087-887c-b83b1a45af85","resolution":{"observed_at":"2026-05-17T22:40:23.549987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-03T19:03:02.677475Z","title":"D4RL: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2512.02581","last_updated":"2026-06-19T14:04:42Z","snapshot_observed_at":"2026-08-04T01:02:06.821031Z","submitted_at":"2025-12-02T09:49:26Z","title":"Training Diffusion Policies via Prior-Mapping Co-Evolution","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T19:03:02.677475Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2512.02581"},"observation_digest":"sha256:194f0210124c024ff7388d50a2a51b7367ec9e75a6d26ea11a900a46983e1261","observation_id":"d823fb07-b89e-4f25-a906-c48b7bf19298","resolution":{"observed_at":"2026-08-03T19:03:02.677475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2512.24497","last_updated":"2026-05-18T09:26:59Z","snapshot_observed_at":"2026-07-31T22:57:41.701920Z","submitted_at":"2025-12-30T22:50:03Z","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T15:33:24.616338Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2512.24497"},"observation_digest":"sha256:fecb9b9127a7578c6a62caa7a694de4dbdf2541be530f3b4f5e1f27981988545","observation_id":"afc9e374-ce41-4c19-8a29-4bd2ca6cb10a","resolution":{"observed_at":"2026-05-21T15:34:15.055466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-03T06:13:00.031328Z","title":"Guo, H., Li, F., Li, J., and Liu, H","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2601.23225","last_updated":"2026-06-27T19:54:11Z","snapshot_observed_at":"2026-08-03T13:58:34.969644Z","submitted_at":"2026-01-30T17:47:36Z","title":"Agile Reinforcement Learning through Separable Neural Architecture and Applications","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T06:13:00.031328Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2601.23225"},"observation_digest":"sha256:08842c25a867393e00183447c6bbc6116cbcaa289b47232eb6da0e4efca6119d","observation_id":"0097d759-404e-46a8-8509-b5575182b672","resolution":{"observed_at":"2026-08-03T06:13:00.031328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-03T05:00:37.896103Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.03582","last_updated":"2026-05-28T14:16:58Z","snapshot_observed_at":"2026-08-03T05:00:33.921193Z","submitted_at":"2026-02-03T14:32:26Z","title":"Optimization and Generation in Aerodynamics Inverse Design","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-03T05:00:37.896103Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2602.03582"},"observation_digest":"sha256:72d7e051e132eb40986d7c06b68faf10ffebd47a95a4a973f480659aa7022cd3","observation_id":"6bdbc15a-247f-426f-9354-62caed138ed6","resolution":{"observed_at":"2026-08-03T05:00:37.896103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2602.07399","last_updated":"2026-05-22T10:22:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T06:31:53Z","title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T07:00:01.741166Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2602.07399"},"observation_digest":"sha256:ffa344a2ac2b3cff01ce44ad38f5a15a2037f8d77612e6a514a3f2b1957d9f54","observation_id":"c8d2bc5c-62e5-4b66-bc8a-af6bf541dbee","resolution":{"observed_at":"2026-05-25T07:00:26.103492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ce5ad5781a0e39f5351cfccb4da50c9c458f4dff292096fc5dec6f213c77dad1","observation_id":"a02efa69-4ede-40bb-a01d-524440790899","resolution":{"observed_at":"2026-05-16T03:37:13.883578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-03T02:53:15.220023Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:15.220023Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:3490b820310df511a9f62b3dab254b666c36a0c89167b9a5e90ce5ca2fef81d4","observation_id":"eb39c09e-d1d7-408d-b62c-421242145b72","resolution":{"observed_at":"2026-08-03T02:53:15.220023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-02T19:22:10.643647Z","title":"cc/paper_files/paper/2019/file/ 378a063b8fdb1db941e34f4bde584c7d-Paper","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.02650","last_updated":"2026-05-31T14:57:33Z","snapshot_observed_at":"2026-08-02T19:22:08.267355Z","submitted_at":"2026-03-03T06:36:16Z","title":"Improving Diffusion Planners by Self-Supervised Action Gating with Energies","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T19:22:10.643647Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2603.02650"},"observation_digest":"sha256:ea56b2f2ae8726287ef421d8f78150055137492f47257af8f014a9bb70c30255","observation_id":"9994c1e3-cfea-43ac-a448-9b2ec568ecc5","resolution":{"observed_at":"2026-08-02T19:22:10.643647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:02ae26d0b25a111fa7cf0b8a27231aa57923520107d5a901c4ad0b6fc9efa292","observation_id":"49fe07e8-0158-4b31-bc4c-500d4644040f","resolution":{"observed_at":"2026-05-15T16:36:17.891180Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2603.06082","last_updated":"2026-04-19T06:37:14Z","snapshot_observed_at":"2026-07-06T22:48:04.438669Z","submitted_at":"2026-03-06T09:33:00Z","title":"Offline Materials Optimization with CliqueFlowmer","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T15:35:43.439664Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2603.06082"},"observation_digest":"sha256:db7969a7ba19c7d5eb80cbe0586a9f56745efebf2c582bb7d6b44c065d1c35e2","observation_id":"0ebca3db-c17c-4070-8574-b1e1eef07451","resolution":{"observed_at":"2026-05-15T15:36:13.368034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2603.14392","last_updated":"2026-05-19T22:32:16Z","snapshot_observed_at":"2026-08-03T02:51:25.795638Z","submitted_at":"2026-03-15T14:12:43Z","title":"WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T11:40:28.002606Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2603.14392"},"observation_digest":"sha256:c4acb7f3d430886bfd546fce1aa0e7b100eeafaf218913b127cf811db9b0d8e0","observation_id":"f5a947da-c221-46c4-b46b-19a01174cdf6","resolution":{"observed_at":"2026-05-21T11:44:09.368937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.02349","last_updated":"2026-02-19T02:11:01Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-02-19T02:11:01Z","title":"OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T21:38:53.792221Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.02349"},"observation_digest":"sha256:a2b33b0b38e80fcda93a9102acd7d197207f2875c9da115a7c00c3d4b36c1557","observation_id":"76d88731-d32f-4c2f-a51e-9ac0178b4463","resolution":{"observed_at":"2026-05-15T21:40:21.069448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-07-13T13:17:06.175932Z","title":"D4rl: Datasets for deep data-driven reinforcement learning,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2604.03531","last_updated":"2026-04-04T00:30:43Z","snapshot_observed_at":"2026-08-02T11:03:27.290907Z","submitted_at":"2026-04-04T00:30:43Z","title":"Genuine pair density wave order on the kagome lattice","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T13:17:06.175932Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.03531"},"observation_digest":"sha256:a272f1596fee67b3750a5d7f0be70a65bb8bf83c3666f844d9369d8d7b8cdc33","observation_id":"1205d63e-d996-4c7f-90e1-76b626f235c8","resolution":{"observed_at":"2026-07-13T13:17:06.175932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.04401","last_updated":"2026-04-06T04:00:40Z","snapshot_observed_at":"2026-08-02T07:48:34.195095Z","submitted_at":"2026-04-06T04:00:40Z","title":"ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:15:17.754359Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.04401"},"observation_digest":"sha256:1844deb2f07e212cd9b0ad15cd0a670ad6b63cfe6cc5a565489be10edd203a45","observation_id":"9712c528-5430-493c-bb61-6410c676f04c","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.07426","last_updated":"2026-04-08T17:14:21Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T17:14:21Z","title":"GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:08.661669Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.07426"},"observation_digest":"sha256:767529b5ea32e95aadd32f9b179768395a98f5e52e8927777191c216bdff7ceb","observation_id":"e3d4369c-2edd-4654-8f6a-7a530f96f858","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.10962","last_updated":"2026-04-13T03:56:37Z","snapshot_observed_at":"2026-08-02T07:19:58.094243Z","submitted_at":"2026-04-13T03:56:37Z","title":"ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:36.261596Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.10962"},"observation_digest":"sha256:c87e409dbc259fa55f19eab92e59e271aa84269b97ed9b12874585919c50443d","observation_id":"61f24b5e-0e21-4723-ab70-4d3bf8bdecc8","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:fabcffc5dc9815e5c80f61d2b634caee789744a9c9fa12fc9b2f5a67292f7a00","observation_id":"190e4f2f-e278-4ee9-8593-9eace7de7c56","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.18343","last_updated":"2026-04-20T14:41:37Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:41:37Z","title":"DAG-STL: A Hierarchical Framework for Zero-Shot Trajectory Planning under Signal Temporal Logic Specifications","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T03:53:37.295204Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.18343"},"observation_digest":"sha256:c14fa2008e137540e11f97fd82019ae5291e8b99c95ac531130a90ce81bb19a3","observation_id":"fdba2290-af2c-49d6-8d2c-e84a4fcd6e54","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:4738f7de7045844b6be8cfd5e1b6366b01cb64f0c20b339d1e02ce9b09d46e76","observation_id":"c66bfe18-9a1c-4107-a25b-10e7dd7c5f43","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.22229","last_updated":"2026-04-24T05:07:09Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T05:07:09Z","title":"Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T12:24:01.571564Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.22229"},"observation_digest":"sha256:460c7c744866400c490883b122cbefdd24327290cf1932c6a309079a75ba1db4","observation_id":"464a0396-f629-4e6c-b26f-4b39347c925f","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.22873","last_updated":"2026-04-23T20:20:11Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-23T20:20:11Z","title":"When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T22:15:16.221059Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.22873"},"observation_digest":"sha256:ab51ebd341a7e3a51adb6e4c410015bea84dcf130cc29db189bd8e4f41e3d830","observation_id":"a84a47fc-3a2c-4d00-9698-2d3450947a1d","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.24532","last_updated":"2026-04-27T14:32:44Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:32:44Z","title":"A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:04:19.891421Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.24532"},"observation_digest":"sha256:72a6076765041a8a5adb0bc96941393637c87725d4018a243cf650c4846bd24e","observation_id":"18cabee3-709c-4f69-85c7-566a74ba41d8","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.24729","last_updated":"2026-04-27T17:40:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:40:18Z","title":"SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:01:31.928056Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.24729"},"observation_digest":"sha256:f34531190d21cc9536fcd8c466ba0925d958b9d042bd272c52df29a819bf3dc3","observation_id":"66f36f7c-97aa-4bc2-9122-46775a80aba1","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T20:30:51.580075Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:235b53aa32d09cc98408099d09dc8f2938eeaee91d446c567b30361f9d020d33","observation_id":"10136481-a4dd-4b07-910e-e847d1dade26","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T00:26:22.118037Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:13ff9b5d8ad0374e2c888bdd503667fc771be57403d0b013c94b3b7f5a8faad2","observation_id":"ca971361-1454-46ed-a56f-7e766c9ecb40","resolution":{"observed_at":"2026-05-21T00:29:17.328144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:d4e19a33bc98a413894885a3d186aa22c235146bb7a3e34e286165b71430c509","observation_id":"3bd84c05-6355-435e-9499-8b697f1c501c","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T00:43:24.171887Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:387a8eb38847d2b921e8a15a506cf730dc2c42e73c90d1be4e44dd76de7cf442","observation_id":"7fdfa13b-b218-4768-b952-242a14399073","resolution":{"observed_at":"2026-07-01T00:45:11.861707Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.01862","last_updated":"2026-05-08T03:23:44Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T13:11:28Z","title":"QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-11T01:17:48.643521Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.01862"},"observation_digest":"sha256:60187576bc7f0265ca3fcf4c3bf2547fabc1c5e9034a7d0ebfc9fc38ba75574b","observation_id":"c43bb4b8-d90c-46e0-9218-f097d8f54369","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.01968","last_updated":"2026-05-03T16:53:29Z","snapshot_observed_at":"2026-08-05T17:06:11.864759Z","submitted_at":"2026-05-03T16:53:29Z","title":"AdamO: A Collapse-Suppressed Optimizer for Offline RL","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-10T14:48:05.166453Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.01968"},"observation_digest":"sha256:2c10aedace560b89dfbb2267b03bb12a901f3d7e4a5ee9e4145b94a76710a86e","observation_id":"c17af99f-deba-4ed7-a985-9d972bd8a6ca","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:af566355ad5d7fcdce36842afc9f535c901bb679ee09b1716a23fd41e0148257","observation_id":"cf50f462-3ba9-4e54-9f39-99c5fb671ce3","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:dd7b6f13a0981203b0617035aecb7d3f7b62be009a73f1747928e534ba2da850","observation_id":"7f2b5ac5-f29a-402d-86da-8695f7888a87","resolution":{"observed_at":"2026-07-01T00:05:09.698570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.05123","last_updated":"2026-05-06T16:51:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:51:44Z","title":"Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T17:17:14.300877Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.05123"},"observation_digest":"sha256:b970994393bc67e8443af4c2aab1436eb53b96ea34b9fe8ef38d763321f43491","observation_id":"24b3ba85-c884-47fe-85b1-f56cffe7dd96","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-08T16:34:18.603134Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:0294f628ade093912f28fa2b1d52cd443dc0a92bd45d5d07b59c76ed1bb78c87","observation_id":"dc57dcd3-07fe-47ae-ae2a-e3e1efdcdcca","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:2b44eaddab37e8799566ad63b4a08a08d46489f86b8e6a46c456cad78a57c632","observation_id":"d828322f-2d29-4f44-a7f2-160889b7446b","resolution":{"observed_at":"2026-06-30T23:25:07.008761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.06104","last_updated":"2026-05-07T12:20:25Z","snapshot_observed_at":"2026-08-05T12:13:27.618448Z","submitted_at":"2026-05-07T12:20:25Z","title":"Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T13:56:01.365382Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.06104"},"observation_digest":"sha256:101bd90ab473940da4f66fc29d88bdf24009855610e05a7ffd2a76669c69ee9c","observation_id":"b6b75675-be3b-4006-a910-0a84b22b2387","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.06470","last_updated":"2026-05-07T15:56:43Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:56:43Z","title":"Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:45:30.543045Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.06470"},"observation_digest":"sha256:1e0190e5911f98f0bbe0a8346eaa049731143d562930715e4fcb4d567e41dfb2","observation_id":"ff817eb7-3b28-4405-98e4-6c28d6b6c3af","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.08202","last_updated":"2026-05-06T01:21:53Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T01:21:53Z","title":"Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:25.783688Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.08202"},"observation_digest":"sha256:8b46386e9526e2cf3bdbcb3598c7a96bdda0c6cbbf8496fb79538434bc7ae697","observation_id":"d9ecb821-828c-4490-951c-054cff5e55d9","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.08253","last_updated":"2026-06-03T21:28:18Z","snapshot_observed_at":"2026-08-02T18:39:18.875350Z","submitted_at":"2026-05-07T19:05:01Z","title":"Path-Coupled Bellman Flows for Distributional Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T02:12:58.528130Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.08253"},"observation_digest":"sha256:60b7506a5b9368742a1ac5a9f9deb50612eab14db64c62f0fea2b2b2815a3d2e","observation_id":"126dba32-4761-4544-8df1-4cb6b8e91b78","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.09999","last_updated":"2026-05-11T05:21:52Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:21:52Z","title":"Muninn: Your Trajectory Diffusion Model But Faster","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:49:48.492957Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.09999"},"observation_digest":"sha256:c7cadb4ff9829acf1bd59f845176171fd61cc684cf9d9dc40b2b3b25cd24fd1e","observation_id":"674b60ee-f6a5-4472-9be6-b3ea984461eb","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T02:32:16.746824Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:6bcc2a8431aaf101058a610b337092047cd6c678f0cc329c5b76b7e0c0defba7","observation_id":"5168a44a-e61d-4195-ace1-3e30d6303173","resolution":{"observed_at":"2026-05-13T02:37:08.265876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T08:53:29.468764Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:484af3fe379707e4e97b79c1b8a925cc1256256bcd19508d6d42a89a9576e5f5","observation_id":"f1b1d3b8-6b7a-49ac-9ea9-261dd9604361","resolution":{"observed_at":"2026-05-21T08:54:05.820213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.12379","last_updated":"2026-05-12T16:44:02Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:44:02Z","title":"Discrete Flow Matching for Offline-to-Online Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T05:48:40.468890Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.12379"},"observation_digest":"sha256:5edb55314e1a2445369e77f50149fab50c7659b93fc9d18ad67bbe0da4b1ee4a","observation_id":"38465ba8-f265-4ffc-a194-0da14a4ed6a9","resolution":{"observed_at":"2026-05-13T05:52:22.621567Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.12416","last_updated":"2026-05-12T17:12:29Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:12:29Z","title":"Aligning Flow Map Policies with Optimal Q-Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:22.603786Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.12416"},"observation_digest":"sha256:92e6f938a10e9186ef929ffb25145753aaa53aad225f450ceb37360175244ab2","observation_id":"e4d16ba0-f6d5-4fdd-a772-588d649e45a1","resolution":{"observed_at":"2026-05-13T05:07:17.469255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.13054","last_updated":"2026-05-13T06:23:51Z","snapshot_observed_at":"2026-07-06T23:24:42.799888Z","submitted_at":"2026-05-13T06:23:51Z","title":"Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:19.948073Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.13054"},"observation_digest":"sha256:ee164fe3cd5d8b13bd7897d92ea473ed577988a533ccf6c166a5a66c71339ac4","observation_id":"a5acfc70-d5e7-43e2-b95c-0f1863985a87","resolution":{"observed_at":"2026-05-14T20:12:54.863399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.13401","last_updated":"2026-05-13T11:57:17Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:57:17Z","title":"Trajectory-Level Data Augmentation for Offline Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-14T20:08:37.905082Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.13401"},"observation_digest":"sha256:123d6d238aaa31be0c7cb45ef3eadf25b5fc284b6b1f44af0f92dae84a7d8182","observation_id":"f7760670-0df6-4bb9-8cf4-69235e2804c6","resolution":{"observed_at":"2026-05-14T20:09:26.246608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T19:26:19.032362Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:4373476eac564d621fe24d2c20cb84953ebecaa59f9d014e47e42e783ac74b09","observation_id":"def7e9d9-865b-4986-8179-fd7c5d15688b","resolution":{"observed_at":"2026-05-14T19:27:51.683262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:35:14.348849Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:8b816e4a58e774947878e641080282452c5da757946e8f393c82f0a218651faa","observation_id":"adfd5b49-d753-43f4-864b-8cb788035b6f","resolution":{"observed_at":"2026-07-01T14:25:46.676612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.14304","last_updated":"2026-05-14T03:12:29Z","snapshot_observed_at":"2026-08-03T04:02:31.058649Z","submitted_at":"2026-05-14T03:12:29Z","title":"Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T02:03:11.540545Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.14304"},"observation_digest":"sha256:86bc0faa97f5d504661cc4243858b6bcb714c714afd12ad60083397d2861f97d","observation_id":"237d37e1-954c-4458-9241-6c3cc4ed5702","resolution":{"observed_at":"2026-05-15T02:03:28.786780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.14497","last_updated":"2026-05-14T07:35:58Z","snapshot_observed_at":"2026-08-01T11:14:55.109730Z","submitted_at":"2026-05-14T07:35:58Z","title":"ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T01:32:42.972836Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.14497"},"observation_digest":"sha256:644ae829ad0f8745ffde5e29108b23533edad00746fecadad112e7cddf0adbfc","observation_id":"d55df0e7-3ba9-46ad-80ea-eb57cb4a6040","resolution":{"observed_at":"2026-05-15T01:33:27.173421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:4b7cc7bd5997e803b8001a336bae1c457107d220015de6a75dd7afe5479a20d7","observation_id":"8198ffb8-9122-401a-bff6-c39122b2a403","resolution":{"observed_at":"2026-07-01T14:25:45.828541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.16054","last_updated":"2026-05-15T15:21:25Z","snapshot_observed_at":"2026-08-03T10:16:57.496693Z","submitted_at":"2026-05-15T15:21:25Z","title":"Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making","version":1},"reference_index":289,"source":"arxiv_source","source_observed_at":"2026-05-20T20:54:31.025488Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.16054"},"observation_digest":"sha256:3a3ae444c96dcd57fd5b98d20b86333e5c0b0b6fc9908fe83a1f234bcbbd6f72","observation_id":"3733f407-d294-46b9-9a2f-ebebce9c9633","resolution":{"observed_at":"2026-05-20T20:59:02.182120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.18320","last_updated":"2026-05-18T12:39:30Z","snapshot_observed_at":"2026-08-03T10:32:13.740060Z","submitted_at":"2026-05-18T12:39:30Z","title":"ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T12:07:21.037980Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.18320"},"observation_digest":"sha256:787397500deb15ca099aac9537cf081eb922c4ca55b66f71a0f4182cc4febf0e","observation_id":"43488997-d8b8-465b-b061-0582c4de41c9","resolution":{"observed_at":"2026-05-20T12:08:15.446243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.19185","last_updated":"2026-05-18T23:24:45Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-18T23:24:45Z","title":"Planner-Admissible Graph-PDE Value Extensions for Sparse Goal-Conditioned Planning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T11:39:11.180742Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.19185"},"observation_digest":"sha256:554de276cb063f84753f22c3fcc787494b0cbaea2a33ce17d1cc8b0e9e5051b0","observation_id":"93b0f1b0-0f9c-4e52-9bae-199ba0d54173","resolution":{"observed_at":"2026-05-20T11:43:15.373119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.20299","last_updated":"2026-05-19T12:34:16Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T12:34:16Z","title":"Mechanisms of Misgeneralization in Physical Sequence Modeling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-21T07:44:37.810511Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.20299"},"observation_digest":"sha256:7f137825122e6601f5d6d5b43bfa6a8121143e9341a7edb40b29ea79eabe5a25","observation_id":"84e4ed2a-33f8-405d-ae91-ead714c2f975","resolution":{"observed_at":"2026-05-21T07:44:48.731073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.21800","last_updated":"2026-05-20T22:58:15Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T22:58:15Z","title":"stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T08:57:19.834179Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.21800"},"observation_digest":"sha256:bb0ccb0b94bcd98aae65be30c8a60a9c6bd421928047953d6eee38a1e95f71c0","observation_id":"13bbe72d-86e0-46db-b225-55663de43657","resolution":{"observed_at":"2026-05-22T09:01:20.300216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.22376","last_updated":"2026-05-21T12:09:11Z","snapshot_observed_at":"2026-08-02T19:31:57.676600Z","submitted_at":"2026-05-21T12:09:11Z","title":"Target-Aligned Bellman Backup for Cross-domain Offline Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T08:02:27.951445Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.22376"},"observation_digest":"sha256:b8714209060bcfe2e1b85b858c924d49a7ac1a7c9d2f7096973c17c290e74780","observation_id":"0083e051-41b1-47bf-adc2-b36f6b49bcf1","resolution":{"observed_at":"2026-05-22T08:04:43.177451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:32d781e0ade57a379783fa3d3243b315596f4b64a73dd5e10b28b4dc9ce8824d","observation_id":"ef85e69b-e9fa-42b6-933e-aa3bc3ad74af","resolution":{"observed_at":"2026-05-25T05:00:21.689776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.23993","last_updated":"2026-05-27T23:18:48Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-17T22:46:44Z","title":"Nano World Models: A Minimalist Implementation of Future Video Prediction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:52:29.675477Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.23993"},"observation_digest":"sha256:c5b214a9a321e9c3cce42459a9c737270235ffe5bbf1adc01da601a23ddf995b","observation_id":"0483ddab-512c-4619-a015-6c90d733a3e4","resolution":{"observed_at":"2026-06-30T18:55:00.269724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.24152","last_updated":"2026-05-26T06:41:34Z","snapshot_observed_at":"2026-07-06T23:34:13.859813Z","submitted_at":"2026-05-22T19:19:32Z","title":"Neuro-Inspired Inverse Learning for Planning and Control","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-30T16:07:16.957620Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.24152"},"observation_digest":"sha256:c362434a7be250e1023acf032a1edb31d3e824267517ce2e3d8015c451dcf82e","observation_id":"d993b474-5cde-4561-9112-c7cfa0d22ab6","resolution":{"observed_at":"2026-06-30T16:14:53.448530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.24649","last_updated":"2026-05-23T16:30:00Z","snapshot_observed_at":"2026-08-01T23:53:20.943593Z","submitted_at":"2026-05-23T16:30:00Z","title":"On the Stability and Realizability of Recurrent Polynomial Surrogate Ternary Logic Gate Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T15:01:45.367343Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.24649"},"observation_digest":"sha256:477cb1c3ad9c1beba553921ed51a2fc2b918c6a7f398b10ecaff7b5c66681f51","observation_id":"d57e4617-eefe-4682-bab0-65e4c02a40ac","resolution":{"observed_at":"2026-06-30T15:04:46.263955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.24810","last_updated":"2026-05-24T01:44:57Z","snapshot_observed_at":"2026-08-03T02:43:58.048800Z","submitted_at":"2026-05-24T01:44:57Z","title":"Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T11:43:41.884049Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.24810"},"observation_digest":"sha256:8327257c437cd1ff97e582350dc8bb985c99aaaf7c82ce375e246772cb79fea0","observation_id":"f8673c23-e7cc-4c9e-a7e1-0eb89ca582e6","resolution":{"observed_at":"2026-06-30T11:44:37.905162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.24924","last_updated":"2026-05-24T08:03:49Z","snapshot_observed_at":"2026-07-06T23:34:57.148983Z","submitted_at":"2026-05-24T08:03:49Z","title":"Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T01:10:47.622232Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.24924"},"observation_digest":"sha256:336aff0140dacd424351df55ab83b6057a39cc23c413e170118fc19c7a39987c","observation_id":"620cc88a-f8c3-4a09-b8de-8368248bf548","resolution":{"observed_at":"2026-07-01T15:45:48.219518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.25414","last_updated":"2026-05-25T04:30:51Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T04:30:51Z","title":"How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.25414"},"observation_digest":"sha256:3c0d25ab4e87c6799169b2a575e3740a784502063a784e59b91c68ed3d5c38c3","observation_id":"9bb7d4a3-abc3-43de-b545-3c4ccdbc78d5","resolution":{"observed_at":"2026-06-29T22:03:59.792125Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.25620","last_updated":"2026-05-25T09:21:43Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T09:21:43Z","title":"Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T21:43:59.953809Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.25620"},"observation_digest":"sha256:e94c428323a4883120febb63d652c6f1492e4ea26cdcd730c4a88f66fbfd554b","observation_id":"13412e0f-17b7-4ab5-9482-8704fa492281","resolution":{"observed_at":"2026-06-29T22:04:00.642255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.25740","last_updated":"2026-05-25T11:54:04Z","snapshot_observed_at":"2026-08-04T22:25:04.000666Z","submitted_at":"2026-05-25T11:54:04Z","title":"Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:24:26.258621Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.25740"},"observation_digest":"sha256:c53f5296fe34f29ce5cc88fc04d968a5668c80a2f5a586c6ba2e6494389a18bc","observation_id":"79c8ee20-236e-4919-a362-eb5da8c599a2","resolution":{"observed_at":"2026-06-29T22:34:02.574506Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2004.07219/citation-record","integrity":"/paper/2004.07219/integrity","json":"/paper/2004.07219/citation-record.json","paper":"/paper/2004.07219"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.00261","last_updated":"2020-10-14T18:56:23Z","snapshot_observed_at":"2026-07-06T08:11:43.104035Z","submitted_at":"2019-08-01T08:22:18Z","title":"On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift","version":5},"cited_work":{"arxiv_id":"1908.00261","doi":"10.48550/arxiv.1908.00261","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.00261","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Preprint arXiv:1908.00261 , year=","venue":"arXiv (Cornell University)","work_id":"f49e0fd8-840b-4c3d-bf03-e057e1da8f2d","year":1908},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1908.00261","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:497aadfce4732393259e557a8dd17919bacc02606737c980b70154400240d01c","observation_id":"a3c1607c-ae24-4103-a6d5-ac4d1bf911e0","resolution":{"observed_at":"2026-05-12T23:19:17.350031Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12200","last_updated":"2020-06-04T11:00:06Z","snapshot_observed_at":"2026-08-05T20:40:57.404955Z","submitted_at":"2019-09-26T15:45:23Z","title":"Scaling data-driven robotics with reward sketching and batch reinforcement learning","version":3},"cited_work":{"arxiv_id":"1909.12200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12200","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling data-driven robotics with reward sketching and batch reinforcement learning.Preprint arXiv:1909.12200","venue":null,"work_id":"c44fff83-b8c4-4bf1-a47d-0f5c0046b36c","year":1909},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1909.12200","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:0e4e2a49f84511af6c38fb6c73bb82a06a5dc233b28e7c844d4ca5e005906e7a","observation_id":"4ddb077d-4ab4-4e16-8f28-80bfed67cb41","resolution":{"observed_at":"2026-05-12T23:19:17.358030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End- to-end driving via conditional imitation learning","venue":null,"work_id":"a28935f5-b348-47b2-9aeb-25c303b9a4aa","year":2018},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:c54f695c3f34599168ef0232b6747b58a26f1358a2b8c4d454804b359622a4d4","observation_id":"e9534e1a-3b3b-4f71-b5cc-fe50080a65fb","resolution":{"observed_at":"2026-05-12T23:19:17.454535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-07-06T07:49:17.886466Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1904.12901","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-07-03T12:48:11.128704Z","title":"Challenges of Real-World Reinforcement Learning","venue":"cs.LG","work_id":"fc99449a-80f4-4f37-a028-7b3774c78bf6","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:78f30a05a57b246ac500d7fd7c1beab485cfa737acb38462442bfef24590de61","observation_id":"27625d21-bc61-4912-97bf-001f9bab866e","resolution":{"observed_at":"2026-05-12T23:19:17.399937Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11881","last_updated":"2021-03-04T13:02:59Z","snapshot_observed_at":"2026-07-06T09:07:31.294850Z","submitted_at":"2020-03-24T11:05:41Z","title":"An empirical investigation of the challenges of real-world reinforcement learning","version":2},"cited_work":{"arxiv_id":"2003.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.11881","snapshot_observed_at":"2026-07-03T14:58:33.280851Z","title":"Mankowitz, Jerry Li, Cosmin Paduraru, Sven Gowal, and Todd Hes- ter","venue":null,"work_id":"72539193-de5d-4093-a85f-abb4eba8699e","year":2003},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/2003.11881","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:99442e504c617f33ca2349ada9f145b43996b4a1e5fa826baae6b96152b93342","observation_id":"bfc646a4-47b4-4068-84fa-e9b213030d6c","resolution":{"observed_at":"2026-05-12T23:19:17.403954Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:563ed7c23c8e8adc082e424f0ca4cd6bf6f90261f7b6cc74abe7e8ed0d85e116","observation_id":"22f1d582-6358-4ddc-9f69-86b106be883b","resolution":{"observed_at":"2026-05-12T23:19:17.409114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning for robotic manipulation with asynchronous off-policy updates","venue":null,"work_id":"0d6f9a8d-2690-4be1-beee-849b9f9461f3","year":2017},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:025c0a6f9bd185ed27179f8866ef8e9f46dd77f5120487b28283f5d49f3a0f99","observation_id":"f4bc3789-f7d7-4bf4-91aa-81d2fe885d58","resolution":{"observed_at":"2026-05-12T23:19:17.471486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-05T07:09:46.676860Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:81027b5a9df6b3e4eb8c9267216a9152445c9568896877a17330713bd4dfbb18","observation_id":"b0592225-ea90-47e1-bf98-8704da4577f9","resolution":{"observed_at":"2026-05-12T23:19:17.414978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":"1801.01290","doi":"10.48550/arxiv.1801.01290","metadata_source":"pith","pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":"cs.LG","work_id":"6674e5db-4e1c-49c0-b598-c108a0ecadb6","year":2018},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:b8a54a48b3056bb07498ce0769d70312e35ac8ba2992d02025959f1e23c147ea","observation_id":"5c4e3e26-8a0c-4db9-a6d1-16be3f6ac593","resolution":{"observed_at":"2026-05-13T01:48:10.852058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1105.1749","last_updated":"2011-05-21T14:15:28Z","snapshot_observed_at":"2026-08-05T14:46:06.841206Z","submitted_at":"2011-05-09T18:17:20Z","title":"A Real-Time Model-Based Reinforcement Learning Architecture for Robot Control","version":2},"cited_work":{"arxiv_id":"1105.1749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1105.1749","snapshot_observed_at":"2026-07-04T19:25:11.510470Z","title":"A real-time model-based reinforcement learning architecture for robot control","venue":null,"work_id":"5fa4ced9-1ae8-4571-a5c6-bfb49eea3d8d","year":null},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1105.1749","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:43c50f745869df36f906526a294ba35ec3527773f0ff2fece96b204ebbeb13d1","observation_id":"68df719a-6080-45f7-8205-a8f327926b17","resolution":{"observed_at":"2026-07-04T19:25:11.510470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.04847","last_updated":"2019-09-26T13:30:53Z","snapshot_observed_at":"2026-08-05T19:55:41.654237Z","submitted_at":"2019-09-11T04:43:45Z","title":"RecSim: A Configurable Simulation Platform for Recommender Systems","version":2},"cited_work":{"arxiv_id":"1909.04847","doi":"10.48550/arxiv.1909.04847","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.04847","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recsim: A configurable simulation platform for recommender systems","venue":"arXiv (Cornell University)","work_id":"d798180f-4254-4e52-8e0d-1846a0a77e67","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1909.04847","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:c419bd7d374b1ea3f638d1d5ce6d829a80305a9fa3175775002712a074f7ed17","observation_id":"c6677e0b-b8ef-479f-83b7-a04ff281d78c","resolution":{"observed_at":"2026-05-12T23:19:17.432972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":"1907.00456","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-07-03T01:37:30.382383Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","venue":"cs.LG","work_id":"42fcaa3e-0409-481b-9dd5-9a2c3be8a383","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:7ddc298977a270ce1e38ce3b126e8c61760c1ffab153456e036c774905ffeda0","observation_id":"8850fa17-b592-49b3-914c-3ca670d20d07","resolution":{"observed_at":"2026-05-12T23:19:17.438895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00949","last_updated":"2019-11-25T18:52:33Z","snapshot_observed_at":"2026-07-06T07:57:34.683633Z","submitted_at":"2019-06-03T17:59:10Z","title":"Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction","version":2},"cited_work":{"arxiv_id":"1906.00949","doi":"10.48550/arxiv.1906.00949","metadata_source":"arxiv_reference","pith_arxiv_id":"1906.00949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kumar, J","venue":"arXiv (Cornell University)","work_id":"5245a2f6-b3e1-4edb-8d34-fb132fc9ccdc","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1906.00949","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:2e73d7ee6b6998298a8105f080e4167c4281822c2bb557fb8977b72b76ef3992","observation_id":"ce0e9a44-c3ff-492d-8b41-c1a1bd497106","resolution":{"observed_at":"2026-05-12T23:19:17.444141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:f16d028596cab1514bea68c730a239ee3f5f9534009e52ded4b5d3dfaf6317f4","observation_id":"b1bc3922-d0e6-40bc-89f5-08672e92a0da","resolution":{"observed_at":"2026-05-12T23:19:17.449574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":"1912.02074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-07-07T14:33:54.438896Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":"cs.LG","work_id":"610269f6-41b3-4fb1-8244-a79a8284c245","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:8261c0b48a552256a47ffa1dd0005aef0c5879d40ad63ec8f4c2134cbaf5f4ff","observation_id":"dcb8eeaf-0b4c-4764-8eac-50538e18f1bf","resolution":{"observed_at":"2026-05-12T23:19:17.364644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":"2006.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-08T22:35:40.693821Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","venue":"cs.LG","work_id":"f0a11265-1acf-4ffc-a822-08bd04b6bddf","year":2020},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:a3a11caaf21174e824637e8fadd52e3f4e8c81927eb6b6981dab162738cdeaa1","observation_id":"60ec4de0-a61c-4ee8-a7dc-fdc81d508179","resolution":{"observed_at":"2026-05-13T03:41:13.013491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:bc53e78766233db90600c27205e261d0ef7d22bdf249afb198b7e976c1980c8d","observation_id":"9ca6c1c0-191a-407d-9f18-79a353236244","resolution":{"observed_at":"2026-05-12T23:19:17.378013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06544","last_updated":"2019-10-01T00:13:58Z","snapshot_observed_at":"2026-07-06T07:08:12.503941Z","submitted_at":"2018-10-15T17:51:03Z","title":"Deep Imitative Models for Flexible Inference, Planning, and Control","version":4},"cited_work":{"arxiv_id":"1810.06544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1810.06544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep imitative mod- els for ﬂexible inference, planning, and control","venue":null,"work_id":"69a0cb9b-cf23-4cd3-a14d-0a5341fc9f10","year":2018},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1810.06544","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:cd7b6feb464641fc4ff594e14372f4a034e0cdc42d8b1630c44ba7b91b393666","observation_id":"fb030031-43ef-4ba9-9115-f9d6f05640f3","resolution":{"observed_at":"2026-05-12T23:19:17.383831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"78d94799-c768-4fbe-a811-1d57fd64018f","year":2012},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:54754775dc009198781f058fd9e4e9f1ef02884e80980dd0e5115a80ef044e91","observation_id":"5fc180cd-e726-4dbd-8194-476c6204ed10","resolution":{"observed_at":"2026-05-12T23:19:17.466685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05465","last_updated":"2021-12-30T22:53:50Z","snapshot_observed_at":"2026-07-06T06:04:20.308068Z","submitted_at":"2017-10-16T01:51:51Z","title":"Flow: A Modular Learning Framework for Mixed Autonomy Traffic","version":4},"cited_work":{"arxiv_id":"1710.05465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1710.05465","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow: Architecture and benchmarking for reinforcement learning in trafﬁc control","venue":null,"work_id":"3ecb1a55-de68-4c90-a7e3-7a81548cd5b0","year":null},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1710.05465","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:3d9ce7c0b39b305b906832ca40287f1d5c03cad9c03374fe0ef5de876b906de7","observation_id":"50a3e41c-c4df-4057-923a-f163b7cf1b81","resolution":{"observed_at":"2026-06-04T20:12:14.318237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:1ed8905413d263018b03e5f758e64d69e2615d18ace87097e8195bf2377998ad","observation_id":"f23487c3-36f7-43bf-8abd-e58104d9bd1f","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"carla-town","venue":null,"work_id":"74be4ac1-65cf-4622-aca2-c14d47cbd29c","year":2016},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:7350e39e851095890e16e853a0dcc9992c2368c54d2cabcfb637cc70b5c51e2c","observation_id":"a382beaf-5594-4e50-b63d-4ec349c568b9","resolution":{"observed_at":"2026-05-12T23:19:17.462257Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2017) Random, Controller Franka Kitchen Gupta et al","venue":null,"work_id":"9815f11a-a5c1-4db9-ac5c-2fc2518aa147","year":2017},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:d913fff0dbd2062b8f8620856682be4ddb5409a0d2c93927ed6ae38b436a633a","observation_id":"9d668e8c-4184-4d06-ab12-a8f095779585","resolution":{"observed_at":"2026-05-12T23:19:17.476151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training","venue":null,"work_id":"91e60325-ea5a-4dba-9c1f-7433775261a6","year":2017},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:b034613e6f4b228efa5e5bd9331324620781410191b1bd5922dc6a13444c7b57","observation_id":"4fa517c2-2747-4d59-997a-b9a64c062f02","resolution":{"observed_at":"2026-05-12T23:19:17.458461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":5},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 100 inbound Pith citation observations for arXiv:2004.07219."}