{"as_of":"2026-08-07T00:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9dafb923557f216e4ebec5cfca01acc2dc9b6c0d3e80ae979491aebe62344a42","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T11:40:26.649975Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:09:44.224340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T10:45:42.632381Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"cited_work":{"arxiv_id":"2604.15308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15308","snapshot_observed_at":"2026-07-01T10:45:42.632381Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","venue":"cs.CV","work_id":"cac892ab-c187-4afc-9d30-45b0eb1df43b","year":2026},"citing_paper":{"arxiv_id":"2605.04470","last_updated":"2026-05-06T03:49:01Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:49:01Z","title":"CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T17:20:55.364175Z"},"links":{"cited_paper":"/paper/2604.15308","citing_paper":"/paper/2605.04470"},"observation_digest":"sha256:5feccde1ff25ebe82258670a9dbec658462de9782c8845b07897c06a7dc2ac47","observation_id":"dff84d96-0b57-448f-a037-f7452849df0d","resolution":{"observed_at":"2026-05-11T17:41:06.621120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"cited_work":{"arxiv_id":"2604.15308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15308","snapshot_observed_at":"2026-07-01T10:45:42.632381Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","venue":"cs.CV","work_id":"cac892ab-c187-4afc-9d30-45b0eb1df43b","year":2026},"citing_paper":{"arxiv_id":"2605.12622","last_updated":"2026-05-14T17:59:01Z","snapshot_observed_at":"2026-08-02T07:45:26.844246Z","submitted_at":"2026-05-12T18:09:04Z","title":"Action Emergence from Streaming Intent","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-14T20:59:42.456958Z"},"links":{"cited_paper":"/paper/2604.15308","citing_paper":"/paper/2605.12622"},"observation_digest":"sha256:2a0784153df3d2dce0486f45d5048c8dbf09eb948d4b6bc6df8a8feda98548c0","observation_id":"c6a744b5-127e-45c8-ac57-7e87bab40e60","resolution":{"observed_at":"2026-05-14T21:02:59.140621Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"cited_work":{"arxiv_id":"2604.15308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15308","snapshot_observed_at":"2026-07-01T10:45:42.632381Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","venue":"cs.CV","work_id":"cac892ab-c187-4afc-9d30-45b0eb1df43b","year":2026},"citing_paper":{"arxiv_id":"2605.12622","last_updated":"2026-05-14T17:59:01Z","snapshot_observed_at":"2026-08-02T07:45:26.844246Z","submitted_at":"2026-05-12T18:09:04Z","title":"Action Emergence from Streaming Intent","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T05:13:44.795483Z"},"links":{"cited_paper":"/paper/2604.15308","citing_paper":"/paper/2605.12622"},"observation_digest":"sha256:5675d806c69069dbfdcde0f4c729f2f30cce9c295969537fa51c612b8997c9c3","observation_id":"139ed23e-ac61-40bc-9be3-8b9a2ac03116","resolution":{"observed_at":"2026-05-15T05:15:03.010464Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"cited_work":{"arxiv_id":"2604.15308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15308","snapshot_observed_at":"2026-07-01T10:45:42.632381Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","venue":"cs.CV","work_id":"cac892ab-c187-4afc-9d30-45b0eb1df43b","year":2026},"citing_paper":{"arxiv_id":"2606.31844","last_updated":"2026-06-30T15:45:34Z","snapshot_observed_at":"2026-07-07T00:05:31.888697Z","submitted_at":"2026-06-30T15:45:34Z","title":"Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T05:09:44.224340Z"},"links":{"cited_paper":"/paper/2604.15308","citing_paper":"/paper/2606.31844"},"observation_digest":"sha256:2f1344073076722a47319be7077c1f6ab148d769688b2848e56a87d8239e2072","observation_id":"91497563-66f8-4f8f-b736-bffaf38cb914","resolution":{"observed_at":"2026-07-01T10:45:42.633736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.15308/citation-record","integrity":"/paper/2604.15308/integrity","json":"/paper/2604.15308/citation-record.json","paper":"/paper/2604.15308"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lan- guage models are few-shot learners.Advances in neural in- formation processing systems, 33:1877–1901","venue":null,"work_id":"4b7abf29-1bb2-469d-b32b-06c66c8b3f03","year":1901},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:36eebe22f91f7cce4218a66604ef5952d2aca118541f492ee72d9d6bcad5432a","observation_id":"840b0c73-cf82-4a07-be4b-883d745314d3","resolution":{"observed_at":"2026-05-19T13:42:19.940862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":"2402.13243","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-07-10T08:36:59.845914Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","venue":"cs.CV","work_id":"e7670f83-e1e1-41e7-86eb-39477a3a10b2","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:609824f5ecd4b1e143d8cd23ecb1ac7d2c2bcde7fa6fc3788d558bb6d237102f","observation_id":"f0dbca0e-be35-4dca-893c-7892d2c8cc93","resolution":{"observed_at":"2026-05-10T11:50:21.041065Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfuser: Imitation with transformer-based sensor fusion for autonomous driv- ing.IEEE transactions on pattern analysis and machine in- telligence, 45(11):12878–12895","venue":null,"work_id":"f40bbd5b-a575-4dfc-aed1-8fd1771b7052","year":2022},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:1313e53d7902db0ce1ac4414b9da5890adb915d5aa7d94a9ad59d76ea1700bd8","observation_id":"92b86fd1-531d-45c6-9395-4c3209775aae","resolution":{"observed_at":"2026-05-19T13:42:19.954402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:32:56.698477Z","title":"Carla: An open urban driv- ing simulator","venue":null,"work_id":"60a7fbfd-2dfb-4197-8c87-7b563aa3cc5d","year":2017},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:38284f2bcb993dea88827302ca5c67f853fb89f5e32e394f178bf8d0ee9d3e59","observation_id":"2d2cf40f-1149-4bad-8976-4cf465f8bffb","resolution":{"observed_at":"2026-05-19T13:42:19.956583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17879","last_updated":"2024-06-07T12:27:03Z","snapshot_observed_at":"2026-07-06T18:21:05.410042Z","submitted_at":"2024-05-28T06:57:22Z","title":"Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree","version":2},"cited_work":{"arxiv_id":"2405.17879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resisting stochastic risks in diffusion planners with the trajectory ag- gregation tree","venue":null,"work_id":"0d64e65f-7344-45a6-ab88-1968e569e909","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2405.17879","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:5f6574769cbf90adc8fe8c6b66ac3764a9c774fd05a2a1049d0911f17ca9c557","observation_id":"d07e678b-9544-4407-a69c-0161020672db","resolution":{"observed_at":"2026-05-10T11:50:21.045184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13636","last_updated":"2026-07-17T07:01:14Z","snapshot_observed_at":"2026-08-04T13:44:30.220787Z","submitted_at":"2025-12-15T18:31:32Z","title":"MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2512.13636","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13636","snapshot_observed_at":"2026-07-20T02:18:22.862599Z","title":"Minddrive: A vision-language-action model for autonomous driving via online reinforcement learning","venue":null,"work_id":"194e5628-5507-415b-b9dd-adf44a066c35","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2512.13636","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:251de1e60d7f5941ddb204bb15db31fce5fde0c032bd6ef91b34007fed1ee6de","observation_id":"51c2ff29-f615-4989-acf3-288d6436912b","resolution":{"observed_at":"2026-07-20T02:18:22.862599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:14.075735Z","title":"Rad: Training an end-to-end driving policy via large-scale 3dgs-based reinforcement learning","venue":null,"work_id":"1387647a-8622-4dcc-b807-054507a83d60","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:6470ecf3c03fbe885468044240f8d7cf7142a0355840076379ea55fe4aef8f6f","observation_id":"fc49d740-28e1-4fa7-91d7-4034eefa377b","resolution":{"observed_at":"2026-05-10T11:50:21.049149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:c0fc30b09e1bfc36c26f1dd5425136e324256603c4b01f683a38b475f4a3ff50","observation_id":"80eb5342-4900-445e-8868-3e4d60b7950e","resolution":{"observed_at":"2026-05-10T11:50:21.064344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15111","last_updated":"2025-05-21T05:05:38Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:05:38Z","title":"iPad: Iterative Proposal-centric End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2505.15111","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15111","snapshot_observed_at":"2026-07-10T08:36:59.832088Z","title":"Marcel Hallgarten, Julian Zapata, Martin Stoll, Katrin Renz, and Andreas Zell","venue":"cs.CV","work_id":"8d622f56-73cd-4199-b12d-af1a96142c26","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2505.15111","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:e53cfc2724639e51084c7bbeb3c7670fac9a23b9f04f7843da5da6862cf47125","observation_id":"1d83db5a-3405-479e-97ba-50cdab6d643c","resolution":{"observed_at":"2026-05-10T11:50:21.056914Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"c8293393-6024-4f07-b0d2-6f9d7eef7894","year":2020},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:fa48deefddb9c01d65ff5abe9eb1af62fb35b6cb09cb9d45b65aacc5791abe26","observation_id":"16eb8e52-696c-4f20-ad40-8be71aa10b6b","resolution":{"observed_at":"2026-05-19T13:42:19.948732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:1eee377be51ee1b4658941eef5ed1043940036e7ecc2bb4fb728d5266b78afdd","observation_id":"b2802603-c05d-4535-b324-e3b446ad262d","resolution":{"observed_at":"2026-05-12T07:15:10.779550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T06:03:21.397537Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"eef1dca1-4ab4-4600-a3e3-3a6198d81384","year":2023},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:824a163ad768e30cb4bd2162bd1c0eaf206baed8ee02fece1a8213a0ab25104d","observation_id":"8b408c0a-1490-4320-8198-03231d5407de","resolution":{"observed_at":"2026-05-19T13:42:19.943020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient deep reinforcement learning with imitative expert priors for au- tonomous driving.IEEE Transactions on Neural Networks and Learning Systems, 34(10):7391–7403","venue":null,"work_id":"7692727a-2f4b-46bf-bacd-fe8aa5742121","year":2022},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:5c72497a4f28f489f49a9113b8795553badc382a359b6cdaad2c135e6d899b4b","observation_id":"3548b779-b234-4869-80b6-91adb1501a60","resolution":{"observed_at":"2026-05-19T13:42:19.945020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial transformer networks.Advances in neural informa- tion processing systems, 28","venue":null,"work_id":"24e391e1-47eb-4b97-b590-40cb742110a6","year":2015},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:4fcf8dcdfc8d0a980c3012f99008b53d3cd528c2bb56b4a8a8ab157adb0af4a8","observation_id":"70ba084a-20ee-4e53-ab87-c041e02fb532","resolution":{"observed_at":"2026-05-19T13:42:19.958457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:751155dbeba6e19406544b5bafecc058c283f92c9238f0f5d0aedfaccc2d4846","observation_id":"9c2763b5-0114-431c-8799-11ea5c3d6578","resolution":{"observed_at":"2026-05-10T11:50:21.098215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vad: Vectorized scene representa- tion for efficient autonomous driving","venue":null,"work_id":"3a39c453-074d-42e8-b745-044b632055a1","year":2023},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:3024c40bc42f39fa77bd564506f4c5667d2c52284d86f0f33400f04f9c093a69","observation_id":"39d8feef-cfeb-46f1-908b-6b481ed0f38a","resolution":{"observed_at":"2026-05-19T13:42:19.946880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2410.22313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-07-10T08:36:59.782338Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","venue":"cs.CV","work_id":"d832f16e-83a0-4311-bc95-39727ba8ccb6","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2ad1fbc988ef1ba0f86d0554f3f2d3e5443f2f154d67657f770127fe6735b713","observation_id":"569dbf75-583f-4a1b-a9e2-508011a630fb","resolution":{"observed_at":"2026-05-15T15:24:24.181007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07608","last_updated":"2025-03-10T17:59:42Z","snapshot_observed_at":"2026-08-01T16:55:41.453922Z","submitted_at":"2025-03-10T17:59:42Z","title":"AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning","version":1},"cited_work":{"arxiv_id":"2503.07608","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07608","snapshot_observed_at":"2026-07-05T11:41:02.666322Z","title":"AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning","venue":"cs.CV","work_id":"6cb91ed2-9a71-43b2-8cdc-656e5c3e918d","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2503.07608","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:cf5b9c26059e92767a55ae571b92d61ce2da100278704061623786fc683dd15c","observation_id":"4770d6a5-9a45-489f-aa13-5625ee58a909","resolution":{"observed_at":"2026-05-16T20:06:27.342141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to drive in a day","venue":null,"work_id":"8e24e14d-5251-4678-947f-a223de20f1d7","year":2019},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:5414cc650e4b11d13e6fbe259143bb223755ca6b07e9227068fee6ce93d5aaaa","observation_id":"a7875584-d594-4914-b0d9-2090c549625c","resolution":{"observed_at":"2026-05-19T13:42:19.934668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:46:04.037239Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":"f02b3a8e-cb41-4f1f-ae1c-75b487ba20f9","year":null},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:789c2ca319ded685f293a5ea88c76449b457bbb06543a39ddd89205bb750401c","observation_id":"d748a0f8-3a40-4758-8e41-0bf85737e925","resolution":{"observed_at":"2026-05-19T13:42:19.936700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refining dif- fusion planner for reliable behavior synthesis by automatic detection of infeasible plans.Advances in Neural Informa- tion Processing Systems, 36:24223–24246","venue":null,"work_id":"53e831ff-e567-41d9-be01-dc4cab7eced3","year":2023},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:3fa9a8266096e415f54f45c9f70873fa65d7641312d6090db990c4e4a193b315","observation_id":"d56b62e9-6713-4cd1-9581-b6e503732534","resolution":{"observed_at":"2026-05-19T13:42:19.930951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-07-06T06:37:02.085757Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":"1805.00909","doi":"10.4249/scholarpedia.1658.url:http://www.scholarpedia","metadata_source":"pith","pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","venue":"cs.LG","work_id":"e29031ac-37fe-4702-86de-bb869d1f5c9a","year":2018},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:5366a5f1f48a4675a554d1f7608a8e60380fa49df79b677e64c3bffbf39dae42","observation_id":"0ed22d82-7023-4b08-bbd6-f7433d96b1a5","resolution":{"observed_at":"2026-05-13T18:27:03.097041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18313","last_updated":"2026-06-29T02:20:45Z","snapshot_observed_at":"2026-08-06T20:20:34.094359Z","submitted_at":"2025-10-21T05:49:01Z","title":"OmniNWM: Omniscient Driving Navigation World Models","version":6},"cited_work":{"arxiv_id":"2510.18313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18313","snapshot_observed_at":"2026-07-08T03:24:28.733832Z","title":"Omninwm: Omniscient driving navigation world models","venue":"cs.CV","work_id":"48c27159-47ff-410a-b026-b217c324aa98","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2510.18313","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2b2f295e7601c0cc1d3c88d7c227ffe0ebc38d80e6e2adb2dcbba79725450376","observation_id":"4f1d6be8-e7eb-4c6a-aa5d-2907f89ace15","resolution":{"observed_at":"2026-06-23T03:12:33.346294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12820","last_updated":"2025-03-17T04:58:09Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T04:58:09Z","title":"Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation","version":1},"cited_work":{"arxiv_id":"2503.12820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12820","snapshot_observed_at":"2026-07-04T19:30:08.088137Z","title":"Hydra-mdp++: Advancing end-to-end driving via expert-guided hydra-distillation","venue":null,"work_id":"5e0c3498-ea2e-4cc2-b330-4d1e5a7af793","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2503.12820","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:b575982399ac20e12738c256e2b747d66b29007e39d2b20dbf46a0d64997539e","observation_id":"5176e58d-a71c-462e-bd17-fa5c7e09eb5e","resolution":{"observed_at":"2026-05-10T11:50:21.117631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"cited_work":{"arxiv_id":"2507.07969","doi":"10.48550/arxiv.2507.07969","metadata_source":"pith","pith_arxiv_id":"2507.07969","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Action Chunking","venue":"cs.LG","work_id":"d9b89a8b-b7ed-44cb-8c55-09d4c2b6e8a5","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2507.07969","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:c9630135952b4b66a9c1d2ae56f0e01577c62b6d9002454a0ff967307f18e17d","observation_id":"77658704-a00f-465e-b097-1037e2b88b7c","resolution":{"observed_at":"2026-05-12T03:42:01.554293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2bd22a75270bfa3c661b5d934c74c179df614c72d275487c66a3bda91159c67c","observation_id":"e70560a9-a09a-419a-93da-e5ce0af06da3","resolution":{"observed_at":"2026-05-11T22:16:43.095562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iterative linear quadratic regulator design for nonlinear biological movement systems","venue":null,"work_id":"f31e7d77-f9f9-459e-9f0b-49b4c1ec6716","year":2004},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:814c5e7373c6f900feda9486de6f3719a34dae6ffa184b0ebd5c3e60b8c20c75","observation_id":"fca5608c-9329-4f03-b45c-44aa2e34dba7","resolution":{"observed_at":"2026-05-19T13:42:19.962411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01941","last_updated":"2025-04-09T12:01:43Z","snapshot_observed_at":"2026-07-06T21:03:11.554376Z","submitted_at":"2025-04-02T17:47:23Z","title":"End-to-End Driving with Online Trajectory Evaluation via BEV World Model","version":2},"cited_work":{"arxiv_id":"2504.01941","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01941","snapshot_observed_at":"2026-07-04T19:30:07.201101Z","title":"turn left","venue":null,"work_id":"96ea8513-8adc-42ef-85bf-d2686aa7f0ab","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2504.01941","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:86a313111dcd31124d502adc146ea59e7898038dd0f5fb0fc3c8e93b5c8aff87","observation_id":"da3db91f-4450-4c79-a101-06bbe6bca610","resolution":{"observed_at":"2026-05-10T11:50:21.125285Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2506.08052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08052","snapshot_observed_at":"2026-07-10T08:36:59.842975Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","venue":"cs.CV","work_id":"02bd7e58-a437-4e26-912d-8f1a2e695fa7","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2506.08052","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:66a3a0f23950493e4e6388487a60843f5b98b908e44087e17919de5f82c505ee","observation_id":"868d851c-5245-4722-b7cb-f0bdc877a8b6","resolution":{"observed_at":"2026-05-15T07:36:24.555133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06978","last_updated":"2024-08-30T03:37:36Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:18:26Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","version":4},"cited_work":{"arxiv_id":"2406.06978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06978","snapshot_observed_at":"2026-07-10T08:36:59.824360Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","venue":"cs.CV","work_id":"c1e2622d-92db-4a96-aa17-8ef832270ed1","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2406.06978","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:d409fe7fc4f60c33d301f4d26761cf30fe7d2480f8a7861051cf2f62f667b002","observation_id":"bef77172-a39c-4f90-8318-603eb9ce6374","resolution":{"observed_at":"2026-05-13T23:13:55.802367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ae19a9c2-f96a-4e53-a6be-a2e2827f6771","year":2020},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:4f0ff9ffffb249b91ff2a860f9aa7466c5bcee879779ce8af5500e4049d6b93c","observation_id":"6d3dca14-9aa3-4b72-9527-3c5077ffc45d","resolution":{"observed_at":"2026-05-19T13:42:19.932827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24108","last_updated":"2026-07-08T06:19:04Z","snapshot_observed_at":"2026-08-06T13:51:48.113268Z","submitted_at":"2025-10-28T06:26:36Z","title":"Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer","version":2},"cited_work":{"arxiv_id":"2510.24108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.24108","snapshot_observed_at":"2026-07-09T02:19:48.260809Z","title":"Ztrs: Zero-imitation end-to-end autonomous driving with trajectory scoring","venue":null,"work_id":"cd653797-513e-46fa-9288-25ee701d574d","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2510.24108","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:4344ce375556fbd57442a3fc0b7522c82107f2bc1a80b3ce5847ac487fb1f4bf","observation_id":"4b5101a2-0834-4ec0-bb95-8f160defba92","resolution":{"observed_at":"2026-07-09T02:19:48.260809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06664","last_updated":"2025-06-07T05:06:05Z","snapshot_observed_at":"2026-08-05T08:34:09.387431Z","submitted_at":"2025-06-07T05:06:05Z","title":"Generalized Trajectory Scoring for End-to-end Multimodal Planning","version":1},"cited_work":{"arxiv_id":"2506.06664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06664","snapshot_observed_at":"2026-07-04T16:39:58.091867Z","title":"Generalized trajectory scoring for end-to-end multimodal planning","venue":null,"work_id":"5c027ae8-9c2a-4484-a685-f902c6221905","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2506.06664","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:cbd4aa1a897949bd9c73c6afa253b5917b492aa0d35f73643fa302a5e140a7e4","observation_id":"b593187a-3442-42c8-8df4-9db4c667bd30","resolution":{"observed_at":"2026-05-10T11:50:21.075872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13842","last_updated":"2026-04-10T02:57:29Z","snapshot_observed_at":"2026-08-02T22:21:29.644302Z","submitted_at":"2026-03-14T08:53:47Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","version":3},"cited_work":{"arxiv_id":"2603.13842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.13842","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving","venue":"cs.RO","work_id":"0a3b0963-1b63-4332-94ce-404f50b318f3","year":2026},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2603.13842","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:7f92dd0bcf69757d86f0a050ee0a9f17160810b022909205d72b157009d99d0c","observation_id":"c0863630-3113-4b41-ad4e-dc60c09b293f","resolution":{"observed_at":"2026-05-10T11:50:21.121209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cirl: Controllable imitative reinforcement learning for vision-based self-driving","venue":null,"work_id":"2f11bcd9-5564-4dfe-b7a1-76c3524dfe00","year":null},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:d4fe02bb60d5338b7070aa930d409a07a80b9881c980ef12e0bc11a751986661","observation_id":"20618d5e-cd4f-4b22-827f-9c0f9dcfea21","resolution":{"observed_at":"2026-05-19T13:42:19.960509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusiondrive: Truncated diffusion model for end-to-end autonomous driving","venue":null,"work_id":"c8c6adcc-b5a5-41d7-89cc-0f9362982267","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:dfdc1c02424d74e17a2f5b6f9bcd0646272a1ed144360313a24849195ea4fdcf","observation_id":"f9b14ead-3dcd-4472-a0ac-f427fe1325db","resolution":{"observed_at":"2026-05-19T13:42:19.950598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:4ddd7f7229b0b1fb68d926ffe527576083974b42af45b5169dc12fe88034d807","observation_id":"0ae4f41e-7c48-42c0-8ebc-876224a2831f","resolution":{"observed_at":"2026-05-11T15:43:36.523954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09800","last_updated":"2025-06-11T14:42:11Z","snapshot_observed_at":"2026-07-06T21:40:26.217708Z","submitted_at":"2025-06-11T14:42:11Z","title":"Reinforced Refinement with Self-Aware Expansion for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.09800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09800","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforced refinement with self-aware ex- pansion for end-to-end autonomous driving","venue":null,"work_id":"8aeb007e-9f5a-433c-9df2-633fd61b8b66","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2506.09800","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2764946dbed95bbae216b5486e2cefe884966c0d3cd87c4611f812b53b2cd373","observation_id":"ac48b991-b899-43d0-a6e8-55ff5e622b0b","resolution":{"observed_at":"2026-05-10T11:50:21.101934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imitation is not enough: Robustifying imitation with reinforcement learn- ing for challenging driving scenarios","venue":null,"work_id":"82f17de6-b80a-4768-8be5-c67dcb06e6a0","year":2023},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:3902041786b62409b2a6a17d581de92342cdef2b8e02a54184fa907251f5be86","observation_id":"984f6165-9b3d-4c99-8d80-16f4ec300a04","resolution":{"observed_at":"2026-05-19T13:42:19.938636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08170","last_updated":"2025-08-21T11:45:55Z","snapshot_observed_at":"2026-08-05T21:42:24.839347Z","submitted_at":"2025-08-11T16:45:55Z","title":"ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction","version":2},"cited_work":{"arxiv_id":"2508.08170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08170","snapshot_observed_at":"2026-07-04T03:59:33.829869Z","title":"Recondreamer-rl: Enhancing reinforcement learning via diffusion-based scene reconstruction","venue":null,"work_id":"9c88f5b1-4e7e-4de7-b2ea-c89aebb40ac4","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2508.08170","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:26e1da0fefaa61f640684eb29d3adc0b2e11581796edb1a19d27660eda5b5014","observation_id":"bec0fbcf-48ea-4449-8ea9-80319859acf8","resolution":{"observed_at":"2026-05-10T11:50:21.155676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d","venue":null,"work_id":"b2a066a6-6c7d-4066-9029-1c306f28f0bd","year":2020},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:f4d45b0bb1322085d074741e71f4e21fb929252fa5148b3ec34de57be5b89f5d","observation_id":"743b89a7-c38e-4a68-8787-7823417a73f6","resolution":{"observed_at":"2026-05-19T13:42:19.928932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:6b36f3cd5c3602c9e519b3e2ca205d00f05e550cafe296ccb0e2477f0da1a6ae","observation_id":"d3bcc715-ef98-474e-95c5-44b690ea2303","resolution":{"observed_at":"2026-05-10T11:50:21.178700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.132323Z","title":"Drivedpo: Policy learning via safety dpo for end-to-end autonomous driving","venue":null,"work_id":"87d25e56-fa80-4c5b-a584-6cc24dfcc4ba","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:228912cacc7aeb719521cd7c11e90bf5b2195aa36f3ef762af8400fd727bad4e","observation_id":"1855e6ef-8bea-4628-a884-2f5d5ad16837","resolution":{"observed_at":"2026-05-10T11:50:21.147098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:88e066438c7fa6a6f3c9f7a0dd5b13e6479bc520f127d6666183ffc594dd6b8f","observation_id":"2ee83fe9-c1a6-4a79-86e3-38f11ecea743","resolution":{"observed_at":"2026-05-10T11:50:21.143111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.937908Z","title":"Senna-2: Aligning vlm and end-to-end driving policy for consistent decision making and planning","venue":null,"work_id":"20c79478-6d9f-4818-acdc-70cfdef2a0af","year":2026},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2491dd0f5a2f9aad68df678ac8122b85256a1df3863b42b3b3e4cd2e04f9bf30","observation_id":"b79b221d-8bfa-4951-a37c-73dcbf68dac0","resolution":{"observed_at":"2026-05-10T11:50:21.186727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.29163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:47:17.908664Z","title":"Sparsedrivev2: Scoring is all you need for end-to-end autonomous driving","venue":null,"work_id":"aed1144b-daed-4e81-8552-b6dd205f2556","year":2026},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:73af15a97faf198bf5c274523925560cdef50f744ded8b32ae931aec84726c2a","observation_id":"96d24e68-a977-4ed6-a8b7-7e38d4c183f7","resolution":{"observed_at":"2026-05-10T11:50:21.175328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":"7003a456-8745-4349-aa28-f62e95312d9d","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:9c00fe4ba8d14e7ed433af0fc7b4189d2aeb062a7b67ac18965bf757de29c24a","observation_id":"c628a69a-466d-46eb-a2eb-96448df2df94","resolution":{"observed_at":"2026-05-19T13:42:19.924714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":"402eb66a-30cc-4f0e-a5d2-a4a50ed0ee93","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:71b0d014afd69477f3fc589778a8b3633692099ac794ea9da0fbfb9f40b715cf","observation_id":"679a7699-20e5-4e0c-9c69-1b6194e38217","resolution":{"observed_at":"2026-05-19T13:42:19.926618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Para-drive: Parallelized architecture for real- time autonomous driving","venue":null,"work_id":"2332d1ee-fcd5-4686-a9ae-da3c024ee4c5","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:64cbee8dbdba6bfd82eee6b03828c6f8438425836853908dacdaad03b4e117c2","observation_id":"1d44b207-bfd9-432f-a151-4ef13a81ccc2","resolution":{"observed_at":"2026-05-19T13:42:19.964237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"cited_work":{"arxiv_id":"2512.23421","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23421","snapshot_observed_at":"2026-07-01T22:16:16.888093Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","venue":"cs.CV","work_id":"896c37d3-f87a-437b-b4f2-c16e1876e156","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2512.23421","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2d221bba8d7a3c8d9e06207f2a28079445232bf99d52efcb583ef3c3d0a43bf1","observation_id":"3408d938-2324-4c75-b29d-9b505b746050","resolution":{"observed_at":"2026-05-10T11:50:21.204147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ad-r1: Closed-loop reinforcement learning for end-to-end autonomous driving with impartial world models","venue":null,"work_id":"54561e63-7919-4b7a-a342-e3a15381d1ad","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:08e3646f080cb390a46c7f1da5c5e254677813e6dedb0264219b1a084e3a160a","observation_id":"74b02d06-d359-474a-9226-ae2d2378bc19","resolution":{"observed_at":"2026-05-10T11:50:21.189985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Worldrft: Latent world model planning with reinforcement fine-tuning for autonomous driving","venue":null,"work_id":"8993e0ca-84e9-4217-8bb0-44a87e779c9c","year":2026},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:7e809befc366c4b05f111e6db38bccf4e99164e280b85b6f580d5b8cda3871d0","observation_id":"6aa3edd0-f19a-4655-9dbd-d72de32df77d","resolution":{"observed_at":"2026-05-19T13:42:19.952425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24587","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:46:57.139340Z","title":"Dreamerad: Efficient re- inforcement learning via latent world model for autonomous driving","venue":null,"work_id":"1d16664a-40b6-4fa9-bbd0-9eddae7c9015","year":2026},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:21021cdfd1d2db5cc6fcd80757919a66b84b7c397e15f91e5d593f9e0e3ca710","observation_id":"216911d1-6cc0-4cf6-85b8-172bf4654b73","resolution":{"observed_at":"2026-05-10T11:50:21.171465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.06659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.072014Z","title":"Drivesuprim: Towards precise trajectory selection for end-to-end planning","venue":null,"work_id":"d445dbeb-a6af-49a4-8615-d52d711ed40a","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:71e3aad63f6608d80b2c7d8b0274f3625c274d311006f55b4b42921a6da0da61","observation_id":"7a1271f1-1074-4bc1-86ee-efaf29257272","resolution":{"observed_at":"2026-05-10T11:50:21.182568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:bf1c7deadfe33efc37b7e8b16911add73a1a6a9e12776cbcffc01ec96d844d1d","observation_id":"419b87fb-db5d-4124-be81-f42815cd8489","resolution":{"observed_at":"2026-05-10T11:50:21.197191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09765","last_updated":"2022-02-03T23:13:38Z","snapshot_observed_at":"2026-08-02T17:20:06.366226Z","submitted_at":"2022-01-24T15:53:32Z","title":"Generative Planning for Temporally Coordinated Exploration in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2201.09765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.09765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative plan- ning for temporally coordinated exploration in reinforcement learning","venue":null,"work_id":"cd695d85-d4ec-461a-a18e-bac2affd0a51","year":2022},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2201.09765","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:3380d6215fb7b9941c5d69542b41e4250f05b473e60cdd7d787a35058d8a2952","observation_id":"cf179533-b3ae-4a4f-950b-57e98827f6f0","resolution":{"observed_at":"2026-05-10T11:50:21.167640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivedreamer4d: World models are effective data machines for 4d driving scene rep- resentation","venue":null,"work_id":"b5557e6b-3f86-4e0d-b114-3e1537dd3d85","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:abf50e720a11f215ade252ab8e0d71188e2fa483bc6aeb952b9b2fa9ac820142","observation_id":"9c1cbdf6-983c-4f5a-a4ec-3a0e1ada0167","resolution":{"observed_at":"2026-05-19T13:42:19.967956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18438","last_updated":"2025-07-10T07:01:22Z","snapshot_observed_at":"2026-07-06T20:57:39.173371Z","submitted_at":"2025-03-24T08:40:20Z","title":"ReconDreamer++: Harmonizing Generative and Reconstructive Models for Driving Scene Representation","version":2},"cited_work":{"arxiv_id":"2503.18438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18438","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- condreamer++: Harmonizing generative and reconstructive models for driving scene representation","venue":null,"work_id":"7204c094-ff5e-44ec-b7bf-5898170006c6","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2503.18438","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:1a2b9113f7ec29c75c65c846772cc9de66526739a28964370df88dd370916b87","observation_id":"a64745a4-ee6f-49d6-8778-4e83741f652d","resolution":{"observed_at":"2026-05-10T11:50:21.200657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:df27ca7455b386f5708b3a2b37e600f508e6850f17e487b50421e19d22ffaa7a","observation_id":"e4390d3e-6b73-43ce-8830-3e51dceb0bb8","resolution":{"observed_at":"2026-05-10T19:22:54.227899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genad: Generative end-to-end au- tonomous driving","venue":null,"work_id":"2deaacf0-7a28-481e-949f-55807d846072","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:13f7e79b245ac9d9cb10000230684325d041de58eed326081da8ba39f4b47d2d","observation_id":"e32df56e-55aa-4f52-85a2-65fbaa968f02","resolution":{"observed_at":"2026-05-19T13:42:19.966099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15564","last_updated":"2025-02-09T16:37:09Z","snapshot_observed_at":"2026-08-02T07:56:14.673217Z","submitted_at":"2025-01-26T15:49:50Z","title":"Diffusion-Based Planning for Autonomous Driving with Flexible Guidance","version":2},"cited_work":{"arxiv_id":"2501.15564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15564","snapshot_observed_at":"2026-07-10T08:36:59.821774Z","title":"Diffusion-based planning for autonomous driving with flexible guidance","venue":"cs.RO","work_id":"25af4a06-f2ba-40e3-a38d-b643f82db3a0","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2501.15564","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:7e540f62b337d0da81930e85b80c0ef421f679cd0e542b5150725960d6b01d9f","observation_id":"6c264c51-5309-4664-9bcf-d5ea6ddc073f","resolution":{"observed_at":"2026-05-10T11:50:21.159683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22801","last_updated":"2026-05-16T16:36:34Z","snapshot_observed_at":"2026-08-02T07:50:39.034281Z","submitted_at":"2026-02-26T09:37:38Z","title":"Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2602.22801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.22801","snapshot_observed_at":"2026-07-02T08:26:48.317515Z","title":"Unleashing the potential of diffusion models for end-to-end autonomous driving","venue":"cs.RO","work_id":"4db25156-f8d8-4dbb-ae6f-803d4e472a2b","year":2026},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2602.22801","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:6fce407d5756144b86b03f38adfa2dfb3ea01ef81156544cba969ef365d69dc8","observation_id":"55dcca5a-0239-424b-b7e9-ec7dfd902dc4","resolution":{"observed_at":"2026-05-20T00:03:06.805723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.099262Z","title":"Resad: Normalized residual trajectory modeling for end-to-end autonomous driving.arXiv preprint arXiv:2510.08562","venue":null,"work_id":"9839db69-0650-48d4-8ce2-7f57d10c3dfb","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:f822892580c926795608e7859e1f73dd7e469c0e8c37b851aafe1ab969cbab1f","observation_id":"4f97e69b-e206-408d-acc2-3bb63369d86e","resolution":{"observed_at":"2026-05-10T11:50:21.151276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01718","last_updated":"2024-12-02T17:07:59Z","snapshot_observed_at":"2026-07-06T20:00:23.632792Z","submitted_at":"2024-12-02T17:07:59Z","title":"HUGSIM: A Real-Time, Photo-Realistic and Closed-Loop Simulator for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2412.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01718","snapshot_observed_at":"2026-07-03T18:38:49.990320Z","title":"Hugsim: A real-time, photo-realistic and closed-loop simulator for autonomous driving","venue":null,"work_id":"b9dec19b-6478-4aae-9f41-835fb34bd080","year":2024},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2412.01718","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:d6afebb54b9dc9b9f235b330eed6686363c86ca1b9d438dc14f019dca1c13fc7","observation_id":"93b8efd6-75ca-4464-b539-da29aae3e44c","resolution":{"observed_at":"2026-05-10T11:50:21.134298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09776","last_updated":"2020-11-01T01:32:36Z","snapshot_observed_at":"2026-08-04T02:16:12.249684Z","submitted_at":"2020-10-19T18:26:10Z","title":"SMARTS: Scalable Multi-Agent Reinforcement Learning Training School for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2010.09776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.09776","snapshot_observed_at":"2026-07-04T06:49:38.031790Z","title":"Smarts: Scalable multi-agent reinforcement learning training school for autonomous driving, 2020","venue":null,"work_id":"f8a28378-c6af-4fc1-92c8-0298d217cffa","year":2010},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2010.09776","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:2a2c45ee0611b21914cda080833a076f8a5392b462aad6dbeae1ef8c1ddb48bf","observation_id":"58949104-f078-4e4d-a38f-da0d850632ba","resolution":{"observed_at":"2026-05-10T11:50:21.194000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2506.13757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13757","snapshot_observed_at":"2026-07-10T08:36:59.854319Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"945172fb-0f3b-43be-88b4-ae61042517e9","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"cited_paper":"/paper/2506.13757","citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:457920b10ffb6f52ed482c49f41549fb261bb7b0541a910a4d7c83bfebcf3eef","observation_id":"29082637-b118-4b0a-a719-402304e5f8fe","resolution":{"observed_at":"2026-05-14T21:46:44.401546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:08.059832Z","title":"re- gions important for driving","venue":null,"work_id":"e0b7a052-e6b6-4950-a9c2-1f052f74afec","year":2025},"citing_paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:26.649975Z"},"links":{"citing_paper":"/paper/2604.15308"},"observation_digest":"sha256:bae142b378f6729362f3bbf0e71983762ab6d56e7dc9d0900b61ce2b0cae27c6","observation_id":"c1670164-64e3-4a9c-a313-cbe79657ab58","resolution":{"observed_at":"2026-05-10T11:50:21.052852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.15308","last_updated":"2026-04-16T17:59:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T17:59:44Z","title":"RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":40,"verified_fuzzy":22},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 4 inbound Pith citation observations for arXiv:2604.15308."}