{"as_of":"2026-08-07T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25f8b5be13edddccfd3a7cdeaa0b5a9ade0353975b0c424bbd4ac9d647e1f1c0","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:41:31.838029Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:27:24.257956Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T08:36:59.779636Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T12:48:32.123998Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2509.24948"},"observation_digest":"sha256:173d11c30b11053fc681031c0c0222ebb7991d0e5915254152e7c55e14254e8b","observation_id":"0bf917a1-ce2c-4b1c-9be6-5d5b4f46a41b","resolution":{"observed_at":"2026-05-18T12:51:23.519299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T02:35:13.126171Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2511.00088"},"observation_digest":"sha256:8956c63f2717707ec795e1fdf5129d4b948db6394ec5b7cd95ba87a30707dd58","observation_id":"b8797e64-ab29-46c2-9fbb-9996a361131f","resolution":{"observed_at":"2026-05-18T02:35:13.275712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:71eecf4915411696a47da51d08909efe7a447a1c3f471d112d4ae404bc6997d2","observation_id":"b1fde534-10ca-400a-bfb6-388f62c45197","resolution":{"observed_at":"2026-05-17T06:29:09.833895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2512.10226","last_updated":"2026-04-14T00:44:42Z","snapshot_observed_at":"2026-08-02T07:00:45.391301Z","submitted_at":"2025-12-11T02:22:07Z","title":"Latent Chain-of-Thought World Modeling for End-to-End Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T23:16:41.916869Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2512.10226"},"observation_digest":"sha256:63d57e6b169e777142fa4b811e5d50ab347064e1743b72aaed163a0f860b7801","observation_id":"bba8b92a-e0e6-496f-b302-b97ab1d846c4","resolution":{"observed_at":"2026-05-16T23:18:39.859691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-08-03T16:27:24.257956Z","title":"Irl-vla: Training an vision-language- action policy via reward world model.arXiv preprint arXiv:2508.06571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13636","last_updated":"2026-07-17T07:01:14Z","snapshot_observed_at":"2026-08-04T13:44:30.220787Z","submitted_at":"2025-12-15T18:31:32Z","title":"MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:24.257956Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2512.13636"},"observation_digest":"sha256:0c7f0728787855bab731aa8bf2385a014e655330d466aae6736c0fcbcc2da6d4","observation_id":"78427e88-2f27-4152-ac07-e3e37463355d","resolution":{"observed_at":"2026-08-03T16:27:24.257956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:ed578df80f47ab2a646b25f8aa19abbbf5cdb18a70bb3cee741530f76c99ecd6","observation_id":"cc3c1ee7-953f-4aaa-a642-ed20e715d474","resolution":{"observed_at":"2026-05-10T14:10:29.734642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:cc83060d930b05755f90b3e8972ac7ccb344cbc2c9c355a8a919cdb231b6a74b","observation_id":"726b3100-d940-45dd-bc8e-612e43ff0621","resolution":{"observed_at":"2026-05-10T08:12:26.263488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2604.19710","last_updated":"2026-04-21T17:34:19Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:34:19Z","title":"SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:34:29.624029Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2604.19710"},"observation_digest":"sha256:c8f8e509da35a3b4ae8b1fd43e8914147a2574b2f71fd2810957f80afbef2ddb","observation_id":"906c2d25-f002-4967-b119-fad978051e4b","resolution":{"observed_at":"2026-05-11T12:56:10.808364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.08975","last_updated":"2026-05-09T14:34:00Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T14:34:00Z","title":"Latency Analysis and Optimization of Alpamayo 1 via Efficient Trajectory Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:52:02.233177Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.08975"},"observation_digest":"sha256:ea7505d15df29f0c7c663c7ba40d76149a87a7df291ea95e98d6cd6f785b1b77","observation_id":"6140c01f-3951-42f6-806c-f72b4e4d7bb9","resolution":{"observed_at":"2026-05-12T07:46:50.857406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.21139","last_updated":"2026-05-22T01:55:27Z","snapshot_observed_at":"2026-07-06T23:31:37.061253Z","submitted_at":"2026-05-20T13:14:28Z","title":"Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T04:44:48.349384Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.21139"},"observation_digest":"sha256:1761a781ed3e64dd822390427f8c788df00aaf711d8a809d01e449d4fe38e797","observation_id":"a9519e4e-7fde-4811-a07e-b7089c25c52e","resolution":{"observed_at":"2026-05-21T04:49:35.792564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.21139","last_updated":"2026-05-22T01:55:27Z","snapshot_observed_at":"2026-07-06T23:31:37.061253Z","submitted_at":"2026-05-20T13:14:28Z","title":"Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:10.143179Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.21139"},"observation_digest":"sha256:572ea5dc093e525aa1c5f3206e0be606b48c33c2ceb8972b13bc7f71e9319af8","observation_id":"b49abf41-3de4-495c-973f-050d5cf5a7f8","resolution":{"observed_at":"2026-05-25T05:55:24.815699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.31116","last_updated":"2026-05-29T10:27:32Z","snapshot_observed_at":"2026-08-02T02:51:10.320818Z","submitted_at":"2026-05-29T10:27:32Z","title":"NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T22:57:01.742536Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.31116"},"observation_digest":"sha256:453854e5f2d864f7cb17b6a66d512fdccfe8b391cd3f52ea2081c6dacccb58b1","observation_id":"0e8534ad-08b3-4702-9e8b-cbba6dfdff07","resolution":{"observed_at":"2026-06-28T23:02:46.926168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.31476","last_updated":"2026-05-29T16:05:42Z","snapshot_observed_at":"2026-08-07T03:01:35.395589Z","submitted_at":"2026-05-29T16:05:42Z","title":"IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T22:23:07.223613Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.31476"},"observation_digest":"sha256:d2ade330b2cf14b081b488d994dc5bbce381b46c37d5c157b82c8c158ad38d53","observation_id":"b00599c5-6f3f-430f-bbc2-6a4f40027e71","resolution":{"observed_at":"2026-07-01T19:36:08.476569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2606.00113","last_updated":"2026-05-27T05:32:17Z","snapshot_observed_at":"2026-08-01T09:58:43.654749Z","submitted_at":"2026-05-27T05:32:17Z","title":"World Models for Robotic Manipulation: A Survey","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-06-29T12:24:18.025364Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2606.00113"},"observation_digest":"sha256:a2a512b7fcc334e536825d8c8b0559edd5cb1cdeb6ff28df444573eae8fb1b04","observation_id":"ceaf1399-6b15-4a6f-9991-67721a9a07c6","resolution":{"observed_at":"2026-06-29T12:33:25.078010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2606.05645","last_updated":"2026-06-09T07:25:40Z","snapshot_observed_at":"2026-07-06T23:45:37.713710Z","submitted_at":"2026-06-04T03:16:31Z","title":"Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T01:49:25.510681Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2606.05645"},"observation_digest":"sha256:e1a4bba68d333b03943ce93e8217315be113ec8b822057536273664f45016c75","observation_id":"860069f4-8aa2-41d2-9a69-2b774bdb3957","resolution":{"observed_at":"2026-07-02T12:46:57.089281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2606.19836","last_updated":"2026-06-18T06:28:33Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T06:28:33Z","title":"World Engine: Towards the Era of Post-Training for Autonomous Driving","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-26T17:21:15.456982Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2606.19836"},"observation_digest":"sha256:83ad565e51677ea58290c1a35351c30f82484c8b871386e4970f3047162b3d7c","observation_id":"673c745e-6bdb-452c-9c15-9afbabf66cdb","resolution":{"observed_at":"2026-07-04T03:59:33.870818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2607.08072","last_updated":"2026-07-13T20:41:06Z","snapshot_observed_at":"2026-08-02T10:52:12.500003Z","submitted_at":"2026-07-09T03:00:47Z","title":"Post-Training in End-to-End Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T00:42:28.701843Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2607.08072"},"observation_digest":"sha256:5b7ef2ba9af7aa6514fbe6c1d8fc0c6773fc28239ac8fd4b8ed0d799200976c3","observation_id":"5a592479-c7e2-440b-bb5b-c89a8e3a29bf","resolution":{"observed_at":"2026-07-10T00:46:40.298575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2607.08375","last_updated":"2026-07-09T11:49:57Z","snapshot_observed_at":"2026-08-01T14:34:54.273695Z","submitted_at":"2026-07-09T11:49:57Z","title":"WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T08:30:29.351159Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2607.08375"},"observation_digest":"sha256:0b15834377c8e0ba18410f73c158799e958643320f7c41510ad1dcfb5fe7b00d","observation_id":"29aca45e-edf5-4daa-8fdf-06915c8773ba","resolution":{"observed_at":"2026-07-10T08:36:59.781035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06571/citation-record","integrity":"/paper/2508.06571/integrity","json":"/paper/2508.06571/citation-record.json","paper":"/paper/2508.06571"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T23:41:31.725595Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.725595Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:7b0e406866dc8a74e0aee03a9c4f770cae8373559486b827ecc68d77eb4527ba","observation_id":"19a43edb-9e70-49d0-8bd3-e205ac0bd3a0","resolution":{"observed_at":"2026-08-05T23:41:31.725595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.346182Z","title":"Training diffusion models with reinforcement learning, 2024","venue":null,"work_id":"8a535172-db9a-4fde-ba9f-be91693ea488","year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.731882Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:21e9e5b7693bee16396c86ef71cbcc9cb5d8600e0a6a34086f55af0cb1384768","observation_id":"73b426f7-a4dc-4022-a6de-0d63445c8c70","resolution":{"observed_at":"2026-08-05T23:41:32.349252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.736375Z","title":"Pseudo- simulation for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.736375Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:5a8c009f5a5692731f4d7109968e9a30b2e254ac7bb892d8cbfc93637f370d8c","observation_id":"10117937-04c5-4fdc-a9e3-327b56b8ff8a","resolution":{"observed_at":"2026-08-05T23:41:31.736375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.336749Z","title":"Transfuser: Imitation with transformer-based sensor fusion for au- tonomous driving","venue":null,"work_id":"b0336ff7-75b7-49f3-8981-21fe09434f95","year":null},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.740137Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:6ea2f8cec97900eb7d6ea298884512535eccbe7e50bcb37b39cb7cb63868dc5b","observation_id":"12831453-a6e2-4209-8fce-de07c480d253","resolution":{"observed_at":"2026-08-05T23:41:32.339969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.327882Z","title":"Parting with misconceptions about learning-based vehicle motion planning","venue":null,"work_id":"683a1b5e-15e9-423b-9ca6-f14fbe968d96","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.743912Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:2219a560e66cef5faf26799610739a2832cd8a266c2950b8d13f8ce1f9373fe1","observation_id":"1c3578b4-b05c-4f19-97c9-5a75c2cb28ba","resolution":{"observed_at":"2026-08-05T23:41:32.330769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.318510Z","title":"Navsim: Data-driven non-reactive autonomous vehicle simulation and benchmarking","venue":null,"work_id":"146e978b-72f4-4aec-a397-38876f9fe9e9","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.747756Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:15f7d8ac931fc90b2b64ded898a609b0a8fb258c632c302b3742d69505c4234b","observation_id":"e3db77b6-c139-4555-9b31-0fb3986738a0","resolution":{"observed_at":"2026-08-05T23:41:32.321930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-05T21:57:39.132989Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19755","snapshot_observed_at":"2026-08-05T23:41:31.751498Z","title":"Orion: A holistic end-to-end autonomous driving framework by vision-language instructed action gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.751498Z"},"links":{"cited_paper":"/paper/2503.19755","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:a3ef06a4a2e922cdc2af4e8c2cebcf3b1ee3e5e4e3bc435dc8277662fa05003f","observation_id":"6bc197cc-12e3-47c6-bc39-60c10520e2c1","resolution":{"observed_at":"2026-08-05T23:41:31.751498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.755666Z","title":"Rad: Training an end-to-end driving policy via large-scale 3dgs-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.755666Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:621c7114514a40b959fa3d9a45417b821d18481ed1694696b40a8427ebeb8f06","observation_id":"be38b2d6-bcb0-4ed9-94cd-b5159061e992","resolution":{"observed_at":"2026-08-05T23:41:31.755666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:41:31.759015Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.759015Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:b5463a42b0a096918c53c808bf2ed2449e38125e524bbb5bbceb5e1a0ab9c7da","observation_id":"48f5bac0-284e-4315-9f00-8a476dcdee68","resolution":{"observed_at":"2026-08-05T23:41:31.759015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.309136Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"59f8642c-5d5b-46d6-b455-064a8f787e11","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.762813Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:26185edfa5df435944cb85aa1f9f946b43ef801aaf776368fc062c60cdb257eb","observation_id":"fb25938f-71dc-4de2-8767-58b5d5feba6a","resolution":{"observed_at":"2026-08-05T23:41:32.312110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-05T23:41:31.766176Z","title":"Emma: End-to- end multimodal model for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.766176Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:f7b5021ecea468b43be5beb7af6d07bc96afeb8970cbe2ee5cd483d8b7855f14","observation_id":"9a9efb1e-292e-48fb-8693-635745dd3494","resolution":{"observed_at":"2026-08-05T23:41:31.766176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-05T23:41:31.769794Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.769794Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:1e7e341f39f36adcb6e7ae25f10c1ce0051b66c99202ff4c397bb7c0fda9d618","observation_id":"e9227cc0-15a1-4ff1-b4f9-4abff732a5c1","resolution":{"observed_at":"2026-08-05T23:41:31.769794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19381","last_updated":"2025-06-03T02:28:31Z","snapshot_observed_at":"2026-08-07T14:12:57.110186Z","submitted_at":"2025-05-26T00:49:35Z","title":"DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19381","snapshot_observed_at":"2026-08-05T23:41:31.774080Z","title":"Diffvla: Vision-language guided diffusion planning for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.774080Z"},"links":{"cited_paper":"/paper/2505.19381","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:19f739a58d1bae15b8274819b3bf4bc5a24550346f40ccc88c94dcab9d9e81bb","observation_id":"539c03c9-b0de-49b4-acd6-2035043bae97","resolution":{"observed_at":"2026-08-05T23:41:31.774080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-05T23:41:31.777980Z","title":"Senna: Bridging large vision- language models and end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.777980Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:e85a0ae433de885399a8f879f1d10319117e13b5b908722472df0844bc698717","observation_id":"213b3c2c-5e5c-4467-bafe-94ad9546f0c9","resolution":{"observed_at":"2026-08-05T23:41:31.777980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.299821Z","title":"Vad: Vectorized scene representation for efficient autonomous driving","venue":null,"work_id":"396b2829-8f5f-4b17-a3ab-756415e3b1fc","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.781549Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:25b4ec6e2b91a8467bfe4912ea903945e979b2ca520f33d68b947c4c7d329b4d","observation_id":"1ff95cbe-0d21-43ac-b262-001535e5e840","resolution":{"observed_at":"2026-08-05T23:41:32.303150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01941","last_updated":"2025-04-09T12:01:43Z","snapshot_observed_at":"2026-08-07T16:13:51.725618Z","submitted_at":"2025-04-02T17:47:23Z","title":"End-to-End Driving with Online Trajectory Evaluation via BEV World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01941","snapshot_observed_at":"2026-08-05T23:41:31.785006Z","title":"End-to-end driving with online trajectory evaluation via bev world model.arXiv preprint arXiv:2504.01941, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.785006Z"},"links":{"cited_paper":"/paper/2504.01941","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:39e096494df48047270d023ed75c88ae98a2c27e0d4b324c5f242ec4eb7e9ad4","observation_id":"230a0b04-8927-41b3-9e69-ca7de315e0e4","resolution":{"observed_at":"2026-08-05T23:41:31.785006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08052","snapshot_observed_at":"2026-08-05T23:41:31.788746Z","title":"Recogdrive: A rein- forced cognitive framework for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.788746Z"},"links":{"cited_paper":"/paper/2506.08052","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:73acd65ba918e7652d852ca8bdced9d7e3792155b81a75e3fdb8a34a5338ee9a","observation_id":"b9d1c1f7-27d1-4edd-ae28-ea730f060092","resolution":{"observed_at":"2026-08-05T23:41:31.788746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06978","last_updated":"2024-08-30T03:37:36Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:18:26Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06978","snapshot_observed_at":"2026-08-05T23:41:31.792633Z","title":"Hydra-mdp: End-to-end multimodal planning with multi-target hydra-distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.792633Z"},"links":{"cited_paper":"/paper/2406.06978","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:754a1c85523f89d7d5cdf483bebcacda9cee0f8d3aaf709ee60171afd1309c15","observation_id":"acc7543c-7e1d-4d01-898f-e197281976e8","resolution":{"observed_at":"2026-08-05T23:41:31.792633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06664","last_updated":"2025-06-07T05:06:05Z","snapshot_observed_at":"2026-08-07T05:50:04.045234Z","submitted_at":"2025-06-07T05:06:05Z","title":"Generalized Trajectory Scoring for End-to-end Multimodal Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06664","snapshot_observed_at":"2026-08-05T23:41:31.796375Z","title":"Generalized tra- jectory scoring for end-to-end multimodal planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.796375Z"},"links":{"cited_paper":"/paper/2506.06664","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:1aeae817483e6bcda55dd84ec0898c651ca21f8d84b938020a22e600841eb21f","observation_id":"71701eec-44e2-461e-9382-3e4e5b9274f0","resolution":{"observed_at":"2026-08-05T23:41:31.796375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15139","last_updated":"2025-04-10T08:48:37Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:59:47Z","title":"DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15139","snapshot_observed_at":"2026-08-05T23:41:31.799889Z","title":"Diffusiondrive: Trun- cated diffusion model for end-to-end autonomous driv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.799889Z"},"links":{"cited_paper":"/paper/2411.15139","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:2411c65e8a4374b150fead3be94d650cc092516a2cc03e5d5166000613c8de4f","observation_id":"2be68a7b-7bbd-49c4-9637-7eca3de7b726","resolution":{"observed_at":"2026-08-05T23:41:31.799889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.289998Z","title":"Diffusiondrive: Trun- cated diffusion model for end-to-end autonomous driv- ing","venue":null,"work_id":"17b46a32-f740-439e-86e9-298d2f88e985","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.803399Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d97179d9fbfa7ee7c927850b8096c41d1a818ebbca6843e891941edc5e4bee29","observation_id":"46338617-f4df-429c-b157-1ed26c088973","resolution":{"observed_at":"2026-08-05T23:41:32.293240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-05T23:41:31.807052Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.807052Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:025eafc75c64adfab94ac2e6563220dad7bed683d9e95bd68cbb7d33f5bf9b5e","observation_id":"c3cab5c8-2364-4ba4-b226-026b9df6c532","resolution":{"observed_at":"2026-08-05T23:41:31.807052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.280758Z","title":"Simlingo: Vision-only closed-loop au- tonomous driving with language-action alignment","venue":null,"work_id":"11d36d4d-1052-4c00-b7f8-4beeb2d45883","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.810869Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:7b63936c0cacba6add4a0d761e0b0c4438ab9949d41a5738ad7b426e93aa2548","observation_id":"a7fe2bb6-be6c-4f05-bd13-76e76d5c13a4","resolution":{"observed_at":"2026-08-05T23:41:32.283875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.270558Z","title":"High-dimensional continuous control using generalized advantage estima- tion, 2018","venue":null,"work_id":"1e1a0be7-34ab-40fd-8269-2de3e96bd22f","year":2018},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.813938Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:fa713dd8d80a5838f4634509fe8045f8ac28e88e3a277f5a6db597bc3b53fa16","observation_id":"bd531091-cd19-4492-8439-a8e50e69d93c","resolution":{"observed_at":"2026-08-05T23:41:32.274253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.817547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.817547Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d1aa140c8f963acd0e4c1d29813172624c4f375088e775e5d5a0425ee8508a3b","observation_id":"39ef19ad-c823-45e8-a107-2e31eae148bc","resolution":{"observed_at":"2026-08-05T23:41:31.817547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19620","last_updated":"2024-05-31T07:40:55Z","snapshot_observed_at":"2026-07-06T18:22:22.643181Z","submitted_at":"2024-05-30T02:13:56Z","title":"SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19620","snapshot_observed_at":"2026-08-05T23:41:31.820894Z","title":"Sparsedrive: End-to-end autonomous driving via sparse scene representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.820894Z"},"links":{"cited_paper":"/paper/2405.19620","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:7eb5e409f393f8a9493523cd054db03ead8410aaacc74efb4daa61b889426752","observation_id":"3bfb75c9-dc1a-4684-9f11-68baacb63df7","resolution":{"observed_at":"2026-08-05T23:41:31.820894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.253449Z","title":"Diffsemanticfusion: Semantic raster bev fusion for autonomous driving via online hd map diffusion, 2025","venue":null,"work_id":"123c93d3-d0e4-4d7a-a9ef-4c64def56c79","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.824390Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:5bda2d964208f846211a46d8d0ac0f77a7cb56996c773509505535c7e542af75","observation_id":"be67406b-29b3-46b7-8ea6-1bf9730e4512","resolution":{"observed_at":"2026-08-05T23:41:32.256924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04412","last_updated":"2023-05-08T01:39:35Z","snapshot_observed_at":"2026-08-04T09:43:23.261807Z","submitted_at":"2023-05-08T01:39:35Z","title":"Efficient Reinforcement Learning for Autonomous Driving with Parameterized Skills and Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04412","snapshot_observed_at":"2026-08-05T23:41:31.827833Z","title":"Effi- cient reinforcement learning for autonomous driving with parameterized skills and priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.827833Z"},"links":{"cited_paper":"/paper/2305.04412","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d7a3dd7da6c8df593eb3da99b14640d6082925df21eea43224e1e8c653f70b91","observation_id":"64093467-0a56-4ce8-aa72-b159878d7a16","resolution":{"observed_at":"2026-08-05T23:41:31.827833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.243478Z","title":"Carplanner: Consistent auto-regressive trajectory plan- ning for large-scale reinforcement learning in au- tonomous driving","venue":null,"work_id":"10d82449-8519-4d25-ba66-90d9c57fb3d2","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.831351Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:a0f82b7883301cce1de585e01849c66bdd449ffd006b18c51682e7058e632eb4","observation_id":"6a08dcfb-c46b-421c-951d-930a25083ecc","resolution":{"observed_at":"2026-08-05T23:41:32.246657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.231405Z","title":"Accelerating reinforcement learning for autonomous driving using task-agnostic and ego- centric motion skills","venue":null,"work_id":"7811cade-d477-4259-a93f-6dc2946ca325","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.834652Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:14b18b4ec19cec44a78fc535b2bb77cd00248d1288a2ca5a08089b087e6da9d4","observation_id":"915dc76c-a89d-4f05-af92-afa619e7bb84","resolution":{"observed_at":"2026-08-05T23:41:32.236597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.838029Z","title":"Opendrivevla: Towards end-to-end autonomous driving with large vision language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.838029Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d888b730ecf16af9f7df3fc71eaed691057cc4882463326387d8b5b3b65aaf00","observation_id":"02553d1d-7218-4414-8240-7aa7760f6556","resolution":{"observed_at":"2026-08-05T23:41:31.838029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 18 inbound Pith citation observations for arXiv:2508.06571."}