{"as_of":"2026-08-07T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7610b78eadc5d70b04b39fdf0b1eabb5243bd57f466d680a84ad860c8c5a178d","coverage":[{"denominator":166,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:31:04.674245Z","state":"measured"},{"denominator":114,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":114,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:39:02.315303Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T11:41:02.543365Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-06T12:39:02.315303Z","title":"A survey on vision-language- action models for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21610","last_updated":"2025-08-16T15:20:38Z","snapshot_observed_at":"2026-08-06T12:38:57.028677Z","submitted_at":"2025-07-29T09:06:40Z","title":"Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:02.315303Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2507.21610"},"observation_digest":"sha256:c9680c626ba97763fa8bfcc22f38283211cdd4312f98db239d481bc26b562917","observation_id":"6114a5cf-459a-4563-b467-772dcb481c99","resolution":{"observed_at":"2026-08-06T12:39:02.315303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-04T09:08:07.066489Z","title":"A survey on vision-language-action models for autonomous driving.arXiv preprint arXiv:2506.24044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:07.066489Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:677f6b3c4b42885ea54b4d88029af7c902ba9ea55b48b43c42978cff29a3fa9c","observation_id":"0538d1b4-ec46-4733-ba7d-7fb55c70bcfc","resolution":{"observed_at":"2026-08-04T09:08:07.066489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T18:37:03.416823Z","title":"A survey on vision-language- action models for autonomous driving.arXiv preprint arXiv:2506.24044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.416823Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:b2b4637e171a1e896346465d127c9ca870db80581d5cb748f21a200e12c29cd4","observation_id":"92d6ba2c-4203-42ed-9441-008dca2c40cc","resolution":{"observed_at":"2026-08-03T18:37:03.416823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T17:38:20.749342Z","title":"A survey on vision-language-action models for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-03T17:38:18.677599Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.749342Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:9adb6914a640af902c3a2e66c8adb2158633d4ed748fdeb864d5fe2b23f0213f","observation_id":"3ac9cf36-3282-43d6-9301-f54beba24238","resolution":{"observed_at":"2026-08-03T17:38:20.749342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T16:52:52.413571Z","title":"arXiv preprint arXiv:2506.24044","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-03T16:52:46.785804Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:52.413571Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:3c48114eb04c3ecf5ae020b535e37d5f45ba31654ca5828f8055ef45672780bb","observation_id":"ac0e4079-2379-48f1-aae3-20bfad6b6af6","resolution":{"observed_at":"2026-08-03T16:52:52.413571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2601.01322","last_updated":"2026-05-03T05:35:23Z","snapshot_observed_at":"2026-08-02T23:32:22.443147Z","submitted_at":"2026-01-04T01:17:36Z","title":"LinMU: Multimodal Understanding Made Linear","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T18:32:23.951566Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2601.01322"},"observation_digest":"sha256:ad4068853900831adb170d5bb142fce4d729c69be14baa3c3e63c7e588c6cb67","observation_id":"0b1d1384-657a-4d9f-b8a6-c3c5f9bd6585","resolution":{"observed_at":"2026-05-16T18:33:15.213150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-04T06:07:09.468768Z","title":"Tian, X., Gu, J., Li, B., Liu, Y ., Wang, Y ., Zhao, Z., Zhan, K., Jia, P., Lang, X., and Zhao, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10719","last_updated":"2026-08-01T13:11:04Z","snapshot_observed_at":"2026-08-07T02:18:23.017364Z","submitted_at":"2026-02-11T10:25:05Z","title":"From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:09.468768Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2602.10719"},"observation_digest":"sha256:e5d224f2c2acbab2df9f8e5350f6e9de851e8846723eb0e45152073b94da0e18","observation_id":"04c9f689-ac34-47c7-a01d-e8440510b18d","resolution":{"observed_at":"2026-08-04T06:07:09.468768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:bac20f81b71215da9854c6d43c8c66846e69f05930343702ab6a593a23e3ab26","observation_id":"136b991e-d88f-48a0-9c4b-a5d941be43f3","resolution":{"observed_at":"2026-07-05T11:41:02.544826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:949a1582ecd73861bfdaf63342f211dc017092bc468d3129b7d11ec5bb135127","observation_id":"85266423-3b9a-482c-b212-fadb1dfcaf91","resolution":{"observed_at":"2026-05-10T05:51:10.420760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2604.22851","last_updated":"2026-07-07T12:47:51Z","snapshot_observed_at":"2026-07-12T18:45:30.417168Z","submitted_at":"2026-04-22T07:49:02Z","title":"EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T00:09:18.068337Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2604.22851"},"observation_digest":"sha256:091a4d09777dad3312918bf8f40eff3581a7ffb410306ce9ee670d671d2f975a","observation_id":"24670dd2-623b-4306-9a19-12df51202285","resolution":{"observed_at":"2026-05-10T00:19:47.159530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:46.145616Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:a13458c11ed38deb96742c3e0c62098c30d75d6ddff71edb8a7d84d9684352f1","observation_id":"670b3c2b-9aab-4827-bfd5-e0b330b9271c","resolution":{"observed_at":"2026-06-29T18:23:51.152734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T21:35:33.280591Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:2376d148d2dc4a3a9b20a4dcc8685f5fb538a14b4a9cfcd378df3765ccdd0046","observation_id":"3158c713-bf1e-40eb-aa7b-8f6b7f88b616","resolution":{"observed_at":"2026-07-02T21:37:24.180527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2606.31830","last_updated":"2026-06-30T15:36:48Z","snapshot_observed_at":"2026-08-03T02:38:11.037610Z","submitted_at":"2026-06-30T15:36:48Z","title":"PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T05:58:58.075150Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2606.31830"},"observation_digest":"sha256:da21d07c5f65d3324860855ceafaa2954c6269d3e04337b753b825b92c7290b2","observation_id":"0d0865d9-586c-436c-b941-718cebd07d84","resolution":{"observed_at":"2026-07-01T09:55:41.492322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-04T07:11:20.776007Z","title":"A survey on vision-language-action models for au- tonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02449","last_updated":"2026-08-03T16:24:17Z","snapshot_observed_at":"2026-08-06T23:37:57.080849Z","submitted_at":"2026-08-03T16:24:17Z","title":"MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T07:11:20.776007Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2608.02449"},"observation_digest":"sha256:2fc8acadc0e535359ed111b6afe4e6ae646443ec3358469b76c41ebd2883b069","observation_id":"8c159a26-866d-4ccf-a534-b4e5dccdc3dc","resolution":{"observed_at":"2026-08-04T07:11:20.776007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.24044/citation-record","integrity":"/paper/2506.24044/integrity","json":"/paper/2506.24044/citation-record.json","paper":"/paper/2506.24044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.317875Z","title":"Flamingo: a visual language model for few-shot learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.317875Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1074d73c91fe27e5c1e40795b582d8c7d9d8bdc3ab0f1f7c96b960da15ec0a5c","observation_id":"95972b4e-af7f-4426-b799-a6a82ba1c909","resolution":{"observed_at":"2026-08-06T21:31:04.317875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.321970Z","title":"An lstm net- work for highway trajectory prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.321970Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f87d77b63aa74d355a9086d6d6b0a2f3f62f0f261e71d54b89ea059190659bf3","observation_id":"9683c8e4-9fa6-4ba5-b4de-b343ce145803","resolution":{"observed_at":"2026-08-06T21:31:04.321970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15672","last_updated":"2025-02-21T18:56:02Z","snapshot_observed_at":"2026-08-06T17:20:46.736928Z","submitted_at":"2025-02-21T18:56:02Z","title":"VaViM and VaVAM: Autonomous Driving through Video Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15672","snapshot_observed_at":"2026-08-06T21:31:04.325481Z","title":"Vavim and vavam: Autonomous driving through video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.325481Z"},"links":{"cited_paper":"/paper/2502.15672","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:be44a5072c7d0b3f694a67be6b2290094b8fe2f0c3c6dd0d7ca38b4b9668777e","observation_id":"1d2f59fb-38cf-4392-b6ad-e788b6dbb978","resolution":{"observed_at":"2026-08-06T21:31:04.325481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T21:31:04.329364Z","title":"pi0: A vision-language- action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.329364Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:163ae5517fa8b412af1d2f8824150a0edb5f4ccf1a812d1059349b73cdac0c5e","observation_id":"3be9daf3-30aa-47f2-8f53-03ea0dfa3524","resolution":{"observed_at":"2026-08-06T21:31:04.329364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.333208Z","title":"Fine-grained affective processing capabilities emerging from large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.333208Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a145008f27959027833131528960785182e534cb8502df1c1d24fdef278464d9","observation_id":"a940b45e-a0dc-4940-be05-64a3d59804c0","resolution":{"observed_at":"2026-08-06T21:31:04.333208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.336827Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.336827Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0564acf51a207670700ae6fc1a4c15f4691a685e95e9e04316a637bc1ba81659","observation_id":"0c255595-3398-4239-bed9-78afb5ad81ef","resolution":{"observed_at":"2026-08-06T21:31:04.336827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.341206Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.341206Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0ea0bf3d5d81f9d75d50a31c87467cfd713192254e1cb430608fb01b2c719255","observation_id":"eddffb62-ec8c-4c99-9782-f80d4cdc0146","resolution":{"observed_at":"2026-08-06T21:31:04.341206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.344745Z","title":"nuscenes: A mul- timodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.344745Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:4e252c2d7c2288eb14d4345c88bec7c086711ba7781d00090cbdd36e13080a2f","observation_id":"7fa2c5dd-9bfd-4e66-9c0b-c682eeeca2fa","resolution":{"observed_at":"2026-08-06T21:31:04.344745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.349406Z","title":"Learning from all vehi- cles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.349406Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:14775fa962259a48a6cd3b11b37d2f78db8d481e783859d3e65117935a8a7a84","observation_id":"87ae5ca0-c84f-4946-9287-e7bf4952b552","resolution":{"observed_at":"2026-08-06T21:31:04.349406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.352905Z","title":"Insight: Enhancing autonomous driving safety through vision-language models on context-aware hazard detection and edge case evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.352905Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:753c3f0aef0699727bfeaa78fa0a915d6261ded8411033aafb21e10659502607","observation_id":"15618d1e-cae1-4536-a0a4-4ad30489a0fb","resolution":{"observed_at":"2026-08-06T21:31:04.352905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12670","last_updated":"2025-05-19T03:37:15Z","snapshot_observed_at":"2026-08-04T12:57:06.728774Z","submitted_at":"2025-05-19T03:37:15Z","title":"TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12670","snapshot_observed_at":"2026-08-06T21:31:04.357239Z","title":"Ts- vlm: Text-guided softsort pooling for vision-language models in multi-view driving reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.357239Z"},"links":{"cited_paper":"/paper/2505.12670","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:05a5e08840cfb02b9d568403be29f604180f0061e36428abb8e2abae2db87160","observation_id":"88023e48-d173-4a4c-a9d3-d4966c1b92f8","resolution":{"observed_at":"2026-08-06T21:31:04.357239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.361431Z","title":"What data do we need for training an av motion planner? In 2021 IEEE Inter- national Conference on Robotics and Automation (ICRA) , pages 1066–1072","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.361431Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9b8224b72c6275ff0950a7dfaeb74be8ce7a2a27376b53351308293df5e95802","observation_id":"4e41fc49-42a9-42da-9ee8-3ce930c479e6","resolution":{"observed_at":"2026-08-06T21:31:04.361431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.364887Z","title":"End-to-end autonomous driving: Challenges and frontiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.364887Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f2362a7f1bc22d7a4216dd885bcad6632e9017d9c85c088e6391552006722f1a","observation_id":"b5cd6e6b-7abf-4712-a9a2-783a5470fee6","resolution":{"observed_at":"2026-08-06T21:31:04.364887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-06T21:31:04.369131Z","title":"Vadv2: End-to-end vectorized au- tonomous driving via probabilistic planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.369131Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:4a50e0b518a2efd14bf590524977fe8cad7362360c3b7b9edfe64b70387fe567","observation_id":"f48e424e-dd98-4372-b145-c8ce827bcbc7","resolution":{"observed_at":"2026-08-06T21:31:04.369131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.373472Z","title":"Asynchronous large language model en- hanced planner for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.373472Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:7dc83327cf06d9f6db616c9483c816905d6c268f6385033e9c726e383d50c3b2","observation_id":"1d70c450-28a6-4dcc-8af5-14c10c1389aa","resolution":{"observed_at":"2026-08-06T21:31:04.373472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.377211Z","title":"Ppad: Iterative interactions of prediction and planning for end-to-end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.377211Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d244063eecd46aff2b15c39c3d584e06eb447ada5a2d25f6c58cae68377b4015","observation_id":"206166b7-1c33-4c8c-971f-57f8bf472cfb","resolution":{"observed_at":"2026-08-06T21:31:04.377211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.381473Z","title":"CoVLA: Comprehensive vision-language-action dataset for au- tonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.381473Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:8ae69174f05d004d63d888f28cd49a246cccdb1f29d59a0c0a2b5c6b826ee32a","observation_id":"981fc864-c778-4305-a2b6-26039998b808","resolution":{"observed_at":"2026-08-06T21:31:04.381473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-06T21:31:04.384791Z","title":"Impromptu vla: Open weights and open data for driving vision- language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.384791Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:95afa723c8d588cb777481579da380dbffe85b3ecb846604d4d922bc17525ddd","observation_id":"ae9035c8-cebe-40f7-8752-3275413763fa","resolution":{"observed_at":"2026-08-06T21:31:04.384791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.388971Z","title":"Neat: Neural attention fields for end-to-end autonomous driving","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.388971Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2f42652a819e3f3af5166e41e5b1c66449ac6885ad8a4cda64780176ed41779d","observation_id":"f0a55e4d-3b65-4899-9f39-c0b41d12bc6b","resolution":{"observed_at":"2026-08-06T21:31:04.388971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.392370Z","title":"Transfuser: Imita- tion with transformer-based sensor fusion for autonomous driving","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.392370Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2008f2d068f52a3fbbfa467670692676b931a16f80ccb21b4200fa098c789a3a","observation_id":"16c070ea-5acb-463f-9fea-4626f7e83d4f","resolution":{"observed_at":"2026-08-06T21:31:04.392370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.395495Z","title":"Talk2bev: Language-enhanced bird’s- eye view maps for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.395495Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:327bfab80255e4030fd2393be7a071ee3809551be8fbf8147528310e856c7836","observation_id":"230a8c27-d8da-41f2-863a-2fe5460e25b3","resolution":{"observed_at":"2026-08-06T21:31:04.395495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.398942Z","title":"A survey on multimodal large lan- guage models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.398942Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:05b42bae6ca747c38a81f1e9d4dcd164ce2e351ef84d6b37b4a9d1f3e4212b40","observation_id":"d5233365-64c2-4c2b-9811-1693fd109563","resolution":{"observed_at":"2026-08-06T21:31:04.398942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-06T09:04:17.335900Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20223","snapshot_observed_at":"2026-08-06T21:31:04.402197Z","title":"Chain-of-thought for autonomous driving: A comprehensive survey and future prospects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.402197Z"},"links":{"cited_paper":"/paper/2505.20223","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ddca4122408fb6e8e15ab792087c00a75d1ab9f1cad6d44f5c676ea7302680a1","observation_id":"bb544cc9-b712-435f-b5f1-ee1b4e55acd0","resolution":{"observed_at":"2026-08-06T21:31:04.402197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06702","last_updated":"2024-09-10T17:59:40Z","snapshot_observed_at":"2026-08-06T04:59:18.522033Z","submitted_at":"2024-09-10T17:59:40Z","title":"Hint-AD: Holistically Aligned Interpretability in End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06702","snapshot_observed_at":"2026-08-06T21:31:04.405773Z","title":"Hint-ad: Holistically aligned interpretability in end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.405773Z"},"links":{"cited_paper":"/paper/2409.06702","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ca193789c0721cf6a8b76cc8fe02053d23b17e25a02026481f99bd3257440ae1","observation_id":"97a7f9ab-fabd-4d1e-ba7a-1558608947d7","resolution":{"observed_at":"2026-08-06T21:31:04.405773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.409296Z","title":"Dualad: Disentangling the dynamic and static world for end-to-end driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.409296Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a3e41d74f6b662d9481f8600aa9a9fe4f8c91303edb2fb6ac35b5d40119f4d28","observation_id":"400d1b16-2441-4279-a5c5-cb36963b63cf","resolution":{"observed_at":"2026-08-06T21:31:04.409296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.412510Z","title":"Carla: An open urban driv- ing simulator","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.412510Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0e2750f7b4aa65f4a503e274ca1352e0e50c0284c0b62ba76c6bfe383948773f","observation_id":"043f54c0-3ae0-49c0-b9c5-106b8097b215","resolution":{"observed_at":"2026-08-06T21:31:04.412510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.415798Z","title":"On the road to portability: Compressing end-to-end motion planner for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.415798Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:91830e76dfcc94b5143d28814b87dc758a2bbbd7569eda0d9f5845522113520a","observation_id":"18721357-3ffb-480b-a858-92e7014b9fc1","resolution":{"observed_at":"2026-08-06T21:31:04.415798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.418970Z","title":"Polarpoint-bev: Bird-eye- view perception in polar points for explainable end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.418970Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b029367d148df540110873e4baa3defc2eeac7bc161f7caf59e3a8dde9c7fdff","observation_id":"bf68921b-35b3-4fb8-984d-61e1486323c8","resolution":{"observed_at":"2026-08-06T21:31:04.418970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.422092Z","title":"Drive like a human: Rethinking autonomous driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.422092Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:65d697c844ebdf85d1a927d0ee07a92da26a64746caa5a9f369c8f4a62a79a04","observation_id":"c5da9684-8de4-4242-87fb-5b4afdb9c75e","resolution":{"observed_at":"2026-08-06T21:31:04.422092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-05T21:57:39.132989Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19755","snapshot_observed_at":"2026-08-06T21:31:04.429364Z","title":"Orion: A holis- tic end-to-end autonomous driving framework by vision- language instructed action generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.429364Z"},"links":{"cited_paper":"/paper/2503.19755","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2025a9d97df75c7a022f268e0c8e50db96ad8687802586a2f9bac39dcf7486fc","observation_id":"25067f8d-5942-446f-b9ee-06a64cc0550d","resolution":{"observed_at":"2026-08-06T21:31:04.429364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01105","last_updated":"2024-09-05T03:38:08Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:44:59Z","title":"A Survey for Foundation Models in Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01105","snapshot_observed_at":"2026-08-06T21:31:04.432603Z","title":"A survey for foun- dation models in autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.432603Z"},"links":{"cited_paper":"/paper/2402.01105","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:461192a0c381ecf0e3963281b14277b384ad0b29c78ad20022b6f118cdf09150","observation_id":"ff5b3305-7a88-4afd-9ab0-2fc46ae66821","resolution":{"observed_at":"2026-08-06T21:31:04.432603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13406","last_updated":"2025-04-21T02:00:43Z","snapshot_observed_at":"2026-07-06T21:11:15.204298Z","submitted_at":"2025-04-18T02:03:14Z","title":"LangCoop: Collaborative Driving with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13406","snapshot_observed_at":"2026-08-06T21:31:04.436251Z","title":"Lang- coop: Collaborative driving with language","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.436251Z"},"links":{"cited_paper":"/paper/2504.13406","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:bd1da02e8bf9c5a6e5436ffff18ce9e5dce5433e0a7b2e8957d86743823562c4","observation_id":"e064c0f6-803e-497d-814f-5ec440ab0104","resolution":{"observed_at":"2026-08-06T21:31:04.436251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.439666Z","title":"A review of motion planning techniques for au- tomated vehicles","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.439666Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:751dea246c3d336dbb793704c0aead49b53034719952b375835f43ad7fb7d083","observation_id":"a06dc6e1-527a-4ff7-84eb-a8eb02c12f7c","resolution":{"observed_at":"2026-08-06T21:31:04.439666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15111","last_updated":"2025-05-21T05:05:38Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:05:38Z","title":"iPad: Iterative Proposal-centric End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15111","snapshot_observed_at":"2026-08-06T21:31:04.442877Z","title":"ipad: Iterative proposal-centric end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.442877Z"},"links":{"cited_paper":"/paper/2505.15111","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0dc0f1689b79c3f3fcf7844a1aa86b7744548304bb51797a6cdcb003e7ca447d","observation_id":"eb80006e-0204-4af8-9719-477ef2246b51","resolution":{"observed_at":"2026-08-06T21:31:04.442877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17680","last_updated":"2024-06-25T16:12:52Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T16:12:52Z","title":"End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17680","snapshot_observed_at":"2026-08-06T21:31:04.446259Z","title":"End-to-end autonomous driving without costly modularization and 3d manual annotation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.446259Z"},"links":{"cited_paper":"/paper/2406.17680","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:89ec4b862596400b4b069c6316faa79cff644e57b80138d7f4c9a150e2ccc88a","observation_id":"f6b14606-f44c-4317-aff4-815a937b3744","resolution":{"observed_at":"2026-08-06T21:31:04.446259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13112","last_updated":"2025-05-27T14:49:49Z","snapshot_observed_at":"2026-08-03T12:16:27.889586Z","submitted_at":"2024-11-20T08:14:01Z","title":"SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13112","snapshot_observed_at":"2026-08-06T21:31:04.449729Z","title":"Drivem- llm: A benchmark for spatial understanding with multi- modal large language models in autonomous driving.arXiv preprint arXiv:2411.13112, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.449729Z"},"links":{"cited_paper":"/paper/2411.13112","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ae527c9e5fa0677869b396a4b140d8d7e8499fb55523c240e5400a41272347ba","observation_id":"cbe35daa-af34-47e7-9f69-a5ff07a714ed","resolution":{"observed_at":"2026-08-06T21:31:04.449729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.453118Z","title":"Dme-driver: Integrating human decision logic and 3d scene perception in autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.453118Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:17bf035e5c8736331a9dfcc90132cf359c279c2a35339d586cbeef2fb2096278","observation_id":"c8a4693a-d8ac-41fc-86b0-14116f3e8d94","resolution":{"observed_at":"2026-08-06T21:31:04.453118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.456365Z","title":"Driveaction: A benchmark for exploring human-like driving decisions in vla models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.456365Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f9ed950eda91050d78352e2cd9463358dc3a461f9c6c7b0070cefc14092130a2","observation_id":"ed0d1377-4c9b-413f-b84e-4ff74c4aeca0","resolution":{"observed_at":"2026-08-06T21:31:04.456365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.459454Z","title":"Urban driving with conditional imitation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.459454Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b83eb94150a500e2a07b3f61ad942486ba144eeb5861127449a2c817aee046a4","observation_id":"625c298e-8009-4e1a-815c-aeb0cfe79849","resolution":{"observed_at":"2026-08-06T21:31:04.459454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02123","last_updated":"2025-05-04T14:13:00Z","snapshot_observed_at":"2026-08-03T23:34:38.202808Z","submitted_at":"2025-05-04T14:13:00Z","title":"DriveAgent: Multi-Agent Structured Reasoning with LLM and Multimodal Sensor Fusion for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02123","snapshot_observed_at":"2026-08-06T21:31:04.462537Z","title":"Driveagent: Multi-agent structured reasoning with llm and multimodal sensor fusion for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.462537Z"},"links":{"cited_paper":"/paper/2505.02123","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1e06cb4876d3386a6be338baef385af7a5081ea6ab0c54a228c14a28e1746587","observation_id":"49fdd285-272c-4511-a055-efdfe7f3aef7","resolution":{"observed_at":"2026-08-06T21:31:04.462537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.465990Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.465990Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:842b9f33d67f3ce772172109fa9478a40e009c572832cf278c5d963f29536ff5","observation_id":"7222be9c-5737-4c26-b8fb-be9cc01874f8","resolution":{"observed_at":"2026-08-06T21:31:04.465990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.469144Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.469144Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:822b2437f0d71a8fb89da5046151f0b8ac1c3e02d73819f45366f143d31b167f","observation_id":"3b76c5c3-ee14-47a7-a98d-07ad99bca1d9","resolution":{"observed_at":"2026-08-06T21:31:04.469144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.472273Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.472273Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:dd241fa640a346d6658d412ab98aac641e561651c9dbabad76114134d4ba1258","observation_id":"25810685-f58b-4f16-a052-e0c8c25afd6c","resolution":{"observed_at":"2026-08-06T21:31:04.472273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.475355Z","title":"A survey on trajectory-prediction methods for autonomous driving","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.475355Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:18b458503be706d8f5969d211a421483bd25434c47e5a03eb321b074bb27a269","observation_id":"3f37d0c4-e48d-4bbc-9443-1f08c6123840","resolution":{"observed_at":"2026-08-06T21:31:04.475355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07689","last_updated":"2025-08-07T06:38:32Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T17:27:32Z","title":"RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07689","snapshot_observed_at":"2026-08-06T21:31:04.478639Z","title":"Drivemm: All-in-one large multimodal model for au- tonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.478639Z"},"links":{"cited_paper":"/paper/2412.07689","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1bf9b63aa8b74ef4eeff8359a90d4a0443bc9a6888d9ff679b6674a927ddfdfb","observation_id":"a181b55c-bd64-43f7-8c89-c9e8f06f9781","resolution":{"observed_at":"2026-08-06T21:31:04.478639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15544","last_updated":"2024-12-20T04:08:11Z","snapshot_observed_at":"2026-08-06T17:28:05.501969Z","submitted_at":"2024-12-20T04:08:11Z","title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15544","snapshot_observed_at":"2026-08-06T21:31:04.482447Z","title":"Vlm-rl: A unified vision language models and reinforcement learning framework for safe autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.482447Z"},"links":{"cited_paper":"/paper/2412.15544","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f322e713db4fbb416c8d808fb0ef1d651f0cd77566afe2c64a92c91718d7e984","observation_id":"c46c8d11-f331-4e38-8b22-09967ed31c8b","resolution":{"observed_at":"2026-08-06T21:31:04.482447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-06T21:31:04.485889Z","title":"Nora: A small open-sourced generalist vision lan- guage action model for embodied tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.485889Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e40c43c3909abddae7c89d9223509a31daf48bc1bb5f0540ca706c72cd978611","observation_id":"0bc08dcf-5eaf-4ec0-9951-e0c68652fccf","resolution":{"observed_at":"2026-08-06T21:31:04.485889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.489388Z","title":"Yolo-v1 to yolo-v8, the rise of yolo and its complementary nature toward digital manufacturing and industrial defect detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.489388Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:291cc5eccd01d633950aaecde4ac29734c8921f6a62898bb1d7102b94fdfebcb","observation_id":"569b3479-5401-4fbc-8485-2bc3187b5b8a","resolution":{"observed_at":"2026-08-06T21:31:04.489388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-06T21:31:04.492816Z","title":"Emma: End-to-end mul- timodal model for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.492816Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:361379614d49ed1a1e6bad65383221adad5d7dd0ce258acd9ac9944460494a06","observation_id":"5224ef4c-f19f-4cbf-b687-c2984152e145","resolution":{"observed_at":"2026-08-06T21:31:04.492816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10621","last_updated":"2025-03-13T17:59:01Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:59:01Z","title":"DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10621","snapshot_observed_at":"2026-08-06T21:31:04.496591Z","title":"Drivelmm-o1: A step-by-step reasoning dataset and large multimodal model for driving scenario understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.496591Z"},"links":{"cited_paper":"/paper/2503.10621","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:61484e135505f797f8553df1d5469831dc7a0661ae83a25c24d19cf3260a3491","observation_id":"559edfd9-9390-47cf-841f-54cc8482836a","resolution":{"observed_at":"2026-08-06T21:31:04.496591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.499865Z","title":"Narrate: Versatile lan- guage architecture for optimal control in robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.499865Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:36f971abb9377e399dbb3857d8070233eb41a7709365e78dd1d3e52d683de20a","observation_id":"aacfba20-a326-47dd-945b-f37dc9f8ee14","resolution":{"observed_at":"2026-08-06T21:31:04.499865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13549","last_updated":"2023-11-22T17:44:29Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T17:44:29Z","title":"ADriver-I: A General World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13549","snapshot_observed_at":"2026-08-06T21:31:04.503085Z","title":"Adriver-i: A general world model for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.503085Z"},"links":{"cited_paper":"/paper/2311.13549","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f1b606a6441ca68f91fe01678ecc7326cb2bc03760184f8b6a85a4dad2b1254c","observation_id":"d92e1b2c-cbdb-4b14-9bc7-14bf466ee07e","resolution":{"observed_at":"2026-08-06T21:31:04.503085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.506379Z","title":"Think twice be- fore driving: Towards scalable decoders for end-to-end au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.506379Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:fb5405e1cad5de77ab75c802f54b3164df102c992bf104aa441df71ab66d7809","observation_id":"334a87f1-6670-47ce-9a9c-084f0356cfd2","resolution":{"observed_at":"2026-08-06T21:31:04.506379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03877","last_updated":"2024-11-27T09:31:04Z","snapshot_observed_at":"2026-07-06T18:26:19.664486Z","submitted_at":"2024-06-06T09:12:30Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03877","snapshot_observed_at":"2026-08-06T21:31:04.509692Z","title":"Bench2drive: Towards multi-ability bench- marking of closed-loop end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.509692Z"},"links":{"cited_paper":"/paper/2406.03877","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f3702a7f50f25cb1151488cc13c945938c9598872e431a0503025c901e7bfa7c","observation_id":"38578a71-14e3-43f1-aca0-8dd29613d89c","resolution":{"observed_at":"2026-08-06T21:31:04.509692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07656","last_updated":"2025-07-11T08:15:30Z","snapshot_observed_at":"2026-08-04T23:03:25.422868Z","submitted_at":"2025-03-07T11:41:18Z","title":"DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07656","snapshot_observed_at":"2026-08-06T21:31:04.513157Z","title":"Drivetransformer: Unified transformer for scalable end-to- end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.513157Z"},"links":{"cited_paper":"/paper/2503.07656","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:7de7f677077d52c0fd4da6dcb8c17f8272f21944e5ce2f6b7ea26a399759b2c7","observation_id":"41eabb91-c06c-40d7-9c42-900df6541d45","resolution":{"observed_at":"2026-08-06T21:31:04.513157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19381","last_updated":"2025-06-03T02:28:31Z","snapshot_observed_at":"2026-08-06T16:15:13.811472Z","submitted_at":"2025-05-26T00:49:35Z","title":"DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19381","snapshot_observed_at":"2026-08-06T21:31:04.516550Z","title":"Diffvla: Vision- language guided diffusion planning for autonomous driv- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.516550Z"},"links":{"cited_paper":"/paper/2505.19381","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:797f6fd509d430b6f5bea0940be51a6e2721360035cf797f2a7f400b6479e9f6","observation_id":"224a316f-d4fa-4a7b-a4cd-896d8c42f4ef","resolution":{"observed_at":"2026-08-06T21:31:04.516550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-06T21:31:04.520794Z","title":"Senna: Bridging large vision-language mod- els and end-to-end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.520794Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e2409a2f3e1af2b35aee2119ff63efb2a4e5a558f332bca5ac68443702cf21af","observation_id":"e42c38b3-5667-4a3b-9987-316e834e7550","resolution":{"observed_at":"2026-08-06T21:31:04.520794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.524393Z","title":"Vad: Vectorized scene rep- resentation for efficient autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.524393Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:96a27eb8ab9602a2d5d231460691837d572297279e08c6f93ce9a4d04976bc53","observation_id":"5c35b144-26d3-4866-b0c6-8ca291c57bda","resolution":{"observed_at":"2026-08-06T21:31:04.524393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.527846Z","title":"Koma: Knowledge-driven multi- agent framework for autonomous driving with large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.527846Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0ac23cceb063d18d9543a96c7c2d102032fc3707d4d7b2ad987cf0f547daad0d","observation_id":"8269ba50-47e2-4843-b48a-d34b15368cda","resolution":{"observed_at":"2026-08-06T21:31:04.527846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08964","last_updated":"2024-07-12T03:28:24Z","snapshot_observed_at":"2026-08-03T10:26:14.756945Z","submitted_at":"2024-07-12T03:28:24Z","title":"Communication-Aware Reinforcement Learning for Cooperative Adaptive Cruise Control","version":1},"cited_work":{"arxiv_id":"2407.08964","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08964","snapshot_observed_at":"2026-08-06T21:31:06.137249Z","title":"Communication-Aware Reinforcement Learning for Cooperative Adaptive Cruise Control","venue":"cs.LG","work_id":"d74671d8-bfb0-4f4a-86e6-e7f12de0797f","year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.530858Z"},"links":{"cited_paper":"/paper/2407.08964","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:88ffaef2ad0940dfdad3ccd1327b326a7a63bf1221e44fe5d7501effcfe7aab1","observation_id":"848168b4-dbea-4e9c-8ddf-c10b85559472","resolution":{"observed_at":"2026-08-06T21:31:06.177631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.534174Z","title":"Learning to drive in a day","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.534174Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:062b339adb65b8e6e7ebae26286376d3f705e8ab43e15611159176c9e5ac6346","observation_id":"faec5161-b732-46ed-bc48-d3785462ad2c","resolution":{"observed_at":"2026-08-06T21:31:04.534174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.537689Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.537689Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:969289eaa443d3993bd4a61220c41bd3cd17757f0a6d137e245633e3031531d7","observation_id":"653bce07-5833-4ada-90fe-b04a282e2f8f","resolution":{"observed_at":"2026-08-06T21:31:04.537689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-06T21:31:04.540761Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.540761Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:81a0050d5d0c19e17572f1df3e170b2560e718c18c2eaaeacb53aa0e31cb394a","observation_id":"75ea97e9-bd5c-4ff7-b378-05062533862b","resolution":{"observed_at":"2026-08-06T21:31:04.540761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T21:31:04.544824Z","title":"Open- vla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.544824Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a888fdf89a7439893418f19b40370d9021dc85be9002d107f381c601770d3434","observation_id":"88d37ec8-5d2f-4ecf-8d92-6d7cb7aaa2d4","resolution":{"observed_at":"2026-08-06T21:31:04.544824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.549316Z","title":"A survey on motion prediction and risk assessment for in- telligent vehicles","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.549316Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:6ce8f50a29b38859f54511badaf7377b8cb010ebf8a6eb217301b67e290f9a6a","observation_id":"0261be28-95c3-4a3f-b0dc-7f76815360f1","resolution":{"observed_at":"2026-08-06T21:31:04.549316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-07-06T20:50:00.422560Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-06T21:31:04.553726Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.553726Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:774bb8128440193a638f1e0d7b42c3d1f35abe5ddec0b72cfcfb612813d584d1","observation_id":"4acb9048-e194-4083-bc7f-d33873d302b6","resolution":{"observed_at":"2026-08-06T21:31:04.553726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18341","last_updated":"2025-03-01T10:42:24Z","snapshot_observed_at":"2026-07-06T19:23:06.818254Z","submitted_at":"2024-09-26T23:30:48Z","title":"Navigation-Guided Sparse Scene Representation for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18341","snapshot_observed_at":"2026-08-06T21:31:04.557074Z","title":"Does end-to-end autonomous driving really need perception tasks? arXiv preprint arXiv:2409.18341, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.557074Z"},"links":{"cited_paper":"/paper/2409.18341","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f177812174ce96be7692c352a676bf7c05275b6d75a156cf45e1ff9f603f55e0","observation_id":"d42ecad3-38ae-4afa-a415-a0a6ab560be7","resolution":{"observed_at":"2026-08-06T21:31:04.557074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08481","last_updated":"2025-02-28T07:43:38Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:21Z","title":"Enhancing End-to-End Autonomous Driving with Latent World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08481","snapshot_observed_at":"2026-08-06T21:31:04.560587Z","title":"Enhancing end-to- end autonomous driving with latent world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.560587Z"},"links":{"cited_paper":"/paper/2406.08481","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f421fb8471d151f0aafd5ff8d0a76d4230c37e05cd19035bd71652217c8b5880","observation_id":"004a1db2-0aa4-40a9-94f9-8ba012b716fd","resolution":{"observed_at":"2026-08-06T21:31:04.560587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.564262Z","title":"Recogdrive: A reinforced cognitive framework for end-to-end autonomous driving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.564262Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9ad50956908daa37cb6c7e13f3a40114882b76796f0f50a3ff25938ab2ff6d53","observation_id":"e3f1a3fa-a0a9-4035-9bf7-2035b9e91235","resolution":{"observed_at":"2026-08-06T21:31:04.564262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06978","last_updated":"2024-08-30T03:37:36Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:18:26Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06978","snapshot_observed_at":"2026-08-06T21:31:04.568371Z","title":"Hydra-mdp: End-to-end multimodal plan- ning with multi-target hydra-distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.568371Z"},"links":{"cited_paper":"/paper/2406.06978","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:66c11ef14c97c33f9aaa24f4aa344edc30108e37060f30871fa59617a81ae4e5","observation_id":"01b84402-1ceb-47f6-bd22-f4984485b8b3","resolution":{"observed_at":"2026-08-06T21:31:04.568371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06664","last_updated":"2025-06-07T05:06:05Z","snapshot_observed_at":"2026-08-05T08:34:09.387431Z","submitted_at":"2025-06-07T05:06:05Z","title":"Generalized Trajectory Scoring for End-to-end Multimodal Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06664","snapshot_observed_at":"2026-08-06T21:31:04.572098Z","title":"Generalized trajectory scor- ing for end-to-end multimodal planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.572098Z"},"links":{"cited_paper":"/paper/2506.06664","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:717a79efd917502331e504035acd672cd2bf197185e12c31c8bb94ce24132076","observation_id":"58283645-65e3-4dc8-be82-d85c9dc06e21","resolution":{"observed_at":"2026-08-06T21:31:04.572098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.576167Z","title":"Pnpnet: End-to-end per- ception and prediction with tracking in the loop","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.576167Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:12c044ccd0ba327ee2acfaaacf9205109f6b7f1e67235f111c456c4eed5609a0","observation_id":"6b37605a-5907-47e3-959b-3713cd1443eb","resolution":{"observed_at":"2026-08-06T21:31:04.576167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.579305Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.579305Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:bd41b1ee91d3d9d44dabe6b5b600ce2dd6845a411d1effcaed472da7bb0dfeb6","observation_id":"e0c04cd3-a3d8-41b6-880b-70f0e1e154a1","resolution":{"observed_at":"2026-08-06T21:31:04.579305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.582341Z","title":"Mtd-gpt: A multi-task decision-making gpt model for autonomous driving at unsignalized intersections","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.582341Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:aab2803a006c672b395352dbcdf7d5563e041f75b37e4d506a27d86e2aabb10f","observation_id":"44ea8d2f-3f23-4c2f-ae28-109d31e4e189","resolution":{"observed_at":"2026-08-06T21:31:04.582341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.585664Z","title":"Robomamba: Ef- ficient vision-language-action model for robotic reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.585664Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ec51b37a7488c0617ac05f65e7f8c058938a92516bd68fb654b970d261207d7a","observation_id":"25d0286c-a370-4c1f-8d37-358293a1a5d5","resolution":{"observed_at":"2026-08-06T21:31:04.585664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12667","last_updated":"2025-07-15T09:24:20Z","snapshot_observed_at":"2026-07-06T21:10:46.664436Z","submitted_at":"2025-04-17T05:52:35Z","title":"Fully Unified Motion Planning for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12667","snapshot_observed_at":"2026-08-06T21:31:04.588876Z","title":"Two tasks, one goal: Uniting motion and planning for excellent end to end autonomous driving performance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.588876Z"},"links":{"cited_paper":"/paper/2504.12667","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:cad086409b60e706dd1b4e59fba00eab10d380c364e37de8580cce031d48ee52","observation_id":"6b80e62b-0141-4228-8bbd-3fd7451e7954","resolution":{"observed_at":"2026-08-06T21:31:04.588876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.592420Z","title":"Vlm-e2e: Enhancing end-to-end autonomous driv- ing with multimodal driver attention fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.592420Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ba26fdc9fcc7a56995a877d3e2d075ce205d55be854b09a8f420ef4a12800458","observation_id":"a78c074f-2c92-41a6-8e06-99d5163e47a5","resolution":{"observed_at":"2026-08-06T21:31:04.592420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.595814Z","title":"Reasonplan: Unified scene prediction and decision reasoning for closed-loop au- tonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.595814Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2d582abb24fd8464e48ffa675d041ccc408ed84b6519c1dfff60a10dafe78587","observation_id":"a9f834fe-66c9-44ec-82ad-36c0632a40ce","resolution":{"observed_at":"2026-08-06T21:31:04.595814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.599077Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.599077Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b794bc8bef71feb978b5f7555bf291dcd8dc4d0ea99151c95cdae6361e995e61","observation_id":"2dd1e3bc-b9ca-4c7b-8123-1e5b6f7222f6","resolution":{"observed_at":"2026-08-06T21:31:04.599077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04821","last_updated":"2024-10-03T00:06:02Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T02:27:25Z","title":"VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04821","snapshot_observed_at":"2026-08-06T21:31:04.602293Z","title":"Vlm-mpc: Vision language foundation model (vlm)-guided model predictive controller (mpc) for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.602293Z"},"links":{"cited_paper":"/paper/2408.04821","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:094da1e5c291314afda0f9654dbc6048199d7cfc2f13e89cd4dff2dbaaf4f90e","observation_id":"30478a36-9dec-494f-9251-a392c74f2b68","resolution":{"observed_at":"2026-08-06T21:31:04.602293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02877","last_updated":"2024-03-05T11:39:07Z","snapshot_observed_at":"2026-08-03T14:33:46.003146Z","submitted_at":"2024-03-05T11:39:07Z","title":"ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02877","snapshot_observed_at":"2026-08-06T21:31:04.605560Z","title":"Activead: Planning-oriented active learning for end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.605560Z"},"links":{"cited_paper":"/paper/2403.02877","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:178b32808cc9b32336f16677274780083cd000951b2356c333f5b7ff5520924e","observation_id":"f55be80c-fd31-45a6-a185-719224fa5fd1","resolution":{"observed_at":"2026-08-06T21:31:04.605560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.608939Z","title":"Fast and fu- rious: Real time end-to-end 3d detection, tracking and mo- tion forecasting with a single convolutional net","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.608939Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:bcb66d493a970219f96402e8391c8bff4ac77ac997f36abad241248a2abcf1fa","observation_id":"6b7a9aad-23d7-4b7d-89c1-d3bf8446c354","resolution":{"observed_at":"2026-08-06T21:31:04.608939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.612085Z","title":"Dolphins: Multimodal language model for driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.612085Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0e820f084b1b736809438acac0f873a1c9500d4e3221c0a53a73ce2fe5121242","observation_id":"8342d199-fd35-4553-81a6-23c516a5613a","resolution":{"observed_at":"2026-08-06T21:31:04.612085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-06T21:31:04.615132Z","title":"A survey on vision-language-action models for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.615132Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2e2f1412330123de1c62be718187d43415529435aedbf947b14870afb1373c75","observation_id":"89742c4a-fee3-4efe-bba9-f3dac8bf713a","resolution":{"observed_at":"2026-08-06T21:31:04.615132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08168","last_updated":"2025-01-14T14:49:45Z","snapshot_observed_at":"2026-07-06T20:20:55.958338Z","submitted_at":"2025-01-14T14:49:45Z","title":"LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08168","snapshot_observed_at":"2026-08-06T21:31:04.618427Z","title":"Leapvad: A leap in autonomous driving via cogni- tive perception and dual-process thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.618427Z"},"links":{"cited_paper":"/paper/2501.08168","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:75517eca2bfd48198a779145d9fc602eb596f16014b863eaeff86a968447c8b6","observation_id":"6e81063f-e9f2-41e9-b3cf-77ed23412124","resolution":{"observed_at":"2026-08-06T21:31:04.618427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-06T21:31:04.622875Z","title":"Gpt-driver: Learning to drive with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.622875Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d9ab6652a4a8bb697ef444119ad010b5bf311cc0ddca15357fb38c4591ad31f9","observation_id":"cda65a11-b737-4623-b2a2-fbc9896fcb20","resolution":{"observed_at":"2026-08-06T21:31:04.622875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10813","last_updated":"2024-07-28T23:37:51Z","snapshot_observed_at":"2026-08-01T17:51:53.220489Z","submitted_at":"2023-11-17T18:59:56Z","title":"A Language Agent for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10813","snapshot_observed_at":"2026-08-06T21:31:04.626480Z","title":"A language agent for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.626480Z"},"links":{"cited_paper":"/paper/2311.10813","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:033d22c14fb5ee2dd5d36bf0aac78eb0b2a7cc19045d8372da484c5492e174eb","observation_id":"d02d2829-189c-4182-a3c9-f7aa54bf1d9c","resolution":{"observed_at":"2026-08-06T21:31:04.626480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.629874Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.629874Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b970627d22828e50ab6125cf831bf7c0c264d360b383a31612ede9e191786b1d","observation_id":"83a6066d-1707-4fa5-9bbb-420260d6686b","resolution":{"observed_at":"2026-08-06T21:31:04.629874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15324","last_updated":"2024-10-25T16:00:54Z","snapshot_observed_at":"2026-07-06T18:19:13.078606Z","submitted_at":"2024-05-24T08:07:28Z","title":"Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15324","snapshot_observed_at":"2026-08-06T21:31:04.633849Z","title":"Continuously learning, adapting, and im- proving: A dual-process approach to autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.633849Z"},"links":{"cited_paper":"/paper/2405.15324","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e648bda0930d5f85c7c9a0333814311c01859199a1dbd3e6281019417423dd3e","observation_id":"1ec33b50-ede3-45f7-a0bb-db23a2fe0d2f","resolution":{"observed_at":"2026-08-06T21:31:04.633849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.638377Z","title":"Chatmpc: Natural language based mpc personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.638377Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:90795861abbc97dfd191a25b83d1a1dceac1d7e197ea8919873947aa53409606","observation_id":"e7f686fe-f594-4a44-a100-80d971a5004e","resolution":{"observed_at":"2026-08-06T21:31:04.638377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04338","last_updated":"2025-04-06T03:23:48Z","snapshot_observed_at":"2026-07-06T21:04:57.459296Z","submitted_at":"2025-04-06T03:23:48Z","title":"Data Scaling Laws for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04338","snapshot_observed_at":"2026-08-06T21:31:04.641543Z","title":"Data scaling laws for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.641543Z"},"links":{"cited_paper":"/paper/2504.04338","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:01f62ec1b0ca6447f025aa3fc0de17fcd2d0026888799134a5b9ddd5eb2dcf29","observation_id":"4ef1b1d9-cf11-4a75-bdc3-3bef5054ae1a","resolution":{"observed_at":"2026-08-06T21:31:04.641543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.645337Z","title":"Rea- son2drive: Towards interpretable and chain-based reason- ing for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.645337Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:53cbcf182f45be3272ec565c0d17c1705fc57aa623618df9f880ab7b4d8af3f6","observation_id":"aab49f27-f584-4724-a0ef-1071af9a8d3e","resolution":{"observed_at":"2026-08-06T21:31:04.645337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:31:04.648737Z","title":"Dinov2: Learning robust visual features without supervi- sion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.648737Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a8aeee74b7d1362af9b4be6a8f5a1b2b3223829cf3326d49cfa82a3823866e7f","observation_id":"50a6587c-3ce2-410d-b1f3-67784e3c7a6a","resolution":{"observed_at":"2026-08-06T21:31:04.648737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.652503Z","title":"A survey of motion planning and control techniques for self-driving urban vehicles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.652503Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d22f8938a6f35e69b86513485cf7aa034c4b48059fbabdc8bdf208dc1cca97af","observation_id":"2bd0575f-59dd-4132-9ead-ab10afbd4ff6","resolution":{"observed_at":"2026-08-06T21:31:04.652503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.656685Z","title":"Vlp: Vision language planning for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.656685Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9506c45696be06c972baae74114fdd68f731461b150b5136b1d4af080dcfae4c","observation_id":"ae903616-2e2d-4ab7-a36c-49d69a2c4e2e","resolution":{"observed_at":"2026-08-06T21:31:04.656685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.659895Z","title":"Lego-drive: Language-enhanced goal-oriented closed-loop end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.659895Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:cac5519e47c199a9f5d6318d17cddebeb2a5859774249a374331741809e1960f","observation_id":"d4f55e8d-20a7-4b11-897b-961c39ea1760","resolution":{"observed_at":"2026-08-06T21:31:04.659895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-06T21:31:04.663325Z","title":"Fast: Efficient action tokeniza- tion for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.663325Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:448b43503648ea9041f7918a5b1d87eac053f7fb229e30f92e1b9d99f0445a6c","observation_id":"29f45af6-fa90-40c6-93e8-d9eddb9426a5","resolution":{"observed_at":"2026-08-06T21:31:04.663325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.667282Z","title":"Agentthink: A unified framework for tool-augmented chain-of-thought reasoning in vision- language models for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.667282Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:8807e57fe4dbaae8182c9f7cbfb8b00eb47da2e33559bac5d1e90e7648e69ce9","observation_id":"c2c0b6f3-5add-43e1-8983-a090cf69e547","resolution":{"observed_at":"2026-08-06T21:31:04.667282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08162","last_updated":"2025-03-11T08:27:01Z","snapshot_observed_at":"2026-07-06T20:50:27.661417Z","submitted_at":"2025-03-11T08:27:01Z","title":"FASIONAD++ : Integrating High-Level Instruction and Information Bottleneck in FAt-Slow fusION Systems for Enhanced Safety in Autonomous Driving with Adaptive Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08162","snapshot_observed_at":"2026-08-06T21:31:04.670504Z","title":"Fasionad++: Integrating high-level instruc- tion and information bottleneck in fat-slow fusion systems for enhanced safety in autonomous driving with adaptive feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.670504Z"},"links":{"cited_paper":"/paper/2503.08162","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:fe51bc27aefbf3add1a2184479442e9b96f372605df70441d7a8e6696a91993e","observation_id":"bd8d2423-3ca1-44ce-bdaa-d1c46b3f86ec","resolution":{"observed_at":"2026-08-06T21:31:04.670504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-06T21:31:04.674245Z","title":"Spatialvla: Exploring spatial represen- tations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.674245Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a44eba9bbdee77c7c7b137cf1f1215534bdc3784f0590d4523b300dd45a3ed4b","observation_id":"a020dcbf-7044-407c-8e17-0afe8753c195","resolution":{"observed_at":"2026-08-06T21:31:04.674245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:22:48.148173Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":166},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 166 outbound references and 14 inbound Pith citation observations for arXiv:2506.24044."}