{"as_of":"2026-08-08T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3435bda61d6554fc41c0f479beddf598e59e4244a621c208942d52cf7c05906a","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:58.997932Z","state":"measured"},{"denominator":116,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":116,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:31:04.384791Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T08:36:59.862431Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-06T21:31:04.384791Z","title":"Impromptu vla: Open weights and open data for driving vision- language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.384791Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:48183cfe5c3d22d4144f8ad32fa527793e655ed161c693f1d4645bebc6aadd40","observation_id":"ae9035c8-cebe-40f7-8752-3275413763fa","resolution":{"observed_at":"2026-08-06T21:31:04.384791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T21:29:09.319498Z","title":"Chi, H.-a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-04T21:29:05.648300Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:09.319498Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:0121709375f7efeb2de0535d6f8599ac2e8b445ce8f7137a9c6981d4c9c5f425","observation_id":"196d0325-5a3a-45f0-8a4f-148bbc2a9828","resolution":{"observed_at":"2026-08-04T21:29:09.319498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T20:10:13.346389Z","title":"Chi, H.-a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-08T00:20:56.144397Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.346389Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:c409985eac7b73f2bcf5c4ebb084cb1db94cc0cd0b0990c5686d3e9d1faffa31","observation_id":"5c04cba9-c92c-419f-8919-09e294d9f439","resolution":{"observed_at":"2026-08-04T20:10:13.346389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T19:19:25.999539Z","title":"Impromptu vla: Open weights and open data for driv- ing vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10570","last_updated":"2025-09-11T10:30:06Z","snapshot_observed_at":"2026-08-07T17:01:22.354040Z","submitted_at":"2025-09-11T10:30:06Z","title":"Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-04T19:19:25.999539Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2509.10570"},"observation_digest":"sha256:4b851445cd87e02bc95d8a3e0fac903bdf91c1b05e5b846ca94ea702148c74da","observation_id":"2fd31518-1945-4c47-9f28-8ff102d89257","resolution":{"observed_at":"2026-08-04T19:19:25.999539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T08:57:06.465834Z","title":"Impromptu vla: Open weights and open data for driving vision-language-action models.arXiv preprint arXiv:2505.23757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18313","last_updated":"2026-06-29T02:20:45Z","snapshot_observed_at":"2026-08-06T20:20:34.094359Z","submitted_at":"2025-10-21T05:49:01Z","title":"OmniNWM: Omniscient Driving Navigation World Models","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:57:06.465834Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2510.18313"},"observation_digest":"sha256:51c86f77b5376c798beb1af08631582247a7ca2dea5a529188edb737abcf77cf","observation_id":"1f7b0815-e253-4a45-8645-c237db0073a8","resolution":{"observed_at":"2026-08-04T08:57:06.465834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T02:35:13.126171Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2511.00088"},"observation_digest":"sha256:71d45f8a7d0fc8216f769ea4b049c908b00b98cafdf82585cfc6ba6b59b634a2","observation_id":"6ece5e9a-6bc4-4cb6-831b-a8860fccd60d","resolution":{"observed_at":"2026-05-18T02:35:13.234197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-03T16:52:50.875760Z","title":"arXiv preprint arXiv:2505.23757","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-03T16:52:46.785804Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:50.875760Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:d7e7f18f09657fb3c4a345064fead4a356425eda701909440b00b1ee7b166159","observation_id":"f66ab2f8-169a-4d0e-9e54-7b985db40f93","resolution":{"observed_at":"2026-08-03T16:52:50.875760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-02T21:19:52.228992Z","title":"Impromptu vla: Open weights and open data for driving vision-language-actionmodels[J].arXivpreprintarXiv:2505.23757,2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20575","last_updated":"2026-07-18T07:58:59Z","snapshot_observed_at":"2026-08-07T11:27:35.926728Z","submitted_at":"2026-02-24T05:57:18Z","title":"An interactive enhanced driving dataset for autonomous driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:19:52.228992Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2602.20575"},"observation_digest":"sha256:a94282833de1d627b81b18de0b1731a35210b93a505c78001e046ce5692bba77","observation_id":"bf88cfa6-ffb5-41e2-be72-78f8cca2a231","resolution":{"observed_at":"2026-08-02T21:19:52.228992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-02T21:12:24.280721Z","title":"Impromptu vla: Open weights and open data for driving vision-language- action models.arXiv preprint arXiv:2505.23757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21172","last_updated":"2026-06-05T21:24:23Z","snapshot_observed_at":"2026-08-03T02:26:02.645885Z","submitted_at":"2026-02-24T18:17:21Z","title":"NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:24.280721Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2602.21172"},"observation_digest":"sha256:4ff4cd485b257fb1df0cbd1b156bd52786f14cc39f2c834f8936d699e85206ae","observation_id":"f1bf4274-ba9d-4722-af5d-70e5225b7d90","resolution":{"observed_at":"2026-08-02T21:12:24.280721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2603.09465","last_updated":"2026-05-11T07:51:23Z","snapshot_observed_at":"2026-08-06T10:13:11.855502Z","submitted_at":"2026-03-10T10:19:07Z","title":"EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:14:45.982490Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2603.09465"},"observation_digest":"sha256:36e8319c1ae88814f9e4631a696c9a86efa566e4ae1c4600472af1c2b41d90ff","observation_id":"96755b8f-5a6b-47f2-9dbc-ff4a36ee3874","resolution":{"observed_at":"2026-05-15T14:15:54.611568Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2603.19675","last_updated":"2026-05-03T12:12:49Z","snapshot_observed_at":"2026-07-29T22:55:09.570425Z","submitted_at":"2026-03-20T06:19:31Z","title":"DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T09:07:01.727331Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2603.19675"},"observation_digest":"sha256:b462fd623d0dc3743510d30f33ea0efe748226cefcdaa3f4cae5431f517940fc","observation_id":"dc71aff4-7332-468f-935f-4088eb4fccf0","resolution":{"observed_at":"2026-05-15T09:09:53.310593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.09059","last_updated":"2026-04-10T07:38:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T07:38:05Z","title":"Learning Vision-Language-Action World Models for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:08:10.442655Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.09059"},"observation_digest":"sha256:7f9bb66df3faaa63e419f62b2150c73e33ab71468aa344899cd14dd7eb66f162","observation_id":"c10fb34f-1770-4aa9-be17-16998f63e453","resolution":{"observed_at":"2026-05-11T07:31:00.784336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.17915","last_updated":"2026-04-20T07:50:00Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:50:00Z","title":"OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T04:27:24.653711Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.17915"},"observation_digest":"sha256:5600e2f2c59b5020d51c15ed0cd5ead5db76f8a709e89f33aa23974452b042df","observation_id":"102e638e-1929-4de6-b939-7ec014fc23f3","resolution":{"observed_at":"2026-05-11T11:56:25.641365Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:3b5aced39485d3fdb85e891785ed9d4d22c4a6873df9971208323891f396ada9","observation_id":"18343ed0-f8e3-4702-9396-71794fb63389","resolution":{"observed_at":"2026-07-05T11:41:02.538983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:ec5cc95d9a4ec8121c15173b22042a0e68fd160433288f5764d5e7d887cd6ecd","observation_id":"a57e6d60-440d-49cd-b71f-72e0af0f88c8","resolution":{"observed_at":"2026-05-10T05:51:10.265223Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.22851","last_updated":"2026-07-07T12:47:51Z","snapshot_observed_at":"2026-07-12T18:45:30.417168Z","submitted_at":"2026-04-22T07:49:02Z","title":"EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T00:09:18.068337Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.22851"},"observation_digest":"sha256:9d5fb98cee7148687fc906ad6a1d7b019bd6cf646b6269fd6a2dd640541b85e6","observation_id":"2a6caab4-0303-4337-a55f-79cfb4dd03f0","resolution":{"observed_at":"2026-05-10T00:19:47.186985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.24086","last_updated":"2026-04-27T06:20:15Z","snapshot_observed_at":"2026-08-03T03:51:20.015005Z","submitted_at":"2026-04-27T06:20:15Z","title":"AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T03:18:03.855477Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.24086"},"observation_digest":"sha256:2a27b4fe9d6dba55824186c15dcc5873e5b63ba27f40d972770253ebaae702d9","observation_id":"db4d8c7c-7ec7-43ce-9cc4-f1f3239dca43","resolution":{"observed_at":"2026-05-11T22:11:13.827738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:54:50.887381Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:bcd93422457d989b187ad907d0618f83a500f137626d93d6146f14fc98bdb041","observation_id":"a2f4e5b7-4af1-487a-b581-34cec67da7b9","resolution":{"observed_at":"2026-05-14T20:59:28.107280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T05:07:58.953866Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:4db15119a10feae2c46512111d863e2de9b52d471fc30d7544ca5bf7dc64ac35","observation_id":"ce5fa6dc-884f-491f-a29b-7d7767cbc6ee","resolution":{"observed_at":"2026-05-15T05:09:45.382811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.15120","last_updated":"2026-05-15T11:07:11Z","snapshot_observed_at":"2026-07-31T03:54:36.293193Z","submitted_at":"2026-05-14T17:32:18Z","title":"CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T20:57:06.455108Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.15120"},"observation_digest":"sha256:d7d157642571e0b6cdf47e35b0010a09394dfc96e67974d037a2c10fb0ebc415","observation_id":"5d1bdaca-ec1a-45c0-abb1-3e0d717c4206","resolution":{"observed_at":"2026-05-20T20:59:01.699297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.21061","last_updated":"2026-05-20T11:45:32Z","snapshot_observed_at":"2026-08-03T03:46:14.228234Z","submitted_at":"2026-05-20T11:45:32Z","title":"Grounding Driving VLA via Inverse Kinematics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:33:34.750047Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.21061"},"observation_digest":"sha256:ba4a59717a78abe02a586aea09b9d0d18c86763dd52ca8f6d66ba9416252fb56","observation_id":"eb88c94d-c203-4732-8dd5-2b3ec0f04ac8","resolution":{"observed_at":"2026-05-21T05:33:58.357428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.31041","last_updated":"2026-05-29T09:18:32Z","snapshot_observed_at":"2026-07-06T23:40:17.605034Z","submitted_at":"2026-05-29T09:18:32Z","title":"Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:39:32.487156Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.31041"},"observation_digest":"sha256:678a76e04afe246c318747d09827d888e674d76c327a3c390931c55bf70bc712","observation_id":"060aea4e-8b4d-4cac-8f62-43a0d117a65b","resolution":{"observed_at":"2026-06-28T22:42:46.544305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.31572","last_updated":"2026-05-29T17:40:04Z","snapshot_observed_at":"2026-08-07T10:08:21.298450Z","submitted_at":"2026-05-29T17:40:04Z","title":"nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:04.552901Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.31572"},"observation_digest":"sha256:821bf7b3c8a0a1b3f3426e331c8e386429069cf34fc79cbfba277224779968dc","observation_id":"ad0db585-6a53-4775-9363-3f47ad8aa934","resolution":{"observed_at":"2026-07-01T19:26:00.310988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2606.02774","last_updated":"2026-06-01T18:36:46Z","snapshot_observed_at":"2026-08-06T21:46:55.137951Z","submitted_at":"2026-06-01T18:36:46Z","title":"GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T14:45:54.904876Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2606.02774"},"observation_digest":"sha256:ce277d97f24723baecd544fe7312c9254b83581f7e6cb2519c78333c0d4a27c1","observation_id":"2675bb56-f3c4-435f-98cb-17f099b597ca","resolution":{"observed_at":"2026-07-01T23:06:19.763326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2606.18242","last_updated":"2026-06-16T17:58:40Z","snapshot_observed_at":"2026-08-02T10:04:20.980054Z","submitted_at":"2026-06-16T17:58:40Z","title":"EventDrive: Event Cameras for Vision-Language Driving Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:43.752335Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2606.18242"},"observation_digest":"sha256:43c8e6bf3b558bcbd9bf007f764fb6eb9a83c3e9260aa1a6eee9e8720fc93611","observation_id":"b36d16e5-a5a3-4960-ae6f-89b354f46b6a","resolution":{"observed_at":"2026-07-03T20:18:57.106030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2607.01658","last_updated":"2026-07-02T03:34:32Z","snapshot_observed_at":"2026-08-06T09:28:15.995609Z","submitted_at":"2026-07-02T03:34:32Z","title":"Teaching Vision-Language-Action Models What to See and Where to Look","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T16:42:13.520913Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.01658"},"observation_digest":"sha256:0142bb18fe646e2046983ce4ea4844e6fb57359531e76b5a39ac28adb8a8660d","observation_id":"40521f0b-87c1-4641-8430-fd7a0260f15d","resolution":{"observed_at":"2026-07-03T16:48:39.587385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2607.07103","last_updated":"2026-07-08T07:39:21Z","snapshot_observed_at":"2026-08-07T14:50:20.140478Z","submitted_at":"2026-07-08T07:39:21Z","title":"A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T20:11:02.051543Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.07103"},"observation_digest":"sha256:ba65913c4b57159cd2382923a34ff58757bfa01dcb5b268b8e3cae741527d084","observation_id":"7c17c601-7636-4dc0-9aef-31e85dd41760","resolution":{"observed_at":"2026-07-09T20:16:29.462683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2607.08375","last_updated":"2026-07-09T11:49:57Z","snapshot_observed_at":"2026-08-01T14:34:54.273695Z","submitted_at":"2026-07-09T11:49:57Z","title":"WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T08:30:29.351159Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.08375"},"observation_digest":"sha256:5e0ee8e2f0fcb81d8d42a27bd08759ddd6c984c8c0471c9345c9b69eb3f92863","observation_id":"866d70bb-612c-4630-b88e-85afed4dc9b8","resolution":{"observed_at":"2026-07-10T08:36:59.863731Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-14T12:33:06.583512Z","title":"Impromptu vla: Open weights and open data for driving vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10336","last_updated":"2026-07-11T14:36:40Z","snapshot_observed_at":"2026-08-06T10:29:35.876302Z","submitted_at":"2026-07-11T14:36:40Z","title":"PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T12:33:06.583512Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.10336"},"observation_digest":"sha256:018272025d62785ff8cd689022f8d3043eea12fbff6de6e5ff002f4483e663ae","observation_id":"de6d88e8-cce2-4956-9193-a8291c402400","resolution":{"observed_at":"2026-07-14T12:33:06.583512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23757/citation-record","integrity":"/paper/2505.23757/integrity","json":"/paper/2505.23757/citation-record.json","paper":"/paper/2505.23757"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:43:52.448551Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.448551Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:008d1829f64a5b5e519abfafef210d7040093ba0ec70d1f151ef075e530f5948","observation_id":"a10d2d51-7056-40df-85db-bffb9279fc94","resolution":{"observed_at":"2026-08-07T12:43:52.448551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:43:52.550258Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.550258Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:593fcf5dc109ea289d614e3e07b1dba0e975fb2019eedbdf66bdba86d976f25c","observation_id":"0e1a8d2b-7c83-4323-af40-283c5fcaa33a","resolution":{"observed_at":"2026-08-07T12:43:52.550258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:43:52.772359Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.772359Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:b772860d14bfef2b4eab76dd9c57dfabe045b9a111499ba14509d67c77e4f66f","observation_id":"b502bf3b-0a0d-41e8-991d-08adcc1c2fd2","resolution":{"observed_at":"2026-08-07T12:43:52.772359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.884004Z","title":"Fishyscapes: A benchmark for safe semantic segmentation in autonomous driving","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.884004Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e96c35dbe631b83b8ee096e8a98e7dbdefd9b88b4c7c90625c5c8e32b2b3e11e","observation_id":"7bbad7fa-4c5a-4587-b967-7465c9bdef93","resolution":{"observed_at":"2026-08-07T12:43:52.884004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06370","last_updated":"2024-09-30T22:02:34Z","snapshot_observed_at":"2026-08-04T14:49:35.502670Z","submitted_at":"2024-06-10T15:32:16Z","title":"UMAD: Unsupervised Mask-Level Anomaly Detection for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06370","snapshot_observed_at":"2026-08-07T12:43:53.034369Z","title":"Umad: Unsupervised mask-level anomaly detection for autonomous driving.arXiv preprint arXiv:2406.06370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.034369Z"},"links":{"cited_paper":"/paper/2406.06370","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:9f7bd45087e5e139d0a435e7dc8808fd26858889614e55464dc5eeafd6ec432a","observation_id":"80a78b90-59ec-43a0-9dad-eb2e8c3343ca","resolution":{"observed_at":"2026-08-07T12:43:53.034369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.121418Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.121418Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6b0a38f6a7e05f0f15a921c27b6cac7b934a36a5c71e962110df49e8974298f8","observation_id":"d1ce83ed-dc78-4220-999f-e1b49e987b28","resolution":{"observed_at":"2026-08-07T12:43:53.121418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11810","last_updated":"2022-02-04T02:50:02Z","snapshot_observed_at":"2026-08-02T23:58:09.453937Z","submitted_at":"2021-06-22T14:24:55Z","title":"NuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11810","snapshot_observed_at":"2026-08-07T12:43:53.171614Z","title":"nuplan: A closed-loop ml-based planning benchmark for autonomous vehicles.arXiv preprint arXiv:2106.11810, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.171614Z"},"links":{"cited_paper":"/paper/2106.11810","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:3030c3588c68e1bf8eef1e84e5b7d8e3484dcf6525d3fe7c9b0390a3108018a2","observation_id":"26736415-571b-4adb-a88b-48c0ee75a23c","resolution":{"observed_at":"2026-08-07T12:43:53.171614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.235636Z","title":"Argoverse: 3d tracking and forecasting with rich maps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.235636Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:8f0f9a0d86a22c0984948f9fd50143b961ba818c4bcf740e79f350ab3343219c","observation_id":"24317afe-9fc7-40a7-b2d5-22bac49689db","resolution":{"observed_at":"2026-08-07T12:43:53.235636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01957","last_updated":"2023-10-13T21:59:27Z","snapshot_observed_at":"2026-07-06T16:27:02.440383Z","submitted_at":"2023-10-03T11:05:14Z","title":"Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01957","snapshot_observed_at":"2026-08-07T12:43:53.357114Z","title":"Driving with llms: Fusing object-level vector modality for explainable autonomous driving.arXiv preprint arXiv:2310.01957, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.357114Z"},"links":{"cited_paper":"/paper/2310.01957","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0bc896a1f61c84129877b9508a2e68f0a695f1402560a4668caaa7e9b882b246","observation_id":"3208e4ff-2c46-43c4-98ee-3ba3029e6d94","resolution":{"observed_at":"2026-08-07T12:43:53.357114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-07T12:43:53.449636Z","title":"Vadv2: End-to-end vectorized autonomous driving via probabilistic planning.arXiv preprint arXiv:2402.13243, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.449636Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:34b26180f392d0dc2f43807f8ab2a1880fa117147c78d5ce61c8c48713abbafb","observation_id":"212a2b96-5d96-445c-8edd-38255f37563b","resolution":{"observed_at":"2026-08-07T12:43:53.449636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.498716Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.498716Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:20b5e17e95134d53de088be4dfd5e15e3f21e596c139f025a22563f087ce501a","observation_id":"2a60960a-d589-4686-b944-501628b7dc39","resolution":{"observed_at":"2026-08-07T12:43:53.498716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.560050Z","title":"Exploring the limitations of behavior cloning for autonomous driving","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.560050Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ceb366e4ac179133d50dde974d3cad3247c1ff971a94bee6dbba7ed92e4b8abb","observation_id":"63e28846-2f63-4b4d-abfa-16f5b69a3f7b","resolution":{"observed_at":"2026-08-07T12:43:53.560050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.653787Z","title":"Navsim: Data-driven non- reactive autonomous vehicle simulation and benchmarking.Advances in Neural Information Processing Systems, 37:28706–28719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.653787Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:1b9fadcce114aa883c8a716ba9e397ba19e12ffc58f0dc254c49641d8fd610bf","observation_id":"1350197a-208c-452c-a0ee-40388fa8fc18","resolution":{"observed_at":"2026-08-07T12:43:53.653787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10838","last_updated":"2020-08-26T06:27:52Z","snapshot_observed_at":"2026-07-06T08:24:08.781755Z","submitted_at":"2019-09-24T12:29:27Z","title":"Talk2Car: Taking Control of Your Self-Driving Car","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10838","snapshot_observed_at":"2026-08-07T12:43:53.696335Z","title":"Talk2car: Taking control of your self-driving car.arXiv preprint arXiv:1909.10838, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.696335Z"},"links":{"cited_paper":"/paper/1909.10838","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:174c9eb563e0ae8eb7f568c7fcece2f334984f04d8710a2d12083cfeb8fdae45","observation_id":"d295e31f-64dc-42ab-bb2a-e584f48cca0c","resolution":{"observed_at":"2026-08-07T12:43:53.696335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.721481Z","title":"Pixel-wise anomaly detection in complex driving scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.721481Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:8be1b68e78d872ded85c0e6ce065ec7fc1ebaf3b330dbcf1f8c5a01ffbb1a01c","observation_id":"0759dfdb-5a24-45cb-83f9-8a88413ea2f3","resolution":{"observed_at":"2026-08-07T12:43:53.721481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06702","last_updated":"2024-09-10T17:59:40Z","snapshot_observed_at":"2026-08-06T04:59:18.522033Z","submitted_at":"2024-09-10T17:59:40Z","title":"Hint-AD: Holistically Aligned Interpretability in End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06702","snapshot_observed_at":"2026-08-07T12:43:53.752395Z","title":"Hint-ad: Holistically aligned interpretability in end-to-end autonomous driving.arXiv preprint arXiv:2409.06702, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.752395Z"},"links":{"cited_paper":"/paper/2409.06702","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:bc84539c6f2736d2a6636664a752ccaf52836a419fa6a59c955cf89fdff94dd0","observation_id":"aa9b24ba-3d67-4b4b-ab1b-951511837eed","resolution":{"observed_at":"2026-08-07T12:43:53.752395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.369938Z","title":"Idd-3d: Indian driving dataset for 3d unstructured road scenes","venue":null,"work_id":"a164a167-7194-41bd-96b6-e1a73213e503","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.830196Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6bf2ce80617ef07af85437173e54f502ef60f0b61181eda621560ce79932c2e8","observation_id":"63aef99d-c6b4-45a9-88a0-8d37a5329bda","resolution":{"observed_at":"2026-08-07T12:44:07.427101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.895816Z","title":"Carla: An open urban driving simulator","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.895816Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:8163e81c493b10c67fcd59702cbf655056fe386d093be0b1d609920919cf039b","observation_id":"76d49308-e499-476f-a0a7-f6ea89406f18","resolution":{"observed_at":"2026-08-07T12:43:53.895816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.108410Z","title":"Scp- diff: Spatial-categorical joint prior for diffusion based semantic image synthesis","venue":null,"work_id":"846b5d78-8f6a-41c5-953a-ef44d04823ba","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.949655Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:84aaea5720f0171a733d0a88d7d45247cbb106ba3c74e6d1a87e32e1dae411e6","observation_id":"93aea4b8-0a05-4728-b8ae-2daddcb8919f","resolution":{"observed_at":"2026-08-07T12:44:07.220851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.073828Z","title":"Vision meets robotics: The kitti dataset.The international journal of robotics research, 32(11):1231–1237, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.073828Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ad13d2caa6fbb165484e431ca6dc19e21a70d9e493d33b03d9d2c500a9958f1b","observation_id":"afc9e56e-04ce-49ed-972b-56964b82372b","resolution":{"observed_at":"2026-08-07T12:43:54.073828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.882949Z","title":"St-p3: End-to-end vision-based autonomous driving via spatial-temporal feature learning","venue":null,"work_id":"313e939c-fb03-421a-8a50-6fa78a0944e7","year":2022},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.163868Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:5a282f3d59c5984600013550b6d173aff2ce1393710adf397fd014f7a426a61c","observation_id":"d96b76f2-f3a2-4d7c-8b9a-bacc479beac4","resolution":{"observed_at":"2026-08-07T12:44:06.973594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.680477Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"951c6332-e72f-4466-a9a5-36cacd4efe1b","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.308023Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:5890596bf47e7355715009d3a8b5bba341409d84f6eb8d31d48c85c7ccd3856b","observation_id":"73d29622-2013-47dd-9ff6-7c26a05aea5b","resolution":{"observed_at":"2026-08-07T12:44:06.751459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:43:54.581479Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.581479Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:a4b58b9cf27c1cff9d2a554e1199bcb6627a7b8de5d01c1b7500d1dccc2494cf","observation_id":"29ed6ffb-3f55-4935-8502-a113f19e44b6","resolution":{"observed_at":"2026-08-07T12:43:54.581479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-07T12:43:54.713487Z","title":"Emma: End-to-end multimodal model for autonomous driving.arXiv preprint arXiv:2410.23262, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.713487Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:cf7e46036cc3938ef16841100537628e954d8fa395bf011fd6fedeb2d53ad221","observation_id":"9746c94c-552a-4f6f-a3cf-e51c4af7cde6","resolution":{"observed_at":"2026-08-07T12:43:54.713487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.988387Z","title":"Driveadapter: Breaking the coupling barrier of perception and planning in end-to-end au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.988387Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e0cea844d67615e4f8293e1d221aab3427085e684ea036483dd983d84236e3a0","observation_id":"61f869b5-bc0a-48bf-95f8-9d73ada5e3a0","resolution":{"observed_at":"2026-08-07T12:43:54.988387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03877","last_updated":"2024-11-27T09:31:04Z","snapshot_observed_at":"2026-07-06T18:26:19.664486Z","submitted_at":"2024-06-06T09:12:30Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03877","snapshot_observed_at":"2026-08-07T12:43:55.071281Z","title":"Bench2drive: Towards multi-ability benchmarking of closed-loop end-to-end autonomous driving.arXiv preprint arXiv:2406.03877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.071281Z"},"links":{"cited_paper":"/paper/2406.03877","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:21ff2cb4585f2c0b5cebdba82319fef35b06b1493560d0b19c7a8d8b6c4b651d","observation_id":"6b2882a8-35d7-433d-9b7b-e2f18872a0c0","resolution":{"observed_at":"2026-08-07T12:43:55.071281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-07T12:43:55.159426Z","title":"Senna: Bridging large vision-language models and end-to-end autonomous driving.arXiv preprint arXiv:2410.22313, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.159426Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d71104e875f092729556190456c0ef419040ef3f46cefa02928bcf88970e09a8","observation_id":"c0930aff-f9ef-424a-b145-d4c73b2cdbb8","resolution":{"observed_at":"2026-08-07T12:43:55.159426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.204126Z","title":"Vad: Vectorized scene representation for efficient autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.204126Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ebaa6977b4d7c41c1a631d602e9800f5ff7317e36ed232c6a1fb3dd064574f35","observation_id":"b9183ddc-f8f5-41e7-b2cd-44a86d43be99","resolution":{"observed_at":"2026-08-07T12:43:55.204126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.402686Z","title":"P-mapnet: Far-seeing map generator enhanced by both sdmap and hdmap priors.IEEE Robotics and Automation Letters, 2024","venue":null,"work_id":"a5d39c8b-f3cf-45ab-b922-47d9066a3adf","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.252353Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:bb191bbfb14ac69abd90a07a734bc965d9ec2682d8377fa06f69e082304ab97d","observation_id":"23f3dfe6-0b3b-40b5-8fa2-5a41c99b67e9","resolution":{"observed_at":"2026-08-07T12:44:06.488874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.232442Z","title":"Adapt: Action-aware driving caption transformer","venue":null,"work_id":"24b664c9-01a7-4c4d-9116-1e41c3553c0e","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.289844Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:55112e0ef4c6faab738f88537e72d05db1cf68e014d5993da7b64dae93155859","observation_id":"f801b714-02da-4f08-a8cb-e5fe5dec14ba","resolution":{"observed_at":"2026-08-07T12:44:06.304166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.109361Z","title":"Tod3cap: Towards 3d dense captioning in outdoor scenes","venue":null,"work_id":"02387aa8-74c9-49de-bc98-cc73a51e5a5d","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.393975Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f9a59881f99b4b3649500495a05e79b5cabe8dd8ac598a9f02e092d1cafbd9ba","observation_id":"c2977a51-0889-45fc-9f9a-eec082c71f38","resolution":{"observed_at":"2026-08-07T12:44:06.161345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.960132Z","title":"Textual explana- tions for self-driving vehicles","venue":null,"work_id":"1b6805b0-63ad-4f7f-87f4-43ea6e77bb12","year":2018},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.528628Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:67cff340168aada8dcdee36b22955765288ed73b09721ead9aa890666012c9bb","observation_id":"f7453340-93d8-47f1-a77c-e2ff434849d1","resolution":{"observed_at":"2026-08-07T12:44:06.032612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05435","last_updated":"2025-03-11T12:38:27Z","snapshot_observed_at":"2026-07-06T20:03:06.933007Z","submitted_at":"2024-12-06T21:41:52Z","title":"UniScene: Unified Occupancy-centric Driving Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05435","snapshot_observed_at":"2026-08-07T12:43:55.666234Z","title":"Uniscene: Unified occupancy-centric driving scene generation.arXiv preprint arXiv:2412.05435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.666234Z"},"links":{"cited_paper":"/paper/2412.05435","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f611c414c236607306547b36e7e18ff83e0d2e4ab1aa4660aeeae8d2f412e432","observation_id":"96e917c7-891a-4741-a3a0-f65f89451a23","resolution":{"observed_at":"2026-08-07T12:43:55.666234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14801","last_updated":"2025-03-04T10:28:47Z","snapshot_observed_at":"2026-08-07T18:01:09.502947Z","submitted_at":"2025-02-20T18:22:44Z","title":"AVD2: Accident Video Diffusion for Accident Video Description","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14801","snapshot_observed_at":"2026-08-07T12:43:55.791504Z","title":"Avd2: Accident video diffusion for accident video description.arXiv preprint arXiv:2502.14801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.791504Z"},"links":{"cited_paper":"/paper/2502.14801","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:db5b001a6ad4c36f36e3a277e8e53b2ea54c62efe5cc7a566a47ef2e41067bb4","observation_id":"9e33c1fd-63ca-4d13-adbb-b191182b7e87","resolution":{"observed_at":"2026-08-07T12:43:55.791504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08481","last_updated":"2025-02-28T07:43:38Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:21Z","title":"Enhancing End-to-End Autonomous Driving with Latent World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08481","snapshot_observed_at":"2026-08-07T12:43:55.915576Z","title":"Enhancing end-to-end autonomous driving with latent world model.arXiv preprint arXiv:2406.08481, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.915576Z"},"links":{"cited_paper":"/paper/2406.08481","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:804fcbed5b3c89a772b5afaec9151f3af68587ea78e7bf3b6556d055691712b4","observation_id":"0164c948-f712-4a29-bc9a-816a9a0a1e33","resolution":{"observed_at":"2026-08-07T12:43:55.915576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.811591Z","title":"Is ego status all you need for open-loop end-to-end autonomous driving? 2024","venue":null,"work_id":"f6478d76-a113-4d6f-8769-b0389a1bf63e","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.024688Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:1195b017beb0de56f17e8a1fdf0184eb167631c9a531b2f3f0e9990306c0cc66","observation_id":"229fed82-a5b1-4018-a3ad-5abc1885bac8","resolution":{"observed_at":"2026-08-07T12:44:05.860962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.705667Z","title":"Detecting the unexpected via image resynthesis","venue":null,"work_id":"887d7b45-8956-4caa-8a4c-4ca40d7693b3","year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.126520Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:2e32aa8f122a2a9cdd893c22169cdc652d297a80970a6987dbe25245454fe9b9","observation_id":"e71fedcd-2e9b-4f44-8409-b1a0e40fa1a3","resolution":{"observed_at":"2026-08-07T12:44:05.763750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.188348Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.188348Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c998e28a75809f26c1bf5ce7eae4d450674984f6fbbb64421bfd2f817e9761b3","observation_id":"628b128c-94a6-47d4-ba42-02873735dabe","resolution":{"observed_at":"2026-08-07T12:43:56.188348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.478245Z","title":"Neural rendering for safety-critical autonomous driving simulation","venue":null,"work_id":"1315b88e-bbef-441f-832f-d0dc9d152df8","year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.271318Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:69f9c520128800873782edcc2b51ae005d403aaccbe49a48c3b488700dbd2c09","observation_id":"b409e9d3-1593-4dc3-bbb6-43de91bf6fdf","resolution":{"observed_at":"2026-08-07T12:44:05.548782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.331487Z","title":"Neuroncap: Photorealistic closed-loop safety testing for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.331487Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6bf7dcb6a48f6659366506bb9dfde370ea4fc396e4a8df8d51ed8db70366fbde","observation_id":"a0da2bbe-dcf4-4da6-ba34-a4f65753fcff","resolution":{"observed_at":"2026-08-07T12:43:56.331487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11037","last_updated":"2021-10-25T08:08:25Z","snapshot_observed_at":"2026-08-02T02:50:48.113132Z","submitted_at":"2021-06-21T12:28:08Z","title":"One Million Scenes for Autonomous Driving: ONCE Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11037","snapshot_observed_at":"2026-08-07T12:43:56.359232Z","title":"One million scenes for autonomous driving: Once dataset.arXiv preprint arXiv:2106.11037, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.359232Z"},"links":{"cited_paper":"/paper/2106.11037","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c76442b4e1bfe526d79b450241dba5324ac65ddef802ebd80453f11e2ff79aa8","observation_id":"8f331ab6-1af1-49d9-bd5a-9f09b1801d9a","resolution":{"observed_at":"2026-08-07T12:43:56.359232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.208921Z","title":"The mapil- lary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"a973edd1-a3fc-4056-82a8-99f19b39955b","year":2017},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.425385Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:fa792a7a6f5656ad920e43aeb366e903aed146a696b9303a152a4dba212c1d23","observation_id":"4041c266-621c-42d7-8e48-fba32bc83a06","resolution":{"observed_at":"2026-08-07T12:44:05.295738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.466434Z","title":"Reason2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.466434Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:01f51e178d1c1341db4d974e94c88707569d99511fca015d28049532d03e98ad","observation_id":"377628ad-4d54-44f5-8214-9642b75d28cb","resolution":{"observed_at":"2026-08-07T12:43:56.466434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.911382Z","title":"Lost and found: detecting small road hazards for self-driving vehicles","venue":null,"work_id":"5a61a212-5ce7-4dc6-8215-cbbea8f8cba2","year":2016},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.494282Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:492236be30dc546f2b3d150bef12e7c9cfce549f0c704590643d005484eab5e1","observation_id":"389c19ae-5645-4c05-908d-0cc03e313712","resolution":{"observed_at":"2026-08-07T12:44:04.991770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.772917Z","title":"Multi-modal fusion transformer for end-to-end autonomous driving","venue":null,"work_id":"e50be613-4761-4fc6-83c4-d15378d6e09e","year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.534206Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:9dc5710aa714c7fead68389037d47c002d3247b0205e7e27ad078f250e9c089c","observation_id":"0499c0e7-4f10-46b7-a299-020ad10c332a","resolution":{"observed_at":"2026-08-07T12:44:04.841677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.661252Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"ad4a80d8-1916-4b5f-8a73-7df25a289f29","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.578100Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:263ec268126f5e372d60955d4778baf1e4f94aaaf1fa715b5690fdec31f752c7","observation_id":"97962e97-d92c-4f8e-984b-a80e9762097c","resolution":{"observed_at":"2026-08-07T12:44:04.727691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00284","last_updated":"2025-09-13T19:54:45Z","snapshot_observed_at":"2026-08-07T15:57:28.514524Z","submitted_at":"2025-05-01T04:12:41Z","title":"LightEMMA: Lightweight End-to-End Multimodal Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00284","snapshot_observed_at":"2026-08-07T12:43:56.629156Z","title":"Lightemma: Lightweight end-to-end multimodal model for autonomous driving.arXiv preprint arXiv:2505.00284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.629156Z"},"links":{"cited_paper":"/paper/2505.00284","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:3bb31fd45a6428d208e642272271f9b21435319f4c33b039ad7877674528f05d","observation_id":"b99bcb2a-0662-426e-b7c8-9dccab1880b7","resolution":{"observed_at":"2026-08-07T12:43:56.629156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03026","last_updated":"2025-04-15T03:45:30Z","snapshot_observed_at":"2026-07-06T16:27:51.438846Z","submitted_at":"2023-10-04T17:59:49Z","title":"LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03026","snapshot_observed_at":"2026-08-07T12:43:56.671998Z","title":"Languagempc: Large language mod- els as decision makers for autonomous driving.arXiv preprint arXiv:2310.03026, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.671998Z"},"links":{"cited_paper":"/paper/2310.03026","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:50a94270197c45de2891daa0b5e774b5e57324b91fb7e27877fe0f523809ddac","observation_id":"5baf5823-14b8-44c1-9e4f-11da0a087384","resolution":{"observed_at":"2026-08-07T12:43:56.671998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.725639Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.725639Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:bf8bd7cbe7e1fb29521523c2450d12a5b4608a46d33e8591e6b937a506c337aa","observation_id":"c959f8f4-9225-4e74-a87d-850c9559fbe2","resolution":{"observed_at":"2026-08-07T12:43:56.725639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.754304Z","title":"Reasonnet: End-to-end driving with temporal and global reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.754304Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:340c7a7b0de2b7089e67df1e56206ea2a09e9bdb0b751167c374422192b0e00d","observation_id":"06d11cc3-e510-48b2-b56c-3f6bd2a80e7f","resolution":{"observed_at":"2026-08-07T12:43:56.754304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.789276Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.789276Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:97c95193f0dea01c5e9da5682e6638e71d50018d0c56ef001c0ee7512057804a","observation_id":"a5e9a7e2-7ccc-4ab9-a62c-0b6a9c4c1180","resolution":{"observed_at":"2026-08-07T12:43:56.789276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-07T12:43:56.830698Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.830698Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0ef5905972acd908822be97aaf697210273241243572391b6e155ebf0b87bbea","observation_id":"693779d1-1163-444d-9fa1-52bc156838c0","resolution":{"observed_at":"2026-08-07T12:43:56.830698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.871535Z","title":"Insightdrive: Insight scene representation for end-to-end autonomous driving.arXiv preprint arXiv:2503.13047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.871535Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ee9973183e273499abb4192ad67e62980418668a56f3cbdfac8d3f1b4ca9ee02","observation_id":"faf08ad7-6753-4a9d-9fab-24146458e038","resolution":{"observed_at":"2026-08-07T12:43:56.871535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.922519Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.922519Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ed38e14fed82f4327bab57e78114683c31ba8d617ace16f3c4590b44fcfc903d","observation_id":"83099bf8-25bf-4237-9a25-d55124355e34","resolution":{"observed_at":"2026-08-07T12:43:56.922519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04942","last_updated":"2024-01-10T05:38:48Z","snapshot_observed_at":"2026-07-06T17:13:33.874642Z","submitted_at":"2024-01-10T05:38:48Z","title":"Latency-aware Road Anomaly Segmentation in Videos: A Photorealistic Dataset and New Metrics","version":1},"cited_work":{"arxiv_id":"2401.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04942","snapshot_observed_at":"2026-08-07T12:44:00.868695Z","title":"Latency-aware Road Anomaly Segmentation in Videos: A Photorealistic Dataset and New Metrics","venue":"cs.CV","work_id":"46268791-0688-4874-a6fe-4eeaa3f9b97a","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.001005Z"},"links":{"cited_paper":"/paper/2401.04942","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f5e5c80d007ff262aa9e10aca8262f0f8ea9af62ead683edf6b5d784d454fab6","observation_id":"f9e89ca9-19a1-4480-ab14-5b7d33608605","resolution":{"observed_at":"2026-08-07T12:44:01.240050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.360006Z","title":"Unsuper- vised road anomaly detection with language anchors","venue":null,"work_id":"9b5840a7-c2c3-48e0-9ef6-caf7f7153f91","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.052492Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:995944b18c13eb93c1731f4f025521921eb0e758807c46edfdbbdc8307d923b3","observation_id":"24c18685-4ae7-4b05-9f51-2a61d2161c10","resolution":{"observed_at":"2026-08-07T12:44:04.444659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-07T12:43:57.109906Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models.arXiv preprint arXiv:2402.12289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.109906Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:2e8d1851a7ee2055b41a21ff218f2d5dbb7b1548a06e19c9699bbd1ba8a3c123","observation_id":"3bb042aa-f010-41af-9d31-dfffc72f96d8","resolution":{"observed_at":"2026-08-07T12:43:57.109906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.202382Z","title":"Idd: A dataset for exploring problems of autonomous navigation in unconstrained environments","venue":null,"work_id":"c9be97c6-86e3-41c2-9b71-3862667489b7","year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.172552Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:529106987ba549a9790796c678c69985254ef542f05f67cb7aca9255a49778b9","observation_id":"20605ac9-5371-4d48-819f-a689e83e7f7d","resolution":{"observed_at":"2026-08-07T12:44:04.255625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.268097Z","title":"He-drive: Human-like end-to-end driving with vision language models.arXiv preprint arXiv:2410.05051, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.268097Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ecc28802fd6dc54ee6eef10da0d1e17ee03ddf07fa22b454c0cdab316c661f36","observation_id":"d99dcaf8-c3b3-465f-a08e-c7de6f248c2e","resolution":{"observed_at":"2026-08-07T12:43:57.268097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-07T03:24:13.032388Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-07T12:43:57.368095Z","title":"Omnidrive: A holistic llm-agent framework for autonomous driving with 3d perception, reasoning and planning.arXiv preprint arXiv:2405.01533, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.368095Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:321825d5d1a3d57593b2ee3705dbaa217cc00a5ba9702393230024237d1262b0","observation_id":"02d85934-b385-458d-8073-fbc9b35054cc","resolution":{"observed_at":"2026-08-07T12:43:57.368095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16996","last_updated":"2024-03-25T17:59:01Z","snapshot_observed_at":"2026-08-02T15:04:51.088784Z","submitted_at":"2024-03-25T17:59:01Z","title":"DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16996","snapshot_observed_at":"2026-08-07T12:43:57.433245Z","title":"Drivecot: Integrating chain-of-thought reasoning with end-to-end driving.arXiv preprint arXiv:2403.16996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.433245Z"},"links":{"cited_paper":"/paper/2403.16996","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:59a3c079dfab9a328b4750b54e8bac43dbf999f0cd2a40ab0a1685f79e93039b","observation_id":"85d3ba32-1571-42fc-8847-ccbbefcaa5e2","resolution":{"observed_at":"2026-08-07T12:43:57.433245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T12:43:57.480708Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.480708Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:953f8745511ece83ca7e92077afcf63cce1b8d0026776a9f595a01fd82b315f8","observation_id":"430c93e9-6093-44ab-81c8-58fd54fe7e6c","resolution":{"observed_at":"2026-08-07T12:43:57.480708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.526427Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for autonomous driving.arXiv preprint arXiv:2312.09245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.526427Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:11ceeb54e9440794e392e26d446d0f43d68a68d5b99f7c2231bd45029614d89a","observation_id":"1ef3c976-2370-40b6-979c-f3cebf2f98a5","resolution":{"observed_at":"2026-08-07T12:43:57.526427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.558191Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.558191Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:397606f37977a8cf025074565be0c2412b3d893ceba922453bc4cafc5b418851","observation_id":"97b848ce-e774-4d42-8097-81e73afa3e3b","resolution":{"observed_at":"2026-08-07T12:43:57.558191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.048505Z","title":"Editable scene simulation for autonomous driving via collaborative llm-agents","venue":null,"work_id":"2c9d7d0b-b542-4d1c-ab4b-1c4a8236c5cb","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.602657Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:1b2631e3b4f11bd701606c8577b983ade26abbd311f8ca196d72011f5e25660e","observation_id":"d689afab-634d-4c53-bb4b-845a0bdb152a","resolution":{"observed_at":"2026-08-07T12:44:04.075517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.904372Z","title":"Para-drive: Parallelized architecture for real-time autonomous driving","venue":null,"work_id":"417d1823-1650-46ec-98db-2de17d2da57f","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.667441Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:bf1f07258b265e1b447491aa0b8e3b57b3235051f4ab087212a188e60bdd251d","observation_id":"4d728ed0-ecb4-4c05-b480-82fef08963d9","resolution":{"observed_at":"2026-08-07T12:44:03.980566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00493","last_updated":"2023-01-02T00:36:22Z","snapshot_observed_at":"2026-07-06T14:36:37.805357Z","submitted_at":"2023-01-02T00:36:22Z","title":"Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00493","snapshot_observed_at":"2026-08-07T12:43:57.720414Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting.arXiv preprint arXiv:2301.00493, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.720414Z"},"links":{"cited_paper":"/paper/2301.00493","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:899de450673f8a9c06ac41cd16d5483bf9e100ff1c61438a399f43a51226e17a","observation_id":"ba8538fc-a862-4b1f-8967-f28846f4bbcb","resolution":{"observed_at":"2026-08-07T12:43:57.720414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.703744Z","title":"Referring multi-object tracking","venue":null,"work_id":"e21d20e8-554d-44bc-b226-26464d2d5a91","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.835861Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:9b250a7e073c198b1f895b49baac12f797bc466b9f0acbc1c49f371e5af1f6b4","observation_id":"d94c9351-d47f-424a-82a6-98a1e87f28d7","resolution":{"observed_at":"2026-08-07T12:44:03.768803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04379","last_updated":"2025-03-30T15:11:24Z","snapshot_observed_at":"2026-08-02T02:55:03.543491Z","submitted_at":"2023-09-08T15:21:07Z","title":"Language Prompt for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04379","snapshot_observed_at":"2026-08-07T12:43:57.928597Z","title":"Language prompt for autonomous driving.arXiv preprint arXiv:2309.04379, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.928597Z"},"links":{"cited_paper":"/paper/2309.04379","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e78a7d869f282d1ce99a1fd71ea134dcb21f0740f9707cebe8384dbd4249ad73","observation_id":"d4d4728f-31d8-4f3d-9841-ad1047878d71","resolution":{"observed_at":"2026-08-07T12:43:57.928597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T12:43:58.005230Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.005230Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:97d9a93f0029e50c5ba8c1d6f3b3c3c441d0a70d0dee660c35b05cb2169882e3","observation_id":"ea3c4b07-d452-49e2-a25b-f1f07e9be472","resolution":{"observed_at":"2026-08-07T12:43:58.005230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.502959Z","title":"Mars: An instance-aware, modular and realistic simulator for autonomous driving","venue":null,"work_id":"ffeb9393-8202-4fa5-a049-713be97431ae","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.078421Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:314d3f5395375e8b2de3331f316cad247b3f72dbb3f10dfddc0d6f3528a87d09","observation_id":"545dd546-060c-4c70-8f3a-d66925eed465","resolution":{"observed_at":"2026-08-07T12:44:03.597040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.365681Z","title":"Synthesize then compare: Detecting failures and anomalies for semantic segmentation","venue":null,"work_id":"6a6440d0-214f-4504-a343-6f5fde45529e","year":2020},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.158410Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:02be54b6ea5593ecffdcea0ac081edbf59fdc401e397bee0b4d4ee948cd6637f","observation_id":"76fdfeaa-9f5e-4d9e-8cf1-77c349b835c6","resolution":{"observed_at":"2026-08-07T12:44:03.413123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-06T22:05:24.113486Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04003","snapshot_observed_at":"2026-08-07T12:43:58.249021Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data, and metric perspectives.arXiv preprint arXiv:2501.04003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.249021Z"},"links":{"cited_paper":"/paper/2501.04003","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c86e7b8067b264b82910d52a5696d40bd3d1eda6d6c88a07a88f008d48434d5a","observation_id":"059b7124-7226-493f-a978-a95d81149207","resolution":{"observed_at":"2026-08-07T12:43:58.249021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:58.324744Z","title":"Openemma: Open-source multimodal model for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.324744Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d8e0fb434fe7655275e4840db1f6526c3819bcad0ca5ffe91c9201d74486f1db","observation_id":"4941784e-7c03-4e07-b97e-785daa6cd89f","resolution":{"observed_at":"2026-08-07T12:43:58.324744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14446","last_updated":"2025-08-29T20:50:08Z","snapshot_observed_at":"2026-08-02T03:23:17.398540Z","submitted_at":"2024-12-19T01:53:36Z","title":"VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14446","snapshot_observed_at":"2026-08-07T12:43:58.375796Z","title":"Vlm-ad: End-to-end autonomous driving through vision-language model supervision.arXiv preprint arXiv:2412.14446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.375796Z"},"links":{"cited_paper":"/paper/2412.14446","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:b6db4de07fe07637115e31c42054f4934220609890df635778f04b5c2b6678c3","observation_id":"ea5a87f9-cdc6-4251-a157-ce6bb2de8908","resolution":{"observed_at":"2026-08-07T12:43:58.375796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-07T12:43:58.419590Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model.arXiv preprint arXiv:2310.01412, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.419590Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e44b89c4b56c7d6f20e9bc9f5594f321792dfa66f9652f56e1707e9111629fb5","observation_id":"6ef35f2a-677a-47a8-ae7b-469e6e68eb71","resolution":{"observed_at":"2026-08-07T12:43:58.419590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15880","last_updated":"2025-05-23T02:48:27Z","snapshot_observed_at":"2026-08-08T03:16:49.699331Z","submitted_at":"2025-05-21T17:59:55Z","title":"Challenger: Affordable Adversarial Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15880","snapshot_observed_at":"2026-08-07T12:43:58.489169Z","title":"Challenger: Affordable adversarial driving video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.489169Z"},"links":{"cited_paper":"/paper/2505.15880","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e90740c5655456cbfc754c96c85dc501355e92426512a744c513ca34f013aacb","observation_id":"ef68b084-f74a-4044-b7b7-dea1cf3cc0b7","resolution":{"observed_at":"2026-08-07T12:43:58.489169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.206175Z","title":"Int2: Interactive trajectory prediction at intersections","venue":null,"work_id":"957c20df-4ea1-4d03-9978-b5d6314f815d","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.603947Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6d52ce4bbdd507ff81d77507b7ee88645c69ec8954653bfd9dad3f2365e3eb59","observation_id":"78fee9cf-bb96-4b43-81b7-9327e759c11b","resolution":{"observed_at":"2026-08-07T12:44:03.257750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T12:43:58.636454Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.636454Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:616447307242ea5dcc08c05365d5c5f0c0ac786da517b4bfd854ea0257e2e522","observation_id":"d3dce658-4871-464d-94a0-4872dff88539","resolution":{"observed_at":"2026-08-07T12:43:58.636454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14182","last_updated":"2025-03-18T11:57:31Z","snapshot_observed_at":"2026-08-07T16:55:06.937571Z","submitted_at":"2025-03-18T11:57:31Z","title":"Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14182","snapshot_observed_at":"2026-08-07T12:43:58.705723Z","title":"Bridging past and future: End-to-end autonomous driving with historical prediction and planning.arXiv preprint arXiv:2503.14182, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.705723Z"},"links":{"cited_paper":"/paper/2503.14182","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:4d0251f810050347c7d56ee7314a5e7915bd384750247b9d0f2c2cbda380e74f","observation_id":"2ef1d802-3bc4-45aa-bb04-09e5aa708757","resolution":{"observed_at":"2026-08-07T12:43:58.705723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06892","last_updated":"2024-04-10T10:34:34Z","snapshot_observed_at":"2026-07-06T17:58:12.766206Z","submitted_at":"2024-04-10T10:34:34Z","title":"SparseAD: Sparse Query-Centric Paradigm for Efficient End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06892","snapshot_observed_at":"2026-08-07T12:43:58.778472Z","title":"Sparsead: Sparse query- centric paradigm for efficient end-to-end autonomous driving.arXiv preprint arXiv:2404.06892, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.778472Z"},"links":{"cited_paper":"/paper/2404.06892","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0c641fa541404520ef4823dc7d605981e555707d09d4c961d5ce522427f5614e","observation_id":"a5b8b443-997a-4739-9a06-d79bbe3ee7d5","resolution":{"observed_at":"2026-08-07T12:43:58.778472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.946080Z","title":"End-to-end urban driving by imitating a reinforcement learning coach","venue":null,"work_id":"1bd43029-afa2-4a78-ad60-1bed0bf88eef","year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.818892Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:b1e6aa20b279023a883bf967c56d82375cdb54f0b52a7df1b3c0390f2643be19","observation_id":"c4ee4bae-a33b-45ae-b8a8-9b5e6a8433dc","resolution":{"observed_at":"2026-08-07T12:44:03.049311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11502","last_updated":"2024-04-07T02:42:27Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T08:21:05Z","title":"GenAD: Generative End-to-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11502","snapshot_observed_at":"2026-08-07T12:43:58.842298Z","title":"Genad: Genera- tive end-to-end autonomous driving.arXiv preprint arXiv:2402.11502, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.842298Z"},"links":{"cited_paper":"/paper/2402.11502","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:8a73f5dbafbe7f114b6d14e63fa149d6823961978b4c9886a5bbc1083d0a404a","observation_id":"e5ef869a-43b2-4f14-b556-ea1b16459bec","resolution":{"observed_at":"2026-08-07T12:43:58.842298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.751503Z","title":"Monoocc: Digging into monocular semantic occupancy prediction","venue":null,"work_id":"18d39874-f5c8-4d1b-aeb4-ee468aee0c28","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.878471Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0a1794f4271289e608cd596eeda87b5056c30d272917eb3c573e008ffe8172d5","observation_id":"b9df9886-45c5-491a-9e2d-cceedb4add23","resolution":{"observed_at":"2026-08-07T12:44:02.875702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.536277Z","title":"Steps: Joint self-supervised nighttime image enhancement and depth estimation","venue":null,"work_id":"eb1de31a-386d-46d5-9e72-d684d976c51b","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.919800Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:44b304f9ba1351705d1c5e2d6e79873cdfc5686d35d7dd0ef4f7e7324ee698d3","observation_id":"1428ab8d-d32d-4d65-8563-e8e168829ebc","resolution":{"observed_at":"2026-08-07T12:44:02.643517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.13076","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:59.467234Z","title":"Hints of prompt: Enhancing visual representation for multimodal llms in autonomous driving.arXiv preprint arXiv:2411.13076, 2024","venue":null,"work_id":"493b71a0-9681-4485-8cf5-8cf906735111","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.952462Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:8e410f84db5b853b4bf21f8133c1934df3dc5f2a564020f23c713434779c0c17","observation_id":"2bca0cde-2dad-4c8b-982e-b9facfa11447","resolution":{"observed_at":"2026-08-07T12:43:59.539208Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04593","last_updated":"2024-03-07T15:39:18Z","snapshot_observed_at":"2026-07-06T17:41:06.530605Z","submitted_at":"2024-03-07T15:39:18Z","title":"Embodied Understanding of Driving Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04593","snapshot_observed_at":"2026-08-07T12:43:58.997932Z","title":"unstructured","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.997932Z"},"links":{"cited_paper":"/paper/2403.04593","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:fbc3b72e9bb9527ab7efe108c7ef79a1469bbd3edb995f11ad1056e9248bc4e7","observation_id":"c4cdcc59-5205-4585-b33a-c833d043cbc0","resolution":{"observed_at":"2026-08-07T12:43:58.997932Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 29 inbound Pith citation observations for arXiv:2505.23757."}