{"as_of":"2026-08-07T19:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f110d9edad091a0fa6177dc2fcce948df09cba7914f52df293c5d20ef57c1037","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:26:11.454206Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T11:39:05.686584Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T11:41:02.600232Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2512.24331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24331","snapshot_observed_at":"2026-07-05T11:41:02.600232Z","title":"arXiv preprint arXiv:2512.24331 (2025) 4","venue":"cs.CV","work_id":"6f0eec4f-5165-4ee1-8669-b1311d705681","year":2025},"citing_paper":{"arxiv_id":"2604.12833","last_updated":"2026-04-14T14:52:15Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:52:15Z","title":"Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:58:28.202606Z"},"links":{"cited_paper":"/paper/2512.24331","citing_paper":"/paper/2604.12833"},"observation_digest":"sha256:1e4f11d6d4436c27b7a528e6ccb85015a08a96d62ede2ca1b0c80ba0ab8e055c","observation_id":"c9a16e7c-c5b9-4780-bb07-e267be93ce5e","resolution":{"observed_at":"2026-05-26T03:04:09.079975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2512.24331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24331","snapshot_observed_at":"2026-07-05T11:41:02.600232Z","title":"arXiv preprint arXiv:2512.24331 (2025) 4","venue":"cs.CV","work_id":"6f0eec4f-5165-4ee1-8669-b1311d705681","year":2025},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2512.24331","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:8c01a6eefe3af24ca8576eeeaa994579f4fd1afab12818107c7d3c5d41e43768","observation_id":"bfcf20d8-8e6d-40c8-9902-7eac5ea03e74","resolution":{"observed_at":"2026-07-05T11:41:02.601691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2512.24331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24331","snapshot_observed_at":"2026-07-05T11:41:02.600232Z","title":"arXiv preprint arXiv:2512.24331 (2025) 4","venue":"cs.CV","work_id":"6f0eec4f-5165-4ee1-8669-b1311d705681","year":2025},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2512.24331","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:a308290a8ec8c7c859223b3d73d25160a46486cffa950ac902f229761f60ea24","observation_id":"b853a694-4a69-44e8-a82f-8e365b053eaa","resolution":{"observed_at":"2026-05-26T03:04:09.079975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2512.24331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24331","snapshot_observed_at":"2026-07-05T11:41:02.600232Z","title":"arXiv preprint arXiv:2512.24331 (2025) 4","venue":"cs.CV","work_id":"6f0eec4f-5165-4ee1-8669-b1311d705681","year":2025},"citing_paper":{"arxiv_id":"2604.20191","last_updated":"2026-04-28T03:54:42Z","snapshot_observed_at":"2026-08-01T01:45:17.134757Z","submitted_at":"2026-04-22T05:11:59Z","title":"From Scene to Object: Text-Guided Dual-Gaze Prediction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T01:03:02.394571Z"},"links":{"cited_paper":"/paper/2512.24331","citing_paper":"/paper/2604.20191"},"observation_digest":"sha256:0b8dfb3f1609b860be99474792350dd6519f3a2aa369ba6537a77fa8dbe263af","observation_id":"46d5025b-8fad-45e6-9c66-1a8faf01e4eb","resolution":{"observed_at":"2026-05-26T03:04:09.079975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2512.24331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24331","snapshot_observed_at":"2026-07-05T11:41:02.600232Z","title":"arXiv preprint arXiv:2512.24331 (2025) 4","venue":"cs.CV","work_id":"6f0eec4f-5165-4ee1-8669-b1311d705681","year":2025},"citing_paper":{"arxiv_id":"2605.31572","last_updated":"2026-05-29T17:40:04Z","snapshot_observed_at":"2026-08-07T10:08:21.298450Z","submitted_at":"2026-05-29T17:40:04Z","title":"nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:04.552901Z"},"links":{"cited_paper":"/paper/2512.24331","citing_paper":"/paper/2605.31572"},"observation_digest":"sha256:f8e0b6d1a119bf1debaa327ec54e163b4a6463fa6a2da1911f540881f8ebd936","observation_id":"e2998a1a-a9a4-4dc6-ad2b-6f34c56712a7","resolution":{"observed_at":"2026-07-01T19:26:00.313523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.24331/citation-record","integrity":"/paper/2512.24331/integrity","json":"/paper/2512.24331/citation-record.json","paper":"/paper/2512.24331"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T13:26:04.102974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.102974Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d7b8962033cf21082240727ec97140f9f576c8323a36aa90867f3c0997215b9c","observation_id":"3d8f00c4-279f-45fb-831d-5f469199e314","resolution":{"observed_at":"2026-08-03T13:26:04.102974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.229161Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gian- carlo Baldan, and Oscar Beijbom","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.229161Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:8d2837b879e3d536f8e1f35e6f6ff4012114ece13cc0971ac68945492d0d3521","observation_id":"9fdc826d-f5ab-48d7-99a6-3f6e4ae5eb0f","resolution":{"observed_at":"2026-08-03T13:26:04.229161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.348454Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.348454Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:02ae753bef3698f9c2bf5e63eb6203fc2aa474470b50164135f96a4bcbc4e116","observation_id":"795edb89-fa86-4894-a991-a98283a9fa88","resolution":{"observed_at":"2026-08-03T13:26:04.348454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.402166Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.402166Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:4a582d5224bdf99bde50bc44e2d929522723c65437c8bfab472a13e57457a6fc","observation_id":"4b9e61bb-647e-4da8-8cd5-8ed246e6e960","resolution":{"observed_at":"2026-08-03T13:26:04.402166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.443067Z","title":"Persformer: 3d lane detection via perspective transformer and the openlane benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.443067Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:370e3cd033367f5d79d5335e2f95567e0ced07c0fcdab5e11bfd7098d2946cbd","observation_id":"b053fe16-3499-4b08-aa81-0a3a95788435","resolution":{"observed_at":"2026-08-03T13:26:04.443067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.485438Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.485438Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:45337cf5e84539b06c6d3f6098be0d8da4273eff5c3b724c4eeaf3faf7077924","observation_id":"7a4fee93-bbb5-4103-9179-29832c60f2db","resolution":{"observed_at":"2026-08-03T13:26:04.485438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.624641Z","title":"Spa- tialRGPT: Grounded Spatial Reasoning in Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.624641Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:171a6fbb2da589203287d026d0aef8d5b6a5b8e28981d65ea60636011062bdc5","observation_id":"45e76b3b-cec0-4b5c-ac05-7c646360a21d","resolution":{"observed_at":"2026-08-03T13:26:04.624641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.766321Z","title":"Talk2bev: Language-enhanced bird’s-eye view maps for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.766321Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:2fbb74e3ddd105d76b8eb4e09e546edaf95679a23bb2f30ae56fec3f261b8b35","observation_id":"092c3ca5-c092-4414-8f2c-5a9acd3c04f9","resolution":{"observed_at":"2026-08-03T13:26:04.766321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:04.887908Z","title":"Talk2car: Taking control of your self-driving car","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:04.887908Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:70c8d6087c15f1894fc9ab661e3ca0edeecdbf3a1a5cc2e60898400715112319","observation_id":"49457181-fbc1-4e90-8e5b-28f57d5c7ffd","resolution":{"observed_at":"2026-08-03T13:26:04.887908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.002937Z","title":"Holistic autonomous driving un- derstanding by bird’s-eye-view injected multi-modal large models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.002937Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:817bf250cfdf86e4df3c45297d968db417378837ca406537d8864ad9725f8c33","observation_id":"8e454b60-2b99-451b-b44d-1e55aee83e79","resolution":{"observed_at":"2026-08-03T13:26:05.002937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.138241Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.138241Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:e2345c345484894c3f2e7a2bc6b591283ecef2db269272bcd1aa16a74b3f54e6","observation_id":"7c2f64fe-55ad-4dfb-b443-d9721013371d","resolution":{"observed_at":"2026-08-03T13:26:05.138241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.220639Z","title":"Fsd v2: Improving fully sparse 3d object detection with vir- tual voxels.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.220639Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:1441e37fb3e48cfa35dc03f82fafce929871b72c14b14ddec04072a33f1dad49","observation_id":"1ec40d66-0471-44ff-8617-a5e16bdf73b8","resolution":{"observed_at":"2026-08-03T13:26:05.220639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.259987Z","title":"Eva-02: A visual representation for neon genesis.Image and Vision Computing, page 105171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.259987Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d1c6cb9402f384932754795c00cb0fcef0b74d2b2f74820bfa438c3c1c61a040","observation_id":"4a0c3f46-6c8a-461d-9195-b5ba888a384d","resolution":{"observed_at":"2026-08-03T13:26:05.259987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.349383Z","title":"ORION: A Holistic End-to- End Autonomous Driving Framework by Vision-Language Instructed Action Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.349383Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:26855c5eec923c991fe8b09928ca25af078fe77b4db50543a7e23d7d383836dd","observation_id":"7e8d08e6-fd34-4cff-b520-5ebe9b252c84","resolution":{"observed_at":"2026-08-03T13:26:05.349383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.415969Z","title":"Multi-Frame, Lightweight & Efficient Vision-Language Mod- els for Question Answering in Autonomous Driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.415969Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:84aed7e5531d7b7f3bf8d5ac32b47a72aec9c3ee7d5f3b7b31ca172417b31107","observation_id":"52925170-7639-4839-acbb-1d697b65e85c","resolution":{"observed_at":"2026-08-03T13:26:05.415969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.480439Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.480439Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:9b31a3735d76d43c695998ed841aade1042a33b62048c74cdd833d2934692a73","observation_id":"2587d52f-f32f-4747-bd68-d9d167d755cb","resolution":{"observed_at":"2026-08-03T13:26:05.480439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.546368Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.546368Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:f1478798a760f900384e7b98dceaba502cc3bd8b8d162b487af6395f2cbd9f0d","observation_id":"d166557d-1bf2-4559-a3af-ec191b8a4ccb","resolution":{"observed_at":"2026-08-03T13:26:05.546368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.625367Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.625367Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:6799fcf00a8232fd7eed67d3c110acd2178902ec93ae38d0f0a96040a43beec5","observation_id":"77f7ba63-0f3a-47bf-878b-2e737e5a923a","resolution":{"observed_at":"2026-08-03T13:26:05.625367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.714982Z","title":"Drivlme: Enhancing llm-based autonomous driving agents with embodied and social experiences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.714982Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:177b7d5fdbdcbe5fff6e7c7c7654a9094fe612c4c5254c37a674ad48666d8c63","observation_id":"f0760355-46f3-42a5-adab-2b3854494847","resolution":{"observed_at":"2026-08-03T13:26:05.714982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T13:26:05.774332Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.774332Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:bcd5110330a95bf59a2f9a02e2e884beb925510312d21627efcd292c804bca2e","observation_id":"842926fd-15f1-4c48-a826-105b18c6454a","resolution":{"observed_at":"2026-08-03T13:26:05.774332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.879351Z","title":"Omnispa- tial: Towards comprehensive spatial reasoning benchmark for vision language models.arXiv preprint arXiv:2506.03135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.879351Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:e4396420bb6e4c4a6b8a403503e8a2990a88ba6afd74590c4a3ce2fce60704dd","observation_id":"0b735342-7dce-41c9-af12-379676b54f8d","resolution":{"observed_at":"2026-08-03T13:26:05.879351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:05.957461Z","title":"Vad: Vectorized scene representation for ef- ficient autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:05.957461Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:6c4b6cc73ec6ab61bf1af57e1ab1c6aea5dee908bac86284897e78b6966b0530","observation_id":"77d74363-c8ce-4378-be6e-50b4a59919f3","resolution":{"observed_at":"2026-08-03T13:26:05.957461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.050138Z","title":"Textual explanations for self-driving vehicles","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.050138Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:05165d94cdc1261436cb1fd091767da267ad1695ee7c9da25181082cde43c347","observation_id":"1da77f5e-8146-475e-8dff-332fd3128df5","resolution":{"observed_at":"2026-08-03T13:26:06.050138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.119663Z","title":"Driving everywhere with large language model policy adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.119663Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:41e6cc22bad49b098c678bc5f9ecbcce4565d25d66cf8c1848618735afd6cd50","observation_id":"ef09e4f7-468b-4fb4-9af3-4bb86ae688aa","resolution":{"observed_at":"2026-08-03T13:26:06.119663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.174798Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.174798Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:df95835a339f9d8b2dd06e8ea0240dc7ed32381ebf9dad4358c18a51d72f0efc","observation_id":"a14c2991-c5f2-4fe4-ab1b-a0711dcbc05a","resolution":{"observed_at":"2026-08-03T13:26:06.174798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.278735Z","title":"Blip- 2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.278735Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:abff664ffdc108f969a2f6215ed7900ab3b8577afc212b9ad80d534896ad018b","observation_id":"198adf4a-2e26-4a85-86d6-99fbbd2b008b","resolution":{"observed_at":"2026-08-03T13:26:06.278735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.335962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.335962Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:f004a2db3e4e5b01ac6e489eb84330a5dd6d04264c2295c304e1b62e69a99ea8","observation_id":"86056dfb-039f-4938-8f1b-f4c6aa88f119","resolution":{"observed_at":"2026-08-03T13:26:06.335962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.408093Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.408093Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:7018fb60e1bedbffb1b51abbe0b3c977c492c823a2db3ce566b2339fdc78ae47","observation_id":"215e248c-9a15-4237-876a-4fed81754d8a","resolution":{"observed_at":"2026-08-03T13:26:06.408093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.505518Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.505518Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:e4eb57f21ea7133afc668ad66f7ca2749a12e3d8e67fbc4909be9b966d487cc8","observation_id":"eee31b8f-1193-47a9-993a-5a1a7218503e","resolution":{"observed_at":"2026-08-03T13:26:06.505518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.547793Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.547793Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:5018318f111bccbd3ee1d128594909671c9f44680614f8c00543c5dc80c01722","observation_id":"303d5d29-3b75-481f-aff7-7ed5fe817837","resolution":{"observed_at":"2026-08-03T13:26:06.547793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.646904Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.646904Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:16cf717c75d71d1f8868792bf407abddb251225eb04ce9951b3471d3fd7c5db4","observation_id":"2554cd72-db52-4710-af52-5e621ed9888e","resolution":{"observed_at":"2026-08-03T13:26:06.646904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19015","last_updated":"2025-08-08T09:55:18Z","snapshot_observed_at":"2026-08-07T15:04:36.637684Z","submitted_at":"2025-05-25T07:37:34Z","title":"Can Multimodal Large Language Models Understand Spatial Relations?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19015","snapshot_observed_at":"2026-08-03T13:26:06.713886Z","title":"Can multi- modal large language models understand spatial relations? arXiv preprint arXiv:2505.19015, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.713886Z"},"links":{"cited_paper":"/paper/2505.19015","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:aba29e8e04038e6dbc002e7794b260c7d9b5e8cda83dd972326d4f807ca331c5","observation_id":"09564187-549e-4c2d-84e4-0eef8ac830b1","resolution":{"observed_at":"2026-08-03T13:26:06.713886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00789","last_updated":"2026-04-19T12:44:09Z","snapshot_observed_at":"2026-08-07T16:49:08.273704Z","submitted_at":"2025-08-31T10:34:44Z","title":"CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00789","snapshot_observed_at":"2026-08-03T13:26:06.814034Z","title":"Omnireason: A temporal-guided vision-language- action framework for autonomous driving.arXiv preprint arXiv:2509.00789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.814034Z"},"links":{"cited_paper":"/paper/2509.00789","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:f19abf3133523e8a35bfbb913cce58695530fa26b72d191c2a51f71a1d7abd7b","observation_id":"cc31a511-0726-4128-8295-55a78bb5a3ad","resolution":{"observed_at":"2026-08-03T13:26:06.814034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:06.900202Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.900202Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:9886830bf59c1751903c776ef2390944748aca4c9be366dfddaf733858947da3","observation_id":"c3e9bf31-27d0-47de-acea-87c5b2e3e085","resolution":{"observed_at":"2026-08-03T13:26:06.900202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-03T13:26:06.977588Z","title":"Gpt-driver: Learning to drive with gpt.arXiv preprint arXiv:2310.01415, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:06.977588Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:98fa0f3a3d007df88b7ef1a996952204303a388adafa95ba0493db0b80cd5911","observation_id":"7a72f88e-63ac-4761-8a60-498734d01265","resolution":{"observed_at":"2026-08-03T13:26:06.977588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.060840Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.060840Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:697c882bc88199ada0c97f1edbaad1d026807845faec2732433794b456bfeca2","observation_id":"032b3462-e5e3-469d-b9df-5f37cbdae398","resolution":{"observed_at":"2026-08-03T13:26:07.060840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.137220Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.137220Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d852aeeb00a873bc3df6c8d806369f16a8f1ac6933680ce12ee280c959ed2878","observation_id":"66aea150-ff76-4a06-bb33-93393a7b36f3","resolution":{"observed_at":"2026-08-03T13:26:07.137220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.224029Z","title":"Vlp: Vision language planning for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.224029Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:4050b507493f661493c8090d67f52cd9caa739584a426dbb784511e1341a02e1","observation_id":"dc236a92-bc36-4f61-b29d-cf85259ab088","resolution":{"observed_at":"2026-08-03T13:26:07.224029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.311902Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.311902Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:7e7b4338e9aa3c4a397f7698a098aed42ffbd69e353ec1c9ed515d6576531328","observation_id":"28285f16-f827-4531-b0a0-b2b05b9f7898","resolution":{"observed_at":"2026-08-03T13:26:07.311902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.413343Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.413343Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:f17cb2f5c9b09544932c7323c1ed2b8d38467e4cc8d0f42fd6dcd1d449ecaaa7","observation_id":"2b846917-d0cb-4730-8cfb-202726c24275","resolution":{"observed_at":"2026-08-03T13:26:07.413343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.566009Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.566009Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:2820ce1eca5f72f627359de71f01889e281dc44528d3d7fb5ff8ffe2f792ed61","observation_id":"201f7912-e90a-4629-9f2d-e4a0d9dd052c","resolution":{"observed_at":"2026-08-03T13:26:07.566009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.681334Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.681334Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:84b1a2c16e70316c7f346d9e3d17520b32670c76b84e1a872a55083ae6a2d2f2","observation_id":"ce2f30e5-7a99-4e9a-94c5-3817d1a6cdd6","resolution":{"observed_at":"2026-08-03T13:26:07.681334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:07.791241Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.791241Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:09be3537ada7874d976f3a83304421f0ead6008c7a6bc77b67318a89e93a7b2c","observation_id":"eacd45d3-8d04-448f-a6c6-f81e1cea767c","resolution":{"observed_at":"2026-08-03T13:26:07.791241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12404","last_updated":"2025-08-17T15:42:54Z","snapshot_observed_at":"2026-08-05T19:26:44.779369Z","submitted_at":"2025-08-17T15:42:54Z","title":"LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12404","snapshot_observed_at":"2026-08-03T13:26:07.904116Z","title":"LMAD: Integrated end-to-end vision-language model for Explainable Autonomous Driving.arXiv preprint: 2508.12404, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:07.904116Z"},"links":{"cited_paper":"/paper/2508.12404","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:04cb56b1d1092ddc9201fe1333382b6c04d416dd2f576ab42d692836edd3ae94","observation_id":"ad45164d-61ac-49c2-ac7b-df7de0ca19fd","resolution":{"observed_at":"2026-08-03T13:26:07.904116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.026106Z","title":"Bev-tsr: Text-scene retrieval in bev space for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.026106Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:211dc0a043a2f4f18c439934d0a79fbcedfe752b1e46bb6b79d22f1722852057","observation_id":"4eb3b491-ba19-4ed5-971e-cc96d40ccfdf","resolution":{"observed_at":"2026-08-03T13:26:08.026106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.097736Z","title":"NuScenes-SpatialQA: A Spa- tial Understanding and Reasoning Benchmark for Vision- Language Models in Autonomous Driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.097736Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:68a485c597cf494809aeb4ba173aa1291841c013e80b652f602acf8270631cc9","observation_id":"3eb9bfbf-1a90-419c-9d21-c705c4a95f34","resolution":{"observed_at":"2026-08-03T13:26:08.097736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.225979Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.225979Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:27216a416b36d01e35caea7ab8cc24edac866abfcb4003c33d333316389e087c","observation_id":"5c2147f5-72a2-44bf-ba6e-1e3ff9db0637","resolution":{"observed_at":"2026-08-03T13:26:08.225979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T13:26:08.319483Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.319483Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:a17f869c38331c573d4bd4b8f9a3ef8dec3d4eeab04e8c7474111ceede5a551f","observation_id":"86167633-8eff-40cf-a7e3-bd43e9c8d441","resolution":{"observed_at":"2026-08-03T13:26:08.319483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.409639Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.409639Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:7e133b331120623b8db156574baa0913a1259e6e87fbb6f71ac3b05c573b84d2","observation_id":"52552ab9-9b24-4336-a3a1-b6f07b32dee8","resolution":{"observed_at":"2026-08-03T13:26:08.409639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.503851Z","title":"Om- nidrive: A holistic vision-language dataset for autonomous driving with counterfactual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.503851Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:992dfabb7d2288756f22d2b159ef75c0c9253ab90d095e6636b76b192cdf1e21","observation_id":"afc0a3d0-6c70-4c78-a501-0dc3712a4ffe","resolution":{"observed_at":"2026-08-03T13:26:08.503851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.571138Z","title":"Mv2dfusion: Leveraging modality-specific object semantics for multi-modal 3d detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.571138Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:ae0314b56fd36c609822a266f8a3c75965ae75ce358b9490b7a08e86ef715641","observation_id":"708dff54-b1a7-48f7-ba96-38b98f94b9a9","resolution":{"observed_at":"2026-08-03T13:26:08.571138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-03T13:26:08.699183Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understand- ing.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.699183Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:26788c0aef5662027eecd28cda1c9f566e03f25413fa90af43cd12e47a53feb3","observation_id":"52338f5f-7cba-4683-ae4e-57c4ce76ae67","resolution":{"observed_at":"2026-08-03T13:26:08.699183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.749857Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.749857Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:737f97ae8ffd9e6476b8b8a5ed7f0c7d0e27b8916c9295350cee24e1132e4e3a","observation_id":"44684c65-3826-4ad2-8ece-63d363117a4e","resolution":{"observed_at":"2026-08-03T13:26:08.749857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13938","last_updated":"2025-03-21T02:17:52Z","snapshot_observed_at":"2026-08-07T16:55:51.209259Z","submitted_at":"2025-03-18T06:12:38Z","title":"ChatBEV: A Visual Language Model that Understands BEV Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13938","snapshot_observed_at":"2026-08-03T13:26:08.821672Z","title":"Chatbev: A visual language model that understands bev maps.arXiv preprint arXiv:2503.13938, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.821672Z"},"links":{"cited_paper":"/paper/2503.13938","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:2ed50b9ea09248a6dd01f7a0276a7d78c20d2d654f11585955185c904b5893d1","observation_id":"e4faeea0-69d6-4dd8-8689-841e7ee79514","resolution":{"observed_at":"2026-08-03T13:26:08.821672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.921762Z","title":"Explainable object-induced action decision for autonomous vehicles","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.921762Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:bf7f617347d71b7f9e7d4d0124186d858780e574cad5b0747c34b42042811f75","observation_id":"068e2522-100c-427b-98cb-eb76d29dcef9","resolution":{"observed_at":"2026-08-03T13:26:08.921762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:08.989622Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model.IEEE Robotics and Automation Letters,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:08.989622Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:1d642184420f2c93866b2590df27a0153f4ebb63713d89d5164fb39c155978a9","observation_id":"938438ad-e962-4386-a0bd-79499374f4d9","resolution":{"observed_at":"2026-08-03T13:26:08.989622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.067884Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.067884Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:cbedc25d095e4f6608abbd8fcb0d33c9ff4b24ded12ec9afc882332cb118ce30","observation_id":"7c208d22-0ce8-4148-b091-0d01b01530dc","resolution":{"observed_at":"2026-08-03T13:26:09.067884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.152689Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.152689Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:8918c6c003fdd4cd4c27494ba1d3bff541aace92da4a3f5b98fca6cd5b6eaf9e","observation_id":"e18029f9-59bd-47b4-a680-f1dd31acf25c","resolution":{"observed_at":"2026-08-03T13:26:09.152689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09251","last_updated":"2025-06-19T05:02:13Z","snapshot_observed_at":"2026-07-06T19:01:58.598116Z","submitted_at":"2024-08-17T16:42:13Z","title":"V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09251","snapshot_observed_at":"2026-08-03T13:26:09.216484Z","title":"V2x-vlm: End-to-end v2x cooperative autonomous driv- ing through large vision-language models.arXiv preprint arXiv:2408.09251, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.216484Z"},"links":{"cited_paper":"/paper/2408.09251","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:b613b58b5b67b800f98adf7fb390077c41936a211e0206a3093905471a4e0f2e","observation_id":"5f15abbd-6293-4c0a-8219-9b91a60e4dff","resolution":{"observed_at":"2026-08-03T13:26:09.216484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10430","last_updated":"2023-10-22T02:45:33Z","snapshot_observed_at":"2026-07-06T15:28:49.253125Z","submitted_at":"2023-05-17T17:59:11Z","title":"Rethinking the Open-Loop Evaluation of End-to-End Autonomous Driving in nuScenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10430","snapshot_observed_at":"2026-08-03T13:26:09.305118Z","title":"Rethinking the open-loop evaluation of end- to-end autonomous driving in nuscenes.arXiv preprint arXiv:2305.10430, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.305118Z"},"links":{"cited_paper":"/paper/2305.10430","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:a8e6c2c54d6927f93e99cd60648e0f19c7d3b9ea6494d5b4f1e6bc686dd93448","observation_id":"272befc2-33ff-476e-88e3-e9949de9cb0b","resolution":{"observed_at":"2026-08-03T13:26:09.305118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07267","last_updated":"2025-05-21T08:38:11Z","snapshot_observed_at":"2026-07-06T19:13:46.489307Z","submitted_at":"2024-09-11T13:43:01Z","title":"MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07267","snapshot_observed_at":"2026-08-03T13:26:09.388873Z","title":"MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving.arXiv preprint: 2409.07267, 2025-05-","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.388873Z"},"links":{"cited_paper":"/paper/2409.07267","citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:73eac331ca3917fa59d75f24849d25c33a6eb2d6f5236d8f0435255ddf8d5349","observation_id":"f4d06326-d0be-4bcb-808c-0d733ac72020","resolution":{"observed_at":"2026-08-03T13:26:09.388873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.457217Z","title":"LLaMA-Adapter: Efficient Fine-tuning of language models with Zero-init Attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.457217Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:5c5023e5fa54bd2d7d139f4057bf4ac97858822719300318b4e8e303b4ac2371","observation_id":"ba3deffa-841f-43bf-ad7d-4480b9656f97","resolution":{"observed_at":"2026-08-03T13:26:09.457217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.545258Z","title":"Interndrive: A multimodal large language model for autonomous driving scenario understand- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.545258Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:4851ffb665824b339e5350fb3fbc943705ba4f5b1f51311c358aac358423800e","observation_id":"d794efb9-1426-47d2-9691-07e9fdc0309c","resolution":{"observed_at":"2026-08-03T13:26:09.545258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.611502Z","title":"MPDrive: Improving spatial understanding with Marker-Based Prompt Learning for Autonomous Driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.611502Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:5697264aa882b9f5dc08877f34c61e7bf4bc107eeb538215d77596cd78c3af96","observation_id":"8fece7bc-a640-4013-a865-114a2a02629b","resolution":{"observed_at":"2026-08-03T13:26:09.611502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.703408Z","title":"Opendrivevla: Towards end-to-end au- tonomous driving with large vision language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.703408Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:76f03a6be3b9bf3f800da670b81591c16cbe4f3d975b0145c99ad80e83e443ef","observation_id":"b5927311-ed47-412d-a84c-4e2573449a7b","resolution":{"observed_at":"2026-08-03T13:26:09.703408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.794400Z","title":"Autovla: A vision- language-action model for end-to-end autonomous driving with adaptive reasoning and reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.794400Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:4bb59b714474e19748608e5180f1edbd06ae6a339d9b9f5794afa5ec235056e7","observation_id":"4012c0d0-1828-452a-b1ce-f1b2381eb1e2","resolution":{"observed_at":"2026-08-03T13:26:09.794400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.860635Z","title":"Further information about our pro- posed SA-QA dataset is presented in Sec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.860635Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:e99d069f4fca982f796ffd1d06343470f553accb9c927090ebf0495d27caf19c","observation_id":"04d7b78e-df96-4b02-8d2c-0914a2e56bac","resolution":{"observed_at":"2026-08-03T13:26:09.860635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:09.979579Z","title":"The specific QA formats and the step-by-step gen- eration procedure are summarized in Tab","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:09.979579Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:fd5bbcb36f731d3abf8f8336ef7cc436ef76eb64d386b11f22b9479713e44f4a","observation_id":"fceeebf0-91a8-4a6f-9caa-c8564f193e0b","resolution":{"observed_at":"2026-08-03T13:26:09.979579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.017450Z","title":"Is object A closer than object B?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.017450Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:eb00b668b6c641cce11ac057a73b6e8fa5d0219b6db3d00a27fec8ba346eed57","observation_id":"de044b08-5e6c-4b27-b56c-8dcc7ffde62d","resolution":{"observed_at":"2026-08-03T13:26:10.017450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.101378Z","title":"For a potential future position at(x, y), is it in a drivable area?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.101378Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:55a5861f7d9c945024d93b73733a69a2a3508b93c4293945723a42beed7f657e","observation_id":"4fce30f9-dd82-4f4b-b938-5d2c1fbaf9d5","resolution":{"observed_at":"2026-08-03T13:26:10.101378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.191266Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.191266Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:27d17f7e33e0a80362b3878cef8d135f3e88b9baf1cd7acb31a3af3c2611ebfa","observation_id":"c115f5a0-c622-4e2c-a4f6-10bdd2493c07","resolution":{"observed_at":"2026-08-03T13:26:10.191266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.255795Z","title":"Yes” if inside; “No","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.255795Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:8041e8c45cb2797d3d80c0a094db58335b660f413963acd492000ed645fe30cb","observation_id":"bd81bdf5-1734-4a99-8c78-b2ce5d2155ae","resolution":{"observed_at":"2026-08-03T13:26:10.255795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.347558Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.347558Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:12500d1add5af9fc3c701a246b8ed23876c61d899b518fa59bf36c2cb9fa744d","observation_id":"47112303-12dc-4d5a-a247-dd3788dbcdbc","resolution":{"observed_at":"2026-08-03T13:26:10.347558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.422118Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.422118Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:8834b60b88bfca2e150b9c068e54de722318e180018c2a155f7427927c49e83f","observation_id":"8dabb2bf-b93e-4766-85d8-a3437915d02d","resolution":{"observed_at":"2026-08-03T13:26:10.422118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.514978Z","title":"The object is a <category>in the<CAM>, location:(x, y), length:<l>, width:<w>, height:<h>, angles in degree:<yaw>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.514978Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:29fc90e44ca6faed530b99f36616d07bf61af3d94b87b654894e1d05b7087af8","observation_id":"2213da90-c987-425b-8d69-07441124e101","resolution":{"observed_at":"2026-08-03T13:26:10.514978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.577345Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.577345Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:ff750ebaa27ae11623becdfa2ed7c01a20c1b06250e1f630263a36a2fd8a65f6","observation_id":"f27e396d-a9fe-4782-a02d-f438d7d293c9","resolution":{"observed_at":"2026-08-03T13:26:10.577345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.641834Z","title":"Identify the object in the masked regionand describe its 3D information","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.641834Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:be7d3808f8d022d6aed3b943c0b25220d600901d696f2534ffb9898481860d31","observation_id":"5a4d019b-1a92-4ae3-a70a-b30eeaaed55a","resolution":{"observed_at":"2026-08-03T13:26:10.641834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.729467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.729467Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:e1a793662b981a13222a73a8d968aff3f4e5b5b40077d490a59574fcde165bf8","observation_id":"d4cd8fdf-2832-49a1-a543-6801f07af9e0","resolution":{"observed_at":"2026-08-03T13:26:10.729467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.780893Z","title":"What objects are on the lane defined by points (x1, y1),(x 2, y2),(x 3, y3)?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.780893Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:f6b60840449f30c81b36c1e10aeb8e043499c084d6a3afc4808d6a8d7991b0fc","observation_id":"7d7e9b52-0204-42c1-84c9-b57c1f4cb600","resolution":{"observed_at":"2026-08-03T13:26:10.780893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.869386Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.869386Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d074afa031697615e1cd5b54828849844a75a0731de3ba3e4895e3ee5b88905e","observation_id":"af62b3e4-1e65-484c-89df-7c5a172d96f2","resolution":{"observed_at":"2026-08-03T13:26:10.869386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:10.928164Z","title":"The object is a <category>, location","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:10.928164Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d8bd2ea664e7997b89233d0e521cc6894785947428d90d769de6c94d793bd03d","observation_id":"ab44230c-96c0-4765-87ce-4d8d92543346","resolution":{"observed_at":"2026-08-03T13:26:10.928164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.008343Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.008343Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d08d6615afde107ef0f682dd4b836adf23cbc415d406452cf7fc799fdbab9352","observation_id":"35e25544-6373-4a8e-9ce3-d6e47220f55b","resolution":{"observed_at":"2026-08-03T13:26:11.008343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.095005Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.095005Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:d7db961a95cdc03a205b1691cb58b7ce542a34c097819867207a9a3574c5ee7a","observation_id":"047e199e-0500-48b6-8596-85c1de859690","resolution":{"observed_at":"2026-08-03T13:26:11.095005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.179600Z","title":"Please determine the metric distance (in meters) separating the two indicated objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.179600Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:43f52b7eae416798f454b71bb244e531113d506df0821404a14f137f0ac3440e","observation_id":"23cf0bcb-2166-42d5-a5f0-44f0e38b75e6","resolution":{"observed_at":"2026-08-03T13:26:11.179600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.237154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.237154Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:567a939055febf52cf45b234bea19d0c6951d8a4a36f915ea6d8c39815dc44a6","observation_id":"73b3e2a9-9cfe-4fbd-971f-d19a48dece12","resolution":{"observed_at":"2026-08-03T13:26:11.237154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.276700Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.276700Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:a6d09cb627f8f792c8f3e8dc57e525c42c6b974a8787bbba4f407c3498d44bef","observation_id":"ea2e33d8-9e27-420a-9a1b-66e1afae807f","resolution":{"observed_at":"2026-08-03T13:26:11.276700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.387856Z","title":"D.” (The value is rounded to 0.1 meters). SR-04 “What is the future position of the object at(x, y)afterT second?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.387856Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:755405b8bbfe01912884a01d2083e1e69d7562e46078def794bf62258dd186f8","observation_id":"5f276cf3-b1b2-4be0-95d7-4169163d0ca8","resolution":{"observed_at":"2026-08-03T13:26:11.387856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:26:11.454206Z","title":"(x f ut, yf ut)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T13:26:11.454206Z"},"links":{"citing_paper":"/paper/2512.24331"},"observation_digest":"sha256:9a03990804abd4a9e69a0cfe48d6eb26df4f2a27d9fc3829eb300a3c7e52ac5f","observation_id":"726a9024-5ecc-4846-90f9-ab9ee2a94d7e","resolution":{"observed_at":"2026-08-03T13:26:11.454206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.24331","last_updated":"2026-05-25T12:17:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:52:13.886460Z","submitted_at":"2025-12-30T16:35:00Z","title":"Spatial-aware Vision Language Model for Autonomous Driving"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":88,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 5 inbound Pith citation observations for arXiv:2512.24331."}