{"as_of":"2026-08-19T01:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03497eeb51f95b214b0d3c43db2d5e153da90a00d3020b5114adc611c19e8f6a","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T16:40:22.441025Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.23176/citation-record","integrity":"/paper/2605.23176/integrity","json":"/paper/2605.23176/citation-record.json","paper":"/paper/2605.23176"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.741304Z","title":"Studies in spatial learning","venue":null,"work_id":"5da6983c-3071-4624-84d7-a4e8197e9a6e","year":1946},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:39e4bc66a155ba667853c29298533c46d5d88e2c362c7d01410695d076014419","observation_id":"4124a936-85e4-479c-b649-9b33c7e313a0","resolution":{"observed_at":"2026-07-08T12:44:53.742607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.794694Z","title":"Cognitive maps in rats and men.Psychological review, 55(4):189","venue":null,"work_id":"77df3af4-b729-4c39-8b2f-b60325a8372c","year":1948},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:e7f56d4e8aceb588b6c8716401d90692397665a2fd4283584a9867cde33ab5a9","observation_id":"4908d26a-f4f6-452a-88d4-23c0b5221b75","resolution":{"observed_at":"2026-07-08T12:44:53.796120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.746674Z","title":"The hippocampus and context revisited","venue":null,"work_id":"4e4486da-9ee1-48cd-b999-f3872496548f","year":2008},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:6baf92a06e25b45341b1f24d6c66ec87bc44d31c1accf555f52d086e60316a52","observation_id":"46ad2d0d-0406-4c71-b866-80c32161dc59","resolution":{"observed_at":"2026-07-08T12:44:53.747734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.753713Z","title":"The effect of vehicle navigation systems on the formation of cognitive maps","venue":null,"work_id":"e0e2e451-6578-4d9c-bcfe-41ef9e001205","year":2005},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:534ac8011d612b5852bc12aa8e34fa17b1bfaa57cfbd2e88a024adc9458a8584","observation_id":"fdcd4ef5-bed5-4f43-bab2-81c653fdd9e4","resolution":{"observed_at":"2026-07-08T12:44:53.755008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.792611Z","title":"Omnidrive: A holistic vision-language dataset for autonomous driving with counterfactual reasoning","venue":null,"work_id":"df33fe02-823f-4549-ab8a-9a00fba77398","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:ff13952db9b6721700d4049f3b974b2399d5b022944c6f5e0ed1fbaf0b387ff6","observation_id":"db2ce18a-30d3-4a8d-a831-f291b7ef0e26","resolution":{"observed_at":"2026-07-08T12:44:53.793920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.772177Z","title":"Is ego status all you need for open-loop end-to-end autonomous driving? InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 14864–14873","venue":null,"work_id":"e75d0c5e-cf23-461c-91be-c9c464ed6516","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:8b121f05efbdaad8f8312cdc9d04a808283c215ba322e0b9bb1fa1dfaea81675","observation_id":"2e812598-d752-44f9-bf5f-43d0e654119c","resolution":{"observed_at":"2026-07-08T12:44:53.773907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.800908Z","title":"Holistic autonomous driving understanding by bird’s-eye-view injected multi-modal large models","venue":null,"work_id":"014eed05-291e-42c6-8d21-9b372c5d9b4b","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:cae51369e5774c9990fe9b1eed197dcac56a8db2fca4d2ac70156fc811ae99a5","observation_id":"018ae19c-0741-41cc-a8af-aa4579592b00","resolution":{"observed_at":"2026-07-08T12:44:53.802326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.767956Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data and metric perspectives","venue":null,"work_id":"9f1b2e29-cea0-4fd1-9184-54ae9208533f","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:54ab22a8e851951c27344dcda73f448d3b662bd6e9acfa77592f35918f2c7181","observation_id":"7e1c8a1d-1d24-46fc-ba36-c8f34e5f375b","resolution":{"observed_at":"2026-07-08T12:44:53.769424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.707449Z","title":"Vlm-ad: End-to-end autonomous driving through vision-language model supervision.Conference on Robot Learning (CoRL)","venue":null,"work_id":"a17a8643-4a82-4e7f-bf4c-b9139658cd02","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:968320ace5e3b51c4ddb20f5c9975394b2e3689a123f66ef3aa8f1cf1890ef72","observation_id":"5f0159d9-0918-494f-a48c-fed2b967c682","resolution":{"observed_at":"2026-07-08T12:44:53.708689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.718899Z","title":"Robotron-drive: All-in-one large multimodal model for autonomous driving","venue":null,"work_id":"4111304b-cfd9-4dc3-b297-685a479dcd36","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:4bf429cd8bd79bf62da79658a7dcccfab899cb78eaa90dcdb43348f96ad02238","observation_id":"7d9f6ce7-ba05-4d31-a037-fa46e9da8f87","resolution":{"observed_at":"2026-07-08T12:44:53.720240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.780830Z","title":"Fastdrivevla: Efficient end-to-end driving via plug-and-play reconstruction- based token pruning.the Association for the Advancement of Artificial Intelligence (AAAI)","venue":null,"work_id":"1b791bb6-95b7-4d50-b9e6-5d9183ed9cb4","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f641fd4c915855bc6a6d6229c8a62fb590e75d5128e47492c5e1f3a86d6e3483","observation_id":"8057aeb5-bcdc-4243-9d22-c010fc6826e3","resolution":{"observed_at":"2026-07-08T12:44:53.782249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.709249Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model","venue":null,"work_id":"d19e2458-ec99-47ee-9c6e-82040627ffde","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:0da2c58882caf528aff962795132e1990b833ee58c4f413f689d0e8736f9637e","observation_id":"8ff366c2-099d-45d1-af50-29ca9c812ee1","resolution":{"observed_at":"2026-07-08T12:44:53.710479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.705641Z","title":"Covla: Comprehensive vision-language-action dataset for autonomous driving","venue":null,"work_id":"5b9c2261-a99f-46cb-9d00-6202b7fa7e5c","year":1933},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:30bb16682b5b89021807d7a0600f00641a6ce987eae6fdb8f14565b8df5bda69","observation_id":"ee46642e-49ac-4018-a940-0eefe3c6dff2","resolution":{"observed_at":"2026-07-08T12:44:53.706881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.757955Z","title":"Emma: End-to-end multimodal model for autonomous driving.TMLR","venue":null,"work_id":"f9bddad5-4d2c-4f5e-98e2-3e3836602bf3","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:9d040f53a73a532494cdfc967e4cdd579c8e186046f4f16031c7944cf3ed89bb","observation_id":"95333992-8ce8-431a-98af-e4f85118f85e","resolution":{"observed_at":"2026-07-08T12:44:53.759266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.782858Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":"72a28ab7-42d3-4727-880a-47b434b3fe62","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:7681f8b671c78a94e0546ce20f3ae436df7455e8eef69b4ee362f860ee2290a5","observation_id":"7f698644-b9af-4646-aa19-6420fa57ad1d","resolution":{"observed_at":"2026-07-08T12:44:53.784193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.788777Z","title":"DriveVLM: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":"a753e0b5-90be-4087-a895-f5d83da92137","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:0f40b0b96033169ecab2ed822b9d242ce4a0492d542482468348b5375e889d9c","observation_id":"c46774f7-2fba-4f9a-bfec-b3732d1293be","resolution":{"observed_at":"2026-07-08T12:44:53.790101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.786864Z","title":"Futuresightdrive: Thinking visually with spatio-temporal cot for autonomous driving","venue":null,"work_id":"316a0547-c7c5-481a-b7eb-f253f82a20d5","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:25affc7717e012efc80cef1a228bead8ca989524d0715caa2aa8219457a728a4","observation_id":"c98558d8-d110-42c0-bf32-aebc48894778","resolution":{"observed_at":"2026-07-08T12:44:53.788154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03164","last_updated":"2025-04-07T03:39:02Z","snapshot_observed_at":"2026-08-16T12:44:04.450879Z","submitted_at":"2025-04-04T04:43:10Z","title":"NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2504.03164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03164","snapshot_observed_at":"2026-07-01T23:06:20.242744Z","title":"Nuscenes- spatialqa: A spatial understanding and reasoning benchmark for vision-language models in autonomous driving","venue":null,"work_id":"83436258-0b5b-44b6-bd79-9cc78420c285","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2504.03164","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:b9ddb86653c9478616aeee0524ec64ced824bd49b3d0cfdedbb159f7b466de04","observation_id":"656104bb-f775-47b5-86da-31557de501c6","resolution":{"observed_at":"2026-06-30T16:44:56.038675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.763919Z","title":"Maplm: A real-world large-scale vision-language benchmark for map and traffic scene understanding","venue":null,"work_id":"d94da023-e9d5-4ac1-a734-bb267e96f430","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:369efce1f8b471ed1b546353dd19e6b7a4e900e6983c3ac436dafed8937e7165","observation_id":"0f352cc1-80c3-42c5-9de3-9c991e2e7446","resolution":{"observed_at":"2026-07-08T12:44:53.765343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.06266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.274403Z","title":"Spatial reasoning with vision-language models in ego-centric multi-view scenes","venue":null,"work_id":"2f4c1dea-b664-42e3-a9b6-0b1d040394a8","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:7d32a089aded1e9b3d10a504357ccf1fb10f3266f338153487da0f3fe051a08c","observation_id":"0083e1b5-e35f-4800-8570-49436f921f03","resolution":{"observed_at":"2026-06-30T16:44:56.035595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.720830Z","title":"Surds: Benchmarking spatial understanding and reasoning in driving scenarios with vision language models","venue":null,"work_id":"bc4811c6-1dd0-4d30-a70b-e49da9e887f0","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f36bdb1cdc4e51ab6c965405f9052b20478d220060bd13f8f7791edf5b77730d","observation_id":"9431909e-311e-4b96-983b-43e5332e90e8","resolution":{"observed_at":"2026-07-08T12:44:53.722106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.751911Z","title":"Automated evaluation of large vision-language models on self-driving corner cases","venue":null,"work_id":"6795b1e8-a419-44e8-b472-c2fae1cf0831","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:3a9216aed8049aacb4ce851e6f787afa2baaf622932f769691189daa870fe740","observation_id":"4d30be20-c9bc-4ae0-9817-4dc6fbea3db5","resolution":{"observed_at":"2026-07-08T12:44:53.753145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.698299Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":"5abd93f9-ba5f-4066-bbf4-a6b48b49e653","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:3419f276bcee17ac0e7ac72b6aaaab662c681bb79600286e9bcdacc23b755f6f","observation_id":"1a14d964-bc55-4fe0-8344-ab1fc1d163a0","resolution":{"observed_at":"2026-07-08T12:44:53.699401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.770032Z","title":"Towards physics- informed spatial intelligence with human priors: An autonomous driving pilot study.International Conference on Learning Representations (ICLR)","venue":null,"work_id":"a03962a8-5de5-4f40-89b2-032c9553efda","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:2baa3cb1939f18c487ec0e6ffa7d7c71944165a8f6c8c54e43a40f7e70016983","observation_id":"fd719db5-702f-4167-a61d-1fba9ea4d46d","resolution":{"observed_at":"2026-07-08T12:44:53.771422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.716923Z","title":"Stsbench: A spatio-temporal scenario benchmark for multi-modal large language models in autonomous driving.Conference and Workshop on Neural Information Processing Systems","venue":null,"work_id":"2c81cf77-a0df-41a2-902b-016d54ee99a5","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:8a72c945ce3907b7b7204115347708c95b0f0a344f88c3ad65f24d1ab2a8a7ec","observation_id":"a979584e-9127-45f6-a598-6709d97ce2f0","resolution":{"observed_at":"2026-07-08T12:44:53.718326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.728373Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"b6784b36-a946-4452-9e39-b49f38db211f","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:3aeb38ae86fda81cb3d0c5e24ac9609d2416f41264fcd510eebea39f368c6286","observation_id":"0bd6d633-47d7-4f8a-912f-e55b4bacd336","resolution":{"observed_at":"2026-07-08T12:44:53.729645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.739543Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":"aba703b9-87be-472a-a06c-a1b3eac05304","year":2020},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:2286f30b76f2f819e66a4a2accd6ae8bf692989b16aa54ff90607cc2f08fc3ea","observation_id":"0f86d378-36a6-4ec2-a281-8b4ddeaa8f8f","resolution":{"observed_at":"2026-07-08T12:44:53.740741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.776690Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting.Conference on Neural Information Processing Systems, 202","venue":null,"work_id":"5c633820-67cc-4a1c-9c22-a690099d6766","year":null},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:213d25c603905a8d8fd33a0d575c8652f187175e906143576ab5e1ac4a457596","observation_id":"dc1a85fc-bb8d-4ac2-b412-d6dc854221aa","resolution":{"observed_at":"2026-07-08T12:44:53.778244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.701852Z","title":"Man truckscenes: A multimodal dataset for autonomous trucking in diverse conditions.Advances in Neural Information Processing Systems, 37:62062–62082","venue":null,"work_id":"c3db01ef-f628-492f-808c-48b0cf2d24dc","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:a57c1bbf85fc129cc39663f00abefbded9a2d23fdba38f3ff33096f6f394d879","observation_id":"8aa9f8b7-4216-468e-bc81-167887f2c9c9","resolution":{"observed_at":"2026-07-08T12:44:53.703324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.784954Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"dcf42d7a-4eb1-4eaa-a60f-bf70cc428106","year":2020},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:058ffa30f6aeacc67f27baeed7ea76620a5217ee3267dfada0f382d9b16af92f","observation_id":"b05017c4-67a5-4206-a04a-9b1b87cd9f62","resolution":{"observed_at":"2026-07-08T12:44:53.786274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.696526Z","title":"One million scenes for autonomous driving: Once dataset","venue":null,"work_id":"20eae31d-1415-4365-be25-97f9917a5112","year":2021},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:69d02524803397da131f5407ea4d8190675da914ec857fcf01898f02af6f2e36","observation_id":"cec05ce0-68c4-434e-8f79-d9661983e896","resolution":{"observed_at":"2026-07-08T12:44:53.697734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14414","last_updated":"2024-06-20T19:36:38Z","snapshot_observed_at":"2026-08-16T14:49:58.499425Z","submitted_at":"2023-10-22T21:06:10Z","title":"Vision Language Models in Autonomous Driving: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":"2310.14414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.14414","snapshot_observed_at":"2026-06-30T16:44:56.040430Z","title":"Vision language models in autonomous driving: A survey and outlook","venue":null,"work_id":"dd4a9bad-6058-4cf1-8ad5-a91fb1fbb2c9","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2310.14414","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:86adf632b115a9752990a2ce1b1c29c0da9276a73371ad4bc3792799b4eb63cc","observation_id":"bf73d056-a96a-4243-9e60-ef44bd737356","resolution":{"observed_at":"2026-06-30T16:44:56.042065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12320","last_updated":"2023-11-21T03:32:01Z","snapshot_observed_at":"2026-08-16T14:41:38.626307Z","submitted_at":"2023-11-21T03:32:01Z","title":"A Survey on Multimodal Large Language Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2311.12320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.12320","snapshot_observed_at":"2026-07-01T20:56:14.194881Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":"ef0f8828-3a40-42cf-8dfd-98e62ec8a85e","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2311.12320","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:0b4647d496c66a483ed2b429e7446772ced9461c1e4981f2b69311c5b3af3318","observation_id":"2a7938e7-7066-4654-946c-825b7f270d77","resolution":{"observed_at":"2026-06-30T16:44:56.048382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:19203bdda325117acddfc5a9565f135aa059fa1b7e394954491e81834c00ce3e","observation_id":"d32995ca-0283-4a6c-b037-500b8d4bc502","resolution":{"observed_at":"2026-06-30T16:44:56.058909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f3df75f6efa668cf181ee820a64b2e42e50b1ca64faade87eacd86f69f8df692","observation_id":"9655550d-5953-49d1-bf53-6d7c3ad10dff","resolution":{"observed_at":"2026-06-30T16:44:56.071393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:00aa179c8a50b5f9aca162b1f55db5ef21e90013c9862d93eadbd367a02fdf3e","observation_id":"54ed0b38-7617-458e-aef5-01720f9d8b9b","resolution":{"observed_at":"2026-06-30T16:44:56.143908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:ffa2697a25b725f02110cabc908c63659470d8b9d1af64184608d0c1b770be6c","observation_id":"3ffac277-ad70-467c-b57f-62b80fb750aa","resolution":{"observed_at":"2026-06-30T16:44:56.029971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:aa5990fde4bd4cad6398ba659d7cf19b2e848e99316b206803f80fd04cdc98ad","observation_id":"a1771ba1-042a-4573-a6a8-ab14f219d7e2","resolution":{"observed_at":"2026-06-30T16:44:56.005964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.802921Z","title":"Llava-onevision: Easy visual task transfer.TMLR","venue":null,"work_id":"57248e4f-8025-47e1-982e-0f7383eaef75","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:174c331bcc55e09d2cf574245644da2719efd9fa0d3fabbf82a67760acfff46f","observation_id":"b74caffe-3ff8-41e1-ab94-d67456a15197","resolution":{"observed_at":"2026-07-08T12:44:53.804237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:6ba8b8d8f789063a16ef379a5dd45356fc3d25a7697f2a5cd9d357c2ff8ade37","observation_id":"fcf8f26a-70fb-4723-98a8-9426b2272fe5","resolution":{"observed_at":"2026-06-30T16:44:56.054097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:b02685acd59d0dda7c8a70012e58167701eea232e6cf11b92f78470c88975e4c","observation_id":"fe67a38c-3f1e-4445-8eae-97c8cec5f9ea","resolution":{"observed_at":"2026-06-30T16:44:56.101355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.774551Z","title":"Henasy: Learning to assemble scene-entities for interpretable egocentric video-language model.Advances in Neural Information Processing Systems, 37:86483–86499","venue":null,"work_id":"c686a324-1668-4585-9909-1ce48f46da4e","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:129063b267b90b50edfbf0bc60c9d9396ba95ea064977ed5e7aed3aaf5b97d1e","observation_id":"85a59b92-6efb-48bc-9707-93e9dee589eb","resolution":{"observed_at":"2026-07-08T12:44:53.776006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.14264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.131081Z","title":"Directed- tokens: A robust multi-modality alignment approach to large language-vision models","venue":null,"work_id":"3708fd21-39be-4a3d-8544-a1c1cfc0ca16","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:51bc0114ea80491705c03c359d7ffa45880c93f6f094f54b3016d316dcf259e6","observation_id":"d249392d-32e4-411a-8869-fa1b7a185066","resolution":{"observed_at":"2026-06-30T16:44:56.104225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:6849ab40513a47ebc2c2028aa01daa8f093db9f8230ab6afe5ef78374564adc0","observation_id":"163974b4-f9eb-4139-8f3f-77a3e8ea6fb1","resolution":{"observed_at":"2026-06-30T16:44:56.106523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.755841Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":"2dd8598f-6b68-4498-b08b-ae6776800281","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:94bd384d1c4a1b53bf4b359645081f3bc4dca7cb1af315e28c23ce840c9b8ee2","observation_id":"75e28c7f-a03a-491c-8cdb-8b5941800416","resolution":{"observed_at":"2026-07-08T12:44:53.757307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09777","last_updated":"2023-11-27T05:09:29Z","snapshot_observed_at":"2026-08-16T14:59:48.218608Z","submitted_at":"2023-09-18T13:58:42Z","title":"DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2309.09777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.09777","snapshot_observed_at":"2026-07-08T20:15:34.250670Z","title":"Drivedreamer: Towards real-world-driven world models for autonomous driving","venue":"cs.CV","work_id":"6f9360bd-694b-4627-8071-516c65e6696a","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2309.09777","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:1d481802dafba34d707d56c98afc0cd163757f111346108b55fc4dbc67c378a0","observation_id":"351df3a5-d6fa-4f0f-b19a-5b3d6d918a8c","resolution":{"observed_at":"2026-06-30T16:44:56.117349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.730212Z","title":"Dolphins: Multimodal language model for driving","venue":null,"work_id":"807169b8-20f2-4bcd-87dd-68e8299e0435","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:6ebc5d773be9cc83d088fa9938b0a32f5c60a3124039b2abb923ab3fc234b081","observation_id":"edce7211-b13f-4dcf-8bac-e9b4bcc8dd60","resolution":{"observed_at":"2026-07-08T12:44:53.731435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.703912Z","title":"Rea- son2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":"c758e473-be82-4fc7-b471-a0ae9394b2cb","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:e5c1ff634469a02d7a44353ed879075466434f1f463395c137d5f68b2e70220d","observation_id":"8f7fd824-9804-4732-93aa-f09306f1fe2f","resolution":{"observed_at":"2026-07-08T12:44:53.705102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.735934Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 11:635–651","venue":null,"work_id":"63f0ab5b-9c48-4cdd-b7e8-8bb9ba320c19","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:3b1b6aec54c30251335f834b87f0ec1919ed6003f5d3d059c5e70a589435f8af","observation_id":"c54f2ed0-211a-4d42-ae35-2ee7899b4b08","resolution":{"observed_at":"2026-07-08T12:44:53.737175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06048","last_updated":"2024-11-09T03:07:33Z","snapshot_observed_at":"2026-08-16T13:01:36.232837Z","submitted_at":"2024-11-09T03:07:33Z","title":"An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2411.06048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06048","snapshot_observed_at":"2026-07-04T08:59:43.214652Z","title":"An empirical analysis on spatial reasoning capabilities of large multimodal models","venue":null,"work_id":"8b692ac9-ab92-4e91-952c-e54e2621b221","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2411.06048","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:8c9253dc86089dcfaccb9fb011a71e2e9bce02837f21bb0e64388eff36c15535","observation_id":"7713b246-3966-4641-94a6-a2f2fbcaf864","resolution":{"observed_at":"2026-06-30T16:44:56.119897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05756","last_updated":"2024-06-09T12:23:14Z","snapshot_observed_at":"2026-08-18T13:29:44.835199Z","submitted_at":"2024-06-09T12:23:14Z","title":"EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2406.05756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05756","snapshot_observed_at":"2026-07-04T03:29:31.578595Z","title":"Embspatial-bench: Benchmarking spatial un- derstanding for embodied tasks with large vision-language models","venue":null,"work_id":"430a6f05-e5ff-4eb8-aaef-7ed742ffe26d","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2406.05756","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:601202bee2c10f529f63103ee0156b421797d2c7be599464cf0167c14c42ac0b","observation_id":"77b10584-e331-485b-a269-77c67ee6e5bb","resolution":{"observed_at":"2026-06-30T16:44:56.133446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.734066Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models.Advances in Neural Information Processing Systems, 37:135062–135093","venue":null,"work_id":"2d59e7cb-d5c8-46e5-bd0b-7158b959b653","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:d9940d0ac75e69ca811c8545089cf20c4a25a0afc1ba333a002419095d748a0c","observation_id":"ddf145be-575c-4c10-828b-04d397eae72d","resolution":{"observed_at":"2026-07-08T12:44:53.735349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.688981Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"6cb0bf5a-aaff-44aa-8877-2ba37b689e5d","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:63422695be0cea6c54d9ec92c43ad5aa2da3b1d9f6559288fc2b1805f3d01fc1","observation_id":"061fa39c-3333-4047-b12e-fbe3b6d5bba3","resolution":{"observed_at":"2026-07-08T12:44:53.690286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.804912Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":"e0fca169-2e83-4833-937c-c62f39c2f4aa","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:a8be0a829ccd2aa5fd7ce8378fc2493d36afaf52aec5ea3b014b00341b483924","observation_id":"7ff65849-f172-4b62-a8af-23eb11dbd7a0","resolution":{"observed_at":"2026-07-08T12:44:53.806450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.713037Z","title":"Spatialllm: A compound 3d- informed design towards spatially-intelligent large multimodal models","venue":null,"work_id":"642438c1-a3bc-496d-b8bc-180b85ce76e2","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:c9791a4bcd188ac816de0e52943beb66eef8964a54aa0b973581391094c74d02","observation_id":"fdf4a296-7595-4a16-b8cb-82407f15c720","resolution":{"observed_at":"2026-07-08T12:44:53.714442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.724440Z","title":"Robospa- tial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":"bf5b0eb6-b9ff-48eb-8177-dceae12bf74d","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:ffd2ab38ce4c27bf6860226529215da55791ce4aecefce548c7b9d3cd191ec4f","observation_id":"5f4702fa-09a1-4018-9624-164a1344e50f","resolution":{"observed_at":"2026-07-08T12:44:53.725664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:070e7a2b613f7e53f4eeedddcf6439fd2d8936be349c15e559195c6ac3f3a21b","observation_id":"557905cf-2c09-43d6-912e-8cf1e0467720","resolution":{"observed_at":"2026-06-30T16:44:56.098982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10074","last_updated":"2025-01-23T02:31:25Z","snapshot_observed_at":"2026-08-15T23:57:27.978058Z","submitted_at":"2025-01-17T09:46:27Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning","version":3},"cited_work":{"arxiv_id":"2501.10074","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10074","snapshot_observed_at":"2026-07-03T22:28:59.692534Z","title":"Spatialcot: Advancing spatial reasoning through coordinate alignment and chain-of-thought for embodied task planning.arXiv preprint arXiv:2501.10074, 2025a","venue":null,"work_id":"0862e22b-0037-4b5d-9f96-5ec002097396","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2501.10074","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:dc693148ca8906a249c39d4a71733b82b087c0901ab1d248da6bbfb7aa61f9f7","observation_id":"c178bf64-6215-4858-8932-b616a2f27228","resolution":{"observed_at":"2026-06-30T16:44:56.062222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03135","doi":"10.48550/arxiv.2506.03135","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models","venue":"Open MIND","work_id":"f971b57a-47ff-414d-80f9-50ccac0c8e78","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:0c150e00623760e2073847877b414110f9d5f0f5a50154353c363aa60302050d","observation_id":"2bd05019-9f66-47b6-9271-19ef4ba2874e","resolution":{"observed_at":"2026-06-30T16:44:56.068860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03922","last_updated":"2026-08-11T06:44:38Z","snapshot_observed_at":"2026-08-18T02:42:20.887010Z","submitted_at":"2025-06-04T13:14:13Z","title":"HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2506.03922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03922","snapshot_observed_at":"2026-08-12T02:23:50.971990Z","title":"Hssbench: Benchmarking humanities and social sciences ability for multimodal large language models","venue":null,"work_id":"88ee92d9-e38d-4285-8296-0d0298dd8b90","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2506.03922","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:28efe44b607aa4a60f8b77fdcc4455fe46a3d59310160ef25a91f95090084794","observation_id":"45a9b7c3-7ce1-40dd-8ffe-f8184af67398","resolution":{"observed_at":"2026-08-12T02:23:50.971990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.049759Z","title":"Spatial-dise: A unified benchmark for evaluating spatial reasoning in vision-language models","venue":null,"work_id":"1b8bfd94-e08b-4e1d-bc47-bef2662deb1e","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:9597ea3c1c3de5e7e9f31e2fc40b3b572b8bada7f93964fae0376caa56649a1d","observation_id":"12e0fb8a-c213-4825-8799-72f80972fec6","resolution":{"observed_at":"2026-06-30T16:44:56.051540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-16T12:46:58.006510Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2503.19707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-07-10T09:37:00.841150Z","title":"Mind the gap: Benchmarking spatial reasoning in vision-language models.arXiv preprint arXiv:2503.19707","venue":"cs.CV","work_id":"06006849-24f6-4955-9dd0-1cbe59b0fc66","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f689872afc9a0afdc97b536c602087cad9c0f12d6c409c22facf4fa45894a6bf","observation_id":"d18c83e4-783f-4d0f-898b-e86c4781003e","resolution":{"observed_at":"2026-06-30T16:44:56.045464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:48:03.213683Z","title":"Mmsi-video-bench: A holistic benchmark for video-based spatial intelligence","venue":null,"work_id":"5576e252-6316-45fb-a511-bcbf65609546","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:4ced9f5bde3f662de8ea795f223573167383271994ba5515e775373296ebee9a","observation_id":"1e7cab4a-e67c-4343-9651-9fc8462c1f2d","resolution":{"observed_at":"2026-06-30T16:44:56.056684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":"2511.04670","doi":"10.48550/arxiv.2511.04670","metadata_source":"pith","pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","venue":"cs.CV","work_id":"f715ecad-ad1d-4060-9a4c-bdb41257ef61","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:56e16efd30bacd3b472c26919c5ee80ea96a7f1880167e0e89edc65b0c770fc0","observation_id":"4a26d7b4-17ff-41c5-920d-337d4fbb55bd","resolution":{"observed_at":"2026-06-30T16:44:56.085193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.790711Z","title":"Agqa: A benchmark for compositional spatio-temporal reasoning","venue":null,"work_id":"f1803696-8088-4bca-a904-39e0adfa3195","year":2021},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:ddd2101a6f3e3be17809b7dde9da36ca1a2e8eff43df9e4b0c8575a386c8b50f","observation_id":"db16a66f-347c-4084-b50b-cd9aab044778","resolution":{"observed_at":"2026-07-08T12:44:53.792010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.778895Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"32523d79-34b7-406a-a81e-c05f63616d7a","year":2021},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:a624c5ad773b972b79c739903f6d59542c48f14b2ecab980e794ff8cddedfe23","observation_id":"5208b9b5-379e-47b1-a6a9-43a1855d0395","resolution":{"observed_at":"2026-07-08T12:44:53.780191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.23510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.147454Z","title":"Visuospatial perspective taking in multimodal language models","venue":null,"work_id":"14f557e6-572f-4c02-bff8-621a75a39260","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:df8f4c15c49e4eb73485712bc9962b7029fd0de785b4930c19b1e0534423fb19","observation_id":"103f2c57-2eb0-4448-8b8c-40e713f614d9","resolution":{"observed_at":"2026-06-30T16:44:56.148812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2602.15892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.15892","snapshot_observed_at":"2026-07-15T02:22:00.923596Z","title":"Egocentric bias in vision-language models","venue":null,"work_id":"d2f276da-fada-43b2-a32b-623ce1133706","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2602.15892","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:2b824d9b239c0fa0f2b4056e949863d8e496c531ed8eab3483114820a31ef124","observation_id":"1dc48536-9cac-4cc0-9600-e63ee7942e78","resolution":{"observed_at":"2026-07-15T02:22:00.923596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:17:02.469742Z","title":"Allocentric perceiver: Disentangling allocentric reasoning from egocentric visual priors via frame instantiation","venue":null,"work_id":"fee0579d-58c1-494f-8712-74d39b87152e","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:71049ddfb745e3bce2e2e27b2b905c93103b368c730f137b141f73b261956b53","observation_id":"2c136e4f-359a-4d3b-921e-bb845528047c","resolution":{"observed_at":"2026-06-30T16:44:56.019175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.022992Z","title":"Keep it sympl: Symbolic projective layout for allocentric spatial reasoning in vision-language models","venue":null,"work_id":"595ca94c-a175-48c1-90de-9f7b423928ff","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:541215fdde250695ec312af5d963a322a53f909482fcbf1c1ff11d75f778b78b","observation_id":"9d3240a9-9e3e-41ae-be79-769d0542c6fc","resolution":{"observed_at":"2026-06-30T16:44:56.024748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-17T13:14:57.271778Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":"2504.15485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-06-30T16:44:56.123044Z","title":"Capture: Evaluating spatial reasoning in vision language models via occluded object counting","venue":null,"work_id":"3ab36349-797a-4437-9dd1-15c00a6826d2","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:2ed91eeb60db8d9aed7af4c29689bfbd2f42764f833722dfc0e5fca8303bfa0b","observation_id":"e513a6c6-598c-42cc-946a-022c513cc61d","resolution":{"observed_at":"2026-06-30T16:44:56.124516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04059","last_updated":"2025-08-06T03:39:21Z","snapshot_observed_at":"2026-08-06T04:55:20.533084Z","submitted_at":"2025-08-06T03:39:21Z","title":"Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.04059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04059","snapshot_observed_at":"2026-06-30T16:44:56.026212Z","title":"Beyond the visible: Benchmarking occlusion perception in multimodal large language models","venue":null,"work_id":"221ed3ce-d7d6-4b6e-8f23-5c61cadae9ab","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2508.04059","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:282a0298f2e9b401b237e4432883cf2a04d94baf546958b393a32ce93bfe3557","observation_id":"ff714df9-b2d9-4417-b1c4-c8c5723470a8","resolution":{"observed_at":"2026-06-30T16:44:56.027656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.012188Z","title":"Mind over space: Can multimodal large language models mentally navigate?","venue":null,"work_id":"3d74dd71-9fff-4b6f-83ed-7acd6351f7b2","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:6a1641dfbce5e98c1c98be72ae5b3e9aee8527558f0e3fcc341ab03298340b17","observation_id":"1656cbd0-b151-4641-bd10-ddd9d3348516","resolution":{"observed_at":"2026-06-30T16:44:56.013763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:17:02.434834Z","title":"Video2layout: Recall and reconstruct metric-grounded cognitive map for spatial reasoning","venue":null,"work_id":"f1e851c5-d06f-4cb3-ac63-a58affabc064","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:0525c31569074a200bd1de40cb22d8c001be13036a6343c9952ea9db844fc739","observation_id":"dccea137-34b3-4506-8ec4-22857003cfff","resolution":{"observed_at":"2026-06-30T16:44:56.011148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12680","last_updated":"2025-04-17T06:16:11Z","snapshot_observed_at":"2026-08-18T12:09:18.030700Z","submitted_at":"2025-04-17T06:16:11Z","title":"Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12680","snapshot_observed_at":"2026-06-30T16:44:56.139813Z","title":"Embodied-r: Collaborative framework for activating embodied spatial reasoning in foundation models via reinforcement learning","venue":null,"work_id":"317f268f-f9e6-4a0c-a876-ae2ccbc772db","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2504.12680","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:b4293c139caa47b2b6ef70708d2b8fecc51824fb3097f253e99327d9e09f930c","observation_id":"d13a77b8-cd58-4f65-b461-274a47f11461","resolution":{"observed_at":"2026-06-30T16:44:56.141303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.748253Z","title":"Talk2car: Taking control of your self-driving car","venue":null,"work_id":"f8f76df0-bea6-49e4-a42c-8a92d3733285","year":2019},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:8de80788795b7450d149c880590202de51f00d529460b59d3cd32ef308805fcc","observation_id":"6f4d57fd-d34d-4953-821b-dd0e4492c6de","resolution":{"observed_at":"2026-07-08T12:44:53.749432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.761853Z","title":"Textual explanations for self-driving vehicles","venue":null,"work_id":"4fc34172-fea1-4aa6-b12c-2cc74ad56251","year":2018},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:75dd34f48534237da0db63f194c5c1be9589c5380feffe341766d6bf31c95fe0","observation_id":"053ee545-ae35-4e97-8647-5ceb13442531","resolution":{"observed_at":"2026-07-08T12:44:53.763268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06352","last_updated":"2023-12-11T12:58:54Z","snapshot_observed_at":"2026-08-16T14:35:54.051089Z","submitted_at":"2023-12-11T12:58:54Z","title":"NuScenes-MQA: Integrated Evaluation of Captions and QA for Autonomous Driving Datasets using Markup Annotations","version":1},"cited_work":{"arxiv_id":"2312.06352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06352","snapshot_observed_at":"2026-06-30T16:44:56.020289Z","title":"Nuscenes-mqa: Integrated evalua- tion of captions and qa for autonomous driving datasets using markup annotations","venue":null,"work_id":"9a5fd048-ee4f-4878-bb7c-c3744e5a1d1a","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2312.06352","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:623dcd3263b9f0d2c805e014f9495243b2711c7c551b2934739680c4ee091bee","observation_id":"6a2d3aa1-88b4-4256-b559-2dbf53d8b5c5","resolution":{"observed_at":"2026-06-30T16:44:56.021817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.10427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:44:56.128526Z","title":"Stride-qa: Visual question answering dataset for spatiotemporal reasoning in urban driving scenes","venue":null,"work_id":"0675f9ed-5c03-47a2-8795-d09e7b3aec35","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:d989e3e6cab9091b68e1438d3e8cb5ff4d51d0f2d522c1bfce9a9d958f241206","observation_id":"a55cd804-8ef1-4680-a12c-5a9d8a4e68ec","resolution":{"observed_at":"2026-06-30T16:44:56.130871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03877","last_updated":"2024-11-27T09:31:04Z","snapshot_observed_at":"2026-08-16T13:45:37.459928Z","submitted_at":"2024-06-06T09:12:30Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":"2406.03877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03877","snapshot_observed_at":"2026-06-30T16:44:56.031336Z","title":"Bench2drive: Towards multi- ability benchmarking of closed-loop end-to-end autonomous driving","venue":null,"work_id":"198e09f9-7399-4636-b63c-a4b1e4009ce9","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2406.03877","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:343fb076bdc690f634dd17ec3064fcc9c17599192ff9c660a89faadcb3c09491","observation_id":"caf445aa-9f86-451c-8aaa-8f277b2bfc7c","resolution":{"observed_at":"2026-06-30T16:44:56.032836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.699949Z","title":"Road scene graph: A semantic graph-based scene representation dataset for intelligent vehicles","venue":null,"work_id":"0031ab87-b2e8-4d24-9e7e-1e6a362bca29","year":2021},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:a78901c11a2c560df94829e1c57d385f48d6be48e311ed8f9f76cb2a39c95620","observation_id":"e8b1579c-2cc9-435d-9f7b-6116c8b0ad72","resolution":{"observed_at":"2026-07-08T12:44:53.701165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08600","last_updated":"2023-09-05T00:44:33Z","snapshot_observed_at":"2026-08-16T15:39:46.338746Z","submitted_at":"2023-04-17T20:38:07Z","title":"RS2G: Data-Driven Scene-Graph Extraction and Embedding for Robust Autonomous Perception and Scenario Understanding","version":2},"cited_work":{"arxiv_id":"2304.08600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08600","snapshot_observed_at":"2026-06-30T16:44:56.125556Z","title":"Rs2g: Data-driven scene-graph extraction and embedding for robust autonomous perception and scenario understanding","venue":null,"work_id":"c9ae4f03-711a-45ab-aecb-6a47bf2e9f84","year":2023},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2304.08600","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:9b8d0a92034d68b4ed4a4e1580047bd8b2099f9a1c4cbdb3879cf9a1b0f59a01","observation_id":"a7d5b92b-9b44-4f34-8a81-b6a08b159d92","resolution":{"observed_at":"2026-06-30T16:44:56.127056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:6f47436ab77c81447f38e9de32ad5c38b5de5375539183dad3cc1bc513733a91","observation_id":"ea6d30d4-b30e-4386-b7e3-d8cfa84120bf","resolution":{"observed_at":"2026-06-30T16:44:56.135972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:dca6ed500b1808777c696f702f18f56aa24723a77ddb397987c5beeb0b74c475","observation_id":"f769e9eb-9f84-4297-9410-d03e38befd3a","resolution":{"observed_at":"2026-06-30T16:44:56.138487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:1bdcdb309353943d9bc6ce2b43dbce77b464edf22cecaf6ea41b549098e2d07b","observation_id":"e8cafc9b-107a-40a8-a8f1-4980cfd7c725","resolution":{"observed_at":"2026-06-30T16:44:56.108882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:939f3e25a391a95c3534ce5e5e0df328d6e54246a3e2f77b443eba192ab33983","observation_id":"34a05e40-7952-4d2c-b237-17b401fe220c","resolution":{"observed_at":"2026-06-30T16:44:56.114512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:e761d7f71b1fad90e80ac9cfa1de70ef9e81748477d22cacadd66ecb6d650eb6","observation_id":"85e50d5d-3ac4-4ad4-94a2-931b68b53dd7","resolution":{"observed_at":"2026-06-30T16:44:56.122000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.743194Z","title":"Gemma 3 technical report","venue":null,"work_id":"9ba110be-b0c4-4a3d-ba6d-184fa6b0e1dc","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:0f3beacc098362b59130898f4d2698f5334cbd0474ee3b266e81857db33e1c9c","observation_id":"51583bb9-4d59-4c0a-863f-5179e44d18ed","resolution":{"observed_at":"2026-07-08T12:44:53.744293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:b252e553414b737f537aac850f3e6853afb10f472df28305efa63facfa3cb76a","observation_id":"4d7619c8-83e9-44ca-ae72-7264adb5a8e4","resolution":{"observed_at":"2026-06-30T16:44:56.146260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:ba4e01baacf8638178de875bef383bcefa32865be60e834763ba1dae8b491416","observation_id":"dbf5427a-699c-44ac-9909-e24c7be5fac7","resolution":{"observed_at":"2026-06-30T16:44:56.090190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:00d597ff028bf9aab5cca928a8718436e2834fc89217a755b181ecbed9ffe355","observation_id":"3379d742-13d3-4106-be51-1e142470df30","resolution":{"observed_at":"2026-06-30T16:44:56.081947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13719","doi":"10.48550/arxiv.2511.13719","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":"arXiv (Cornell University)","work_id":"ceb84861-8bdb-4822-864c-8e2d0ae4d322","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:dab3ad0ebc138be08df8560baff4781ffdc26035ef87323f260455e74ce33aa8","observation_id":"f0702a1e-fb16-41ec-b180-3d71a3f1cdb4","resolution":{"observed_at":"2026-06-30T16:44:56.008458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-15T14:49:21.381235Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"cited_work":{"arxiv_id":"2511.07403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.07403","snapshot_observed_at":"2026-07-07T01:16:00.407423Z","title":"Spatialthinker: Reinforcing 3d reasoning in multimodal llms via spatial rewards","venue":null,"work_id":"1d926991-cdce-49ae-9ba1-226aca6c7ec8","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2511.07403","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:9b92295013db5464e1d0a1478f47856857c9ecb893e8e08cdf2614589ec94323","observation_id":"38dfe81d-c142-4e66-b0af-0bf30c46bbe1","resolution":{"observed_at":"2026-07-07T01:16:00.407423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.694668Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"0c461e55-d2e5-4613-9d31-8ce856e6d86c","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f7d9999d114d47b5d89a70bbbbb68981fc8fcfd7bc47629dff8424c3baf2898e","observation_id":"f33e53a8-abdf-422a-b6a6-fafc3a2d35a6","resolution":{"observed_at":"2026-07-08T12:44:53.695942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.737730Z","title":"Measuring massive multitask language understanding.International Conference on Learning Representations (ICLR)","venue":null,"work_id":"9f476ff4-d008-4016-b0e3-918c9e2a568b","year":2021},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:290594055490f466f1348dc3ff725ba98c7f90db9f1e8e3f532b7f19b7566c7d","observation_id":"587c41a5-2cd0-4360-a093-042a196a5092","resolution":{"observed_at":"2026-07-08T12:44:53.738967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:45:00.507882Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"379af22d-41e1-4dcd-90ed-ba12a2ce31f5","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f84e79b8e7a71d7e53fe90740074dfd11c7ec1e388805e4049e617e9d1e23a67","observation_id":"05b314d4-1ef3-4fc2-9582-9a2ba799ee5a","resolution":{"observed_at":"2026-07-08T12:44:53.723905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.711053Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":"b8ab9916-85b3-4dcd-9a73-2c64bcc95dcf","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:04e401dc07829d3cb9d8a08f3845aac7e04a114965db1de4e7c6e24575e91695","observation_id":"054cba32-fab1-442a-bc10-bc6f296c5a19","resolution":{"observed_at":"2026-07-08T12:44:53.712450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.732020Z","title":"A coefficient of agreement for nominal scales.Educational and psychological measure- ment, 20(1):37–46","venue":null,"work_id":"e739de89-443b-4e1b-a3b7-10dcf519f95d","year":1960},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:ce6ad550078e1a776432d3f520189883e7b35755660bf92d4e5669a3a3cc6101","observation_id":"d34e47c0-cc7c-4161-843c-21f29473bc91","resolution":{"observed_at":"2026-07-08T12:44:53.733472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:37:55.461049Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"20cba820-3902-4de9-9734-46171a0b89c2","year":2022},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:e5753a6351a556c6c82111ca306f474a4552754da2b120ea6fd4ba6fc56e6275","observation_id":"b14ca13c-2e9b-4417-bc5b-f68011cbd662","resolution":{"observed_at":"2026-07-08T12:44:53.800274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.796880Z","title":"Swe-bench: Can language models resolve real-world github issues?The Twelfth International Conference on Learning Representations","venue":null,"work_id":"e65e9c81-bdad-4b27-a22e-8cc26d8fc685","year":2024},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f0fdd5ec37071daf614e260109aa3bc25c10a121d8f1d17fb47e80374c0e9bc4","observation_id":"2c90cc1f-c329-4edc-87a4-ed4957bc7ceb","resolution":{"observed_at":"2026-07-08T12:44:53.798270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":47,"verified_fuzzy":53},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2605.23176."}