{"as_of":"2026-08-22T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eea1de5b6188d96e87dc799726c13183285621b34e847560545da53026a10e7d","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:15:45.532030Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:27:59.560871Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:49:42.189472Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-08-07T14:03:00.036079Z","title":"X-driver: Explainable autonomous driving with vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-14T01:14:39.568702Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:00.036079Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:940dd7754af436f263f037548a3e51a2bcf5f51748c16bbf2ff3e403ea94ad97","observation_id":"2d0e1a59-1d73-4cf8-9aac-8b259f7daff6","resolution":{"observed_at":"2026-08-07T14:03:00.036079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-08-15T18:27:59.560871Z","title":"X-driver: Explainable autonomous driving with vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19769","last_updated":"2025-06-24T16:34:56Z","snapshot_observed_at":"2026-08-17T11:32:57.046929Z","submitted_at":"2025-06-24T16:34:56Z","title":"A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-15T18:27:59.560871Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2506.19769"},"observation_digest":"sha256:f02c5887a5bcae6ca50b935a03e7316ce0889248ec28a29999fa4da047956f12","observation_id":"0623d51f-b139-4d91-8b6a-ecf2434ed5ee","resolution":{"observed_at":"2026-08-15T18:27:59.560871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.05098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-07-04T08:49:42.189472Z","title":"X-driver: Explainable autonomous driving with vision-language models","venue":null,"work_id":"d30137d0-d0db-4e28-8bf1-783e3f45c3a2","year":2025},"citing_paper":{"arxiv_id":"2512.10719","last_updated":"2026-07-12T18:02:23Z","snapshot_observed_at":"2026-08-18T06:00:49.206808Z","submitted_at":"2025-12-11T14:59:07Z","title":"SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T12:17:54.325055Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2512.10719"},"observation_digest":"sha256:d7bb433223f93933d125433b0a1782d1b9cad1d959e46828d787067d036358aa","observation_id":"7b858c97-7156-4c81-8df5-4d9720b93ef1","resolution":{"observed_at":"2026-05-22T12:21:31.325241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-08-03T17:07:44.176133Z","title":"X-driver: Explainable autonomous driving with vision-language models.arXiv preprint arXiv:2505.05098, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10719","last_updated":"2026-07-12T18:02:23Z","snapshot_observed_at":"2026-08-18T06:00:49.206808Z","submitted_at":"2025-12-11T14:59:07Z","title":"SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:07:44.176133Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2512.10719"},"observation_digest":"sha256:75de5db8b90733b566277dd587a145c335c3695a75e8518125f5f5d43babd5a8","observation_id":"e42fad78-cc8a-4dcd-888c-e6ec05e1644d","resolution":{"observed_at":"2026-08-03T17:07:44.176133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.05098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-07-04T08:49:42.189472Z","title":"X-driver: Explainable autonomous driving with vision-language models","venue":null,"work_id":"d30137d0-d0db-4e28-8bf1-783e3f45c3a2","year":2025},"citing_paper":{"arxiv_id":"2605.21139","last_updated":"2026-05-22T01:55:27Z","snapshot_observed_at":"2026-08-17T06:02:56.102205Z","submitted_at":"2026-05-20T13:14:28Z","title":"Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T04:44:48.349384Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2605.21139"},"observation_digest":"sha256:f5f00808888d12388c2a97032d98d26df5da20c4ef2186114f739508984b33f2","observation_id":"1187fb0a-1b66-444f-bffb-9ad5f0c7211d","resolution":{"observed_at":"2026-05-21T04:49:35.802436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.05098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-07-04T08:49:42.189472Z","title":"X-driver: Explainable autonomous driving with vision-language models","venue":null,"work_id":"d30137d0-d0db-4e28-8bf1-783e3f45c3a2","year":2025},"citing_paper":{"arxiv_id":"2605.21139","last_updated":"2026-05-22T01:55:27Z","snapshot_observed_at":"2026-08-17T06:02:56.102205Z","submitted_at":"2026-05-20T13:14:28Z","title":"Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:10.143179Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2605.21139"},"observation_digest":"sha256:186cade50986af506c30c0066fcb00f4d58c951bee61ac69a640c854744173d6","observation_id":"c3cd183f-c643-4993-8613-fa7b2d7b0014","resolution":{"observed_at":"2026-05-25T05:55:24.831108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.05098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05098","snapshot_observed_at":"2026-07-04T08:49:42.189472Z","title":"X-driver: Explainable autonomous driving with vision-language models","venue":null,"work_id":"d30137d0-d0db-4e28-8bf1-783e3f45c3a2","year":2025},"citing_paper":{"arxiv_id":"2606.22617","last_updated":"2026-06-21T17:47:31Z","snapshot_observed_at":"2026-08-14T14:55:35.058161Z","submitted_at":"2026-06-21T17:47:31Z","title":"OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T10:58:41.305619Z"},"links":{"cited_paper":"/paper/2505.05098","citing_paper":"/paper/2606.22617"},"observation_digest":"sha256:8c7de5d7dbc83b93adf9a62482f2b65bdfc3737613c3a3fba75ae34daf19b5c7","observation_id":"19be5ab9-7030-4a42-b81d-8fad4a096b44","resolution":{"observed_at":"2026-07-04T08:49:42.190928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05098/citation-record","integrity":"/paper/2505.05098/integrity","json":"/paper/2505.05098/citation-record.json","paper":"/paper/2505.05098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.443712Z","title":"Advances in neural information processing systems35, 23716–23736 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.443712Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:dc20b812c0925ef72132a6f9d9493306ea86a81f6b2e5e6fcc08c0cf912b779a","observation_id":"45280317-e624-4f18-83de-c6a1ce5f5a3e","resolution":{"observed_at":"2026-08-15T23:15:45.443712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.783648Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":"571492bc-172f-42ac-ae87-84e4d42703b9","year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.449666Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:ade26e2c0cbc4fd12190f22088b27b12400fa7a21da7f8cea6afb80f376603a0","observation_id":"e2e559fa-815a-4d78-8663-678405281241","resolution":{"observed_at":"2026-08-15T23:15:45.788810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.454777Z","title":"Advances in neural information processing systems33, 6840–6851 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.454777Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:68955a43b11d20cc254ecbf4cfe4dc5d074a9528b87149f6426db7189e0deb20","observation_id":"606cc350-6bb7-4bf1-a33a-23b03993af2e","resolution":{"observed_at":"2026-08-15T23:15:45.454777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.460740Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.460740Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:d473362c68e1b8aab37822d6bc6e49e20efb6cdc703d58e9c77bc4db0c7bc837","observation_id":"ec22c60c-23b3-4881-bf98-284254609060","resolution":{"observed_at":"2026-08-15T23:15:45.460740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-21T08:56:38.112795Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-15T23:15:45.465682Z","title":"arXiv preprint arXiv:2410.23262 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.465682Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:700f9dfe6293379f09a32a6d20483d52176daad3ed504801d2a4f4b1e41b4843","observation_id":"b132ddb7-ad6a-42aa-92eb-cb3b4e025d57","resolution":{"observed_at":"2026-08-15T23:15:45.465682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03877","last_updated":"2024-11-27T09:31:04Z","snapshot_observed_at":"2026-08-16T13:45:37.459928Z","submitted_at":"2024-06-06T09:12:30Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03877","snapshot_observed_at":"2026-08-15T23:15:45.472077Z","title":"arXiv preprint arXiv:2406.03877 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.472077Z"},"links":{"cited_paper":"/paper/2406.03877","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:32d12f5315668922521291b62fc9e728195d2c36464e500740a7aa66876222f9","observation_id":"f89aff9a-eba9-4323-8233-284056338ab4","resolution":{"observed_at":"2026-08-15T23:15:45.472077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07234","last_updated":"2025-03-10T12:17:38Z","snapshot_observed_at":"2026-08-16T12:51:33.103151Z","submitted_at":"2025-03-10T12:17:38Z","title":"CoT-Drive: Efficient Motion Forecasting for Autonomous Driving with LLMs and Chain-of-Thought Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07234","snapshot_observed_at":"2026-08-15T23:15:45.477931Z","title":"arXiv preprint arXiv:2503.07234 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.477931Z"},"links":{"cited_paper":"/paper/2503.07234","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:bfa04712791229a15ca164e1c2819394574c1683687f47654da7cea6a2218633","observation_id":"0f147d1b-2f4c-4bd1-837a-951594fe98f6","resolution":{"observed_at":"2026-08-15T23:15:45.477931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.482746Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.482746Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:5d8497ef03804980385d2f4b44219b1776ea568340b4ada00e813f28df70ebd1","observation_id":"3798d937-c05d-4fc7-a2e2-f9e1d7f72f00","resolution":{"observed_at":"2026-08-15T23:15:45.482746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02025","last_updated":"2024-12-02T23:08:38Z","snapshot_observed_at":"2026-08-16T09:27:09.923375Z","submitted_at":"2024-12-02T23:08:38Z","title":"PKRD-CoT: A Unified Chain-of-thought Prompting for Multi-Modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02025","snapshot_observed_at":"2026-08-15T23:15:45.487299Z","title":"arXiv preprint arXiv:2412.02025 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.487299Z"},"links":{"cited_paper":"/paper/2412.02025","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:7d1d984169614e2b8ec518d8f529e390b733f27d3c601726e15cd7158a7c2f88","observation_id":"b0694065-ef49-4648-a00d-7cf133ba5eac","resolution":{"observed_at":"2026-08-15T23:15:45.487299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.492098Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.492098Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:b557aec374dab27e60ac525a0a3464a8799f6b7ae2e92d2222aff5042f9cf717","observation_id":"3edbf027-31ef-43e1-9e5f-dce4ed68b9ed","resolution":{"observed_at":"2026-08-15T23:15:45.492098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.728465Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"21e47540-0865-4f53-9ce2-d1881c819756","year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.496721Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:12d1d01fcc8ea7d90d607f6245345d8d8f75438ee568ca01c02ac1c3642bec62","observation_id":"4edb6cf2-930d-47f1-84df-24a8431d6232","resolution":{"observed_at":"2026-08-15T23:15:45.733727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.501453Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.501453Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:8f0f83661d7ba9995ef04983a4346bc5f2611211560fb3c7e296cfdb58245e87","observation_id":"0adde3b6-28d8-4563-b1f1-dea7b5bca563","resolution":{"observed_at":"2026-08-15T23:15:45.501453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.506631Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.506631Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:db97ab01f9b5f2c3bd338f374a1065b08ae1bd1a86e7ddf5efc5f07e7840a963","observation_id":"e40b16ef-3c04-4c19-80fa-61365e6a86d9","resolution":{"observed_at":"2026-08-15T23:15:45.506631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:15:45.692002Z","title":"Ieee Access (2024)","venue":null,"work_id":"34b73b29-82ae-48a2-b812-86788489c2e5","year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.511297Z"},"links":{"citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:c8d470f5c1a32f043f596609679d2fe3ac7488c8905f2a32bd88c91220a39214","observation_id":"a9daf08b-434f-498f-85db-28c8209ada85","resolution":{"observed_at":"2026-08-15T23:15:45.697695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16996","last_updated":"2024-03-25T17:59:01Z","snapshot_observed_at":"2026-08-16T14:06:34.394777Z","submitted_at":"2024-03-25T17:59:01Z","title":"DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16996","snapshot_observed_at":"2026-08-15T23:15:45.515982Z","title":"arXiv preprint arXiv:2403.16996 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.515982Z"},"links":{"cited_paper":"/paper/2403.16996","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:bc7deca41aae5af06f3c58b3a1ee53719f6d2de70cc470ffb05b32ec1b53be10","observation_id":"6942ee02-1272-4e4d-b017-f4bb4c571dba","resolution":{"observed_at":"2026-08-15T23:15:45.515982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14917","last_updated":"2025-02-19T09:50:44Z","snapshot_observed_at":"2026-08-21T17:49:00.247080Z","submitted_at":"2025-02-19T09:50:44Z","title":"Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14917","snapshot_observed_at":"2026-08-15T23:15:45.521876Z","title":"arXiv preprint arXiv:2502.14917 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.521876Z"},"links":{"cited_paper":"/paper/2502.14917","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:fab7f434e2730d23a754d67f664e9a5437836779d5d3544e83fcbf317bb2254d","observation_id":"eb96e54f-d738-4ef7-bacb-b26d15024d8c","resolution":{"observed_at":"2026-08-15T23:15:45.521876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-15T23:15:45.527291Z","title":"arXiv preprint arXiv:2408.11039 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.527291Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:ce7c480c87f3d23484eedecb950383bc33e5c95d536c115fcde751901f451736","observation_id":"5726c19e-fbff-4c1a-b676-16b3d835c2b6","resolution":{"observed_at":"2026-08-15T23:15:45.527291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02205","last_updated":"2024-02-07T13:09:15Z","snapshot_observed_at":"2026-08-19T17:59:16.867970Z","submitted_at":"2024-02-03T16:38:25Z","title":"GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02205","snapshot_observed_at":"2026-08-15T23:15:45.532030Z","title":"arXiv preprint arXiv:2402.02205 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:15:45.532030Z"},"links":{"cited_paper":"/paper/2402.02205","citing_paper":"/paper/2505.05098"},"observation_digest":"sha256:44f1d22fdf080544e52d6a13237f8c206ea284d8f5a3ef07ead32b206f85f384","observation_id":"87557ba0-f5fa-404f-bbbd-d8d470bed1fd","resolution":{"observed_at":"2026-08-15T23:15:45.532030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05098","last_updated":"2025-06-03T11:30:21Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T11:32:52.873949Z","submitted_at":"2025-05-08T09:52:55Z","title":"X-Driver: Explainable Autonomous Driving with Vision-Language Models"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 7 inbound Pith citation observations for arXiv:2505.05098."}