{"as_of":"2026-08-14T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0af401f2a9939ddaf0860c5b757c7a45c3ccb13a723a18fed826f765da4f550","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T02:01:58.009647Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08745/citation-record","integrity":"/paper/2607.08745/integrity","json":"/paper/2607.08745/citation-record.json","paper":"/paper/2607.08745"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.249525Z","title":"Lang, et al","venue":null,"work_id":"7fa87bc3-7b26-464c-82ce-c9098178e834","year":2020},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:103756c9e3533be8bddee88fad960282dcc2429f370c1c649adb3fbfa38dac49","observation_id":"bfc42bf9-3ec6-45a5-889c-71e1d2271daa","resolution":{"observed_at":"2026-07-10T02:06:42.250635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.231161Z","title":"Argoverse: 3d tracking and forecasting with rich maps","venue":null,"work_id":"e3889f89-6e62-45a0-a4ac-91ee961f9182","year":2019},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:bea388f4c22dee7aa62e4549500fd811920df93e010f806e1f766c8ea346301f","observation_id":"84dceef0-7407-4cb7-ab56-0ba4ba2d5ef8","resolution":{"observed_at":"2026-07-10T02:06:42.232453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.235181Z","title":"Drivingvqa: A dataset for interleaved visual chain-of-thought in real-world driving scenarios","venue":null,"work_id":"0abe2e0f-8a08-4110-a3b1-fcb92ab36602","year":2026},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:93aec053bed89426f36c7454d5f0c571c28e97a036b62e92bb28ba2a87d6bc77","observation_id":"72eab2a4-57cf-49eb-84f9-1550dc09715b","resolution":{"observed_at":"2026-07-10T02:06:42.236499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.233253Z","title":"The cityscapes dataset for semantic urban scene understand- ing","venue":null,"work_id":"d35fc633-93e8-49e3-aad2-7468356b2d2b","year":2016},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:9fb8afdae61ce9ead7e631136ac8e89334b0ed1dc257fa89432ab612c84442c5","observation_id":"2313295b-6e32-4099-a1e9-35ef28916285","resolution":{"observed_at":"2026-07-10T02:06:42.234732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.237397Z","title":"Vision-based traffic accident detection and anticipation: A survey.IEEE Transactions on Circuits and Systems for Video Technology, 34(4):1983–1999, 2023","venue":null,"work_id":"3a167d85-ad37-4874-95a9-8d60415a9c62","year":1983},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:8c5971facf4a952a7a1057f05ce1dce8ddd0a2c219ef4e0f0387eecffcd5189c","observation_id":"8ef455ac-2c4a-430e-b50e-76d1b6c44a56","resolution":{"observed_at":"2026-07-10T02:06:42.238761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.242936Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"25efe2e3-8103-4c3f-b58d-a5b95406936c","year":2012},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:2fb781a573f7c4ddca0508968345bd73ea0797f29cc8870d55be40c95b2a6277","observation_id":"62fc1f11-523c-44c2-941d-3f156605b111","resolution":{"observed_at":"2026-07-10T02:06:42.244268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.244941Z","title":"Computer vision for autonomous vehicles: Prob- lems, datasets and state of the art.Foundations and Trends in Computer Graphics and Vision, 12(1–3):1–308, 2017","venue":null,"work_id":"1461b766-3709-4e55-84dd-302d99e41be7","year":2017},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:389ae1ff96ba4d1efaa181f2940e6c714978c64df7294bf8f25675eca341b2c7","observation_id":"690730ff-9ec8-4863-96eb-ff3c45598f35","resolution":{"observed_at":"2026-07-10T02:06:42.246423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.246975Z","title":"Nuplanqa: A large-scale dataset and benchmark for multi- view driving scene understanding in multi-modal large lan- guage models","venue":null,"work_id":"0ef6e54a-044f-4b45-b5dc-153ed6dafb6b","year":null},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:166f95d705945737b0cd4086cf296d4810ea4064aa1ac21dd568452ed0f7133c","observation_id":"d6c2bce7-542b-489d-9e11-bd69cd7452c4","resolution":{"observed_at":"2026-07-10T02:06:42.248714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.251254Z","title":"Toward driving scene understanding: A dataset for learning driver behavior and causal reasoning","venue":null,"work_id":"cf04fe7b-599a-428a-b8ce-0a5e644225f1","year":2018},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:d2d0761a5505e57341bd9e5aba3b3ce13bcbcb6a3a0317f91072c5e676a28cbc","observation_id":"52d3d124-b2db-4145-8703-6638226949f2","resolution":{"observed_at":"2026-07-10T02:06:42.252557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.239123Z","title":"Scala- bility in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"860c8de7-d471-42f5-b31b-4a47fee75c0a","year":2020},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:c49b42af75de960f4f5980ddb9cd9f84bd93c070e359cbeb1e2cc36f394c7fd8","observation_id":"28a46e76-4422-4f62-ab7e-dc603ce7575a","resolution":{"observed_at":"2026-07-10T02:06:42.240411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.240979Z","title":"Embodied scene understanding for vi- sion language models via metavqa","venue":null,"work_id":"d0932b55-ccd4-4be2-94c6-47434b0ecb50","year":2025},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:8e0a122d916d0d835b7ee19881d3f958952ebe34509a43a084639ad54346ae22","observation_id":"00067a6a-50f3-49fc-835b-5ee56923127b","resolution":{"observed_at":"2026-07-10T02:06:42.242260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.237199Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"6b92fff2-9878-4af6-98e4-7f6161713c19","year":2020},"citing_paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T02:01:58.009647Z"},"links":{"citing_paper":"/paper/2607.08745"},"observation_digest":"sha256:da423639d188af8512781156be11100cbb4ef0f41fef31a0903bdfe95f9f5228","observation_id":"7d2d75f2-f885-4192-b229-100c998caab2","resolution":{"observed_at":"2026-07-10T02:06:42.238542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08745","last_updated":"2026-07-09T17:46:24Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-30T15:11:56.952585Z","submitted_at":"2026-07-09T17:46:24Z","title":"AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2607.08745."}