{"as_of":"2026-08-07T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9a04bd77354e1713636e74bce3a5ab9063bfb427d942015a03b181aec801efc","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:52:02.847623Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:14:11.109840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:14:18.588892Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"cited_work":{"arxiv_id":"2507.09815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09815","snapshot_observed_at":"2026-06-30T06:14:18.588892Z","title":"S., and Abdel-Aty, M","venue":null,"work_id":"99ec7eb2-c523-4d46-bd66-49e15850b0e7","year":null},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2507.09815","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:26f10582d873471f3e5247124019e832ccca88a2a1521d46ebf67137554d2b24","observation_id":"a0715a46-5816-47e9-9d8a-debf9fbb15c5","resolution":{"observed_at":"2026-06-30T06:14:18.592347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09815/citation-record","integrity":"/paper/2507.09815/integrity","json":"/paper/2507.09815/citation-record.json","paper":"/paper/2507.09815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.160469Z","title":"Vru-cipi: Crossing intention prediction at intersections for improving vulnerable road users safety","venue":null,"work_id":"b6727c15-081e-4fb8-b99f-08f5720070c1","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.531647Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:e627357ac8a8ab0b946133b70c2fa10fc81518d15a8ee072a1392f9819f202da","observation_id":"38fd8538-24f6-4d2c-aae3-bd2b897c11cf","resolution":{"observed_at":"2026-08-06T17:52:04.168594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.134157Z","title":"Video-to-text pedestrian monitoring (vtpm): Leveraging large language models for privacy-preserve pedestrian activity monitoring at intersections","venue":null,"work_id":"b4a80544-91e5-4720-957f-ee40309d350e","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.537855Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:b87b301cb716fb4abb3a70ec88c902537ef32aa70c9185e2aa3b07b98d807c01","observation_id":"a286f007-514b-417a-ba85-c1b0ad9a845a","resolution":{"observed_at":"2026-08-06T17:52:04.141310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09949","last_updated":"2025-05-15T04:07:55Z","snapshot_observed_at":"2026-08-07T15:45:13.014860Z","submitted_at":"2025-05-15T04:07:55Z","title":"Advanced Crash Causation Analysis for Freeway Safety: A Large Language Model Approach to Identifying Key Contributing Factors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09949","snapshot_observed_at":"2026-08-06T17:52:02.545707Z","title":"Advanced crash causation analysis for freeway safety: A large language model ap- proach to identifying key contributing factors.arXiv preprint arXiv:2505.09949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.545707Z"},"links":{"cited_paper":"/paper/2505.09949","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:2db1a2b419b1db5ed43bc6bbe28e838dd45f07139e76da82029868b416fdf2ac","observation_id":"c9eec18b-ec51-4a31-9852-9f02a56849cb","resolution":{"observed_at":"2026-08-06T17:52:02.545707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.112858Z","title":"Vrucrosssafe for crossing intention prediction of vulnerable road users for improving safe crossing at in- tersections","venue":null,"work_id":"9edcaa38-1345-4539-8f0a-ef61df20edc6","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.552861Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:51ad5151fa126f8bee36e888cf3e6fdd3e03c8a63d01362430b4c0adb24245f8","observation_id":"4c7d569a-bd47-4b21-9ea6-6e2ada4e1c66","resolution":{"observed_at":"2026-08-06T17:52:04.119283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.088832Z","title":"Evaluating the safety impact of mid-block pedes- trian signals (mps)","venue":null,"work_id":"d44c6631-ee5c-4500-ae5a-62b2e8f81b94","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.558371Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:444d29e62bcc914ea12d4eb40aabd2011ee4b9e6c69d1b6819b33bd279f7e0e7","observation_id":"900be371-71f9-4061-af6e-6b844eb9e059","resolution":{"observed_at":"2026-08-06T17:52:04.096318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.067874Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":"69e1986a-a253-4bb9-8663-5600ee5ff10f","year":2016},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.565180Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:6a95a4bf06bdfb47c4dff18dafac9981ecc1770df5352bb0284874a9916ff924","observation_id":"d48006a3-202e-439e-8f47-478ccb091f61","resolution":{"observed_at":"2026-08-06T17:52:04.073991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T17:52:02.572056Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.572056Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:ee5dac2096f9e6682b8210a794435e25f4d84c918be49aa8addc62045679cea8","observation_id":"3416a708-a128-4df1-b6b7-69178b9aaa4e","resolution":{"observed_at":"2026-08-06T17:52:02.572056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.049876Z","title":"Ex- panding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":"322c036e-be1b-48e5-b1f2-3ede83c14abd","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.581554Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:4b3d0c47c53f6a79ec50e7502925f77bb6d52ff9fd3888ad5e0651c7400271ca","observation_id":"d0d84b7b-0a81-4c40-8868-ba56219f95f6","resolution":{"observed_at":"2026-08-06T17:52:04.056688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:04.024658Z","title":"Analysis of automatic evaluation metric on low-resourced language: Bertscore vs bleu score","venue":null,"work_id":"3fff28b1-e8c7-4d4e-8cf0-ba7b377b646e","year":2022},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.587138Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:dfb63a097c8257095f06ba4eaa73a932859d68ead11dc6d81cc767c552051812","observation_id":"1222fda1-ac94-414e-ba6d-3b64c5e3a3c1","resolution":{"observed_at":"2026-08-06T17:52:04.030930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.996692Z","title":"Dada-2000: Can driving accident be pre- dicted by driver attention? analyzed by a benchmark, 2019","venue":null,"work_id":"bd375bd9-51b9-4f75-b894-17bd361f908a","year":2000},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.592310Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:fa2b497e9941e1eb201c236038c57c022929de9ab1593454853234d23997ad13","observation_id":"96043b8d-26ac-469c-bf94-cff9df10cbbe","resolution":{"observed_at":"2026-08-06T17:52:04.003953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.972576Z","title":"Cognitive accident prediction in driving scenes: A multimodality benchmark, 2023","venue":null,"work_id":"36bc6580-a30b-4503-a852-4d1b2ae58f2a","year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.601084Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:4d4ee5795c01731c78e26a3ed5a75cfbac080117258a7dddbdfd7dae30271d03","observation_id":"a6e8ee17-cba3-4894-8f62-5c425b77185e","resolution":{"observed_at":"2026-08-06T17:52:03.981806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.949254Z","title":"Abductive ego-view accident video understanding for safe driving per- ception, 2024","venue":null,"work_id":"274ff570-5ca5-4941-9157-21225a4f9f26","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.606670Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:6c026f47b496698cd299a04a1c83b6de79da385bd7acb770d3154bdc3601c9e1","observation_id":"b4f48d70-7253-4fe7-bebe-0ff6d0042f61","resolution":{"observed_at":"2026-08-06T17:52:03.955901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.925043Z","title":"Pedestrian traffic fatalities by state: 2019 preliminary data, 2020","venue":null,"work_id":"d2c2ee0d-2d6b-460d-93d4-d549fbab7068","year":2019},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.614469Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:290660f9ea2fe0d61c4782546ad97b2e0d5485330188ae18f6e1781df47c43f4","observation_id":"b45b3eae-6f09-4bed-a23c-72ea6f3cc09f","resolution":{"observed_at":"2026-08-06T17:52:03.931712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.892790Z","title":"Multi-frame, lightweight & efficient vision-language models for question answering in autonomous driving, 2024","venue":null,"work_id":"70fefe90-fd5b-4ae2-9e18-b204ddc1781c","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.619633Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:a178a3061b67d08c05a42324ff67d368b413c586de8ba0651282d59042a6df90","observation_id":"bcbfc582-c3a6-4e7a-a638-26e887c54f5f","resolution":{"observed_at":"2026-08-06T17:52:03.907323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.868376Z","title":"Cipf: Crossing intention prediction network based on feature fusion modules for improving pedestrian safety","venue":null,"work_id":"4fdc41fa-62eb-4670-9799-571e3e343072","year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.626061Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:a36d694355cba7dfa094dbe9a7664817583e17a23fda68363cc86319f4dfe934","observation_id":"c6c2d9de-2839-414b-b9cf-b4ca06f49391","resolution":{"observed_at":"2026-08-06T17:52:03.876626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.835283Z","title":"An attention-guided multistream feature fusion network for early localization of risky traffic agents in driving videos","venue":null,"work_id":"5becb7fa-abaa-4268-b3f2-b97c1198fbf8","year":null},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.630519Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:b343270c552b975a7660b4d730dc8555bb5901c9dbbfff51b866c61d28232354","observation_id":"437af149-efc2-48e1-91b8-ea87e6358e35","resolution":{"observed_at":"2026-08-06T17:52:03.846650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.812305Z","title":"Textual explanations for self-driving ve- hicles","venue":null,"work_id":"ebc6251a-32e8-4c58-9820-a2d2c967a546","year":2018},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.635560Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:ead9ab52da6de8ecd51449660498f64b163e9eded226443464b50742ce653449","observation_id":"c69289b2-c008-457b-9f99-2ad02ae87c93","resolution":{"observed_at":"2026-08-06T17:52:03.819327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.791011Z","title":"Pedes- trian crossing direction prediction at intersections for pedes- trian safety","venue":null,"work_id":"0a6f9d64-26f8-4153-86da-99339b2f5ac8","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.641083Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:d4ca96b363be830bd38588d3c1acf69ab865e28e9796b83025145463ccb5c08a","observation_id":"8f6a7a2c-9d2d-4365-af24-9d981b308623","resolution":{"observed_at":"2026-08-06T17:52:03.797623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.773861Z","title":"Meteor: an automatic met- ric for mt evaluation with high levels of correlation with hu- man judgments","venue":null,"work_id":"055a21c0-6bf6-407a-b8cd-57443f394df0","year":2007},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.645935Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:7ca0117f5bcc41255daf9c066cf9c1243b827751f3776775752d3947b80f5d3c","observation_id":"66c24616-51c5-4880-bfb7-f9bc7114862a","resolution":{"observed_at":"2026-08-06T17:52:03.779038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.650906Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.650906Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:a584c1c5a9b81d10445979648bb6b559353b67fde3cf2661d58a99296f5237b3","observation_id":"e6d39b54-35fc-42bc-884e-64849a02c3e4","resolution":{"observed_at":"2026-08-06T17:52:02.650906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.739025Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models, 2024","venue":null,"work_id":"0efd5e39-eb9d-49af-9709-a3492d2e604c","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.655775Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:96f14bc51aa9f69d51d5b479e3fe63c5f39380b4218e21d2b685748e39ed058e","observation_id":"b4889e41-dde1-40b2-84fe-6b05226fc6c1","resolution":{"observed_at":"2026-08-06T17:52:03.744812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.719315Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":"3e6b626d-85a4-47e1-a47d-20f48c6e58a4","year":2004},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.660510Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:e462604d9caa383cbbcfc234ec93b9679190322a631ac2d75b005e1ec283ff5d","observation_id":"a1e39bb1-e5e9-4e0d-b595-34030f2e210b","resolution":{"observed_at":"2026-08-06T17:52:03.725604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.699715Z","title":"Aligning llm with human travel choices: a persona-based embedding learning approach, 2025","venue":null,"work_id":"2750743d-c4f3-4b54-929d-713206e2594b","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.664906Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:6e2f8b78de2d451de4eed7cc16f3f452f3f5d5c99d870839d7a9e5b3aa0ad058","observation_id":"8df008b4-e0f6-46d6-b7fd-79f86aee2def","resolution":{"observed_at":"2026-08-06T17:52:03.706129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.674453Z","title":"Toward llm- agent-based modeling of transportation systems: A concep- tual framework","venue":null,"work_id":"1a06b699-4839-4dd1-a1e3-5787d4e6c1f3","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.669408Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:c46eeda69d8f28a65d68ef6b13dfc04ff36db9787cb0be4516c3aeda59d2dc57","observation_id":"4f4e8c86-8a73-4805-9d35-81fd31d78cfe","resolution":{"observed_at":"2026-08-06T17:52:03.681997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.651045Z","title":"Video-xl-pro: Reconstructive token compression for extremely long video understanding, 2025","venue":null,"work_id":"c9e9560b-4cbb-4472-af3b-094557fa8dc3","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.673938Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:c196688675d26f2f9156a79a4aadb0ce3d149727d22415c758e190b8d80fa9f4","observation_id":"cb349dfc-58fd-4f56-abd9-84981299b6a4","resolution":{"observed_at":"2026-08-06T17:52:03.657476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.631068Z","title":"A simulation-based frame- work for urban traffic accident detection","venue":null,"work_id":"0250bf31-f19b-45c7-b7cf-a0cc129aa23f","year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.678862Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:149560e59b87c5c708352f611923bc067aa4cb12f221ef9aad543ce35a148561","observation_id":"9af2e01a-8dec-450a-9ea8-adc7cca15778","resolution":{"observed_at":"2026-08-06T17:52:03.637337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.613995Z","title":"Dolphins: Multimodal language model for driving","venue":null,"work_id":"1bfc0a69-3651-4741-917f-510362bec6a7","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.684273Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:b224719079fd5dc6c6e1f830b569da69f2f5878c854ed98b855a563e03183183","observation_id":"75f5519a-8631-45c4-bc38-d279deceaf54","resolution":{"observed_at":"2026-08-06T17:52:03.619441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.690495Z","title":"Drama: Joint risk localization and captioning in driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.690495Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:3ae805d54a3e1814b112ba9532ebab3850b6db4f8db4154486094c94e8d8ce8f","observation_id":"f356e168-ccf3-40f2-b327-152b3748334d","resolution":{"observed_at":"2026-08-06T17:52:02.690495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14115","last_updated":"2024-09-26T15:30:00Z","snapshot_observed_at":"2026-08-05T01:20:20.561142Z","submitted_at":"2023-12-21T18:40:34Z","title":"LingoQA: Visual Question Answering for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14115","snapshot_observed_at":"2026-08-06T17:52:02.695281Z","title":"Lingoqa: Visual question answering for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.695281Z"},"links":{"cited_paper":"/paper/2312.14115","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:3cfd03876bd419a8789109d07e2282bbdcdcaa3dac1e844a5b9f5c1731cfa0c4","observation_id":"3a135f0c-687e-4e62-9b96-62710e03f9e5","resolution":{"observed_at":"2026-08-06T17:52:02.695281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.583407Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"4b4d1430-7af8-4c57-a558-fa1eaa26c967","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.700318Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:dea30fdbbe1c93897c4d3c7bc689b19433396bced55b85f897ba6e3e1c77ab87","observation_id":"16337822-e145-47c9-aed5-43ffa7e03484","resolution":{"observed_at":"2026-08-06T17:52:03.588197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.566464Z","title":"Idd-x: A multi-view dataset for ego-relative important object localization and explanation in dense and unstructured traffic","venue":null,"work_id":"b3c81457-1a2e-48ed-82a2-3d675fe67aeb","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.706429Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:9cf792b1bb12275384695a5443992a567af5ddeb4904ff0dc8ec99905b704db7","observation_id":"11413f66-0aef-43f1-b08d-9d71f1e4d99f","resolution":{"observed_at":"2026-08-06T17:52:03.572315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09636","last_updated":"2023-07-18T20:56:41Z","snapshot_observed_at":"2026-07-06T15:55:36.746891Z","submitted_at":"2023-07-18T20:56:41Z","title":"Traffic-Domain Video Question Answering with Automatic Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09636","snapshot_observed_at":"2026-08-06T17:52:02.711142Z","title":"Traffic-domain video question answering with auto- matic captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.711142Z"},"links":{"cited_paper":"/paper/2307.09636","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:7cf1f66c7e670c1d24783e73ba693db2ceb3b8ea47e044ac88f9d3b42d021c2b","observation_id":"3b07107c-ab52-4cce-8d92-bd624950b985","resolution":{"observed_at":"2026-08-06T17:52:02.711142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14836","last_updated":"2024-02-20T05:04:58Z","snapshot_observed_at":"2026-08-03T10:52:29.042946Z","submitted_at":"2023-05-24T07:40:50Z","title":"NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14836","snapshot_observed_at":"2026-08-06T17:52:02.716601Z","title":"Nuscenes-qa: A multi-modal visual ques- tion answering benchmark for autonomous driving scenario","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.716601Z"},"links":{"cited_paper":"/paper/2305.14836","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:7be4b88f13f44f21311b5214a7d93dc8ffe75c75bf86ead8e4ed50488182353c","observation_id":"32d4c2d8-6703-42a8-9cd3-9e62123a26fc","resolution":{"observed_at":"2026-08-06T17:52:02.716601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.549685Z","title":"Comet: A neural framework for mt evaluation, 2020","venue":null,"work_id":"fa1afb11-a88f-4812-9670-94b63fe43d75","year":2020},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.721525Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:c4ac47d37fee7029ab91b363c7794ff9e69839ad35a05ce228f2707170252bd6","observation_id":"7daffbfd-aaa1-4595-a611-50f5b666af8f","resolution":{"observed_at":"2026-08-06T17:52:03.554026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.533575Z","title":"Rank2tell: A multimodal driving dataset for joint importance ranking and reasoning","venue":null,"work_id":"96493411-f75d-440f-b8ae-8526ef831a7d","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.728469Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:514100d476a97dc7681bafdbf89662352e72aa20f79a4227471f4c455e36a6b4","observation_id":"80e23840-b2fd-4f2a-91aa-eb47000d2447","resolution":{"observed_at":"2026-08-06T17:52:03.538447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.518286Z","title":"Mobile-videogpt: Fast and accurate video understanding language model","venue":null,"work_id":"da947053-f6dc-488d-a4af-a157414784ef","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.733454Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:8570dd1881a8ae838d28211efb27cac02ef90851c64e8cf4d96fee800d6bfeb5","observation_id":"336768a4-ab1f-4dac-be11-3dc0bd9dbc10","resolution":{"observed_at":"2026-08-06T17:52:03.522934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T17:52:02.738153Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.738153Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:92bbfd4d470130036b4b07456be56554dd21ca219fdb4065e919ded7d826ce47","observation_id":"dab9472d-2449-4130-acf1-d9b6d776d216","resolution":{"observed_at":"2026-08-06T17:52:02.738153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-06T17:52:02.743420Z","title":"Drivelm: Driving with graph visual ques- tion answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.743420Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:f8eba25de41c60c0b8a437ba4a71d6d3d8ce1194df065e06a57440d15a1a49b1","observation_id":"ae7b551c-13a4-44c9-ac95-77ba4b1a8538","resolution":{"observed_at":"2026-08-06T17:52:02.743420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.503079Z","title":"Gemini: A family of highly capable multi- modal models, 2025","venue":null,"work_id":"48e93bec-fd3c-4fb8-a960-4a8da890bf4d","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.749174Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:15e08e4e70f0e07118759e36cff9cda60dec225dd1f043120f80be9991bf1dd6","observation_id":"7c694c99-57e3-41b4-a3eb-6f139c2149ad","resolution":{"observed_at":"2026-08-06T17:52:03.508237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.350187Z","title":"Qwen2.5-vl, 2025","venue":null,"work_id":"6b70e92f-efc2-43f9-be47-82b58dba9d37","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.754171Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:3f6340e9c98321af98c2a527bb2673036246d56f15d6a2670d15d19438696415","observation_id":"685bdf84-233c-4eba-b433-f5fe17aa4fdf","resolution":{"observed_at":"2026-08-06T17:52:03.492546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.333974Z","title":"Temporal stability of factors af- fecting injury severity in rear-end and non-rear-end crashes: A random parameter approach with heterogeneity in means and variances","venue":null,"work_id":"7e7dbf7d-2e5e-42e3-9801-16b221dcae98","year":2022},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.758892Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:bc18d6b7c6d87f5dc1578939fc485ee5a3a9f6fb888942b8e4301697b20d9467","observation_id":"82fbeec4-4dcb-4c56-86ba-962cabc0eb05","resolution":{"observed_at":"2026-08-06T17:52:03.339225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.318655Z","title":"Effects of speed difference on injury severity of freeway rear-end crashes: Insights from correlated joint random parameters bivariate probit models and temporal instability","venue":null,"work_id":"8ccb6bf0-aa84-41d5-9f86-86134af343c1","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.763278Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:fc520663e4f450a34f361da8a2b3a9607c311fc3af6afa0a89a1468cc5d3caf1","observation_id":"c24b6dd6-2bae-4b08-8e43-92737626ad03","resolution":{"observed_at":"2026-08-06T17:52:03.323571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.301508Z","title":null,"venue":null,"work_id":"58936d30-11c6-4f4c-9692-aaacc8881bd5","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.767659Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:280d51e89d05c81df9ed1399b6fd5009f9e9200a5991d4b10ddbcb33766499fa","observation_id":"41cfab0a-69d1-4015-bbcb-7c15b58792bb","resolution":{"observed_at":"2026-08-06T17:52:03.306708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.285822Z","title":"Tunnel crash severity and congestion duration joint evaluation based on cross-stitch networks","venue":null,"work_id":"1af1a9e9-344c-4906-8f2f-62b6d1f3fa4a","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.772368Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:4b6f8d389ab36d8f61f8e0cf9d2e45f77e908f9d08709cde018ed36e00dee044","observation_id":"ece9ad69-d10b-45f1-805d-21a54e3633bf","resolution":{"observed_at":"2026-08-06T17:52:03.290523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:52:02.777498Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.777498Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:7e8f01545e0741b4918c7109d4f0caf2cf7ac845a3a16aaeb76f6c9331c324d3","observation_id":"92ee0e55-b875-4625-925e-3d6e5ea59736","resolution":{"observed_at":"2026-08-06T17:52:02.777498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.267780Z","title":"Deepaccident: A motion and accident prediction benchmark for v2x autonomous driving, 2023","venue":null,"work_id":"118ec045-b01e-498a-b2b5-d89e264a840a","year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.785623Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:20a9f2103e9351d19b33a9db5af98cff0a3d31ac8842f6b7ee6c448d92648700","observation_id":"a5f0adfb-f05a-4258-b9b6-f92db2fe9a35","resolution":{"observed_at":"2026-08-06T17:52:03.274491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.247713Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for video rea- soning over traffic events, 2021","venue":null,"work_id":"75e00472-2ef0-40ec-980a-275a6da259c9","year":2021},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.790612Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:d6b2c7b8dba4459d07d6e549ad6cede0f612d6e1f11bedf3e66213c92157c860","observation_id":"9ca26b4d-d584-4b4f-82d4-e1a36294fa85","resolution":{"observed_at":"2026-08-06T17:52:03.255075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.229839Z","title":"Explainable object-induced action decision for autonomous vehicles","venue":null,"work_id":"bf73201a-4d07-487a-93da-46b00e3e7545","year":2020},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.796026Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:f67ad93df5245bfba692e32bb99c3d2a3a8297c57e857a0897455fa9f5c6bfd6","observation_id":"0c910f5c-6e54-498e-99b8-df0fbcb643b8","resolution":{"observed_at":"2026-08-06T17:52:03.235014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.214009Z","title":"Crandall, and Ella M","venue":null,"work_id":"535ea9b2-4dad-4a53-ba95-196e9f69e017","year":2019},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.801047Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:f1bbc48afef39f13f3e8f8f1e3b55ae48e4582b24e2a8b45c8a16726898c134c","observation_id":"d6cbc2ca-0415-4034-9640-498b2112f7e1","resolution":{"observed_at":"2026-08-06T17:52:03.219329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.197704Z","title":"Crandall","venue":null,"work_id":"108a8c56-feab-45a1-b807-1fafa29fb0b4","year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.806325Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:23bc01f2280b6461a96cd490e1919d23b3da8313526d080cade457eec19f87ef","observation_id":"d68548f2-2f28-4ccd-9ae7-f12fafcc7a7d","resolution":{"observed_at":"2026-08-06T17:52:03.202439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.182304Z","title":"same seman- tics, different structure","venue":null,"work_id":"9495d94c-60cb-4068-8a81-3ae71e385822","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.811518Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:6e3f33bb2a5c32be611989f30e34d146a5ab6dc8dd2e3690609aed90c0ddd9be","observation_id":"6e8c4e6c-c1c2-416a-a55b-57ecf3b82c3a","resolution":{"observed_at":"2026-08-06T17:52:03.187076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T17:52:02.823886Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.823886Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:6351a36724f317088f713d9d6641ba5ab5b87a168286fc463d787b68378030d4","observation_id":"abc1d762-fc31-46b7-8a7e-647025476b46","resolution":{"observed_at":"2026-08-06T17:52:02.823886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.140896Z","title":"Traffic Accident Bench- mark for Causality Recognition","venue":null,"work_id":"9c2e8615-3129-4f38-b912-5ac16571f65b","year":2020},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.828834Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:7c2feeee76e7da4f96808c53b324dc4cc96bb2ba159535dce2645cbee2692bbf","observation_id":"6342a1e9-37af-4a02-ac42-f6e3fba4d624","resolution":{"observed_at":"2026-08-06T17:52:03.147044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.121888Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":"432b0249-2bc6-489d-a561-0c3d6e935772","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.833604Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:a622e3873f49b5beeb841c3c5c24d27496a56a4c20abb25122ad7cdb796de830","observation_id":"1b469906-e568-4ae3-baf5-eeb8da683ab3","resolution":{"observed_at":"2026-08-06T17:52:03.126898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.100657Z","title":null,"venue":null,"work_id":"d7cd7c37-6aa3-45f6-9529-78dd2af7dd63","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.838046Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:66889c05f7ede72aca01e0e055a4e68387c082e7d919f577f91ba763b9420771","observation_id":"a29d88a2-c1c7-4c82-9408-08847403189d","resolution":{"observed_at":"2026-08-06T17:52:03.106328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.079620Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"93aeec35-1def-4674-84d9-3dfbf874143b","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.842449Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:53ae061d4d03b88bd3daaeaa6ebed49441014ff608f2c066ff11896c7b9bc89a","observation_id":"7d3019b9-0d0d-45dd-92a4-62edd4999733","resolution":{"observed_at":"2026-08-06T17:52:03.086374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.055891Z","title":"sunny day","venue":null,"work_id":"98e3c349-abcf-4fee-b3e2-fc95e8e041dc","year":2025},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.847623Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:f973bfddfadd4f45cc9477c4335c17c098f8c69e49c6d4e2e504e81495511a78","observation_id":"44828347-caa7-490c-a762-eae894dfb419","resolution":{"observed_at":"2026-08-06T17:52:03.063471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.160394Z","title":null,"venue":null,"work_id":"6951b391-5f8f-4d6b-92d2-a5909eb5fac4","year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":684,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.818786Z"},"links":{"citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:698380d50ee422caa5eec8e10ff4fe5e8611496a0a960496929e65b3fbdc82a4","observation_id":"39424a1c-65d8-4bea-98d6-86b4f1e89ebf","resolution":{"observed_at":"2026-08-06T17:52:03.166377Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":13,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2507.09815."}