{"as_of":"2026-08-12T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4c4cca38c334f9aca840cd0bd7a9527f5f505fe0d8aef67540500dd1b5a5cd0","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:14:11.109840Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:15:13.957224Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30220","snapshot_observed_at":"2026-07-30T12:08:02.361140Z","title":"Lan, Z.; Sun, L.; Walter, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-09T12:12:12.772273Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T12:08:02.361140Z"},"links":{"cited_paper":"/paper/2606.30220","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:c372313a19a936541185ba58be37944b3d3f313091e362ef70c93e7273ee1839","observation_id":"fb9a72ae-3a9b-467b-b250-5d8640e3197a","resolution":{"observed_at":"2026-07-30T12:08:02.361140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30220","snapshot_observed_at":"2026-08-01T10:15:13.957224Z","title":"Lan, Z.; Sun, L.; Walter, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-09T12:12:12.772273Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:13.957224Z"},"links":{"cited_paper":"/paper/2606.30220","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:c5f610227de9af444feeb5cd2e54a8b15d4e22a387d88fb74eeff1b2926bd8ff","observation_id":"08613a70-6534-43ac-805b-5d14fc85d25f","resolution":{"observed_at":"2026-08-01T10:15:13.957224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.30220/citation-record","integrity":"/paper/2606.30220/integrity","json":"/paper/2606.30220/citation-record.json","paper":"/paper/2606.30220"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:19a05a60a9d9c7634e9381a843a57700dfa16f8e6e1389d7a782cf883bd9f7d3","observation_id":"1e364f0f-4414-484a-8593-95681bd6caf2","resolution":{"observed_at":"2026-06-30T06:14:18.544223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:59:32.407782Z","title":"Aofei Chang, Le Huang, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, and Cao Xiao","venue":null,"work_id":"e797b732-3929-4e8b-9103-1dbd2f056fec","year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:dc5af402c05a85ca5d409d0f27683720544c3c45b9671513235ac546eaf8db9e","observation_id":"daa1d942-08ea-4bb0-810c-d6dd88364ec3","resolution":{"observed_at":"2026-06-30T06:14:18.547646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:8b01af301a3e128298edacfedd166d53efbc2906ed2cfcb34604aa16065fbf4a","observation_id":"5fc94880-bb2f-4090-b09a-692695eff023","resolution":{"observed_at":"2026-06-30T06:14:18.554272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:31.614779Z","title":"train on the test set","venue":null,"work_id":"d64190e9-9a3b-4e12-a394-8b75927f8bd5","year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:01208d0c453efcfc95c43dfe2a4777ca3b0456d9b093e18a3d16052bec3bebc8","observation_id":"1d7aac15-7aa4-4732-8fc6-f2d2ddde606e","resolution":{"observed_at":"2026-06-30T06:14:18.557284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:5fc82d38eff82aa247e8377c20bf45d97548f5f9ca5d945c79b7c97b5842fecb","observation_id":"83c8b099-376e-4940-80a7-e7f2feba3c14","resolution":{"observed_at":"2026-06-30T06:14:18.550293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"Words or vision: Do vision-language models have blind faith in text? In 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:f8f060ef77d6e0818964ef3d3df240ffcb8b66e9f0d6d633515520c4b5169855","observation_id":"c3ab84cc-4b58-4d19-a6bd-b6b31f6be870","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2734.2025","doi":"10.1109/cvpr52734.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Freeman, Frédo Durand, Eli Shechtman, and Xun Huang","venue":null,"work_id":"d0e5199d-8907-47b1-905a-07ab8b623a4c","year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:2eef077916237a3b5ea41f124a282ccaafd7e3b78f1afc464c8f7406ea450648","observation_id":"b9e2e139-f95f-4e12-9a41-46bbe689c212","resolution":{"observed_at":"2026-06-30T06:14:17.812087Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:06.316117+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:06.316117+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:58ab2c67f44a2843fe908e0ace677663aa543ce7b8622ae9a405a022e546da67","observation_id":"8eb521de-6f96-46a2-b234-cb41c556b7b4","resolution":{"observed_at":"2026-06-30T06:14:18.598593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09425","last_updated":"2026-04-10T15:38:00Z","snapshot_observed_at":"2026-08-11T12:26:16.700135Z","submitted_at":"2026-04-10T15:38:00Z","title":"Do Vision Language Models Need to Process Image Tokens?","version":1},"cited_work":{"arxiv_id":"2604.09425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09425","snapshot_observed_at":"2026-06-30T06:14:18.603998Z","title":"Do Vision Language Models Need to Process Image Tokens?","venue":"cs.CV","work_id":"6fd29a28-1854-47eb-8fa8-036af7930af3","year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2604.09425","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:88343b4510ddee0b27a329d7034566934351d452921296a1c2042caf522da0a2","observation_id":"ed81f1fa-7da7-435f-9647-6c9504e00fd6","resolution":{"observed_at":"2026-06-30T06:14:18.605692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26636","doi":"10.48550/arxiv.2509.26636","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accidentbench: Benchmarking multimodal understanding and reasoning in vehicle accidents and beyond","venue":"arXiv (Cornell University)","work_id":"a1ff4c5d-2b1a-48cf-9105-caf70c2dc907","year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:77d867da96f23d8be278d507c0845d461ee0cc8c8f05bb93d72c736abaee9e2e","observation_id":"68879b39-a139-4fad-a962-e2e03b9870cd","resolution":{"observed_at":"2026-06-30T06:14:18.599307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-10T11:50:06.525402Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"cited_work":{"arxiv_id":"2507.09815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09815","snapshot_observed_at":"2026-06-30T06:14:18.588892Z","title":"S., and Abdel-Aty, M","venue":null,"work_id":"99ec7eb2-c523-4d46-bd66-49e15850b0e7","year":null},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2507.09815","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:d5c5adb5e127acf76ce8f57d61b0a9a438761d298627cfbbae398e2dd0907c24","observation_id":"a0715a46-5816-47e9-9d8a-debf9fbb15c5","resolution":{"observed_at":"2026-06-30T06:14:18.592347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22843","doi":"10.48550/arxiv.2511.22843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"d327e745-2f93-4aae-8d6f-cba7415a0cde","year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:21fb3f5d4fa00c6203c3f0350ce723e1c7a33e712619f011da33b7b50fd60e67","observation_id":"468a8dbc-ae18-4519-a684-ffc81b210f9d","resolution":{"observed_at":"2026-06-30T06:14:18.602790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:a1f69485daf95b03ea088ae88c65c6eaa7a0e083dd2ba39d14ff49bccb44d93e","observation_id":"81997d68-dc64-4062-a352-15a48ce81e85","resolution":{"observed_at":"2026-06-30T06:14:18.578203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:41.892057Z","title":"Understanding language prior of lvlms by contrasting chain-of-embedding","venue":null,"work_id":"df75cf90-0712-4c74-acfb-61dd921ba1b9","year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:1368cfe8771bdcb0001ef40cbc69467e71730bd176fbde9fa34bc90d934b210c","observation_id":"bae40ca8-26ad-4ca5-92d8-138f00f4da29","resolution":{"observed_at":"2026-06-30T06:14:18.587644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-11T18:58:42.433278Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:1ff1fea8771b142e0292bf0a1fd34f767a4822c6d2df3fcd7e3e19a3cc529c34","observation_id":"365b3d41-34c0-4c51-bf09-e04b99c0b6c3","resolution":{"observed_at":"2026-06-30T06:14:18.581710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09364","last_updated":"2026-04-13T13:46:40Z","snapshot_observed_at":"2026-08-02T12:17:24.434335Z","submitted_at":"2026-04-10T14:36:07Z","title":"Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts","version":2},"cited_work":{"arxiv_id":"2604.09364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09364","snapshot_observed_at":"2026-07-02T16:17:09.180472Z","title":"Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts","venue":"cs.CV","work_id":"2691f87b-4194-4e45-a0e2-4406c06db559","year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2604.09364","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:71c258efec52481e7a237113c9c7adb870524689e9cc37ad4f77078292c55196","observation_id":"6d595c44-01a6-4ad5-bd4e-a7b700ece113","resolution":{"observed_at":"2026-06-30T06:14:18.572004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2407.15754","doi":"10.48550/arxiv.2407.15754","metadata_source":"pith","pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","venue":"cs.CV","work_id":"f6bb6dd9-35f5-4788-9063-af4d76699147","year":2024},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:bfb837f92e9e2d9a5ee39d6ce0441e7eb73e99eac3bd98f9a91d3119bb78c942","observation_id":"e61ca1cd-6bcb-4d80-80f7-7efbe79f15d5","resolution":{"observed_at":"2026-06-30T06:14:18.602974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-10T21:39:35.298437Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"cited_work":{"arxiv_id":"2501.04003","doi":"10.48550/arxiv.2501.04003","metadata_source":"pith","pith_arxiv_id":"2501.04003","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data, and metric perspectives","venue":"cs.CV","work_id":"49b27706-ae9a-4184-a534-7be1eb8cb706","year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2501.04003","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:d0047be9296c07d64a742eeb38911128073ad148e7ea55a522debb0aafec7842","observation_id":"28ac769d-8bc6-4dff-b4c4-b4d879a81dd3","resolution":{"observed_at":"2026-06-30T06:14:18.584457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:18.582823Z","title":"Beyond accuracy: Evaluating visual grounding in multimodal medical reasoning","venue":null,"work_id":"e0463709-2df6-4727-be75-fbea0c7099da","year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:882c3d5b143408a76f623aabe60cf1ee8e85a60945711f776cff5dc561fbba06","observation_id":"ef53ed70-ff35-49b9-ac16-710152423cf0","resolution":{"observed_at":"2026-06-30T06:14:18.585953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05117","last_updated":"2026-04-06T19:22:48Z","snapshot_observed_at":"2026-08-10T20:58:01.238928Z","submitted_at":"2026-04-06T19:22:48Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","version":1},"cited_work":{"arxiv_id":"2604.05117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05117","snapshot_observed_at":"2026-06-30T06:14:18.593976Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","venue":"cs.CV","work_id":"2ad83861-2cbb-4467-b789-b17540578574","year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2604.05117","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:7ac9ef87ac73fa6affa414bbb016b7f174d67eb9189faf2097c61c7c5262736b","observation_id":"bf63b4d9-f67e-4861-b864-62478fbce937","resolution":{"observed_at":"2026-06-30T06:14:18.595304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.04264","doi":"10.48550/arxiv.2406.04264","metadata_source":"pith","pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","venue":"cs.CV","work_id":"346256da-dd21-4cc3-9a98-519467614854","year":2024},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:6aacb9666a5298723ad0abc2e28908adf1fbaf112fbe7e63899dd5b1a8984e64","observation_id":"b1a90ab7-aeb1-4544-b5e2-f6ecaa9d7cee","resolution":{"observed_at":"2026-06-30T06:14:18.571984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"Dataset Videos Avg","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:7bbdf11abd80e4f1550009f9e2e7ff5ce6bbe6fbbbb06e4a638fb460d20e7e36","observation_id":"242a7a44-f182-4792-8574-ec9c43acc111","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:65b911836cc9a54b281579069ca701127cbe1241851350c3a16b7451b12a451d","observation_id":"0b2e5574-9611-4483-aefc-3b6e98ab426b","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:e84babc4ad4c643ef23986c96a27ea50ead0a6c7ddedf7743e3f58830f46e4a3","observation_id":"d2800445-960d-429d-99a4-d755904df3dc","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:f840ab6a5a2bfb343c85942964af819d177b0d7f01a1d80bbfc3875fac9b4c92","observation_id":"b7d99861-7fcb-4e90-a1e9-4d1d78276ab7","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"In multimodal systems this manifests asmodality collapse, where language dominates prediction regardless of visual input (Sim et al., 2025; Deng et al., 2025)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:e282399f1897999467ae90dcd8e644b4dc44f5c053f7061517a1869f41b18659","observation_id":"f9db1599-f84a-4884-942b-65b412814a24","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"Existing auditing approaches either apply binary filtering by removing questions a blind model answers correctly (Asadi et al., 2026; Zhang et al.,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:a11928e484c25ba5b231a98f16d8a0303eef1e3b6b7ec17d72332e7e3f0fcf9b","observation_id":"d0f20afc-500f-476b-88b3-3e6da75e40cc","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"Binary filtering discards visually ambiguous but grounded questions; dataset-level metrics cannot identify which individual questions are shortcut-prone","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:794242f398c11b7809499dda943b2d1c1b32bf4af06b5a0f3f96ee2578836e04","observation_id":"f94cb3ce-3bcb-4be5-a8b0-c016635fa455","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"Videos can reach approximately 16 minutes, posing a practical challenge for models under a fixed frame budget","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:57a98b8d16e0a5fd7a2142ecbc9b56c4655e5884ff6fdc8ea3a569a55bec3d6e","observation_id":"cc854ff6-84d6-4973-b38b-1027dca88007","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:14:11.109840Z","title":"A substantial share of what these benchmarks measure is answerable without any video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:d270bf581e3b3a4714d8d0a2dad2ba0d7ece6bb2d172721914cac8838a8833e2","observation_id":"07379e89-a66b-4d84-8454-3d7042e13d9b","resolution":{"observed_at":"2026-06-30T06:14:11.109840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:02:15.815492Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":9,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2606.30220."}