{"as_of":"2026-08-07T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21a949dc75c2c0fa1b8d566dc0dc703029d688e703d90a1acfb0ffaa51adbb95","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:07.779736Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:39:27.242094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"cited_work":{"arxiv_id":"2507.02074","doi":"10.48550/arxiv.2507.02074","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Akter, I","venue":"arXiv (Cornell University)","work_id":"6afdab24-94d0-40a0-9d70-bb045b5dbe27","year":2025},"citing_paper":{"arxiv_id":"2604.15332","last_updated":"2026-03-09T16:15:28Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-03-09T16:15:28Z","title":"Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T14:46:41.877762Z"},"links":{"cited_paper":"/paper/2507.02074","citing_paper":"/paper/2604.15332"},"observation_digest":"sha256:3e17fe3207f43653ab9e2ea4d4bb3e0595d26b35342667585296e617f5bcaa93","observation_id":"290e8f37-2e24-426b-9fd2-ef980f75c9ae","resolution":{"observed_at":"2026-05-15T14:50:04.412900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"cited_work":{"arxiv_id":"2507.02074","doi":"10.48550/arxiv.2507.02074","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Akter, I","venue":"arXiv (Cornell University)","work_id":"6afdab24-94d0-40a0-9d70-bb045b5dbe27","year":2025},"citing_paper":{"arxiv_id":"2606.01737","last_updated":"2026-06-01T06:01:04Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T06:01:04Z","title":"TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T14:39:27.242094Z"},"links":{"cited_paper":"/paper/2507.02074","citing_paper":"/paper/2606.01737"},"observation_digest":"sha256:3b3ecb8950892f1e9dadac32c7b3965bb6d3f2f6232f9597d44d161dcb77f114","observation_id":"eaa701fc-b87b-4e5a-b9bf-14c87c2f02c3","resolution":{"observed_at":"2026-07-01T23:06:20.629333Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02074/citation-record","integrity":"/paper/2507.02074/integrity","json":"/paper/2507.02074/citation-record.json","paper":"/paper/2507.02074"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.707781Z","title":"Traffic monitoring and accident detection at intersections,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.707781Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ff4caa05cf5de6e85896fd0d8f86d4384a4fde11855b7deeae09921fc6ff5776","observation_id":"7a0a023e-1640-479c-8230-95ecd1fee14f","resolution":{"observed_at":"2026-08-06T20:43:01.707781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.751587Z","title":"A survey of vision-based trajec- tory learning and analysis for surveillance,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.751587Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:0612b0da6fc79bbbd9fcfba8f5d115476671a90c7ad7ff677febe497e90911f6","observation_id":"c181588d-b6cb-4a3f-bc51-1a7a23a84639","resolution":{"observed_at":"2026-08-06T20:43:01.751587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.863066Z","title":"Trajectory-based anomalous event detection,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.863066Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:94863272d0acec3e2b5fc00de9e0e7f717467fd9b30a53b8643f0d2021ee2e0b","observation_id":"eb5f2631-df82-4955-818f-e45ad5f2f003","resolution":{"observed_at":"2026-08-06T20:43:01.863066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.915387Z","title":"Development of artificial neural network models to predict driver injury severity in traffic accidents at signalized intersections,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.915387Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:73a11a784674b4410b0bfc80847c7b429f216237ebba48f699d9505480e51d41","observation_id":"af03812a-3686-4184-84ee-a0e3a288fe7d","resolution":{"observed_at":"2026-08-06T20:43:01.915387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:01.988904Z","title":"Severity of driver injury and vehicle damage in traffic crashes at intersections: a bayesian hierarchical analysis,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:01.988904Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:58e9651ffc95bdd94903cab31c475e969c43b2724eee432f4a97f86ed3290656","observation_id":"7475dead-8473-4927-bb23-ac060d15e6e1","resolution":{"observed_at":"2026-08-06T20:43:01.988904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.099954Z","title":"Two-stream convolutional networks for action recognition in videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.099954Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:020b75ab6a40fefa6eb270f93d8c4bc9e8b498d6e1523216a0a68b6ca969de56","observation_id":"2dcb33f7-1c66-470b-8d73-e91b9984e679","resolution":{"observed_at":"2026-08-06T20:43:02.099954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.171761Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.171761Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:734737a9c37b6e4eb5c5684bd3625431c50ed5ad8f70a1d6a5da1832c71d9a92","observation_id":"b9e77609-0058-4ad8-8a89-7f5eecde20c5","resolution":{"observed_at":"2026-08-06T20:43:02.171761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.230067Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.230067Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b733800fc5877087ab11cab1c5fcbf16c096bd390f32874274b87e35737cdc91","observation_id":"c2a74191-4297-4f9a-acf7-95cd6c5c69a5","resolution":{"observed_at":"2026-08-06T20:43:02.230067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.302154Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.302154Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:67e0edc4eaf88ffa4aa2d7696ec84f99c234c53f542362eca73e3d8c353cfeae","observation_id":"c1e8de97-b561-499b-9a09-5acac53269e2","resolution":{"observed_at":"2026-08-06T20:43:02.302154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.364456Z","title":"Real-world anomaly detection in surveillance videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.364456Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:5f25cb1345069ff6a84f60fa99405ef7e236013b42ee68a930289503ecda2103","observation_id":"8ae9d92e-0c55-4c14-b260-63172779b037","resolution":{"observed_at":"2026-08-06T20:43:02.364456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.398110Z","title":"Future frame prediction for anomaly detection–a new baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.398110Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b1b5d9afbec40b40a76fbf4744ce10853b7e278f7f0bfcfc48679ca1deb63dc2","observation_id":"762e0d57-d62c-4959-8d6e-688d5eb3f115","resolution":{"observed_at":"2026-08-06T20:43:02.398110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.461330Z","title":"Learning memory-guided nor- mality for anomaly detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.461330Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:17a59faaa2a8b9e425efdf1bea0ec0d83f3d1cf77dcab215e8ecb31a0b76fe0c","observation_id":"45769cbc-de9b-4547-9175-371aa7ada1b0","resolution":{"observed_at":"2026-08-06T20:43:02.461330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.527630Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.527630Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c846648c6b95cf4a4deee82ecb923310cf14a53c66d04626b9a8fc7061f9b195","observation_id":"8a4ed46c-ec87-4d43-9dbf-1810b13cdf36","resolution":{"observed_at":"2026-08-06T20:43:02.527630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.565716Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.565716Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9980e7043b3e53d737299f9f5422d67f51d90f59821d4409d5c533bfb2506629","observation_id":"0d915eb2-cc12-4d91-a601-a02dd232d72c","resolution":{"observed_at":"2026-08-06T20:43:02.565716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.649490Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.649490Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:413ed26e8166379aa23ac904f2b82a086c9063a5bbd2a5964b062bcdff4a05e2","observation_id":"cc6bc847-2d23-4df1-be3b-f5ccf41a3dda","resolution":{"observed_at":"2026-08-06T20:43:02.649490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.726302Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.726302Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:305d8273e4212e5d0df5375a3d413acafc3dcec7ab2508bdf832b64fa0d5bc35","observation_id":"a7cd5b0e-f429-4709-8374-5fc24d5e9207","resolution":{"observed_at":"2026-08-06T20:43:02.726302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:43:02.777750Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.777750Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:22e8f347024ee271b63d4397809862ee430c68b3936709187aa166aff795c1f8","observation_id":"ca12865d-0f16-49f5-8ce6-5b324cb69aa9","resolution":{"observed_at":"2026-08-06T20:43:02.777750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:02.860733Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.860733Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:76f8f84038ff65f5a53ed1ca43e1850e884d9ab076f50a4364173ba4d9d80677","observation_id":"2320f2c0-64dc-4ff6-a19c-0b4923c6b4b7","resolution":{"observed_at":"2026-08-06T20:43:02.860733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.971898Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"e482bdf7-496a-4307-ae10-6c36167af8c9","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.905256Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:afedb8fa0faf8fca6afeb6b8d927910a372361f43669d57e9b72db8567ec1d10","observation_id":"ef9a3f3c-0c3d-4a13-a339-aecce4443c8a","resolution":{"observed_at":"2026-08-06T20:43:18.064337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.818707Z","title":"Anomalous video event detection using spatiotemporal context,","venue":null,"work_id":"89447a78-cb17-4dbd-b84f-fb284539f5b0","year":2011},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.943513Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:0366f58ab0f7f62a04a7f6590c3282d567eb9d43c9219a57c53ef531a04aa60b","observation_id":"7da91b94-5ee5-4c89-92c3-19dd261cdbed","resolution":{"observed_at":"2026-08-06T20:43:17.890932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.569304Z","title":"Detecting anomalies in people’s trajectories using spectral graph analysis,","venue":null,"work_id":"8dc93213-6f7a-4572-bf00-615424dbb206","year":2011},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:02.974628Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a99b2fa34cf13504cebea2972c8d4afc29190cca569ebbf633c9a3d9675d8a9e","observation_id":"46d4f0b0-2231-4793-95df-c756a1ab9b1c","resolution":{"observed_at":"2026-08-06T20:43:17.678953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.369923Z","title":"Using support vector machine models for crash injury severity analysis,","venue":null,"work_id":"3f9a18dc-0b26-4037-9fbd-f9ef4c53e57f","year":2012},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.022540Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:1b7a356956aa8fa7b20d4c5afe9a8426a3fe744796a762ed88043e0b6d335a25","observation_id":"314d5834-1e69-40c3-9d01-9abd50c48051","resolution":{"observed_at":"2026-08-06T20:43:17.464120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:17.207985Z","title":"Accident detection system using image processing and mdr,","venue":null,"work_id":"352a95f5-bae9-46d4-974b-d555caf3e33c","year":2008},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.096962Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:13bcbffbd5952efc88e3b7a48de424b1438eb21de7bd889ff657329a2551b0d7","observation_id":"9540b7bf-4036-4920-9371-8967656132ea","resolution":{"observed_at":"2026-08-06T20:43:17.285156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.987237Z","title":"Temporal segment networks: Towards good practices for deep action recognition,","venue":null,"work_id":"6763f3ec-4798-4bcf-8f7e-3d281a3a9660","year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.146316Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:8b0dd49c7561e574db3fad66932d35c3db5d133db6a5a9fdeafe5d6cdc86a698","observation_id":"66facb1f-0cab-46fa-ac98-36c9e68c0d40","resolution":{"observed_at":"2026-08-06T20:43:17.095290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.809422Z","title":"Multimodal machine learning: A survey and taxonomy,","venue":null,"work_id":"d1e240b0-77fb-4657-97f2-68ed20c4d2cf","year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.180713Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4dfa0e16dc336dcc5158b95e6dc26e65ecf376388c6acfe81d258ebdf2f6dfa4","observation_id":"c6f9de2a-893b-4ad6-a4ce-5c6cf1c02cf2","resolution":{"observed_at":"2026-08-06T20:43:16.847350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.639624Z","title":"Multimodal deep learning,","venue":null,"work_id":"1eeff43c-8816-476d-bc4e-ef3080622444","year":2011},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.231501Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:907e9da66ae1d3603d46eca1d7dbf7ced558825870b07cd696c1833e11e659f3","observation_id":"f350ee47-b512-4855-9074-cec27d8e6948","resolution":{"observed_at":"2026-08-06T20:43:16.714894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.471468Z","title":"Deep multimodal learning: A survey on recent advances and trends,","venue":null,"work_id":"d38cce52-12d1-44d3-ab97-255bfdebb574","year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.284396Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f3630c571cd11e29ea2d75f817115d9a04657f1a32785aa069228690b777e3a0","observation_id":"545500c2-2f2f-4e0a-b70f-1704dd55d722","resolution":{"observed_at":"2026-08-06T20:43:16.548682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T20:43:03.339629Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.339629Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ceb48c9d383ac4d9d038495f0a361e97fc9f1d4b5c5a2c00704373e51c9e1c28","observation_id":"354e4939-3157-42f6-b4cd-52aaf15c6c4d","resolution":{"observed_at":"2026-08-06T20:43:03.339629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.259273Z","title":"All in one: Exploring unified video-language pre-training,","venue":null,"work_id":"b15c6bf0-d3c9-4266-9daa-5ac56fe07c70","year":2022},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.378057Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:3116d9993785391ce3a0aa4c1761250ef036dd9d92c6cbc565e631bdbab037fc","observation_id":"ccb2bec7-8af5-441a-aa14-603706962798","resolution":{"observed_at":"2026-08-06T20:43:16.365975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:16.025447Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":"b2d6fdfe-1567-4aa1-9a0e-5b794bb469ec","year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.426557Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:3340bdafc2c149b159462be2363ae3a4018d6120e0a83439337012e81396d389","observation_id":"6da57f0e-1e22-43e5-89db-908caa2860bc","resolution":{"observed_at":"2026-08-06T20:43:16.104420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:03.452329Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.452329Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:32e4f6eef4191aca622dff64da9580e288b05e1628f0b23fb7438a531a05707a","observation_id":"542aa650-d6ad-4e3c-8889-155d0b67985d","resolution":{"observed_at":"2026-08-06T20:43:03.452329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.805617Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite,","venue":null,"work_id":"291f1936-5f60-4101-83a5-e90ab308e9df","year":2012},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.511845Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:fab2099fffe9bfb464c32e4ae838179ca55643f548d4b9006f271d92acf37cf7","observation_id":"ba54830f-f768-497f-bf37-d5e80076dc7e","resolution":{"observed_at":"2026-08-06T20:43:15.881441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:03.545890Z","title":"Edge computing: Vision and challenges,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.545890Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ec432e11dd0a02d2b2700c142244d66affe78eb0d70dc6b903e0a014d6ea4931","observation_id":"19ce6e3b-dbdf-4dd9-901a-bc713e0c3bdf","resolution":{"observed_at":"2026-08-06T20:43:03.545890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:03.594786Z","title":"Edge intelligence: Paving the last mile of artificial intelligence with edge computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.594786Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:086d03f12be612ec3e391259d076a80efc074b014f8214a62333ee982bd46bdc","observation_id":"e2e764c7-9eec-447c-9be3-1f8a6ff2552c","resolution":{"observed_at":"2026-08-06T20:43:03.594786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.545879Z","title":"Videobert: A joint model for video and language representa- tion learning,","venue":null,"work_id":"0bec8dc4-5c61-46c4-97a9-ed6a3b20e284","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.634399Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f42ed9b1271eab4e3c7b2816c4344dfd3bec731f844dd795dff3774596b77432","observation_id":"3bba2dc6-21de-4146-94df-ce35b2cb5aaa","resolution":{"observed_at":"2026-08-06T20:43:15.615669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.390519Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"90dedb0f-2175-45d8-bf26-8ea7443ea1cf","year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.667379Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:be165697a21d2c5ea89a326901912b07f566f504980d3fe1302584d1bb295f8f","observation_id":"bd6011d1-151f-439f-a5ed-162557e87440","resolution":{"observed_at":"2026-08-06T20:43:15.456053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.253347Z","title":"Videogpt: Video generation using vq-vae and transformers,","venue":null,"work_id":"b96293d0-e987-4d9e-ac5c-379792f51275","year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.731997Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:3971dc3412e0dc67f0070e2f89b8b784eed33cba9f3d994182e22d4a2fbd545b","observation_id":"9d5659d3-d7e4-42a9-93ba-4ad4b01dfb20","resolution":{"observed_at":"2026-08-06T20:43:15.309881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T20:43:03.778153Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.778153Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4cd916eef70a1274ac30f745d69cee64250b8aa9a4714dd1c3b9100015914332","observation_id":"7ef8defa-413b-433e-9a5a-4870e5fa5414","resolution":{"observed_at":"2026-08-06T20:43:03.778153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T20:43:03.846253Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.846253Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:bf6e5839af7e82eeeae3d1d602b55c661ae455c67e811cad3358542fc9f93092","observation_id":"288793db-74eb-4782-b296-5890ae443464","resolution":{"observed_at":"2026-08-06T20:43:03.846253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T20:43:03.913715Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.913715Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:824428cd70bd7931f332fa56df724928bbfb223a82b8af845cd6c0a785aab3b0","observation_id":"d137ac91-53fc-401f-9595-d28fe3e60348","resolution":{"observed_at":"2026-08-06T20:43:03.913715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.185771Z","title":"Gpt-4v(ision) system card,","venue":null,"work_id":"9abd67e6-d4c1-43c5-ab95-d2804781e9de","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.964175Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9a7003398caa59297309e279b22986f8dc34644ba310c0dd04278e31eb37f6f5","observation_id":"6fad97ba-8ab2-499e-b3b6-d74d9cb07c50","resolution":{"observed_at":"2026-08-06T20:43:15.210868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:15.093170Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":"ddbac36e-3650-4aba-97f1-35e47fb828e9","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.030238Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f4bd38bd71218fd3d1a8ae6e41c818046563ca2806ecda73682c3f5a8d40e8cf","observation_id":"00e885d6-1256-4256-aa5c-44a0ad06ce9e","resolution":{"observed_at":"2026-08-06T20:43:15.151435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.868365Z","title":"Sora: Creating video from text,","venue":null,"work_id":"342cdc1b-7f97-4d00-9141-8fc03c8b104b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.098209Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b0a0cc02448df19b4ee6b8708020fe4c90e466c854960ed7833dd94310829e4d","observation_id":"b7be538e-2e9e-4368-a47b-acbe008365b6","resolution":{"observed_at":"2026-08-06T20:43:14.993735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.684850Z","title":"Crash: Crash recognition and anticipation system harnessing with context-aware and temporal focus attentions,","venue":null,"work_id":"99cf53f9-c591-4864-b1df-01b2987f991d","year":null},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.154363Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:330c37e85dabcca25124c132bb49dd8d3fda071085ab7653c9a7a113db2d27ca","observation_id":"a12d3737-8413-4032-9198-c63c793d755e","resolution":{"observed_at":"2026-08-06T20:43:14.782918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10604","last_updated":"2025-01-17T23:35:34Z","snapshot_observed_at":"2026-08-06T18:15:19.361212Z","submitted_at":"2025-01-17T23:35:34Z","title":"When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10604","snapshot_observed_at":"2026-08-06T20:43:04.297014Z","title":"When language and vision meet road safety: Leveraging multimodal large language models for video-based traffic accident analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.297014Z"},"links":{"cited_paper":"/paper/2501.10604","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:92b46cb5a2d0701e0cbdf2eac087bcbec61f13eb0ffab85e5cc144b3833de670","observation_id":"f0149b61-9c89-4859-b042-ebcfd31e88a7","resolution":{"observed_at":"2026-08-06T20:43:04.297014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:04.364558Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.364558Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:703170e4574a9fdc179ff4c1288738b17dd732ff1d7dd200ff00705ca711b473","observation_id":"4a95e254-d30b-42cf-a757-3dc95da00af2","resolution":{"observed_at":"2026-08-06T20:43:04.364558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T20:43:04.406744Z","title":"Clip4clip: An empirical study of clip for end-to-end video clip retrieval and captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.406744Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4c07a00a3e4685e77e00269fe02b2eb1851ff7fbc8615cd5addde42ab6576e40","observation_id":"17b3a461-14f7-47f8-a8ff-fbd05e9e0b22","resolution":{"observed_at":"2026-08-06T20:43:04.406744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:43:04.442302Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.442302Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:614c87afc20a1a555c0feb6b3f0424286afe9c0f7d6fea202ff686eccb3f9b41","observation_id":"448b17bc-4b82-4f38-aa8e-10cba87233f4","resolution":{"observed_at":"2026-08-06T20:43:04.442302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.380584Z","title":"Quick and robust detection of crash events from video streams,","venue":null,"work_id":"bb31b57b-5ee7-4489-94f2-0bc3f22eb98a","year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.505518Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:153fdb5ba4d90ef64d52efa6a7d539f0dfa4ee149d5d024d54cac2cd794ab7a4","observation_id":"abd4cb4e-e83c-44dc-8829-7d0d6ddcc42b","resolution":{"observed_at":"2026-08-06T20:43:14.537088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:14.117467Z","title":"A real-time system for detection of road accidents from video streams,","venue":null,"work_id":"47948c33-4713-45c2-b2cb-2f5394db7d3b","year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.570143Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:fb9cf746db9c9a4223dbb910317c76c5a7b91b42c07e5fc78adde2b9955f71ae","observation_id":"1de8b4b1-d6cf-4634-9aca-c2428ce4f0ad","resolution":{"observed_at":"2026-08-06T20:43:14.256997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.817313Z","title":"Video-based traffic accident detection: A survey,","venue":null,"work_id":"02827881-55e8-4404-abd9-a2912c9a8c57","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.622770Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:4e73cbf7e261a11162b924cd5cd438ebd8a2bd328f54e321d28dde8a36ef68a6","observation_id":"3a3c7fb1-97ac-4f3a-987e-eb14d147d8a6","resolution":{"observed_at":"2026-08-06T20:43:13.942348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T20:43:04.679275Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.679275Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:83c0c8a39eb29240138d11fbf3e93b0a045e92ec24e2b3dd53bf48f911f494e4","observation_id":"87610921-fe17-4f72-9711-b5b7c8f55caf","resolution":{"observed_at":"2026-08-06T20:43:04.679275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16682","last_updated":"2024-02-26T16:01:22Z","snapshot_observed_at":"2026-07-06T17:35:36.900600Z","submitted_at":"2024-02-26T16:01:22Z","title":"Pentagon relation and Biedenharn-Elliott identity","version":1},"cited_work":{"arxiv_id":"2402.16682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16682","snapshot_observed_at":"2026-08-06T20:43:10.099554Z","title":"Pentagon relation and Biedenharn-Elliott identity","venue":"math.GT","work_id":"2b31f553-bfe9-4edb-a579-eac882e8ea04","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.749137Z"},"links":{"cited_paper":"/paper/2402.16682","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:df730bd2e056bb7906d7d9b72ff2e4bfcfedcffdd7aa56a57b3ebbbb48f6afb1","observation_id":"4ad41515-89e2-4ee8-aa36-f17d7c4f00e8","resolution":{"observed_at":"2026-08-06T20:43:10.153649Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14412","last_updated":"2024-01-19T23:48:04Z","snapshot_observed_at":"2026-07-06T17:20:33.356092Z","submitted_at":"2024-01-19T23:48:04Z","title":"Harnessing Neuron Stability to Improve DNN Verification","version":1},"cited_work":{"arxiv_id":"2401.14412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.14412","snapshot_observed_at":"2026-08-06T20:43:09.975927Z","title":"Harnessing Neuron Stability to Improve DNN Verification","venue":"cs.LG","work_id":"bd1a4940-7e91-4d23-bb50-d93496f2f41b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.793014Z"},"links":{"cited_paper":"/paper/2401.14412","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2cd0d77c70aec43e8518c7395fd8e237e01c5dfe2b697dd131d9560805fc7b58","observation_id":"a45733c2-3731-4332-a915-3102c9cd5cf3","resolution":{"observed_at":"2026-08-06T20:43:10.016965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13849","last_updated":"2024-02-21T14:50:44Z","snapshot_observed_at":"2026-07-06T17:33:29.707531Z","submitted_at":"2024-02-21T14:50:44Z","title":"Partially hyperbolic diffeomorphisms that are center fixing","version":1},"cited_work":{"arxiv_id":"2402.13849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13849","snapshot_observed_at":"2026-08-06T20:43:09.873853Z","title":"Partially hyperbolic diffeomorphisms that are center fixing","venue":"math.DS","work_id":"dcf53736-4838-40ff-893b-5267440abbce","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.825480Z"},"links":{"cited_paper":"/paper/2402.13849","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:0a58d94c354c07eb620fa85413cb6bab1162b992f64e02c87739cc024de574a8","observation_id":"240f0f88-0037-4bec-9b7f-087d9756e0e4","resolution":{"observed_at":"2026-08-06T20:43:09.921329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07343","last_updated":"2023-05-18T12:56:52Z","snapshot_observed_at":"2026-07-06T15:26:22.787911Z","submitted_at":"2023-05-12T09:41:40Z","title":"On the consistency of relative facts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07343","snapshot_observed_at":"2026-08-06T20:43:04.866116Z","title":"Large language models are temporal and causal reasoners for video question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.866116Z"},"links":{"cited_paper":"/paper/2305.07343","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:6d47cd5ff1254b9c65513d24351844d80cc558a029ccb71e59710c9d8b5dca6e","observation_id":"4956d886-5e93-4272-b982-2d98a7eb761a","resolution":{"observed_at":"2026-08-06T20:43:04.866116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.520449Z","title":"Leveraging video-llms for crash detection and narrative generation: Performance analysis and challenges,","venue":null,"work_id":"4dfe757b-9433-40d0-a05d-68702f188c56","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.920193Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:091d7259383137baaab932ae4576212181b52c393f1798a595dc701e1109f1b6","observation_id":"645beef6-394d-46aa-8ece-d71fc68a0b65","resolution":{"observed_at":"2026-08-06T20:43:13.654406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07223","last_updated":"2021-05-19T06:36:47Z","snapshot_observed_at":"2026-07-06T07:46:14.077705Z","submitted_at":"2019-04-15T17:59:43Z","title":"Joint Discriminative and Generative Learning for Person Re-identification","version":3},"cited_work":{"arxiv_id":"1904.07223","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.07223","snapshot_observed_at":"2026-08-06T20:43:09.730663Z","title":"Joint Discriminative and Generative Learning for Person Re-identification","venue":"cs.CV","work_id":"5da90046-9c6c-4658-b1c7-4fcac09024d7","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.980461Z"},"links":{"cited_paper":"/paper/1904.07223","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c85dbe707f2b12132962d6236767dcfe19dccd880cae853921594c617ceb2751","observation_id":"35443ac5-fef4-4937-b880-52f9a49d9bfa","resolution":{"observed_at":"2026-08-06T20:43:09.775500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.275253Z","title":"Trafficlens: A novel system for video-to-text conver- sion in multi-camera traffic environments,","venue":null,"work_id":"000af1ee-b114-4123-b224-ee117c65cbd7","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.013039Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:bcadd697ca850746f1bdce341b309b8a46eaa324e4d0d4010c11b1d0f945b9de","observation_id":"7b496f6e-da04-4812-97ca-db92a850519c","resolution":{"observed_at":"2026-08-06T20:43:13.417130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12204","last_updated":"2024-02-19T15:07:32Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:07:32Z","title":"Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages","version":1},"cited_work":{"arxiv_id":"2402.12204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12204","snapshot_observed_at":"2026-08-06T20:43:09.592530Z","title":"Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages","venue":"cs.CL","work_id":"f6fd02f7-d812-42c6-8454-03d611048877","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.071380Z"},"links":{"cited_paper":"/paper/2402.12204","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2e3d4dff2b3ce355556b708aa33cc7ef7cc0f1abdfa01afb0b9f6bd4fd369a3e","observation_id":"7d91cfaf-5882-4ede-88c1-5be018cfc9ee","resolution":{"observed_at":"2026-08-06T20:43:09.652431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:13.062708Z","title":"Dad: A dashcam accident dataset,","venue":null,"work_id":"c8b789c1-f928-4333-b1cd-7c944b9c0a78","year":2016},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.117717Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f200584318288ffdde83a3ecbe1fb014440cebb19f87fdfc14ac362b3bcfa43e","observation_id":"3377578f-c309-4f20-8dff-a41c5b3d58d6","resolution":{"observed_at":"2026-08-06T20:43:13.156123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:12.829458Z","title":"Cadp: A novel dataset for car accident detection and prediction from police reports,","venue":null,"work_id":"d090f58d-5e19-48ac-98a8-31f9b32ab55b","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.153296Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:160a6b2b3de6658f2aee313880b61272bcfb9877579b1bc83e58153f36147b26","observation_id":"7023c4c6-fb00-47d1-bced-8fdcceaeaa7c","resolution":{"observed_at":"2026-08-06T20:43:12.935784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04687","last_updated":"2020-04-08T09:25:06Z","snapshot_observed_at":"2026-07-06T06:38:43.563060Z","submitted_at":"2018-05-12T09:24:21Z","title":"BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04687","snapshot_observed_at":"2026-08-06T20:43:05.206991Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitasking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.206991Z"},"links":{"cited_paper":"/paper/1805.04687","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c005bcea16ccc9f90c138ea64148574c7d5dedcdf394b70eea0561424303239e","observation_id":"ac938ad0-26ac-48b0-bb4c-abbdf1f6b792","resolution":{"observed_at":"2026-08-06T20:43:05.206991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03759","last_updated":"2018-06-26T22:36:42Z","snapshot_observed_at":"2026-07-06T06:18:12.309168Z","submitted_at":"2018-01-11T13:55:34Z","title":"Bulk-Boundary Correspondence in the Quantum Hall Effect","version":2},"cited_work":{"arxiv_id":"1801.03759","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.03759","snapshot_observed_at":"2026-08-06T20:43:09.440679Z","title":"Bulk-Boundary Correspondence in the Quantum Hall Effect","venue":"hep-th","work_id":"c9d578c2-450a-4348-be1c-5f936aa1f80c","year":2018},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.265806Z"},"links":{"cited_paper":"/paper/1801.03759","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:eae65f83a993286117348418d56b6312a04043e49c3f86f189912bbb18ae9718","observation_id":"37a20d0b-c064-4295-a336-bf917aa640d9","resolution":{"observed_at":"2026-08-06T20:43:09.499953Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00982","last_updated":"2025-01-13T16:27:06Z","snapshot_observed_at":"2026-07-06T19:25:28.300272Z","submitted_at":"2024-10-01T18:10:23Z","title":"ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding","version":2},"cited_work":{"arxiv_id":"2410.00982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.00982","snapshot_observed_at":"2026-08-06T20:43:09.268997Z","title":"ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding","venue":"cs.CV","work_id":"d7c022b4-7785-4aff-94bf-13dde60c239b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.322723Z"},"links":{"cited_paper":"/paper/2410.00982","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:834dce5ff345ef2ce44506bb07898b2f18415c1b83823c2558016d9d1f6e4a52","observation_id":"c8fcad50-7dac-412b-834f-4a7807d1b478","resolution":{"observed_at":"2026-08-06T20:43:09.342500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09275","last_updated":"2024-04-14T14:51:44Z","snapshot_observed_at":"2026-07-06T17:59:58.611072Z","submitted_at":"2024-04-14T14:51:44Z","title":"TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning","version":1},"cited_work":{"arxiv_id":"2404.09275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09275","snapshot_observed_at":"2026-08-06T20:43:09.124603Z","title":"TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning","venue":"cs.CV","work_id":"bc2d010a-3ead-4eb1-a0e9-908e7845d24a","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.399630Z"},"links":{"cited_paper":"/paper/2404.09275","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9c878871af81f634593975029e39eebfd58ac05d8ad1f77577a99779070452ca","observation_id":"0a3fc6ec-0e31-46ea-8ae6-ceae26073d34","resolution":{"observed_at":"2026-08-06T20:43:09.183265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:12.516680Z","title":"Crash: A context-aware attention-based framework for crash anticipation,","venue":null,"work_id":"955d6002-df81-46ce-908d-95cfd55f9495","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.463586Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:552260015ed0887db539ea7aa62ce08c0265790aa324b1caf6eb8d8592009f2f","observation_id":"bd857ff8-0747-497f-9992-a83301ee16c4","resolution":{"observed_at":"2026-08-06T20:43:12.649915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:43:05.505355Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.505355Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:08516f00200fbc662c91b92495c12955d35403560c3caf563438280d8aff88c6","observation_id":"db865e62-ee75-4544-9a9b-fff300e955c1","resolution":{"observed_at":"2026-08-06T20:43:05.505355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:12.214716Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"bb36bedb-d649-4be4-886c-c8541d1e2359","year":2019},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.565916Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:fddb5eccb2305a964b87877ebe010ee8904df1c7b0ffc13255ea7072e93f8c38","observation_id":"d6bb9525-c2e1-4c40-85f6-0f802bb7578c","resolution":{"observed_at":"2026-08-06T20:43:12.373008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.946824Z","title":"Self-supervised anomaly detection: A survey and outlook,","venue":null,"work_id":"a7a745b6-9f81-4637-aa09-f663d4ee8cf4","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.645978Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:84016a9a5c231c7f17b82963305431df522dff9965c38e71abb0942bec264027","observation_id":"2bceff8e-4009-4032-a3e3-a4939c79406e","resolution":{"observed_at":"2026-08-06T20:43:12.073096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.664200Z","title":"Few-shot fast-adaptive anomaly detection,","venue":null,"work_id":"1609e9a3-52f5-4ab9-861f-1d38e7610669","year":2022},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.691625Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:9800848371cd6f2c0f32017308ccb838d73b06b272cbe1901cedc9d38cc29cb3","observation_id":"eccf9c1e-c30b-4a11-8f5b-eb6dad9d780b","resolution":{"observed_at":"2026-08-06T20:43:11.794299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:43:05.739969Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.739969Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a5cb0fc044894b878c3ecc73595f2ca8da9c9b9800eaf420489479b5383fe8d7","observation_id":"accd368e-1106-4b7f-afb7-66e42b0905cd","resolution":{"observed_at":"2026-08-06T20:43:05.739969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14146","last_updated":"2020-09-29T16:40:46Z","snapshot_observed_at":"2026-07-06T09:59:53.503386Z","submitted_at":"2020-09-29T16:40:46Z","title":"A Survey on Deep Learning Techniques for Video Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2009.14146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.14146","snapshot_observed_at":"2026-08-06T20:43:08.874629Z","title":"A Survey on Deep Learning Techniques for Video Anomaly Detection","venue":"cs.CV","work_id":"66be4498-b1aa-450b-9a40-fade1f2da8e4","year":2020},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.823209Z"},"links":{"cited_paper":"/paper/2009.14146","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b4a22683afbed737060cdef6d30dbfc85c7453e84856f6c7e20d6e03185351d2","observation_id":"7175c93d-b69a-401d-bf3f-7b819aa45d1c","resolution":{"observed_at":"2026-08-06T20:43:08.974237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:05.873151Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.873151Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:92d3f26687f21f754a1f8aa91fc516025cd5b8570705fb5253b5f1d62da17b02","observation_id":"e8ae7848-09dd-479d-af08-841db39a7e10","resolution":{"observed_at":"2026-08-06T20:43:05.873151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.453830Z","title":"Convolutional lstm network: A machine learning approach for precipitation nowcasting,","venue":null,"work_id":"8bf025ae-876f-444b-80bd-f7ffbbf17128","year":2015},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:05.939940Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:cb4f6e232af2826304f358f37461565a1edbcc1aa3c685d973584de0a6973fa9","observation_id":"d4f5159c-5cb2-409d-821f-611f7c353325","resolution":{"observed_at":"2026-08-06T20:43:11.532931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19387","last_updated":"2024-07-01T02:31:53Z","snapshot_observed_at":"2026-07-06T18:22:14.521977Z","submitted_at":"2024-05-29T17:56:31Z","title":"Video Anomaly Detection in 10 Years: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19387","snapshot_observed_at":"2026-08-06T20:43:06.026238Z","title":"Video anomaly detection in 10 years: A survey and outlook,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.026238Z"},"links":{"cited_paper":"/paper/2405.19387","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b290e671af765c8e37c7914ed636f6a0933b24cfeb02dc8d35383a9431d04fdc","observation_id":"4d7b8a6e-051a-4240-a8bb-97af8b39e9e3","resolution":{"observed_at":"2026-08-06T20:43:06.026238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-06T03:32:00.098200Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-06T20:43:06.121709Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.121709Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e786d0a30a95823df3277bca642ba62be45e6e2a64503d2adca9da0e3ba9804b","observation_id":"2c97d037-7e18-4489-90a6-291bf823bb0d","resolution":{"observed_at":"2026-08-06T20:43:06.121709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:06.207625Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.207625Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:8fbafa95efc855863c2923912d9beca5612e6ed222f3d604df8a6c38436f2804","observation_id":"2f72261b-2234-4b57-95af-49b625d86f30","resolution":{"observed_at":"2026-08-06T20:43:06.207625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:06.264040Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.264040Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:39f475f2122588cabd057056e907f738b68cf20a2cad3659ad2e59e4fb225a23","observation_id":"a7d6492b-55f1-461d-8dc3-ba0780cc329b","resolution":{"observed_at":"2026-08-06T20:43:06.264040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:06.334184Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.334184Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a16e49f762b5da89da14df46230d6619ce6f5e47224841569e368ad3ff213885","observation_id":"2a39a169-d8a1-46ae-b00c-51b6e5263cc6","resolution":{"observed_at":"2026-08-06T20:43:06.334184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.234210Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for autonomous driving,","venue":null,"work_id":"2e9d45c7-cec7-4b43-b679-2347913071dd","year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.436310Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:7501d7d990409c9c9ae2b9c8de627ef7c8eb1c72c30bee88152d892b0156aefd","observation_id":"c1740d64-d080-4406-84b4-848f689fc2d8","resolution":{"observed_at":"2026-08-06T20:43:11.302437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:11.099359Z","title":"Causallp: Visual causal question answering with knowledge graphs,","venue":null,"work_id":"f8ba5a6a-6124-4e2d-985a-376245d7028b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.486551Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:b421562093f93651d73c47866b1632a42d6a36714a9f020724318cc6c2626769","observation_id":"f1022a6c-eaa7-465b-98f8-9d7c89144724","resolution":{"observed_at":"2026-08-06T20:43:11.171794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01299","last_updated":"2026-07-04T18:00:49Z","snapshot_observed_at":"2026-07-09T23:17:08.249380Z","submitted_at":"2024-04-01T17:59:53Z","title":"CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes","version":3},"cited_work":{"arxiv_id":"2404.01299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01299","snapshot_observed_at":"2026-08-06T20:43:08.546066Z","title":"CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes","venue":"cs.CV","work_id":"e17fd188-f1bd-4045-8b25-a7dc3427312b","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.555774Z"},"links":{"cited_paper":"/paper/2404.01299","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:d40452454abf9e47ac3aacc3a54b61b981773828a97908b1487af98dcf85c081","observation_id":"f5e412ca-fdd3-4dc9-9d33-1c1f18023792","resolution":{"observed_at":"2026-08-06T20:43:08.600662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.973107Z","title":"Bolstering causal reasoning in video question answering with multi-event causal discovery,","venue":null,"work_id":"d8fbcc02-285c-47c0-8b62-e7cfad4a739d","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.649287Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:54a1a5c67a529c554e01c32c1ce9f7721ca13004b0d00ebc5ce6cb37aa3add4b","observation_id":"046aa1f3-2440-482a-965b-f55308a449ac","resolution":{"observed_at":"2026-08-06T20:43:11.013528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12235","last_updated":"2024-06-29T08:15:27Z","snapshot_observed_at":"2026-07-06T18:32:40.207270Z","submitted_at":"2024-06-18T03:19:24Z","title":"Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12235","snapshot_observed_at":"2026-08-06T20:43:06.699602Z","title":"Holmes-vad: Towards unbi- ased and explainable video anomaly detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.699602Z"},"links":{"cited_paper":"/paper/2406.12235","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:c720b043d93fdd9457e75baa404bcb8be36cad0b818fb04b68769110fc06df45","observation_id":"5e2b02e0-e7f2-42f7-ab20-4f32a1d7f23b","resolution":{"observed_at":"2026-08-06T20:43:06.699602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.03235","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:08.316694Z","title":"Crash time matters: Hybridmamba for fine-grained temporal localization in traffic surveillance footage,","venue":null,"work_id":"57bcde7a-1f0d-4998-a756-9f03b6e2eb76","year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.823875Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2038e3cadb295e3ea854754133c3273626351f0323a294f3b27c8eb62446cd07","observation_id":"fa4a90d0-3923-4b4d-9ace-6a6bdbaffac6","resolution":{"observed_at":"2026-08-06T20:43:08.409542Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05383","last_updated":"2024-09-09T07:31:16Z","snapshot_observed_at":"2026-07-06T19:12:23.792177Z","submitted_at":"2024-09-09T07:31:16Z","title":"Deep Learning for Video Anomaly Detection: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05383","snapshot_observed_at":"2026-08-06T20:43:06.875392Z","title":"Deep learning for video anomaly detection: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.875392Z"},"links":{"cited_paper":"/paper/2409.05383","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:435ffea6b6bac61115769d18977a22b4e7dd1afc8fdbdef6339551342ae5ea61","observation_id":"de6cdf92-6b1d-4796-9fd7-13e3091f4760","resolution":{"observed_at":"2026-08-06T20:43:06.875392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14329","last_updated":"2023-03-25T02:11:31Z","snapshot_observed_at":"2026-08-05T04:18:18.416874Z","submitted_at":"2023-03-25T02:11:31Z","title":"Edge-Based Video Analytics: A Survey","version":1},"cited_work":{"arxiv_id":"2303.14329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.14329","snapshot_observed_at":"2026-08-06T20:43:07.960584Z","title":"Edge-Based Video Analytics: A Survey","venue":"cs.DC","work_id":"5f9bf19c-8866-4963-b163-071e9c9a008a","year":2023},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.975537Z"},"links":{"cited_paper":"/paper/2303.14329","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:46c8a1647e33ce85f5454bd795493e965bc63ee9ff28c417fdd3715f73599000","observation_id":"0b092ca4-8f8d-4826-b6ab-28e387c2b98d","resolution":{"observed_at":"2026-08-06T20:43:08.050272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.857309Z","title":"Synthetic datasets for autonomous driving: IEEE TRANSACTIONS ON INTELLIGENT TRANSPORTATION SYSTEMS, VOL. XX, NO. X, MONTH YEAR 24 A survey,","venue":null,"work_id":"46127c57-b148-445e-b5eb-d85a7dbc5ac5","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.129418Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f1e75e78c6328dd1380d3fc34c5f3a07d92ce02e418e07364b18ce6448d24180","observation_id":"717e465f-ae8d-4ec1-b57d-2bf8175191c6","resolution":{"observed_at":"2026-08-06T20:43:10.906404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.768265Z","title":"Domain general- ization through meta-learning: a survey,","venue":null,"work_id":"5cbd898c-b3f3-4df9-bc99-c81718fccd27","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.219424Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:3da6cc7109926f86a3a2c03876220ae66e8e9a4916b9e2eed2bf4ae371fa0e07","observation_id":"b0c01428-eb14-473d-abfa-5624e1ff7f9c","resolution":{"observed_at":"2026-08-06T20:43:10.802463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11334","last_updated":"2024-01-23T07:36:33Z","snapshot_observed_at":"2026-07-06T12:00:21.464672Z","submitted_at":"2021-10-21T17:59:41Z","title":"Generalized Out-of-Distribution Detection: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11334","snapshot_observed_at":"2026-08-06T20:43:07.278200Z","title":"Generalized out-of- distribution detection: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.278200Z"},"links":{"cited_paper":"/paper/2110.11334","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:271d2d0a43049ab71043aadc5522d51c5d286308cb20f769336b1f70c6da239c","observation_id":"d82ac71d-4534-4271-872a-011aa335da6f","resolution":{"observed_at":"2026-08-06T20:43:07.278200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:07.353734Z","title":"Carla: An open urban driving simulator,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.353734Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:dcf55e53dc257e84fe2c488eadd12ec33992b5de7f574a9f76d940b2521d207d","observation_id":"8303e124-e7be-4be8-b8b6-ea50d8515671","resolution":{"observed_at":"2026-08-06T20:43:07.353734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.646601Z","title":"Perception, planning, control, and coordination for autonomous vehicles,","venue":null,"work_id":"24c07946-8dcc-466e-8935-975f52022979","year":2017},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.464300Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:2d4bea8072310dcced92f0c38f1432357482c47f3520b220a11004040f71a42f","observation_id":"703f5a5a-6ad8-41be-8d29-cfa24306dade","resolution":{"observed_at":"2026-08-06T20:43:10.701373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:10.530614Z","title":"A survey of the multi-sensor fusion object detection task in autonomous driving,","venue":null,"work_id":"93340316-c6e2-4751-af2b-8d0bf0647045","year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.581462Z"},"links":{"citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:82c019252742dba7ef4f5512e7a384029f783179a58ef206bb065b58421a08c0","observation_id":"a8c7cc71-d1b7-48aa-930d-07d82ab268c5","resolution":{"observed_at":"2026-08-06T20:43:10.573511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09724","last_updated":"2025-07-01T18:36:07Z","snapshot_observed_at":"2026-07-06T21:08:42.919796Z","submitted_at":"2025-04-13T21:12:24Z","title":"A Survey on Efficient Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09724","snapshot_observed_at":"2026-08-06T20:43:07.662405Z","title":"A survey on efficient vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.662405Z"},"links":{"cited_paper":"/paper/2504.09724","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:e53baaef5038c004dae5591defeb8551630b59c31cd415ac9c9a29bff5f9cf26","observation_id":"c44dce93-6c64-4a7e-b261-b9159e25900e","resolution":{"observed_at":"2026-08-06T20:43:07.662405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14565","last_updated":"2025-06-28T09:36:36Z","snapshot_observed_at":"2026-07-06T19:54:05.139608Z","submitted_at":"2024-11-21T20:29:59Z","title":"Privacy-Preserving Video Anomaly Detection: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14565","snapshot_observed_at":"2026-08-06T20:43:07.779736Z","title":"Privacy-preserving video anomaly detection: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:07.779736Z"},"links":{"cited_paper":"/paper/2411.14565","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:406a4b4a9ed5b8a4f00bf08ce2f22714b8eafebd3e55d1e56949eac951e80ace","observation_id":"e3e4edb3-e917-46a5-bf44-7a4e139f5ef5","resolution":{"observed_at":"2026-08-06T20:43:07.779736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17757","last_updated":"2024-07-25T04:12:49Z","snapshot_observed_at":"2026-07-06T18:51:41.167282Z","submitted_at":"2024-07-25T04:12:49Z","title":"CRASH: Crash Recognition and Anticipation System Harnessing with Context-Aware and Temporal Focus Attentions","version":1},"cited_work":{"arxiv_id":"2407.17757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17757","snapshot_observed_at":"2026-08-06T20:43:10.328885Z","title":"CRASH: Crash Recognition and Anticipation System Harnessing with Context-Aware and Temporal Focus Attentions","venue":"cs.CV","work_id":"af74c347-5dfe-4405-b222-5c65a095a931","year":2024},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.229060Z"},"links":{"cited_paper":"/paper/2407.17757","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:f624d4020a5fb13ad5d04da7960898817c1cfa57ab466eb8ebbf667642d37a8f","observation_id":"2ff580c3-6c20-4f3b-beec-639e3d156ff0","resolution":{"observed_at":"2026-08-06T20:43:10.363170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:36:27.131971Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":46,"verified_exact":8,"verified_fuzzy":38},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 2 inbound Pith citation observations for arXiv:2507.02074."}