{"as_of":"2026-08-07T19:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffbb85e510fb640dc8170119ee2d99e6264fcff444ce5ebb0a898efc5d59a330","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:27.673880Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:22:12.609121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:22:12.693223Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"cited_work":{"arxiv_id":"2507.09338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09338","snapshot_observed_at":"2026-08-06T00:22:12.693223Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","venue":"cs.CV","work_id":"1b569008-9b36-472c-932b-329e80892f22","year":2025},"citing_paper":{"arxiv_id":"2608.01336","last_updated":"2026-08-02T15:57:40Z","snapshot_observed_at":"2026-08-06T23:26:16.406254Z","submitted_at":"2026-08-02T15:57:40Z","title":"Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:22:12.609121Z"},"links":{"cited_paper":"/paper/2507.09338","citing_paper":"/paper/2608.01336"},"observation_digest":"sha256:0e9a512d4cc9a8ff07c9a8bd71d467976069ee1ed8cfe396eed8cecbf786ee87","observation_id":"fd94202c-0eea-4329-adca-55590de9a3fe","resolution":{"observed_at":"2026-08-06T00:22:12.697368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09338/citation-record","integrity":"/paper/2507.09338/integrity","json":"/paper/2507.09338/citation-record.json","paper":"/paper/2507.09338"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:23.695583Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.695583Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:92c1d7f99c1401201e0c9e17206c0dce98c5e349c4e2b2aa50760d15df5412c1","observation_id":"bccfd1b4-d00a-4dd3-90df-63d7d7e8f575","resolution":{"observed_at":"2026-08-06T18:03:23.695583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T18:03:23.758453Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.758453Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:6eb30bed50094fa5347ea7b3ae546302ee65808e82d1bc4943db66762e9ca3ad","observation_id":"661a675b-711e-4094-965c-e4b8b5fdbb04","resolution":{"observed_at":"2026-08-06T18:03:23.758453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T18:03:23.826777Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.826777Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:424f762c5c31bb4e93d62d445237037003a041ea5824efb60a2b457275ba1ee7","observation_id":"429e1493-0895-424a-b005-bdf7916b3a91","resolution":{"observed_at":"2026-08-06T18:03:23.826777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:23.922395Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.922395Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:4c171d7c6ae6f2d731c3306e72c6c685a9857794711884409535fa938492977d","observation_id":"2e7deb86-c165-42f8-88af-805bb0751be9","resolution":{"observed_at":"2026-08-06T18:03:23.922395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.985070Z","title":"The matthews cor- relation coefficient (mcc) should replace the roc auc as the standard metric for assessing binary classification","venue":null,"work_id":"58593c58-2623-4875-a9fc-2cc6007945c6","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.001312Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:e50438428346e55e0f9968bc9acb5ed20502cf28b8f164c63cd95dd209585f96","observation_id":"7457ec50-1f98-4c7e-875e-b0c52dc843a4","resolution":{"observed_at":"2026-08-06T18:03:38.115329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.581607Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"abc7e13c-831f-4750-9342-4e9ba7f99041","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.058670Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a8d0a174875f53c180fc4436bf5a7a403e811228076ea7babd743e20a9afd507","observation_id":"bd222745-e546-4930-b44b-a7d767ebe9f8","resolution":{"observed_at":"2026-08-06T18:03:37.797049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.295670Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"493e8aa4-759e-4235-b282-6044a912427d","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.148227Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:3cbb66a1ae69165c376f3e70c0d5d48cfcce6dd19a7a740b09c5f54f3b6225f2","observation_id":"1900116b-642a-4200-a0eb-60167936f26f","resolution":{"observed_at":"2026-08-06T18:03:37.467482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.066469Z","title":"Cyclecrash: A dataset of bicycle collision videos for col- lision prediction and analysis","venue":null,"work_id":"6f7c4905-476b-4392-b17a-18ee53f4b38a","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.219473Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:355c85ee66253c456f2ce0ba7430cad557ae731425bfe84c6aba273abd39d890","observation_id":"fc03bc65-cbbd-41d6-92ec-f98cbf47b301","resolution":{"observed_at":"2026-08-06T18:03:37.178219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:03:24.302249Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.302249Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:b5901aa7a72dc8e8adc6807414b5788c6d1cf20d6ba6ed4d6ea6f958642a5bc1","observation_id":"5589556e-3e15-4d1e-86f4-83b5fdcf6c1b","resolution":{"observed_at":"2026-08-06T18:03:24.302249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:36.811759Z","title":"Dada: Driver attention prediction in driving accident scenarios","venue":null,"work_id":"8ad2727a-cb09-40f6-82ce-50b2d9b08e35","year":2021},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.363329Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:310f101545c259bcc575277e59d7b32904aba3fb8609a78323b818a4f9026ac8","observation_id":"c37ed47e-03c7-40f6-9694-56dc27d26a76","resolution":{"observed_at":"2026-08-06T18:03:36.947564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09381","last_updated":"2023-06-16T13:29:45Z","snapshot_observed_at":"2026-07-06T14:32:22.050814Z","submitted_at":"2022-12-19T11:43:02Z","title":"Cognitive Accident Prediction in Driving Scenes: A Multimodality Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09381","snapshot_observed_at":"2026-08-06T18:03:24.414615Z","title":"Cognitive accident prediction in driving scenes: A multimodality benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.414615Z"},"links":{"cited_paper":"/paper/2212.09381","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f20914fcbc1b76b9726968b0b704f61b21edfebe7c928d52a66f98a9e8d25363","observation_id":"979825bd-5fa9-4a0c-a720-303606517295","resolution":{"observed_at":"2026-08-06T18:03:24.414615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:36.523179Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"056eb60c-b745-463d-b250-57e04992ecf3","year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.484634Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:4ef916a0d32c81b18a7c0fa8ebdcffd33642196ea9ae8854798c1b8cf4c0ef34","observation_id":"79969226-8611-40b0-b3df-c3865b68edb4","resolution":{"observed_at":"2026-08-06T18:03:36.652719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:36.209122Z","title":"Don’t stop pretraining: Adapt language models to domains and tasks","venue":null,"work_id":"10382a5b-244b-4ab2-9b56-f1c716e1768e","year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.545206Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:588e70cd1a051fb20191794972f7d0726da31ba63ad4fac8b3324f7ac19d9f6b","observation_id":"1954d4c9-d9f8-4c02-a62c-f5c401497bfa","resolution":{"observed_at":"2026-08-06T18:03:36.371128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:24.614295Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.614295Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:584ac3ced7eb2687986fa8b59eb8adfdff3e3e431dfb0550a50a576fee0e4939","observation_id":"c92d2201-95ff-4109-9d81-7f268d50507c","resolution":{"observed_at":"2026-08-06T18:03:24.614295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.888808Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"6550b226-a872-45f9-a8fb-d6c22c10dc08","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.711115Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:e424d6c84ce4dfcb14013d8093209a2c929daf91dfd54311fa637b6ef8c7df61","observation_id":"b04be85b-6610-4e35-9a7b-66c5bc967dcb","resolution":{"observed_at":"2026-08-06T18:03:36.087967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.483071Z","title":"An enhanced traffic in- cident detection using factor analysis and weighted random forest algorithm","venue":null,"work_id":"29a011d9-8899-4616-953a-d122cbd758e7","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.815333Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:24a8cebd8d6d0692623fa9f0a1a658172bd72b12fafe09a8b1f6c27eb1ff233e","observation_id":"a7b84db8-76bb-4ca8-a398-0beb43d014f9","resolution":{"observed_at":"2026-08-06T18:03:35.683399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T18:03:24.884011Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.884011Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:b5d5c407bffa5ec1fcab86f4e4ba3fb5840543bbc3dc098755f0e300bafbadd6","observation_id":"ec1bea89-c2af-4097-b900-1cb5571dfee6","resolution":{"observed_at":"2026-08-06T18:03:24.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17208","last_updated":"2024-10-08T10:09:14Z","snapshot_observed_at":"2026-07-06T19:22:18.873914Z","submitted_at":"2024-09-25T16:15:06Z","title":"First Place Solution to the ECCV 2024 BRAVO Challenge: Evaluating Robustness of Vision Foundation Models for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"2409.17208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17208","snapshot_observed_at":"2026-08-06T18:03:27.980024Z","title":"First Place Solution to the ECCV 2024 BRAVO Challenge: Evaluating Robustness of Vision Foundation Models for Semantic Segmentation","venue":"cs.CV","work_id":"6847d1b8-f725-49fa-8a3f-5217e1278023","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.962854Z"},"links":{"cited_paper":"/paper/2409.17208","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:5cccf53fef1b233f4c43f7e0e56ba81c4e50c1db97f9ef53db00e0a00804a170","observation_id":"6f28dcb5-205d-4f6b-b30f-faacef738c0c","resolution":{"observed_at":"2026-08-06T18:03:28.120920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.229797Z","title":"Your vit is secretly an image segmentation model","venue":null,"work_id":"219ffd12-0b9a-4e61-b413-7f9d11164912","year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.035772Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:0277580f3146a67a75ceeb4ee87652b88e0809eeccc965d753070a15e143869c","observation_id":"6418d0b6-494c-4469-b9a3-fb6421601651","resolution":{"observed_at":"2026-08-06T18:03:35.369293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.011856Z","title":"Crash to not crash: Learn to identify dangerous vehicles using a simulator","venue":null,"work_id":"d82259d5-811e-42af-8136-2d10daa513ab","year":2019},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.116644Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:640f0c19c28c85aa643f0dc101c2241ac78b804293a29b223dca3d56f4a12ace","observation_id":"b743e67b-1496-48ac-9007-c3c931033331","resolution":{"observed_at":"2026-08-06T18:03:35.099161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.870701Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"00f726f0-e622-48be-b873-a72d2c0cfdda","year":2011},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.200271Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7c441095433d79d79d0b876b97e0c6050b337567a1c9dfd66882a3b32fdb4f47","observation_id":"d4425ac3-992c-4924-82b7-eb014653e47f","resolution":{"observed_at":"2026-08-06T18:03:34.926894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.617120Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"64c98acf-1941-467e-924c-b5965164b725","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.298323Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:144c49c0a61793d0b44b9b7fb60aa1fbf51d04e29aadb5adeaf3619c710b22e4","observation_id":"7ecba662-150e-4a07-9c25-d01856f2f78b","resolution":{"observed_at":"2026-08-06T18:03:34.768314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.441710Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":"9cb3820d-67f8-4312-8ae4-504bf5fff925","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.382881Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:cd951bca082ed64e9dfad1f7cbb8afea4c78aaf0d5b5a313c2f6ac6f18acc8d9","observation_id":"ec521009-6def-4ea2-ad91-266e97a6116a","resolution":{"observed_at":"2026-08-06T18:03:34.525129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.248616Z","title":"Text-driven traffic anomaly detection with temporal high- frequency modeling in driving videos","venue":null,"work_id":"0659079a-0b29-4d0c-8a64-e9ae566d66f0","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.439681Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:951044b34735b57d6f664c431d6ca9f41539b08bdf87e2c1be4ad32c26bef25b","observation_id":"e4914e50-a79b-4dcb-aa4f-703b11535c58","resolution":{"observed_at":"2026-08-06T18:03:34.328413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.010056Z","title":"An interaction-scene collaborative representation framework for detecting traffic anomalies in driving videos","venue":null,"work_id":"3f74541c-3dfa-4131-9ac6-0fe533f19f48","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.493215Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:b4f1238441934f47012ba81685ecda7993735f4792253f10c79d67d5d6e5c3c4","observation_id":"00536d9e-1204-4106-9edb-beee98bad5d5","resolution":{"observed_at":"2026-08-06T18:03:34.150040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.738418Z","title":"Fu- ture frame prediction for anomaly detection–a new baseline","venue":null,"work_id":"c8b847a4-94b7-498f-8044-f6a034cea150","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.588001Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7cab0b0e875b5bc34ad7f4a5905f922a1f7b5b98f8db4199bf258d7c8bc702d3","observation_id":"9ade1e04-7b83-4dbf-b256-ad66e368e7d4","resolution":{"observed_at":"2026-08-06T18:03:33.850887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:25.653452Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.653452Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:47bb0722eeb09091705240ed511a6d8101c1923052062b0678a426c57654d8a1","observation_id":"60a3bbe4-f3e2-4ec9-a2ab-d55d56b174c9","resolution":{"observed_at":"2026-08-06T18:03:25.653452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.463815Z","title":"Video swin transformer","venue":null,"work_id":"3945e0cf-0b4c-49d8-b521-35cada92423d","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.730929Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:be4f73c19f8f1012c5b4891f7a551981bd8b0b072200c2e7f082e9ac080b7fd9","observation_id":"436a92dd-7cb3-4b7a-a14e-ad67dd1b4bdc","resolution":{"observed_at":"2026-08-06T18:03:33.554293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:03:25.796075Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.796075Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7f6a618a2d45ea24d695290395165fcbd6e1c18807385a316b156f07e010e165","observation_id":"62af7b80-8dd7-4ac7-95df-ad4716df2534","resolution":{"observed_at":"2026-08-06T18:03:25.796075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.245932Z","title":"Remembering history with convolutional lstm for anomaly detection","venue":null,"work_id":"c9713501-de99-428c-b3a9-566a594beb06","year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.870824Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f3c68591c58553b70a756575eca85ba5c8f35342a95f913bf3dc927109ab3a70","observation_id":"af920b0b-37ce-4017-a54a-269f41db3066","resolution":{"observed_at":"2026-08-06T18:03:33.352563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.023332Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"0e64c78a-6bac-40e1-95dc-edba9295fcf5","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.937105Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:acb483524421718534ea4302c3c2e4996f02697e5d9c4a101b2b8019303d3aa3","observation_id":"9b024d91-3053-4c89-8de9-7ab60b8df0fc","resolution":{"observed_at":"2026-08-06T18:03:33.128844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.759367Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"37cc4eed-931f-4c2c-9c06-f42cc61b7973","year":2019},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.987270Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:af800c448e49bf079ef40fa535e2b6041d28cb19b6428600714c4b545b936de4","observation_id":"b2b82a26-77c2-41be-ae67-b5f30d874b66","resolution":{"observed_at":"2026-08-06T18:03:32.901464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.486566Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"7ee42913-cf24-454b-b88e-00ec6dd7cd8d","year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.023828Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:41806b68dc7d8cb20da862f87cdc0cd3aa0491157cde541cc0ddfe55ebd13d1a","observation_id":"61aa7cbe-36d8-423d-9765-0fcfdaf6c484","resolution":{"observed_at":"2026-08-06T18:03:32.593427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:26.140435Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.140435Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7d62cc8b887f9851b915791b592ae910c2a8a9e0d61aef670267f91aeaf833d8","observation_id":"d9ea70f7-53a9-4e44-bd17-56adc581b3d1","resolution":{"observed_at":"2026-08-06T18:03:26.140435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.286767Z","title":"Prompttad: Object-prompt enhanced traffic anomaly detection","venue":null,"work_id":"925171c3-0f6a-4abb-aef0-4ea5e40705ae","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.221143Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:eab5d9edac026d8e387d2e60fb4243c2cadac662bd5f82f83c2eb55e1a6df395","observation_id":"28b5ecdd-4a3e-4a73-8052-f96a13734986","resolution":{"observed_at":"2026-08-06T18:03:32.354480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.073287Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"565cccb5-b4dd-42f9-8f48-406426c2062d","year":2021},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.262981Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:d8cbecffe98cf9aaa59f9ea14a12419c5cd55e7238e357a2ed729b1f8f7270fc","observation_id":"2362e116-ac71-4d0a-a1e5-7ca7f5973c57","resolution":{"observed_at":"2026-08-06T18:03:32.188436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.893170Z","title":"Memory-augmented online video anomaly detection","venue":null,"work_id":"5af52af2-d720-4be0-a8b6-6e6f96cea1e7","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.319373Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:ec62dff1ad577d7441af8fb73e075ade26ef5b284d28a615d985b02e071197e5","observation_id":"f9f1ccad-ea79-46ff-b6b9-e964a9f62be4","resolution":{"observed_at":"2026-08-06T18:03:31.964505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.755384Z","title":"Sigma: Sinkhorn-guided masked video mod- eling","venue":null,"work_id":"540e8b31-5c43-424f-8fcc-443156e4b6e4","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.364967Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:ffd6e2ca40cadf850aef9e64c17e18c49c2695b3e98c6bd4dd1e1d55472def0f","observation_id":"796d5331-2bcd-42ed-80fe-0baa65eefca0","resolution":{"observed_at":"2026-08-06T18:03:31.816901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.589975Z","title":"Learning to predict collision risk from sim- ulated video data","venue":null,"work_id":"4a1f919a-5681-4925-a353-b40b26475773","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.453909Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:8d67742f38a30581fc7cea188491c8b6be298b615c68db73d446cd7408182029","observation_id":"17a4f3b1-f50e-493a-9203-a7ed4b305f88","resolution":{"observed_at":"2026-08-06T18:03:31.679589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T18:03:26.500006Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.500006Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:85b9b1b3c6c686d0a86fa2fa74d495b00c2e6716994b379c1910be04e69a915f","observation_id":"8d19e9f5-c8cf-4d63-8148-c807d7629a6d","resolution":{"observed_at":"2026-08-06T18:03:26.500006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.394997Z","title":"Masked motion encoding for self-supervised video representation learning","venue":null,"work_id":"bea1a6fb-c2a5-45ce-9e56-9d9a163d8a9b","year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.584413Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:688de73014e8b7f6f36a387389a236f56c1a5f496c729249f8fbe0ca7efe22e4","observation_id":"ee92a948-9e5c-4cfa-920f-10b71e4a43ba","resolution":{"observed_at":"2026-08-06T18:03:31.473731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.224086Z","title":"Deep learning applied to road accident detection with transfer learning and synthetic im- ages","venue":null,"work_id":"19049f34-790f-45f0-bea3-d744014b681b","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.636581Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:ff39421208e09416774737a0f57a8e3407af535f5ca0886503b6b902741bd51d","observation_id":"29625acc-aa02-45db-a3dd-c55f914eee67","resolution":{"observed_at":"2026-08-06T18:03:31.306431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.022566Z","title":"Smile: Infusing spatial and motion se- mantics in masked video learning","venue":null,"work_id":"57102933-4a86-47df-8d42-fd8875aa7a8b","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.696826Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:19f4b08ee63ce10e8ca46b6f776746e8eb8458d9e0e3750c65634494fcbe77ee","observation_id":"45c85351-4f3b-489e-a18c-3b6906e1de56","resolution":{"observed_at":"2026-08-06T18:03:31.106432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.869459Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"71341fcd-9132-4e6c-a8f2-5064f26bac3e","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.764122Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:57eb4550cc25fe4e5e64ed3c723616bef509dff90b92e750c3527edd7dfb437a","observation_id":"4839ee61-c23f-4c65-9d5d-e170f9f049b1","resolution":{"observed_at":"2026-08-06T18:03:30.940404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.729016Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"30d01418-bd3f-4a1f-80a2-bb853421516a","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.820510Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:631cc6050f08f186670a1783603b0c5839ec7374ff1d312b640bafdfa531e7db","observation_id":"5d070693-5070-4602-8a43-dd64daa12313","resolution":{"observed_at":"2026-08-06T18:03:30.784533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:26.879535Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.879535Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:76e493b92e366002c8b11c980b4a379cd85cc969c9da2ddd3bd89d5c9de72e94","observation_id":"36dce677-0167-447d-b858-471cb5bf498c","resolution":{"observed_at":"2026-08-06T18:03:26.879535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.553382Z","title":"The BRA VO Semantic Segmentation Challenge Results in UNCV2024","venue":null,"work_id":"7a46cf6d-c9cf-41a3-a9a0-916f829c62ca","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.928959Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:e6ddb23e265cfb85dfa40c5405ef3eca768e0305b262aa1ddf6a3f72bfc13bb9","observation_id":"d7b801be-0b65-45cb-9974-de2d9e7fcec3","resolution":{"observed_at":"2026-08-06T18:03:30.634075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.384633Z","title":"Rs2g: Data-driven scene-graph extraction and embedding for ro- bust autonomous perception and scenario understanding","venue":null,"work_id":"98c4b700-c2f3-4397-9168-ac621f6be70a","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.037581Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:358d16334dccc9a475282ddc2e137470df6b8c23c9c475faba4c8aa159355570","observation_id":"376e21f5-01ce-4aad-9338-bbaf159503d5","resolution":{"observed_at":"2026-08-06T18:03:30.469803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.164102Z","title":"Abnormal event detection in videos using hy- brid spatio-temporal autoencoder","venue":null,"work_id":"e7d82c40-945f-473f-b055-fabc98f58a13","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.090464Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f9d1d284b69fe5a528309fac9fe0411dbf669a43ca7a3163e8852e4d27a38762","observation_id":"28b3be1b-0704-46d6-9758-bd0e09ca936d","resolution":{"observed_at":"2026-08-06T18:03:30.294941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.006663Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"ae6404ec-c09e-4765-bf5a-b721a2be0c03","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.147577Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:4c7bb41969adaba0d86c1146d5b354ea4bdd701aea86756e6d0366886d300945","observation_id":"cdf9b9ce-852c-411a-8005-06e59552d406","resolution":{"observed_at":"2026-08-06T18:03:30.076946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.829398Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":"4f160bac-9743-4d50-854b-56e9a4bb93da","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.208198Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:fb15fcdeb0300b5101785243bfe4c44838622e3ec9da459b433c8098366e5ec9","observation_id":"d4cfcded-5b7d-4c01-b59c-48d7ba0fe133","resolution":{"observed_at":"2026-08-06T18:03:29.905668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.563128Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"89536be7-bd6d-4afa-b573-aa1cd89025c6","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.265943Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:24a0035f8f0352b42601d3235c305a3a250c611283f08c033fbb221e49ed30ef","observation_id":"d41e977d-7339-43fa-8678-b9771593a345","resolution":{"observed_at":"2026-08-06T18:03:29.741186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.394861Z","title":"Recurring the transformer for video action recognition","venue":null,"work_id":"a80aedb5-1d26-4fab-9821-77b6461d9cd7","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.322275Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f492e9a62fd06644892010da929d1a36b1a309ac49cc56b0a5a52b113df37f6d","observation_id":"e9e9ce6b-3316-4268-8d96-313129ca2f80","resolution":{"observed_at":"2026-08-06T18:03:29.475904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.192323Z","title":"Dota: unsupervised detec- tion of traffic anomaly in driving videos","venue":null,"work_id":"7bac4a6f-fbdb-423f-a153-fe1111a45e31","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.392733Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:05a4396661844d08bddde6646719e8a8eefc01b61c10cac032457df4b425aa94","observation_id":"4afd28b7-5f1f-4362-b869-179e7b41ef5f","resolution":{"observed_at":"2026-08-06T18:03:29.306398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:28.985413Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"756ad7cf-3932-403e-90bb-c726f32fa8f2","year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.488627Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:1bec2c45b0cf57109d7013fc0115036cb6803abd7b4daafc054f5fd3d397706f","observation_id":"3be299d7-da65-43e5-ab2d-7d7d3048955b","resolution":{"observed_at":"2026-08-06T18:03:29.105493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:28.788761Z","title":"Scaling vision transformers","venue":null,"work_id":"988cc775-e92f-4974-b54b-706f4561e84f","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.576856Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:194e63adbe8a21c59e1e413337885d18b9206868af46d06eeba3dee3d981f110","observation_id":"18749a73-6617-4a64-855e-69118ab4983c","resolution":{"observed_at":"2026-08-06T18:03:28.866362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:28.461534Z","title":"Spatio-temporal feature encoding for traffic accident detection in vanet environment","venue":null,"work_id":"978be436-1b38-430f-92c8-90e2ed26738f","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.673880Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:9d49124e1105c9005a4e3fb12ea51b5223114a1a65f0b24bd48d5944776f2cfb","observation_id":"2f465c5b-39c0-4cc8-9faf-c9555870332f","resolution":{"observed_at":"2026-08-06T18:03:28.601040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:56:06.664845Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2507.09338."}