{"as_of":"2026-08-08T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50b46b063df0954139e7d9b85e6aae66796b56738f48b3e13d2b0eea331e3319","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:47:49.917130Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T01:03:08.765350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T01:03:18.406504Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"cited_work":{"arxiv_id":"2506.01466","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01466","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.01466 , year=","venue":null,"work_id":"6f71f3c5-0179-4a84-8957-9d1eaa0a6ec2","year":null},"citing_paper":{"arxiv_id":"2605.17923","last_updated":"2026-05-18T06:30:31Z","snapshot_observed_at":"2026-08-03T06:19:48.849871Z","submitted_at":"2026-05-18T06:30:31Z","title":"AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-20T01:03:08.765350Z"},"links":{"cited_paper":"/paper/2506.01466","citing_paper":"/paper/2605.17923"},"observation_digest":"sha256:37008350376c8635f87a505a2b803ee976977ec785ab8087c94f397aee2ed18d","observation_id":"506c1b59-eaca-43c7-9567-820ad5617057","resolution":{"observed_at":"2026-05-20T01:03:18.410531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01466/citation-record","integrity":"/paper/2506.01466/integrity","json":"/paper/2506.01466/citation-record.json","paper":"/paper/2506.01466"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.811503Z","title":"Ub- normal: New benchmark for supervised open-set video anomaly detection","venue":null,"work_id":"8ca84737-c8e6-4f52-9a13-6a29be75177d","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.257744Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:0fab0f42b12f5483d0f54a99c8133c8a9a308c08c33780b8193769b2abbc36a5","observation_id":"b3e61b2b-19ba-46b9-a1e5-e4b51bfae013","resolution":{"observed_at":"2026-08-07T11:48:04.820160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.784432Z","title":"Robust real-time unusual event detection using mul- tiple fixed-location monitors","venue":null,"work_id":"7f2976ab-f37b-4e31-a0ff-d1c2ca60ce8c","year":2008},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.294557Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:2fa5dfe4f0b21628e5186f4b91f6dc746fbbb3a4778a0a572131e5e1b571e33a","observation_id":"76be9730-b41b-4d14-be18-93689015a9e8","resolution":{"observed_at":"2026-08-07T11:48:04.793423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.758480Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"fdf5f2a5-ec39-4718-becf-7e197028a4d4","year":2021},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.338099Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:368e88e521c1b9879c71e3ae1ff932415602ac956521cb7c08f08a906164d7c1","observation_id":"2781f05a-17ec-47f1-b6ab-a430a9a21d66","resolution":{"observed_at":"2026-08-07T11:48:04.769933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.736477Z","title":"Context recov- ery and knowledge retrieval: A novel two-stream framework for video anomaly detection","venue":null,"work_id":"ba13cb5f-18f2-4cc6-ad79-b2ea5b7a3fd4","year":2024},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.381728Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:fc401f8b707b5379b58fc1ac2b1c32c76f2ad083ec50e2e1607f5e6bc093afba","observation_id":"24441f28-bd6c-4da7-a083-ff4ce0db8b4d","resolution":{"observed_at":"2026-08-07T11:48:04.741986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.707598Z","title":"Gramian multimodal representation learning and alignment","venue":null,"work_id":"73b3572a-c64a-4fb2-a40d-0a5aa32da7fb","year":2025},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.417217Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:207b83f0fa8750e5fb085a9555b678f37f3fdae85ccd4e14e53c1d991ebc3a87","observation_id":"d3aa3363-97d0-4a86-91dd-064478ddfa72","resolution":{"observed_at":"2026-08-07T11:48:04.719392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.681643Z","title":"Deepseek-r1: Incentivizing reasoning capa- bility in llms via reinforcement learning, 2025","venue":null,"work_id":"1ab4bdf9-6163-4d4d-9daf-075cbd9ca608","year":2025},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.454077Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:f505810a03dd2fe9c26e1438289b5f54d24bcec02d1fa555678e07f7d2db37e9","observation_id":"a496dd08-4744-4d82-96c5-c2e5ead58977","resolution":{"observed_at":"2026-08-07T11:48:04.694784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.653795Z","title":"https://github.com/modelscope/diffsynth- studio, 2023","venue":null,"work_id":"e71a2bd1-fbf9-4d74-91c6-96a2ea6c1ce9","year":2023},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.487703Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:1b2639420af96f974dd1250dc3d5f7aafadf4521ff7e3ff3c9420d650c134576","observation_id":"f391045a-4b07-402f-8ff7-9b7885b04901","resolution":{"observed_at":"2026-08-07T11:48:04.663266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.623789Z","title":"Oops! pre- dicting unintentional action in video","venue":null,"work_id":"0aa63497-f09d-46b9-af7a-7228a46f53fa","year":2020},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.523469Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:fb0a668688deebe935046a6768b5e96500ca1224bc0f7df0ba3b47d07e748b4d","observation_id":"aa5dc797-0c68-4faf-869b-de024f8171de","resolution":{"observed_at":"2026-08-07T11:48:04.629283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.593168Z","title":"Mist: Multiple instance self-training framework for video anomaly detection","venue":null,"work_id":"79cbb8d6-2ec9-4183-b318-ee091792351d","year":2021},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.557768Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:9b9a661670c6c1f76da428e8f34bade28d23a57c5ebeb63f5670861a35d80a4b","observation_id":"c8d7672a-e83c-48cf-afef-44107b200500","resolution":{"observed_at":"2026-08-07T11:48:04.607665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.550995Z","title":"Cnvid-3.5 m: Build, fil- ter, and pre-train the large-scale public chinese video-text dataset","venue":null,"work_id":"ee6264f5-340c-4b3e-abd7-e2e6913a46e6","year":2023},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.603164Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:262047f1939099b98537559b8988d8a08aa8f173b7bbfbee954ff4715f33daef","observation_id":"7b00f05f-9335-4bed-81be-05184ab6f5dc","resolution":{"observed_at":"2026-08-07T11:48:04.572148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.523279Z","title":"Tem- poral tessellation: A unified approach for video analysis","venue":null,"work_id":"35a5f5c8-a5ab-4eb8-9f18-cc8e3438980a","year":2017},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.649305Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:70c85608937eb3636a6f49b76cb2115ccaae176aa79cf8cee28f60c78fa87eba","observation_id":"d0861689-6476-4af3-ace4-432f4c20299f","resolution":{"observed_at":"2026-08-07T11:48:04.534192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-07-06T04:00:05.122784Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-07T11:46:59.685597Z","title":"Unifying visual-semantic embeddings with multimodal neu- ral language models","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.685597Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:7d31cdcb8877b80c3151afe1cbef423a4091738897b38b7e15459646c8545ba6","observation_id":"47aaabf1-c5ca-4621-a95e-a4b3924ddc8f","resolution":{"observed_at":"2026-08-07T11:46:59.685597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.493514Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"d6dbef5b-62b4-4e35-8d2e-e955bcd05067","year":2021},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.718189Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:6b9b9ba25ba809c47413ae30113eedbf4f3bfd39904248acaa93ece5614402e0","observation_id":"f1a1ffcf-2bac-4b9c-8780-410566b31af2","resolution":{"observed_at":"2026-08-07T11:48:04.506777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.465683Z","title":"Selvaraju, Akhilesh Deepak Got- mare, Shafiq Joty, Caiming Xiong, and Steven Hoi","venue":null,"work_id":"00b80c30-be30-422f-ad6b-7cbf5890dca8","year":2021},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.771665Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:5a6aeb0fa1e43b740889c9e290d0830c7174b8b4eb81b00ef08e6fd29cbf8e08","observation_id":"0218e602-47e0-4e4d-8f5f-01d32fefa3b6","resolution":{"observed_at":"2026-08-07T11:48:04.477579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.431444Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"25ecffbf-0956-41d1-8bf0-3b079eb897d4","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.816199Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:b7b7b759e07f043c1ee088fdee80f09ad5ecc6d38c29dc16b66dc4a3e79c9a9c","observation_id":"80cab21c-fdcd-41f3-ad77-2ce7d66efa75","resolution":{"observed_at":"2026-08-07T11:48:04.447046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.408143Z","title":"Anomaly detection and localization in crowded scenes.IEEE transactions on pattern analysis and machine intelligence , 36(1):18–32, 2013","venue":null,"work_id":"9aa25670-b83c-4a62-b3a6-d4dc28cbab30","year":2013},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.861918Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:5ad67aae98d91fdf6455a54c4d4928c998e6dd50f6388e5af75549bfd6b97c04","observation_id":"26ccb0db-e76b-49a7-af37-77816ab71122","resolution":{"observed_at":"2026-08-07T11:48:04.416998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.382751Z","title":"Fine-grained key-value mem- ory enhanced predictor for video representation learning","venue":null,"work_id":"7389e259-7be7-49c0-9fa0-1644513bfe84","year":2023},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.897479Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:522d4367beed7145a181deb8cde33761301392bfe233e5d8977d8fbd2ccf79a2","observation_id":"e45c6866-5130-4dd1-9a7e-a2ea3b718453","resolution":{"observed_at":"2026-08-07T11:48:04.393712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.356014Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model","venue":null,"work_id":"b166450d-1504-4968-8090-86429d09be60","year":2025},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.944689Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:d9f677aeb0cdc4dc4840efca7e76daa7143bbbf761d851aa3471c4699f767ed4","observation_id":"ef58b787-bd5e-4cc7-a471-3dc9d2eab273","resolution":{"observed_at":"2026-08-07T11:48:04.368644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.330385Z","title":"Ntu rgb+ d 120: A large- scale benchmark for 3d human activity understanding","venue":null,"work_id":"21a2f473-b220-452a-8991-3b44aa1f8ee5","year":2019},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.980551Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:e2d99b2f36b0cc48686396c81e9574be7082c320397dd7e4910a1bba3a6d3046","observation_id":"a784cecb-13ac-41e5-bc38-6e3a1bdd2f63","resolution":{"observed_at":"2026-08-07T11:48:04.341893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.311733Z","title":"Fu- ture frame prediction for anomaly detection – a new baseline","venue":null,"work_id":"d903b090-cc28-4395-806b-ed1669477c1b","year":2018},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.015552Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:20a143cd1777cf391ae9609a0b37b286459c892eb534e3eacd327df255e7458d","observation_id":"57088754-9328-46ed-b572-3baaa8057a17","resolution":{"observed_at":"2026-08-07T11:48:04.318743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.290334Z","title":"Abnormal event detec- tion at 150 fps in matlab","venue":null,"work_id":"de13e0cf-0c21-41d7-bc8a-961e4205d877","year":2013},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.065422Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:5fe8ffa7c6a789016a4f3d7caad2b234acd00270aaef8dadcb99ec91a392556a","observation_id":"ba8dd758-a087-4f6f-afc2-8e1b6ba58bf7","resolution":{"observed_at":"2026-08-07T11:48:04.296958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.262816Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"c41741e3-7f8b-4b36-ab73-a799ea07bba2","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.110324Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:9b1ac5b4796095e78d62d72c37b3b159d243ef152167e8d87e6d762a66ff7d27","observation_id":"f88d50f8-8bb0-491f-9bec-e31856423e61","resolution":{"observed_at":"2026-08-07T11:48:04.275100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:52.201175Z","title":"A revisit of sparse coding based anomaly detection in stacked rnn framework","venue":null,"work_id":"eeae9495-7606-4948-bde0-b4b2510ad8a8","year":2017},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.147802Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:9dfd1f4c2b5cb6d95dd939f964ce76387617911ece8a0ea1d97b262552805227","observation_id":"cc15ba76-37ad-4474-95ac-737f93687af2","resolution":{"observed_at":"2026-08-07T11:47:52.230451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:52.089793Z","title":"X-clip: End-to-end multi-grained con- trastive learning for video-text retrieval","venue":null,"work_id":"a80cff79-23fc-416e-81fd-9ac32496ebd3","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.182569Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:0c32997f5d5ff13a757a355640c4fc8e068fbb6588e344e06dac3979adf2f62e","observation_id":"ea7a4e13-c862-48ed-a4fb-8b50de34b642","resolution":{"observed_at":"2026-08-07T11:47:52.157747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:52.021170Z","title":"MULDE: Multiscale Log- Density Estimation via Denoising Score Matching for Video Anomaly Detection","venue":null,"work_id":"36fc730b-a452-41f2-a59f-727b868fdcbd","year":2024},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.218181Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:1b3df665f11adb25bc64b610ee4387a0cf7ba46d29cfa4f338335e469fbf6fdd","observation_id":"479b3a4a-e8c7-4d05-87b8-793d42d18eed","resolution":{"observed_at":"2026-08-07T11:47:52.043913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.940639Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"7fb51316-9ef2-4d63-bc6e-4bb54f295d6e","year":2020},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.263702Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:f6ad2e6830ffc881cf3e7e87500e803c356c383fda5140f2313506c86155bde6","observation_id":"fe935186-786b-4e09-88b5-551c215b8fc9","resolution":{"observed_at":"2026-08-07T11:47:51.986421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.884658Z","title":"Learning memory-guided normality for anomaly detection","venue":null,"work_id":"25e136e1-6e48-4208-b384-81738bfa0eaa","year":null},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.305971Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:534555503d7e94b0bd483a072d44bd3772bd80feadbc60a43c0bb6ee0756e643","observation_id":"8a176fbd-0fbc-48c2-b9b2-ace4788a6b9d","resolution":{"observed_at":"2026-08-07T11:47:51.907315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.816546Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"e5ec8a48-b2e9-407e-8679-673915f4f675","year":2021},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.342033Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:a0a7a2182f3fa350934564bcd93fe8a69e63ba05b59cbcaef7bb010b1b1d9eb4","observation_id":"807ee946-4392-42bc-bf45-cc4779bc7854","resolution":{"observed_at":"2026-08-07T11:47:51.836927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.750581Z","title":"Street scene: A new dataset and evaluation protocol for video anomaly detection","venue":null,"work_id":"c461364d-dca6-466f-9d89-97620dd8d58b","year":2020},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.378013Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:9c58c187f1723307ce7bb21e6a9109d1e285e05b7227e48cd1126c412943bb2e","observation_id":"55e30f53-fc90-4984-8a21-33957f0e8697","resolution":{"observed_at":"2026-08-07T11:47:51.783052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.549168Z","title":"Deep-cascade: Cascading 3d deep neu- ral networks for fast anomaly detection and localization in crowded scenes","venue":null,"work_id":"85598a61-3742-4909-b6a9-fb74753faf00","year":1992},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.421107Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:f8b4c1249cd352d85360df4be4e87e68cc4210cc58bab6306c095250fa555fee","observation_id":"7ceab09c-2a3c-4ab3-8fbf-38ea0212d68f","resolution":{"observed_at":"2026-08-07T11:47:51.594973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:00.457859Z","title":"Seed-thinking-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.457859Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:dd68fa20236cea4aa1eab1da4b1e45b2474ecc03fa43d2b45336c47a28d310d8","observation_id":"7912519c-064e-4453-a84a-b65ae92d858c","resolution":{"observed_at":"2026-08-07T11:47:00.457859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.324309Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":"c898b0e3-02a0-4bee-b24c-d917a01fd1c0","year":2018},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.509178Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:3527423cdf93d53d05a614d635491332a06957a8c5f0b5268082f9b04368354a","observation_id":"822328db-508d-4f27-930d-ffcb4db7374a","resolution":{"observed_at":"2026-08-07T11:47:51.431409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08124","last_updated":"2016-09-26T19:14:12Z","snapshot_observed_at":"2026-08-03T14:48:01.874047Z","submitted_at":"2016-09-26T19:14:12Z","title":"Learning Language-Visual Embedding for Movie Understanding with Natural-Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08124","snapshot_observed_at":"2026-08-07T11:47:00.567024Z","title":"Learning language-visual embedding for movie understanding with natural-language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.567024Z"},"links":{"cited_paper":"/paper/1609.08124","citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:5079e1f08970e78dd748d2e4b2908984c50d07e06d2d8f6ec8bf29e7cefdb719","observation_id":"2489e4e5-1b8b-4c57-9127-e95d5f1a4b1a","resolution":{"observed_at":"2026-08-07T11:47:00.567024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T11:47:00.600380Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.600380Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:ffe98605d089fcf85224b06efb7de60ff6313d427bfbf773c76af3e81c8f0353","observation_id":"86774dba-c311-4625-9e30-c87efad533db","resolution":{"observed_at":"2026-08-07T11:47:00.600380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.136279Z","title":"Align and tell: Boosting text-video re- trieval with local alignment and fine-grained supervision","venue":null,"work_id":"27fddcf4-93a8-49ba-a388-2b2ab5d76de9","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.634336Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:a0d63ea1779fe0ffaa93d8ff2177dc801890f8da45893d46a377011a9d4e2100","observation_id":"d631f271-bb79-44bf-8efc-850dfbeac467","resolution":{"observed_at":"2026-08-07T11:47:51.215256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.960204Z","title":"Rtq: Rethinking video-language under- standing based on image-text model","venue":null,"work_id":"5915b8ba-5963-412e-b37b-b4fd5606a444","year":2023},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.668010Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:1ec5a87c8d625ad68bd4e98ae4cbcc99d2d8b6f95ed7a9569f226f292a1de3f3","observation_id":"5a9a5dc6-6722-4e3f-b70b-85b0f3e7175e","resolution":{"observed_at":"2026-08-07T11:47:51.043543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.884469Z","title":"Weakly-supervised spatio-temporal anomaly detection in surveillance video","venue":null,"work_id":"b97ff384-5bc8-4842-a39e-0cf743d48df3","year":2021},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.702477Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:ef5aafe54d40313eec18af69fca2aab49441345487b2cbb3e9194be8534c9940","observation_id":"a1308361-3255-44f3-9c1f-59b3f487f0aa","resolution":{"observed_at":"2026-08-07T11:47:50.914803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00298","last_updated":"2023-11-01T05:03:48Z","snapshot_observed_at":"2026-07-06T16:41:31.021679Z","submitted_at":"2023-11-01T05:03:48Z","title":"An Empirical Study of Frame Selection for Text-to-Video Retrieval","version":1},"cited_work":{"arxiv_id":"2311.00298","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00298","snapshot_observed_at":"2026-08-07T11:47:50.032128Z","title":"An Empirical Study of Frame Selection for Text-to-Video Retrieval","venue":"cs.CV","work_id":"b717b39c-e59e-4049-b726-0f75daf1f66f","year":2023},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.746919Z"},"links":{"cited_paper":"/paper/2311.00298","citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:0d1a8751a2f10afeb9f70b9ae8b176b9b82f703ec094205500128b4abd6421da","observation_id":"56210328-3d42-429e-adde-bc05dbf14b7c","resolution":{"observed_at":"2026-08-07T11:47:50.068685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.772429Z","title":"A deep one-class neural network for anomalous event detection in complex scenes","venue":null,"work_id":"0c811015-c176-47c1-a140-398a1e43ba27","year":2019},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.789124Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:ab4d13afa655226485d1a85e20a03cf958a876e1233a909a4d77d6ab4e94baaa","observation_id":"726c3cb4-152b-4f38-b109-c0b94bbe65a7","resolution":{"observed_at":"2026-08-07T11:47:50.847482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.700989Z","title":"Not only look, but also listen: Learning multimodal violence detection under weak supervision","venue":null,"work_id":"8716ac52-3560-4480-8cca-6480f541ef16","year":2020},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.031838Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:ffc3c1cfc12a7e14cff51555fdbb9f4ab91929cb619ff794a4746100820d7d55","observation_id":"011d23c4-624b-4443-8ccb-d5032e634352","resolution":{"observed_at":"2026-08-07T11:47:50.736171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.614654Z","title":"Toward video anomaly retrieval from video anomaly detection: New benchmarks and model.IEEE Transactions on Image Processing, 33:2213–2225, 2024","venue":null,"work_id":"50a037be-e796-451e-80e6-18129b16329b","year":2024},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.593594Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:107cc9c584258e548ccfa29ff9b724de0cf42afc80b8df1df0c11d72b12da6c4","observation_id":"0f655683-0618-4411-a9ba-631b06229c93","resolution":{"observed_at":"2026-08-07T11:47:50.646165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T11:47:49.662405Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.662405Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:13c869bd8e829cbfb0c7e5ea03deba939de521e3bb118ef41489c94a02ef507c","observation_id":"055c5596-8eba-47ff-951d-4c9d7a07e594","resolution":{"observed_at":"2026-08-07T11:47:49.662405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.530340Z","title":"A joint se- quence fusion model for video question answering and re- trieval","venue":null,"work_id":"6e5cbf20-e3b6-4df5-98b1-3f291c0262c3","year":2018},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.716576Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:8011cd41e603fa46d604135260b42bcee09f912e5d63003a22ba1f68e9b16841","observation_id":"7544813d-fc40-408b-951c-f9d34cf2ccc0","resolution":{"observed_at":"2026-08-07T11:47:50.572592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.435086Z","title":"Towards surveillance video-and-language understanding: New dataset baselines and challenges","venue":null,"work_id":"86bf8987-4d5e-4c8a-aada-afd9a05e0b87","year":2024},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.775107Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:aebf381c9c7090af2597754fc63ad14e17ba594551c67d5a20b92805e6fef918","observation_id":"85981e0f-2e06-4b70-bfdf-d4ce52478934","resolution":{"observed_at":"2026-08-07T11:47:50.477398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.335393Z","title":"Generative cooper- ative learning for unsupervised video anomaly detection","venue":null,"work_id":"f5ae8dbe-3345-49a6-9b4b-5e139435d77c","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.834248Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:b4096654da15fdcfa7d7d8c3e6e3536f077655423368a695d6b582637262b342","observation_id":"13787662-58bb-43ef-9e44-16aea6ba8ebd","resolution":{"observed_at":"2026-08-07T11:47:50.386022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.236779Z","title":"Multi-grained vi- sion language pre-training: Aligning texts with visual con- cepts","venue":null,"work_id":"098bb8e4-d399-4f9c-85c3-eac3ff00389d","year":2022},"citing_paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.917130Z"},"links":{"citing_paper":"/paper/2506.01466"},"observation_digest":"sha256:f8b578141e02f920ce6a3fed8c2b083f93a69e6a55a93155c6160354d2a32472","observation_id":"594de4d2-954b-4c8d-bd16-75a52231f0fa","resolution":{"observed_at":"2026-08-07T11:47:50.296830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01466","last_updated":"2025-06-02T09:23:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:38:06.223213Z","submitted_at":"2025-06-02T09:23:58Z","title":"Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2506.01466."}