{"as_of":"2026-08-04T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47942952deedd49f5e264751cb8c9abfaf13d4083b6e3c9c34e325576b8b0af6","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T03:48:26.807495Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:09:50.577740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.00336","snapshot_observed_at":"2026-08-01T02:09:50.577740Z","title":"Mvad: A comprehensive multimodal video-audio dataset for aigc detection.arXiv preprint arXiv:2512.00336,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-02T06:20:07.168293Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.577740Z"},"links":{"cited_paper":"/paper/2512.00336","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:9fcac53ce8ed87d7a988cd21c25de1d0e8949aecc632e50180a745caa3122608","observation_id":"8a8c9257-e712-4914-bca4-bfb95e7a82f4","resolution":{"observed_at":"2026-08-01T02:09:50.577740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.00336/citation-record","integrity":"/paper/2512.00336/integrity","json":"/paper/2512.00336/citation-record.json","paper":"/paper/2512.00336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:36:07.226215Z","title":"write newline","venue":null,"work_id":"8481976a-f196-4822-833d-e487ae5a1e81","year":null},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:9efd86d2b50755bcee49441f0abd49bbd1af70503a25f7ba1c061b3f6f6355c5","observation_id":"385ea3f2-394b-4b69-942f-8a78c5f7a5a4","resolution":{"observed_at":"2026-05-17T03:48:58.682602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-07-11T00:07:42.711856Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:4efafd40185dea8503090c94d1e3cd90534a2a66f04f738f19c92a4ef44d6c86","observation_id":"be46b26c-0823-4a42-b745-796776d3d43e","resolution":{"observed_at":"2026-05-17T03:48:58.485045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixverse: Ai video generation platform","venue":null,"work_id":"6c5f335f-a482-4907-bb55-0ba30bb37fd0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:492696a63648419efd93db28b683f6117d05e0645f21fae8be6392b9abc52fcf","observation_id":"bfb3ff66-0d22-46e4-99bc-01b76015ee21","resolution":{"observed_at":"2026-05-17T03:48:58.748751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan (tongyi wanxiang): Ai video generation platform","venue":null,"work_id":"a30caec4-c8ed-4404-8c5d-463d593bd473","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:165b482dcbc2542d7a678dfb38276c0d751cd17f23f2cee4507f0f2dcf0fdf1f","observation_id":"06801ed0-8e3d-42a7-a8cc-015c18139320","resolution":{"observed_at":"2026-05-17T03:48:58.689467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai-generated video detection via spatial-temporal anomaly learning","venue":null,"work_id":"c3dec086-d259-4961-8be1-dcba19f14070","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:8552380bfd20a7dd78db50b317d257655da88fa5b53478943ff5332ff68329a1","observation_id":"ba1ad8be-6252-440e-b739-2ae62638602e","resolution":{"observed_at":"2026-05-17T03:48:58.686307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Christodorescu, M., Datta, A., Feizi, S., et al","venue":null,"work_id":"fbb8a187-f8d7-44fd-8f10-a34ba17ec1c1","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:f3501d420ad1572e0cf107482b842096ea57e9d447a140e3f648612901007d6e","observation_id":"fb233442-266a-4ef8-9531-6a1c30fc9d98","resolution":{"observed_at":"2026-05-17T03:48:58.760771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:e4a5eb2f2b87d09ece2e122d1aaedf0290cdba1124b0c63a1a438042c1ab1611","observation_id":"f9debaa9-ecb0-43ec-a26f-ce1b534b8a3a","resolution":{"observed_at":"2026-05-17T03:48:58.498245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Dolan, W","venue":null,"work_id":"acfaf0ca-ab1f-45c5-a8db-1f18b1b0e13e","year":2011},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:965d52f1699343c5c906fd0cc98c64ae0cefdecd5d8ebfd9c82499534a1f16c9","observation_id":"9e456cce-2586-4711-beb9-c400eef1481a","resolution":{"observed_at":"2026-05-17T03:48:58.743124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffute: Universal text editing diffusion model","venue":null,"work_id":"8e01283e-794d-4952-9736-b7f7a16be6d8","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:fa0b8da86a6ddefaa28bacb4e35939e292c839af11bddff39ea277be44e420d6","observation_id":"5c2d038c-5b25-4881-9559-0cdb87202e9c","resolution":{"observed_at":"2026-05-17T03:48:58.718885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19707","last_updated":"2024-08-22T09:48:49Z","snapshot_observed_at":"2026-07-06T18:22:27.156635Z","submitted_at":"2024-05-30T05:36:12Z","title":"DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark","version":3},"cited_work":{"arxiv_id":"2405.19707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19707","snapshot_observed_at":"2026-07-02T13:56:59.231785Z","title":"Demamba: Ai-generated video detection on million-scale genvideo benchmark","venue":null,"work_id":"7ac1e8a8-2f81-4be9-b84c-03ad1078adcc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2405.19707","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:368cb818eee6fe3bc361454d3d393051b3bb238be097357f5b85a6c3df86bf59","observation_id":"5f9987b1-f6a8-4b79-884d-a082faac9e62","resolution":{"observed_at":"2026-05-17T03:48:58.490202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"2786aeb7-e33d-4229-b40a-415b1c5daade","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:10f087384079336f978614aece484b8f406a783f81dea6cce3833b4c945e609e","observation_id":"a283af88-5db6-41a9-b208-470110ee1944","resolution":{"observed_at":"2026-05-17T03:48:58.669045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-02T12:36:04.409975Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:341d8cb5774a64ef0ffa7f29914b7b883e197a2bf40097cd7e24b5f33edcf08d","observation_id":"b2177093-0791-4c79-9f92-221d3a59a587","resolution":{"observed_at":"2026-05-17T03:48:58.476215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-07-06T22:14:53.752207Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:fa07c23ad1587fa28943e9055367aa775402aa3154264ccd2fc9a51428c2ffd7","observation_id":"aff5c502-e45a-46f6-8ca0-34a01eb77b0b","resolution":{"observed_at":"2026-05-17T03:48:58.439681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10975","last_updated":"2025-06-12T17:59:33Z","snapshot_observed_at":"2026-07-06T21:41:14.693158Z","submitted_at":"2025-06-12T17:59:33Z","title":"GenWorld: Towards Detecting AI-generated Real-world Simulation Videos","version":1},"cited_work":{"arxiv_id":"2506.10975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10975","snapshot_observed_at":"2026-07-01T22:56:20.995621Z","title":"Genworld: Towards detect- ing ai-generated real-world simulation videos","venue":null,"work_id":"c1031e17-6d82-43c8-abfa-e14f425d6ec4","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2506.10975","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:45dbf9102ad954de73346718c82e399630beac43a58a9ef919719750e434e8b7","observation_id":"6b415433-1011-4cb0-91c8-4ba9b555151f","resolution":{"observed_at":"2026-05-17T03:48:58.508275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"K., Ishii, M., Hayakawa, A., Shibuya, T., Schwing, A., and Mitsufuji, Y","venue":null,"work_id":"ddbb7d3c-ac8e-408e-b451-09a57bd08686","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:6ca8602defcb5cd3ea829f799f1316f5ac2d88a9d17da2fef393f5d9e7c8a302","observation_id":"f94fbd65-2ad7-41ee-9536-01bb94e8e7e5","resolution":{"observed_at":"2026-05-17T03:48:58.729168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek ai chat platform","venue":null,"work_id":"df488d37-4b1a-48f0-9cb3-4d0e1a4330f0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:439b50a6cd411fc6afdc65520a16713dbf4e88e5e2453453a431903ec2da5b68","observation_id":"9d832905-4a76-41b1-86c7-d6383882e2dd","resolution":{"observed_at":"2026-05-17T03:48:58.698974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":"2006.07397","doi":"10.48550/arxiv.2006.07397","metadata_source":"pith","pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-07-10T12:17:03.842394Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","venue":"cs.CV","work_id":"c15e77e5-8189-45a5-98ca-f6d6286fb6e5","year":2020},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:129004a06a4affe404783fd5884d28de3ac62ed64716a257c3bacce8a26a5dc0","observation_id":"cbfb7b39-9a4d-4015-a19b-eec7d01089aa","resolution":{"observed_at":"2026-05-17T03:48:58.449861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Privacy and security concerns in generative AI : A comprehensive survey","venue":null,"work_id":"998a1ae3-fc7b-4966-baaa-af7e3e3787e0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:4c7f99634b1edec5279def95d8b712190e8756019be98f715ed24dd1f6fa71cd","observation_id":"d17fb73d-1e4e-4406-85f2-089e4660f65f","resolution":{"observed_at":"2026-05-17T03:48:58.710603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Haiper AI : AI video generation platform","venue":null,"work_id":"7e79a854-4172-4a62-af1f-259bf2b60245","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:1b2cd94d7b3a3ad345d33cc62e5ffd771e8576089b6e142b03a03528a0126222","observation_id":"274e194d-73f5-4ddb-8c66-12fdeaf162c7","resolution":{"observed_at":"2026-05-17T03:48:58.757722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"0df234b0-7229-46c1-9e5e-0c66a4866810","year":2020},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:8bd678571f408427048ed3def0ad0cf2c7061bc9d37587d0f4168f42bbef82b5","observation_id":"fadd186e-dc12-4b94-aa28-d98c3e458f1a","resolution":{"observed_at":"2026-05-17T03:48:58.763921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VBench : Comprehensive benchmark suite for video generative models","venue":null,"work_id":"e29c1290-1a74-4efa-8d36-0503cefad58e","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:dd0cb94525f7e986e526ce16ff08c1f11539dc61a762240a8a89bd186cc86fd1","observation_id":"c2ebd8ed-355e-449c-bf08-2d4498977f32","resolution":{"observed_at":"2026-05-17T03:48:58.776552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcaai.2024/46","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech-forensics: Towards comprehensive synthetic speech dataset establishment and analysis","venue":null,"work_id":"46648769-78f9-4c25-bb45-9aea8e32df2f","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:72b7d0a0e726de309773a3bfce2339dc82893743a7ce389f316ff19b48224b69","observation_id":"a4bbcb05-04ed-4b7a-bde3-d240acb30e22","resolution":{"observed_at":"2026-05-17T03:48:58.222809Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jiying ai: Video generation platform","venue":null,"work_id":"6b9a2f03-2ee4-4684-8897-a28b757c3b20","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:e9a47e5beea61a3453138dbcfe88b2bd5c27c43a306e650eb86a8099fc83a891","observation_id":"efb550e6-1126-44ec-857e-4afc930f274e","resolution":{"observed_at":"2026-05-17T03:48:58.773431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoofceleb: Speech deepfake detection and SASV in the wild","venue":null,"work_id":"e6780a0d-e1b3-4c4d-8758-4a609cdfb227","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:40be759efbea34b8d42d9fed3f44226f4a3fb77b3216de8d5c9f7743b18e1802","observation_id":"91bd9d9e-d018-4d1d-91b8-fa56f35463cb","resolution":{"observed_at":"2026-05-17T03:48:58.770380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-04T03:14:03.509708Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":"2108.05080","doi":"10.48550/arxiv.2108.05080","metadata_source":"pith","pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FakeA VCeleb: A novel audio-video multimodal deepfake dataset.arXiv preprint arXiv:2108.05080","venue":"cs.CV","work_id":"fe618fae-959b-4493-aef9-9ec5715f256d","year":2021},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:ab5b606689238562e1e46b3feaa833d97480d313d85fdd890527727c6c1f6b7f","observation_id":"8a75ae79-6716-4ef4-8cad-b3bbd923a34c","resolution":{"observed_at":"2026-05-17T03:48:58.454672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling ai: Advanced video generation platform","venue":null,"work_id":"d4c237b7-0913-400c-b992-3477b5a84157","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:e28b33a070f92c81c45830d6560de482a348393b536134023f3a942dd698ba49","observation_id":"91a5a70c-1c20-4e7d-b3c2-d66fe2279a9c","resolution":{"observed_at":"2026-05-17T03:48:58.678930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling ai: Advanced video generation platform","venue":null,"work_id":"ec2cda7c-f016-450b-b541-dff7749a2a46","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:f8a276c30c666cc5c7285c323a4acd27541dd3b440c1f4dce538c8fef4f1b9e1","observation_id":"cb96bf76-a2d5-4192-948b-fa6beb9e0373","resolution":{"observed_at":"2026-05-17T03:48:58.740978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:fce4731218b81f1f702539f7f23ee5fb9e33e7d89de1e38549635f6f0dc89de0","observation_id":"0854a0a2-e6ca-4e51-b458-91b31e781a56","resolution":{"observed_at":"2026-05-17T03:48:58.444755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Snapfusion: Text-to-image diffusion model on mobile devices within two seconds","venue":null,"work_id":"4cd872a1-d66c-42cc-8f2e-cf9f429a0d18","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:cc51898f84410a589b704577d413c7f096c6db3f04933f5db15ebf0fbe91afc1","observation_id":"27f0263c-bbde-44e6-b260-79b9f16520ca","resolution":{"observed_at":"2026-05-17T03:48:58.704696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stiv: Scalable text and image conditioned video generation","venue":null,"work_id":"74e37dc2-43fa-496a-af38-36c607282769","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:59d1443eda31245b286003509b103d6120c596a87a5880e707160125e019a6cb","observation_id":"c03309e9-ed0d-475e-8b3b-19fe2c112312","resolution":{"observed_at":"2026-05-17T03:48:58.701958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"616005c0-79d9-4847-a462-aaf483e4a7da","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:5335bcd79289fe2082c3210a5f031e70504780f63c199064d349bf097ff33b5e","observation_id":"511b0684-6fdc-4b10-8744-d6a284b04226","resolution":{"observed_at":"2026-05-17T03:48:58.734095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uve: Are mllms uni- fied evaluators for ai-generated videos?","venue":null,"work_id":"010783d3-c959-41ae-a7ca-4784395a9152","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:4c973f707fa2ad6c38f821ff4802fb88d07207a14fe64fafd6971f223c6a4c56","observation_id":"06dfe0d5-1661-4759-8e92-498e5a3668d7","resolution":{"observed_at":"2026-05-17T03:48:58.434459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeCoF : Generated video detection via frame consistency: The first benchmark dataset","venue":null,"work_id":"a9e9e530-c288-4746-8905-d9eab2805329","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:fb4ad2570c52e592158aad3a4b02735cc6fc2633c3ad0ea9d7028b2f81c02000","observation_id":"373a8b8c-e438-4957-9e27-4af6ee801ae4","resolution":{"observed_at":"2026-05-17T03:48:58.731700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moonvalley: Ai video generation platform","venue":null,"work_id":"10e6bd25-1dfd-4d5c-9922-b19477bbe06f","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:9bf3a1bd399eecf65be9f816433173b69d1774b50485bb67aaa4b4c42fb1312e","observation_id":"01b51975-af4e-457d-a69d-7620548f457b","resolution":{"observed_at":"2026-05-17T03:48:58.672210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-02T14:57:48.676109Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:f5440b2bdcd1d8b7ca80ca63503e3465f26e2ccf3563385422c76b387ad3e0d5","observation_id":"de74674a-4403-4655-8f83-3db6bf4b7de4","resolution":{"observed_at":"2026-05-17T03:48:58.480719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.11340","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:33:50.981345Z","title":"Genvidbench: A challenging benchmark for detecting ai- generated video","venue":null,"work_id":"2c04927e-61cc-44ee-844a-c7c544b06bca","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:ad49cfd537343ae5f76e36c2981fe7481fe65b7c4528a02f511c0f63359915e3","observation_id":"9163091b-7f8a-46ac-9cb4-336cddaaa5c5","resolution":{"observed_at":"2026-05-17T03:48:58.518103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1352696b-dae1-4e4d-8d98-39c0089dd8dc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:3b2e51a8f30cc5814c2f09407389c25ea57afba28e359c19bf9f233b1caf6e1d","observation_id":"49270c42-31b2-4728-82f8-aceaf78d57e4","resolution":{"observed_at":"2026-05-17T03:48:58.663956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora: Creating video from text","venue":null,"work_id":"c5f46323-1aa6-4fe1-8a45-c71ea90fb0d0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:a4cb1dfdf6bd25dba5386339a4a71204019b4dbef59897a1df6779d5f1a23d0e","observation_id":"1ea498d5-e9f5-47c1-898f-f05538fb07cd","resolution":{"observed_at":"2026-05-17T03:48:58.745699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora: Creating video from text","venue":null,"work_id":"817a7dbd-3c69-43a9-9d2f-52efaf887cbc","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:648b84c93abb2ac0298c656cb8250e6d3b5ff37ea953117ed2dce090b9e04b4d","observation_id":"1c1cd15f-6ef9-420e-bcde-4cc2aa13ad2e","resolution":{"observed_at":"2026-05-17T03:48:58.767119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pika: Ai video generation platform","venue":null,"work_id":"07329cc0-da43-4282-8968-385988841bda","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:63c245e1d0abf7a9443e6a82032e6fe932b53933457875f601ef26d0e0b0857c","observation_id":"4f57e052-4437-44d8-9169-69ba2369f3cf","resolution":{"observed_at":"2026-05-17T03:48:58.707582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Runwayml: Ai video generation platform","venue":null,"work_id":"22f187f6-0bc7-48a3-a90c-62ca8130756d","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:92aeaf1f83c91945f089dfea18ac3c84b90ccab7d12e844c558a9282456fef9f","observation_id":"253e9e22-cc2c-42fa-b68f-6643fe72e3f9","resolution":{"observed_at":"2026-05-17T03:48:58.726841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-07-06T22:17:02.502437Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":"2508.16930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-07-02T04:56:39.439125Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"c52cc69a-842a-4c11-873a-e3d9aaaeb3de","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:3d5dbb1c1543e57813de4c78e5137b37540a52ad0e46112e9d72527100b6c494","observation_id":"50efffe9-2666-45d3-a15b-0ec52b44af34","resolution":{"observed_at":"2026-05-17T03:48:58.471609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On learning multi-modal forgery representation for diffusion generated video detection","venue":null,"work_id":"d900bbc2-959b-4d4b-8983-508e6f68ba5a","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:d89536ed340b6b02f54de6fab36f3d45f2de8861e77f067e42e9c5531a85347a","observation_id":"dea81e3e-a84a-4672-8059-f183746fb1a6","resolution":{"observed_at":"2026-05-17T03:48:58.724267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":"2503.10522","doi":"10.48550/arxiv.2503.10522","metadata_source":"pith","pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","venue":"cs.MM","work_id":"ec79607c-bea2-4879-85ed-00db057adcc7","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:7fa7bef19ce746908378614d7a7d2dd63af18dc536755aa34d73f55253f46a90","observation_id":"01912514-e6ff-413a-932d-456ba25297a3","resolution":{"observed_at":"2026-05-17T03:48:58.464790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Noisee ai: Ai music video generation platform","venue":null,"work_id":"2a8bf184-359f-4c64-99f5-59079bd284af","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:762b85d818dbabef5fc04a136f387556ef6e9012ba6cc3e9a2625fbcbd44443a","observation_id":"9b6a0c37-3867-4399-b1ea-385bc8941c5d","resolution":{"observed_at":"2026-05-17T03:48:58.721738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo3 ai: Advanced video generation platform","venue":null,"work_id":"48154ecb-d9f3-4f20-8801-6b1b5874ede8","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:8562b3e46ba71124b4bcbbc0004969db3f0ad6c617894852ddb657ce4f0166a9","observation_id":"ce423e2f-c8e2-4e01-88b7-b1ff7a154525","resolution":{"observed_at":"2026-05-17T03:48:58.675390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vidu: Ultra-realistic video generation model","venue":null,"work_id":"b7d4c523-f092-4534-9f49-e8b91f1c608e","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:670df3f6d02ad2c9fcc72d8db14f07546ea00b52ab0c8649cb9bff41784f6879","observation_id":"1e84c879-3455-45d6-95db-6520b75a922e","resolution":{"observed_at":"2026-05-17T03:48:58.779587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viva video ai: Ai video generation platform","venue":null,"work_id":"d156e4e9-d517-42fb-ba0f-dc5403a008a2","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:137f217c25b8365859f5a4d23e748efa83c38e07f0a38c6b71524c33b7278257","observation_id":"e12fc069-f194-412e-a5ad-7646c49b25ec","resolution":{"observed_at":"2026-05-17T03:48:58.737094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-10T06:36:52.573462Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:fe60472a9c0ef8bfd8c49749ef234fb8d1fb9016bcea5bb2469457f20105f658","observation_id":"8490cdfd-32df-451d-8825-b2c8c225a84b","resolution":{"observed_at":"2026-05-17T03:48:58.429877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:2c46ebe7b40a8908d1aa8c9f360bd8a49baa873f49c360e1173e25dcfae87879","observation_id":"aee86242-127c-4615-a89d-8336e02dae48","resolution":{"observed_at":"2026-05-17T03:48:58.512894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"ba7e9179-f130-46fc-9396-650377fa0674","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:c2f85708b3ae04717ff5ff9ea8f1e39a44dd7034b1177b632be448e3df692c77","observation_id":"bfb542af-99c8-4afa-ae7d-4972022864fd","resolution":{"observed_at":"2026-05-17T03:48:58.751676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":"1bb44fe8-38a2-466d-b71a-e7a2f39eacc9","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:02c6cd16d60fca0d2f1441369f175a4a482d16a9f98b805271ca020a020fc779","observation_id":"99ec872a-2f0c-4b73-aa44-141f08650ff9","resolution":{"observed_at":"2026-05-17T03:48:58.695929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.11336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.639632Z","title":"UGC-VideoCaptioner : An omni ugc video detail caption model and new benchmarks","venue":null,"work_id":"3c348e09-df51-45d9-aade-df844c77a187","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:c4e81de883c0a14a82cda54cf3812bacf281742adfc199e5d1940a70ac4e16a2","observation_id":"40aa8e99-3fd4-4cdf-93de-2182c11273bb","resolution":{"observed_at":"2026-05-17T03:48:58.503202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MSR-VTT : A large video description dataset for bridging video and language","venue":null,"work_id":"23935bab-5883-49c2-9aa9-6566805d8cae","year":2016},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:43d077501b05d015c86d2e6cebbd81a889ef63fe89891c688eb0295363aee9bd","observation_id":"c245160a-4d9f-4606-b9ad-5db345a98370","resolution":{"observed_at":"2026-05-17T03:48:58.716384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"3c4fd165-2a58-466d-af26-a61eb10205cf","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:d34ed1e84242135c17e2bdde154f334f5e14c3e7855946d3fdd020431ad4a1ed","observation_id":"c7a10a39-8adf-49be-ae4f-c6ea8c30eaa1","resolution":{"observed_at":"2026-05-17T03:48:58.692452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-03T01:05:23.269633Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":"2407.01494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-07-08T07:14:45.319897Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":"cs.CV","work_id":"15978118-0cb9-48fb-8c66-d8f1ea7e79fc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:c2244cb5f8a459c96d06b9bf1b228266c2d59b00503df9bdcd779eba220d8d24","observation_id":"270cdb8c-cd4a-449e-b745-efa3bffbc071","resolution":{"observed_at":"2026-05-17T03:48:58.459651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Occworld: Learning a 3d occupancy world model for autonomous driving","venue":null,"work_id":"068268f6-fd18-480d-9634-bb8a07e596c3","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:8561e867022c6ce5b71651de7300742b547463391e69c712a434187de5dfa90f","observation_id":"7f26f15f-5020-4141-ab57-831089f2ca56","resolution":{"observed_at":"2026-05-17T03:48:58.713578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:d295b22dc4620bb2adb751cfd9c816dc2ef2d26dcb8046c32e8517b6ac2cb84d","observation_id":"65f086f1-3f17-4604-8f29-e6c908eb2083","resolution":{"observed_at":"2026-05-17T03:48:58.522778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harmonyset: A comprehensive dataset for understanding video-music semantic alignment and temporal synchronization","venue":null,"work_id":"efbe3785-04b7-4020-9158-6d369db783f0","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:94ff550cd3076272313055b72503d162fa255cdd1964387eb08d8ac8e3af6a84","observation_id":"91170183-a9de-4f74-aa59-24d9f9cb0632","resolution":{"observed_at":"2026-05-17T03:48:58.754656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":38},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2512.00336."}