{"as_of":"2026-08-07T17:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:311df155aa979663e2f8a564cf60a41e3232d9f5ea1e0eca6cb1fd5b40b36109","coverage":[{"denominator":278,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T09:16:37.881212Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10787/citation-record","integrity":"/paper/2607.10787/integrity","json":"/paper/2607.10787/citation-record.json","paper":"/paper/2607.10787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:5bce1479d1529f43c711ca67346206e303031072fd9626a9ca766d17fa890da6","observation_id":"0c6e7c7f-1de3-4253-a087-ce14202f0ebf","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:38009e149e6fad8f3c8e507e14ef331dd72c7ddf43a3641ee90269010c3e867c","observation_id":"b6dff643-23b5-4961-8039-a02b1344bdd4","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:7f34bde7c5a0f205715dcac2765c6b9fd5d3fad3f25f3ed0db6b195dd8e8d79a","observation_id":"580f69c7-f8d0-4e01-8845-99809927364d","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:feefbf7f30e2f9fce909733548b46d7e0c7ebc55d5a40975075c3617ed84070d","observation_id":"c8f45b89-b579-41db-a0a0-3d877d3f6dd9","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 37th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:c2501b969b0f2b07e0f1bf971c222fd1ec2b6385f0b5b32e49725cb16c34d0e9","observation_id":"b97db3ad-7184-4828-9f4f-d5ff85a573ce","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:c4514bc6d966e8c4641f9a381c3bcf92acbafcf74ed567fad148265b5070d758","observation_id":"b8cc641c-b61f-485b-8d5f-33168ff99e48","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2021 IEEE/CVF International Conference on Computer Vision (ICCV) , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:1734672efb3da0d3ed687c9c9e49425d3fc8c774f74e596ce4baae11e8007f19","observation_id":"9f439e6f-b810-49c1-9694-4045c68e837f","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:3a1dd429a9e04800c533266c463544f185ca5cfdd63f720b76efcc9a2caf57a1","observation_id":"35dda2d3-36b2-4373-95a1-a07195f35e5e","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:e1646604757ca6e32503d79fb155fa8a658557527bb852e4410ad945268d0e3e","observation_id":"3ba522de-5ac3-43e9-9547-99d36955f3dc","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:da49538c2c08e069f0598b3dd1f4dae0d12db3c7da90a513cb219caa239a486b","observation_id":"6bcc3fbd-a279-4002-972a-949739b9a190","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:d407cdb694d383d3b7f07dbf6b0f48eba19f7c139ee903fc13816cd1fffc9013","observation_id":"2cd04000-aa54-4dcd-aed3-69365a4344ca","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2019 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW) , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:6fa174af2b1d02bd8dbefe5d1378f1edc26e242eac3080769bed6b67278fcff0","observation_id":"8400e060-a91c-487b-8cb2-a9fae733970c","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2020 IEEE international joint conference on biometrics (IJCB) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b44314a8803e30273821e517df0ae9fd80d776867313e54cc90df1ddb14152fb","observation_id":"c4c0f437-c311-4107-b7b5-af0f0e0929b8","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2018 IEEE International workshop on information forensics and security (WIFS) , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:60ea38e375664c43a27cba4b4541532ec47f473900dcc9ef397de2a1a47e9aa4","observation_id":"891f7de7-cf25-4d7c-aea6-dfd15fdc4713","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"The Visual Computer , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:a29140cb8ec63429a682b9c8abe32d8bbe6e14e1096a236e66985cbcbca70467","observation_id":"97666b7b-171c-4dc4-b454-73eb65e83693","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:800a772c3a6a8d176ddf6931f17c7fb94f0c8028d3d2f8e5e5b6d82a84b8ed68","observation_id":"ffc48574-eb53-4b71-8158-0d11ec519d86","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2021 International Conference on Information and Communication Technology Convergence (ICTC) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:52be181bcf13dc0840e2745c47e1cfbec65ef232c2c9813971460cad2a8bd04d","observation_id":"3695d179-38e6-42af-a93f-403e7e4775c0","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"IEEE Access , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:f3244182cd6b6778c399295e0fb15a0f6aeabf04c96d9724231ca09ca78071b8","observation_id":"c0565043-e3c6-4038-bbde-304dcb527646","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08380","last_updated":"2022-07-18T05:14:24Z","snapshot_observed_at":"2026-08-04T04:06:04.945777Z","submitted_at":"2022-07-18T05:14:24Z","title":"Visual Representations of Physiological Signals for Fake Video Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.08380","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2207.08380 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2207.08380","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:f9567c631802207f8ff081b76bd8ea0076167a1a44cdaf926e346e91e99bb1e1","observation_id":"cad87556-2bb2-482c-bdb3-13f3a3d41a07","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15561","last_updated":"2021-10-29T06:05:52Z","snapshot_observed_at":"2026-07-06T12:03:21.405261Z","submitted_at":"2021-10-29T06:05:52Z","title":"Exposing Deepfake with Pixel-wise AR and PPG Correlation from Faint Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15561","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2110.15561 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2110.15561","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b8dc15f2b6fc3928e35746a8b9da14049dc6d235b1700f9bba5fa61db4fb1117","observation_id":"e8e69d92-827c-40dc-af4b-954c8ed71da2","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"IEEE transactions on pattern analysis and machine intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:26c7bfdeb70ef10b034574ff4ede0a6fa3d3a0fbf7534165c13ebc35c310c8b1","observation_id":"ccbd1c1f-0c54-40e0-b1c9-7e2d17df6dd0","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:bb00b205207da7719554ed6927fdc0c01ee6d75f0b7b50363309d24cd77b2262","observation_id":"ef88d546-4f0f-4a9f-aa85-32803e39bebb","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09601","last_updated":"2024-06-13T21:52:49Z","snapshot_observed_at":"2026-07-06T18:30:41.802045Z","submitted_at":"2024-06-13T21:52:49Z","title":"Turns Out I'm Not Real: Towards Robust Detection of AI-Generated Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09601","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2406.09601 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2406.09601","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:627383cea2ce505462da25d32de295da9276191c651bbf8767bfb16a50e2cd66","observation_id":"6a520cbe-08ac-4175-8d34-e491617204a6","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00400","last_updated":"2020-12-14T14:34:23Z","snapshot_observed_at":"2026-07-06T10:00:32.161241Z","submitted_at":"2020-10-01T13:37:58Z","title":"DeepFakesON-Phys: DeepFakes Detection based on Heart Rate Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00400","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2010.00400 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2010.00400","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:ede966805229c03120a79f0feee6ef7d3150266f5ea7603a370955a0b7526738","observation_id":"18b3a503-187e-487a-9c40-a4bc570b9755","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 28th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:75935fbd293d4cef929e599892e11e22507482e8ad8fea7e30087159cbae5131","observation_id":"7468e190-05c3-474e-a7d5-f9bf2affd3f1","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:934fe0629b1bcec82e6c490a1d329e5960e9bbe08bbe2faa5b9764912d8ad65d","observation_id":"5accfdb3-c721-4540-868e-5a7d64496262","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:cafc6675b141e6b4e1937cc34afc7a8fb7b6469d62154ee2749d1104105b6298","observation_id":"bc60491c-5e10-4321-8b37-54b3bda3b63e","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:53f4891cd5a7a330a5c715b51febec437bdc946b192379fc8f0c680de507412d","observation_id":"9dce3e36-0949-4b17-a342-81ce1f9e9b27","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"The 20th Irish machine vision and image processing conference (IMVIP) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:f266db75faf94f2003aeea995639e43f8cd593dbf2264235fbd5eb0460800bd4","observation_id":"c74e6ec3-fc06-40d9-8aa5-9f561aa60f08","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 29th ACM international conference on information & knowledge management , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:1857fe454543fb8601e551588feb8b234e7ba3b834b93131c8c8b9fc27a3c1b2","observation_id":"42239cc8-58d5-462e-82a0-c5086298d9aa","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:8c56a49b9b8e462025d33ba9c268a0c3d8ec92f8cc57aa61b7b853e086c9db02","observation_id":"b7459516-2edc-4ebf-b654-1a2236da59ea","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:48474733e2391c847799c51b15d0c9383c2eb31c342621c0381f0d0dfe93e556","observation_id":"c86640ed-ef94-4717-8fab-70d17384ed73","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"ICASSP 2019-2019 IEEE international conference on acoustics, speech and signal processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:604ae2924f8e8cdb5cf3d11156d675f6a6a94bcc39d236a8beea7d275163c417","observation_id":"bb46ad82-f9b0-4fd3-a43e-7adf493e0083","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"APSIPA Transactions on Signal and Information Processing , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:bd83fde22a8a27c50cf9ef999a0ec9b05ad322933e98b7877016aa5098250d60","observation_id":"8d621b29-f772-4dbc-aab1-15c7f9b05080","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:e09bdec67707aedc157e2734a7648cfa4efc0689816cdae1b12d2b92620ff3a8","observation_id":"a76b5560-a504-4512-b411-04b8c1cfc5e9","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"35th British Machine Vision Conference 2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:591a41a612b1fc98b9920f6ac00509f5357b37945e387922d78c5639f0b1f1e2","observation_id":"0aff161e-72ad-4f80-9da1-1944a2d49402","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:69fb4c184ad19176805f73480e12c2c4e1d107032573902b33a36f982e81a9f3","observation_id":"a4085a3d-5a09-4b76-b0f5-289557fc7e29","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:0c48172b346e2146f7e6f9a9219aa4b5fbe12bd627b6f9720687906c39a2f89e","observation_id":"d9d9d0f5-4e45-4db0-b2df-6540efe59db9","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:ab2b0792f5e5f6e40046c30c51680a7b46f4fe8738e34b1248bd1154c4e78f17","observation_id":"e9b06bdf-c208-4097-b75f-c97729288a03","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:ea42ede0c7e892eb4daafbe065ac97b13ab954b6a90fc43b1fe29c61f38d7973","observation_id":"117ca051-595a-4853-894f-c8d468fc81a6","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2510.24285 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:16f4ee89291c1826cf22670a947f643313e32ee1a89751e90c373cfd0bd01e46","observation_id":"371aa94c-310d-4141-9312-eaccf4df7007","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06803","last_updated":"2026-04-20T09:04:42Z","snapshot_observed_at":"2026-07-06T22:41:19.981014Z","submitted_at":"2026-01-11T08:30:49Z","title":"Forest Before Trees: Latent Superposition for Efficient Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06803","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2601.06803 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2601.06803","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:a0e8e69452f47c2d6d3b3521b3ab73b1b3f8785010407adfc3bb8c2b1a1bcc81","observation_id":"9d832085-06fa-459a-9214-09327d4e3766","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:f01460689b28e8bd5ac9d43c0f2cb2936f9cbe9386acffe68bc1516466b8827b","observation_id":"4da6fec6-dc80-4baa-b64c-b21eb92ad1ef","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 42nd International Conference on Machine Learning , series =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b07523fb984ec1c23124aa46d9950b6ac8b45ea6ba7cc6ad31cefa8c48381724","observation_id":"43d32f85-4c78-463f-b196-219bda5a993b","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04501","last_updated":"2025-06-04T22:50:07Z","snapshot_observed_at":"2026-08-07T10:38:27.509312Z","submitted_at":"2025-06-04T22:50:07Z","title":"AuthGuard: Generalizable Deepfake Detection via Language Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04501","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2506.04501 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2506.04501","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:1c145fedf7d5f530c8915eeb4881639a67ac5a01793d043730c698117cb0283a","observation_id":"044c57a6-8884-4af3-aa2c-89a8966b0f08","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14994","last_updated":"2025-02-20T19:34:58Z","snapshot_observed_at":"2026-07-06T20:40:06.124191Z","submitted_at":"2025-02-20T19:34:58Z","title":"LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14994","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2502.14994 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2502.14994","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b5a13dfc758f13a8487972f96de6d4a7130813774a4c81cc1d1f5ae6d3f81cfa","observation_id":"2d9fce17-49e1-4472-ad66-e77c28e8999d","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2510.02282 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:68d0c22c08b0ae9aa459ab11a704b8b3a0df28bc920498f503712540e2dccfb8","observation_id":"b1bb2faa-e3ec-490d-9e40-874578c41f37","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2508.21048 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:de36376b6bfdafbcc83fe1fbf046d50b8572133f5a1477adad5060875f03a2bc","observation_id":"1476ed4c-cdce-49a3-9694-c6a7b698e254","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2509.22646 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:55bd05c5efa09c97b0cd95ff10040dfec7eeb06120f188cb308f63560506c6e7","observation_id":"d861eddb-eedb-4574-bed9-fb355ffa9efa","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2108.05080 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:95ab52fdb75083b2343ed4be72747d630b24e81467c4af9cc07ea2c571079bc6","observation_id":"7d79cdbd-432c-4dd8-9402-c4deabca9d37","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2006.07397 , year =","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:d9925e7dacbf24ba802b05e71c97df4ce91820ffecbafe5f360fa4e101ce0fd7","observation_id":"7d4e9ca4-d20a-4006-b196-de5c9502d9fb","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:08e6738a1197ac10770087e2ec9141db7cb943d19a99caa8f9575daf70300be1","observation_id":"27ec1db6-1e98-4cb0-8f94-6f4a44e08173","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Image Analysis and Processing -- ICIAP 2023 , series =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:58cc3bb922106862420ff648d3cd879bac5f9cf33bbc6d9263d3a7df0cd8484a","observation_id":"45f6993a-af84-42eb-b35b-94db12baf359","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b254081156fcefb12d19d76b860f7b9cea1c691521f28df722796b367e08b3a3","observation_id":"16d1c880-c331-4bd2-8b30-76b53cf54d6c","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2510.07550 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4dcba631911f87ac1da35e6f915452d2250af5846f7229249cc19821a455dbe8","observation_id":"cde90911-6594-4b6b-b8f8-de62574bce29","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02918","last_updated":"2026-06-29T01:14:54Z","snapshot_observed_at":"2026-08-07T16:11:10.408396Z","submitted_at":"2025-04-03T15:21:17Z","title":"Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02918","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2504.02918 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2504.02918","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:6fefc5339bf89b4ad27aea73b6b5ecd0a3d05e12c8703d2ff3737a5977689c30","observation_id":"7800022c-29ee-4f89-a4da-f8915bea1c1a","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00337","last_updated":"2025-05-01T06:34:55Z","snapshot_observed_at":"2026-08-07T15:57:27.646623Z","submitted_at":"2025-05-01T06:34:55Z","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00337","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2505.00337 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2505.00337","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4455836a3782fac5714b0d37a830cfbb3835ef8807169dc2c52b7461dd8bbb50","observation_id":"9e410049-9217-415e-9faa-34fa82d15a79","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13428","last_updated":"2026-05-26T08:34:24Z","snapshot_observed_at":"2026-08-06T16:22:35.916708Z","submitted_at":"2025-07-17T17:54:09Z","title":"\"PhyWorldBench\": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13428","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2507.13428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2507.13428","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:9fd6f25fd1ea2b6d31bd016f0e8aefaa3461f78e05f0ee6908d7a1f1b3586c1c","observation_id":"03f63bb6-53c1-44eb-8ad4-3c1c4842ff06","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.01843","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2512.01843 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2512.01843","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:01b0e8f957ff628e955701fafd9e5789da047938977986c4a736af81625d2cc7","observation_id":"b3b1cea4-f6a8-4a25-9266-5e90895ceb96","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2411.02385 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:dce927eda099459f9e6da387a75c24e4737be785fb665f38e6f56c7036c7465c","observation_id":"81a305ea-c709-4138-980d-11527c80d072","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:525f2e960d40f9255e2e9765524b087710dfac7cc99eeab69dde41dcf8045fb9","observation_id":"18146a03-dae5-4141-b9a4-09b75de077a0","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2511.18102 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:68e54d9b36204c5d9169162985f9af1e923c2fff6a71ccc95882e50791a648bd","observation_id":"37833ef2-fd2b-42fc-be25-1bbd8693257a","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 29th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b0485f6eba6cd181744c5f613c8f90f09995913739f93620647532f6b9b1b841","observation_id":"fa4f016d-673b-4126-a91c-49b48ea07041","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:cb123b76f56db732b2741c5088f95a4b7bd9516b2b1149a476297693f8786c10","observation_id":"9dea41b0-94f0-4e2d-8f2e-1a1f141e6c28","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b34d6efa12dac2140d3662f7844e5bd9c46174eac81725c0d296746fe68f4a67","observation_id":"d7318deb-371c-437f-97c4-ae3f7b8b6245","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:49563c7602e6c5d57618fe75977f3e5a90d633bbd020ef54fd1ac909c5970893","observation_id":"e8e3505c-d8a9-471b-b925-6ef67f9da528","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:ccbe0bcd06e75fcc182dd5c7e06e0d9fb7cd6f8f4e8581e3d0f644b951b92f11","observation_id":"c08b2431-8fac-451a-b90f-a99bd6a81d94","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2020 IEEE international conference on multimedia and expo (ICME) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:c4b080b27ce35dfd4ea5428fd39f10d6258d2eb040fa2d037b1874e812c556af","observation_id":"094000e6-ca4c-4a07-b1b6-1ac50a43002d","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:3fd9efc3a6989440eaccbab6e2388337f617b4ec13cc3aa3dabb293053d5c7c4","observation_id":"89f0c085-8c7f-420e-90fa-ea5a236ab598","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:81f980a637a775f811b3d30e3b9dc9e1a3d12ff71bbf453d9f4fd249f95040c2","observation_id":"2601fb4a-8b4b-4208-a218-c645ad5bf53d","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4229fa93b6422769b38f47ced88bb0c9278e54276552c13a20c304721665272f","observation_id":"212526e4-4362-41eb-8094-9c15eedcae13","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"CoRR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:9a19692ba871f35734019a01b036454c8f9de8b960c911a0cb30d18ecf7e24da","observation_id":"03ef81f0-8f41-4697-b236-bd94af00b32a","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13435","last_updated":"2025-01-23T07:43:56Z","snapshot_observed_at":"2026-07-06T20:24:50.262766Z","submitted_at":"2025-01-23T07:43:56Z","title":"GC-ConsFlow: Leveraging Optical Flow Residuals and Global Context for Robust Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13435","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2501.13435 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2501.13435","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:7c71cc9a9e0453e568473e857075c9639a59177e1f97047c69db8174ad8a5dbe","observation_id":"497d868e-4bbb-4005-ab72-563229e7037b","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"IEEE Transactions on Information Forensics and Security , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:a72135b20cd53c1c15342eb4d4cf97ae7dbc0febb1522c38d07d95c73b32eb09","observation_id":"b555ace1-d36b-4701-9c77-e9ebc5deeebd","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"IEEE Transactions on Circuits and Systems for Video Technology , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4136c36ee17ac4a9fe90d120a9f9b380c9f4217f087361eda2f8a3a5f3d81e23","observation_id":"1d54e2af-902f-42d3-9ec4-88c284b56500","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"IEEE Transactions on Multimedia , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:bcc0557319b0fcee5c751bbfcf91537f6195cba3b52b4d8e1b7c42a7542bd703","observation_id":"67254bfc-9d34-44e2-998e-2e8b534cd362","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02398","last_updated":"2025-07-10T06:52:35Z","snapshot_observed_at":"2026-08-06T20:28:00.778891Z","submitted_at":"2025-07-03T07:49:55Z","title":"Beyond Spatial Frequency: Pixel-wise Temporal Frequency-based Deepfake Video Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02398","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2507.02398 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2507.02398","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:0cbf4d088997a51d9918c72464b188aa152141c24b7e343d0fa1efebf0349992","observation_id":"0977fc1a-a29c-4a61-a505-b9570a8dd9bc","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:6a9e7da7f455bc2908c7c7e7232e7b8c10812711fa28146c04e44da28a707a18","observation_id":"2255e46d-a313-4249-a146-ff7429d824a5","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03334","last_updated":"2025-07-14T05:02:35Z","snapshot_observed_at":"2026-08-06T20:10:34.107551Z","submitted_at":"2025-07-04T06:42:51Z","title":"De-Fake: Style based Anomaly Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03334","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2507.03334 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2507.03334","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:e51c0338816a1be661900e3725cf205cab4d457d80e73e3b27a1deec0bf65e17","observation_id":"33117486-8254-44d9-8456-c8726036573a","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07607","last_updated":"2025-03-10T17:59:38Z","snapshot_observed_at":"2026-08-07T17:15:54.257585Z","submitted_at":"2025-03-10T17:59:38Z","title":"VoD: Learning Volume of Differences for Video-Based Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07607","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2503.07607 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2503.07607","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b7fe33372be1a65b796e89f6d5654f658b127666b2cff36a7c296375b2e727c2","observation_id":"e8b0ac30-120d-449d-9c96-9837ab1483b0","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4e6a3b2b71fdd59989eb3f2ab66b313427f4cb663cb0e92f06bc69d9c1b31feb","observation_id":"c9eb7ce4-0a58-4c2e-aa33-948e0a09df3c","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:62933ce19193a51ed7098e78878748ce3f7f3272e5a42d06c08d70dbed01ed61","observation_id":"d4deaf06-9df9-4528-af28-4d17e24c05b9","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4f179b49bf8246ed3ff44b595094deb5bc33d697238be8f5d4b389b95e6c0139","observation_id":"6815ff52-bd26-4a72-8398-a21a3aa8d464","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:f9b1ebb21d694fb14797107c0a6e0b34b222fb2367f0e019a51c6c6e81c0131a","observation_id":"1584f34e-107a-4e4c-9ea5-ee9e9e6b3256","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2509.25503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:798e3f562220c9b800c92396154be025c0398e73c82810c5dc87b9ffaf72188c","observation_id":"fdaf13eb-f5b3-46cf-9d73-b4985beb7724","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03930","last_updated":"2020-12-07T18:59:08Z","snapshot_observed_at":"2026-08-06T08:38:45.843213Z","submitted_at":"2020-12-07T18:59:08Z","title":"Identity-Driven DeepFake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03930","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2012.03930 , year=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2012.03930","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:e41093b1e01ed897c02cc29f3d86e17e447ea5a327804d894798208a3bd76318","observation_id":"8829322f-0023-481e-aca1-f4a448321c4a","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"2020 IEEE international workshop on information forensics and security (WIFS) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:602520f2a889c2f8b4119d94cd9d406eb86e76d3b2b551c33990bae411e6a665","observation_id":"2bdea401-86be-481a-b6fd-3bcc8ca6c43e","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition workshops , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:7fca5e81b520584807f6eb6d70e464ea79a90d453d08be4650a8a010136e5e06","observation_id":"236770bb-90a5-43b9-ac26-17d839a18c6a","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01184","last_updated":"2025-07-19T09:15:28Z","snapshot_observed_at":"2026-07-06T20:15:45.334609Z","submitted_at":"2025-01-02T10:21:34Z","title":"Vulnerability-Aware Spatio-Temporal Learning for Generalizable Deepfake Video Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01184","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2501.01184 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2501.01184","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:9267194f7fc19deee7a379d37d6d8400c6e9822a3a509fed959da1bc33246320","observation_id":"e39e51b4-50da-46a6-b4e4-b238bb7a7453","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:fb4d5f2510b84d6813e51291d52aaaa9e0092c6153d3ad57c8ca5f72cac41a9d","observation_id":"e70517cd-198b-47a8-bc8e-de9c2d6a5d33","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the IEEE/CVF winter conference on applications of computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:7e8f1dc8a8c4b8d30b6a8998918f77902373aa31fe44068dd05ed4219d1fd6aa","observation_id":"16ca0585-37ee-444e-bdf8-889373f138f8","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13224","last_updated":"2025-07-17T15:36:39Z","snapshot_observed_at":"2026-08-06T16:24:49.976323Z","submitted_at":"2025-07-17T15:36:39Z","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13224","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2507.13224 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2507.13224","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:8080bc617110809cd25fdb8be23f5168bf38a6f024412c6409883d4b48867cbb","observation_id":"f115174a-66fb-44cc-82a9-b9ed101f4226","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"International conference on image analysis and processing , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:e2c677de7038643a5a582f899bbeaf8fa7b5cb9c0ff4ac2753767f902cf9e348","observation_id":"61860338-5054-43f6-afe8-3d8584504f4e","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2508.05526 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:5bdf62ff7d6eea60d21818b9a10ecea15c5b5180cfcdeed7ae07c105bdb65738","observation_id":"b4adcc58-7fbb-4886-bd54-fe3a64f9b17b","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2506.16802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:103f475cf07311670ff4374cca36e461bbd7a6ea64622669927245cea8dc03f0","observation_id":"4931bcc1-1f08-4200-bafa-a8e8006e0cf6","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the web conference 2021 , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:c41605a22579cfecec2908e22d0a481f077cbf736f69e0275efcf9a9b630b82e","observation_id":"f407ff98-eaf9-4319-b8a0-02a1d6c7cd8d","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05335","last_updated":"2025-05-17T10:04:20Z","snapshot_observed_at":"2026-07-06T19:47:16.854192Z","submitted_at":"2024-11-08T05:14:46Z","title":"A Quality-Centric Framework for Generic Deepfake Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05335","snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"arXiv preprint arXiv:2411.05335 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"cited_paper":"/paper/2411.05335","citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:4f29d121e1985e750fbd7fb427e671381deaa2531ca887cf7b361391cd5bb391","observation_id":"637d376e-4b58-4a6d-8ae9-2331efcac4cf","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Pattern Recognition , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:b701e34510cf69da888b967755922139cb16782fc498e7bbe7639deb6300abe3","observation_id":"e5218f4b-d470-4887-9464-c31dd47bb942","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:971df8034db4c61a7d5b2baa7f8b839ce2592f099e6562421f7290c1cd43645b","observation_id":"9fcb7c09-9983-48f9-b89c-3f857888e8e2","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:16:37.881212Z","title":"Proceedings of the 28th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-14T09:16:37.881212Z"},"links":{"citing_paper":"/paper/2607.10787"},"observation_digest":"sha256:71af6a1af76b5748a905cc242d1cead3662fa5f80970828ce0c10babe6dbb552","observation_id":"d95aa965-3c95-43a2-b9b0-48c3f659cdee","resolution":{"observed_at":"2026-07-14T09:16:37.881212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10787","last_updated":"2026-07-12T14:25:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:12:11.216373Z","submitted_at":"2026-07-12T14:25:04Z","title":"Detecting AI-Generated Video: A Vision-Language Dual-View Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":278},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 278 outbound references and 0 inbound Pith citation observations for arXiv:2607.10787."}