{"as_of":"2026-08-08T20:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d3c5a79fdbe095ea03e5241af27af9f468f561d940b0524d35d745b1cae6715","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:45:28.405188Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22469/citation-record","integrity":"/paper/2507.22469/integrity","json":"/paper/2507.22469/citation-record.json","paper":"/paper/2507.22469"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.677908Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.677908Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3260489707931584fb0fe31e626c08b69f14570136b80874e833cd3e4212ba48","observation_id":"9cc01c1d-a0d2-4ed7-81f4-a7398bcaeb91","resolution":{"observed_at":"2026-08-06T11:45:25.677908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T11:45:25.682150Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.682150Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3028713ddd9bfd59eef0a07a2f013ba6486feccfb9c3357c9aa445463fac6097","observation_id":"9fa5cd60-95ba-42e4-871e-3961f6655280","resolution":{"observed_at":"2026-08-06T11:45:25.682150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.686108Z","title":"Large scale GAN training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.686108Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:a2df6a39e7a8092552d9c9f663c3e4ef55a33c6a2642524591d2b51ff3960501","observation_id":"4d6e501a-ea0a-466a-a501-cb79b27d68f1","resolution":{"observed_at":"2026-08-06T11:45:25.686108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.689434Z","title":"Roop unleashed","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.689434Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:a47a0abe2c8322d7acd6ac1753a9c3f00144bae00ed3a9e0fe7dd48ae9726c0d","observation_id":"a4444121-126e-4e64-a904-7fa2827bba1c","resolution":{"observed_at":"2026-08-06T11:45:25.689434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.526116Z","title":"End-to-end reconstruction-classification learning for face forgery detection","venue":null,"work_id":"4d4734ae-1309-4482-8130-28ed549bbf91","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.692672Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:4f4a7b4ddc0bd47367abf5e23d7da02d17c9a63b5cb85b8e8f1f5e35c39244e7","observation_id":"ea8e19f1-b90b-4ba7-afe0-10e5eaa17029","resolution":{"observed_at":"2026-08-06T11:45:30.545072Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.696042Z","title":"M., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.696042Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:be8938aff8c0b1c59e66e6095c7b86cc2c0ace1e8b707e8a8fd417043fd5d81e","observation_id":"3649df1b-a8b6-42c4-9629-d39ffd10b97f","resolution":{"observed_at":"2026-08-06T11:45:25.696042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17419","last_updated":"2024-08-21T07:42:02Z","snapshot_observed_at":"2026-08-07T20:34:56.788333Z","submitted_at":"2023-10-26T14:23:45Z","title":"AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17419","snapshot_observed_at":"2026-08-06T11:45:25.699244Z","title":"Antifakeprompt: Prompt-tuned vision-language models are fake image detectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.699244Z"},"links":{"cited_paper":"/paper/2310.17419","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:43810f6d9724f9a7366640870fdb2743741c281d5e38e2e094b86197aa689121","observation_id":"4ee77696-f2aa-4b4a-83ea-38cea61ac296","resolution":{"observed_at":"2026-08-06T11:45:25.699244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.703813Z","title":"Simswap: An efficient framework for high fidelity face swapping","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.703813Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d189aebd92763b478a9aefcc51f6a54907cc33c2d82d28b1970143d714f0d26a","observation_id":"25d2a2dd-db83-4058-86f7-e4d85a8780b8","resolution":{"observed_at":"2026-08-06T11:45:25.703813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02577","last_updated":"2021-05-06T10:44:32Z","snapshot_observed_at":"2026-08-06T09:12:53.226793Z","submitted_at":"2021-05-06T10:44:32Z","title":"Local Relation Learning for Face Forgery Detection","version":1},"cited_work":{"arxiv_id":"2105.02577","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.02577","snapshot_observed_at":"2026-08-06T11:45:30.271207Z","title":"Local Relation Learning for Face Forgery Detection","venue":"cs.CV","work_id":"6e099be2-e5ff-4f6a-bee7-186723a27edc","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.707088Z"},"links":{"cited_paper":"/paper/2105.02577","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:21947054a0d1be274b64846335dc5f2b06bd746ca49840411f0ebd1dce370cd4","observation_id":"dcd0eef2-ce9b-4277-9464-1b7a72f143b5","resolution":{"observed_at":"2026-08-06T11:45:30.334523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.710366Z","title":"Xception: Deep learning with depthwise separable convolutions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.710366Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:808b52e112bba8b45b6c56b67eaccb185aaf8a78c1e4463616c72d68bb8302d0","observation_id":"58adea83-b287-460e-b8b4-748e978dfe5b","resolution":{"observed_at":"2026-08-06T11:45:25.710366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.657030Z","title":null,"venue":null,"work_id":"50e8d142-6ed2-42f9-939a-2e703eb64165","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.713915Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c78ff84ee4d6c71ee9479f921ce01bc3f73b77141b3d2f0e7321a5413d1e8031","observation_id":"8141a213-e235-4a42-a869-eb46adcf00a1","resolution":{"observed_at":"2026-08-06T11:45:33.739891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T11:45:25.716907Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.716907Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:132b90ebe75410b434ac1dc971f1d15d3178da66f96d0a9ddb0e89a14770c388","observation_id":"c52c6a3e-714a-487b-9bd8-b5d4dcf8eb05","resolution":{"observed_at":"2026-08-06T11:45:25.716907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T11:45:25.720181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.720181Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d18c7a348de2174fb2e6aa7b754c042cbe4d7bcefe0248620868a63566db5e80","observation_id":"f443438e-f66e-456f-8050-157487ba6878","resolution":{"observed_at":"2026-08-06T11:45:25.720181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.723587Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.723587Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:2d61ee3afe03f357ada1e8c026a700575ec22ae4c5e8a307a05aa2b1bfc9f365","observation_id":"a7ba93c4-b437-4bca-84e4-c819341c01fb","resolution":{"observed_at":"2026-08-06T11:45:25.723587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-06T11:45:25.726493Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.726493Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:dabcc2074a22c6395b8094b5ed9c68009501eb5291225bf61d126624ab229145","observation_id":"0844cb37-fe0e-4e30-999e-d600b69618ad","resolution":{"observed_at":"2026-08-06T11:45:25.726493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.510865Z","title":"Implicit identity leakage: The stumbling block to improving deepfake detection generalization","venue":null,"work_id":"5fc77f47-2806-4885-9337-ee459cc626f9","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.729823Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:daeeeeba66b08e6aa4ca341d9304629d23a80f3fb712d94b6b2a75801b6ab454","observation_id":"90be74f7-7faa-4504-a1a3-ca14fac78960","resolution":{"observed_at":"2026-08-06T11:45:33.587314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T11:45:25.732820Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.732820Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8af82940b389e122ba1574b15f8632b007ccbd404181dd74edd6e27810c8e2a4","observation_id":"bf6f11b3-47d6-4648-b225-a4f6200908b5","resolution":{"observed_at":"2026-08-06T11:45:25.732820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"status/1636755","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.042716Z","title":"Asking chatgpt to generate a random number","venue":null,"work_id":"400f225f-d367-488f-b1b5-e21e90e7b3c8","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.735678Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ac7ae7568e576937431dea4c49439549aa7092505c98462eb8a672e44cc0d8e5","observation_id":"3a0a7b10-c991-41cf-a46d-6a0b34b9167b","resolution":{"observed_at":"2026-08-06T11:45:30.111538Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.324752Z","title":"J., Pouget - Abadie, J., Mirza, M., Xu, B., Warde - Farley, D., Ozair, S., Courville, A","venue":null,"work_id":"9dd15ec4-b3ec-4e20-a010-57b216e3a02e","year":2014},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.738503Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c26d18503e58f4d2d80a4846280a4510bb29e4bd28b501d0a25d74a9a82b017d","observation_id":"f9c41a9e-8d14-489c-bbc6-a083d91002ad","resolution":{"observed_at":"2026-08-06T11:45:33.432068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.159008Z","title":"Google colab","venue":null,"work_id":"49005c9b-f232-4960-8f41-d7052938804e","year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.741242Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e751ba70d4a6ee83e82ece200297c40b9f1ef1ef2e1a52253d0c0bb79dd5d460","observation_id":"be4e6da1-04ee-4dae-b684-914383a0f6be","resolution":{"observed_at":"2026-08-06T11:45:33.225486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.016805Z","title":null,"venue":null,"work_id":"636c048f-e598-4a16-b29b-cf301340faac","year":2025},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.744058Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:cf81da338d772870ac720e51af6c1c545083f5f756a317135035df98fb003bed","observation_id":"6cecf45d-a368-45a0-81ea-faceb5ae5d90","resolution":{"observed_at":"2026-08-06T11:45:33.089573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.889204Z","title":null,"venue":null,"work_id":"f71d7aa4-fcaf-4ac3-ac21-221e62f03dd8","year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.746884Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f2e95f1582cb538cf4a64f2096861e92707e065c8a83a5e98d71bab7562935ee","observation_id":"ed0b236a-8c8e-4bd8-beb4-9c20b3a85238","resolution":{"observed_at":"2026-08-06T11:45:32.941399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07657","last_updated":"2021-08-15T18:33:04Z","snapshot_observed_at":"2026-07-06T10:24:15.698595Z","submitted_at":"2020-12-14T15:53:56Z","title":"Lips Don't Lie: A Generalisable and Robust Approach to Face Forgery Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07657","snapshot_observed_at":"2026-08-06T11:45:25.749720Z","title":"Lips don't lie: A generalisable and robust approach to face forgery detection, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.749720Z"},"links":{"cited_paper":"/paper/2012.07657","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:2fa06e318adbe26159f83005ba16e081dd62cc48781c8c45e9dcd06d9a6c72e1","observation_id":"476c3118-dcd6-4d90-99c4-09d305e0b016","resolution":{"observed_at":"2026-08-06T11:45:25.749720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.725306Z","title":"Deepfake detection using deep learning methods: A systematic and comprehensive review","venue":null,"work_id":"13989ba4-b179-4853-bd49-b674d1ba19d1","year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.752836Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:fa0d68a1f5d326d20352dbbfdd6902e91f67be2c202af67d0d02a388888cc368","observation_id":"8e0abdf6-b301-4543-aa82-b193a0b61a78","resolution":{"observed_at":"2026-08-06T11:45:32.789728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-06T11:45:25.755888Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.755888Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9ef5c9087b91f751ba3e1ae988d61301aaaaa39b6d7b80cc334c6792fe812d79","observation_id":"1b3162eb-5743-476e-97a2-9ab79c3494cc","resolution":{"observed_at":"2026-08-06T11:45:25.755888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T11:45:25.758972Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.758972Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:4eb9cb1828b2f84dc8e5a32b061a1e4dc61ea63b9a7e319775a4f34dd33cedad","observation_id":"c001dc96-f7c4-4acc-aa57-d697d71eecdb","resolution":{"observed_at":"2026-08-06T11:45:25.758972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.762668Z","title":"and Belongie, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.762668Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:2a86281264c108f5daca07d11c3d1ffe7b304dc17c2196fe3adc0b7c067d75d9","observation_id":"a6f9e54b-4d84-4425-aa38-09e32f66ee1c","resolution":{"observed_at":"2026-08-06T11:45:25.762668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.765541Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.765541Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:668a376e8039932e09a28a1ab15dcd2967ed423f22eff9c6d0f7fdbceb05f264","observation_id":"3bbd3608-32ba-46d8-b746-c839e31c4661","resolution":{"observed_at":"2026-08-06T11:45:25.765541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03206","last_updated":"2021-06-23T00:25:31Z","snapshot_observed_at":"2026-07-06T10:46:57.608963Z","submitted_at":"2021-03-04T18:20:50Z","title":"Perceiver: General Perception with Iterative Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03206","snapshot_observed_at":"2026-08-06T11:45:25.769203Z","title":"Perceiver: General perception with iterative attention, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.769203Z"},"links":{"cited_paper":"/paper/2103.03206","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:1fae55c954426c449624fde32c3cd65b9f5770883b07a49e3a31879fed20d4fb","observation_id":"5f1369a1-705e-40de-8d92-17e2d240420d","resolution":{"observed_at":"2026-08-06T11:45:25.769203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14077","last_updated":"2024-06-11T16:24:45Z","snapshot_observed_at":"2026-07-06T17:48:03.807374Z","submitted_at":"2024-03-21T01:57:30Z","title":"Can ChatGPT Detect DeepFakes? A Study of Using Multimodal Large Language Models for Media Forensics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14077","snapshot_observed_at":"2026-08-06T11:45:25.774011Z","title":"Can chatgpt detect deepfakes? a study of using multimodal large language models for media forensics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.774011Z"},"links":{"cited_paper":"/paper/2403.14077","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c40416918e80c13465516cab4b67862b37d681ccbc2eb69949809e77c1d4c766","observation_id":"24010e10-2f9e-4ddb-8682-3aa945e3fea6","resolution":{"observed_at":"2026-08-06T11:45:25.774011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.593151Z","title":null,"venue":null,"work_id":"70abcbef-77bf-4da6-984b-d7c056f24ad5","year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.779652Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9a45d4ffacd7e494a1c984fe84f118d0910bad1dc18ef02304f48b2a12bc78db","observation_id":"fe3c2745-697b-4979-a326-74f65fefdfff","resolution":{"observed_at":"2026-08-06T11:45:32.632587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.03024","last_updated":"2020-12-11T11:24:04Z","snapshot_observed_at":"2026-07-06T08:49:30.736218Z","submitted_at":"2020-01-09T14:37:17Z","title":"DeeperForensics-1.0: A Large-Scale Dataset for Real-World Face Forgery Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.03024","snapshot_observed_at":"2026-08-06T11:45:25.789130Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.789130Z"},"links":{"cited_paper":"/paper/2001.03024","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:bc2f50dbe7f8ea8a3c9ad73bd202937899a4b85c5b4a4b968eb590a6dcc454e2","observation_id":"4ea0d829-ed47-4b90-ba33-908e6edc1354","resolution":{"observed_at":"2026-08-06T11:45:25.789130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10196","last_updated":"2018-02-26T15:33:34Z","snapshot_observed_at":"2026-07-06T06:06:26.276752Z","submitted_at":"2017-10-27T15:28:35Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10196","snapshot_observed_at":"2026-08-06T11:45:25.798808Z","title":"Progressive growing of gans for improved quality, stability, and variation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.798808Z"},"links":{"cited_paper":"/paper/1710.10196","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:79f7b434e6843a2323cf463834eb6af4861ba5dd9be3310b74db3bef0588ead3","observation_id":"4f5e0708-6e59-4baf-a4ad-6035e1081274","resolution":{"observed_at":"2026-08-06T11:45:25.798808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.809899Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.809899Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:02fc9538640298ac5e4cd1f51f0d8be4ca3444d4bab4210af6c80b1456ada888","observation_id":"e2aa1969-782b-4ab3-9184-6fdbf7e8babb","resolution":{"observed_at":"2026-08-06T11:45:25.809899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13823","last_updated":"2023-06-13T21:54:58Z","snapshot_observed_at":"2026-07-06T14:46:41.380338Z","submitted_at":"2023-01-31T18:33:44Z","title":"Grounding Language Models to Images for Multimodal Inputs and Outputs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13823","snapshot_observed_at":"2026-08-06T11:45:25.821030Z","title":"Y., Salakhutdinov, R., and Fried, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.821030Z"},"links":{"cited_paper":"/paper/2301.13823","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:6d10407ebe1f59669340b6c8e09074736c338f7cad0c37db5578b8fc39d7e48a","observation_id":"023256c2-59cf-4509-9605-53896f22f191","resolution":{"observed_at":"2026-08-06T11:45:25.821030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T11:45:25.833109Z","title":"What matters when building vision-language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.833109Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9632796745f9fe03986876099526c95f13dc93b12b216b309db734ae7e91a6e1","observation_id":"1baf0051-add2-4089-8741-eceb534f935e","resolution":{"observed_at":"2026-08-06T11:45:25.833109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.444359Z","title":"Why do facial deepfake detectors fail? In Proceedings of the 2nd Workshop on Security Implications of Deepfakes and Cheapfakes, pp.\\ 24--28, 2023","venue":null,"work_id":"3bbc011b-25a8-40b4-9aaa-60216af40cd7","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.837613Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:941156bf829841ebcd3655a37b3f3de17e1359546bede16466f73d39ccbe4cdb","observation_id":"873d2fc7-9d1a-4d96-b1cd-a5e4c6858068","resolution":{"observed_at":"2026-08-06T11:45:32.501558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03553","last_updated":"2021-12-07T07:58:28Z","snapshot_observed_at":"2026-07-06T12:16:05.364132Z","submitted_at":"2021-12-07T07:58:28Z","title":"ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images","version":1},"cited_work":{"arxiv_id":"2112.03553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.03553","snapshot_observed_at":"2026-08-06T11:45:29.597661Z","title":"ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images","venue":"cs.CV","work_id":"1c1762d8-1963-47ef-a6be-c8769b323893","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.843303Z"},"links":{"cited_paper":"/paper/2112.03553","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:026a094d3d8d0f2820a3046a55f9d4d79db5f63dacc0b0e8a503e4cc20326393","observation_id":"c1786cf5-8db9-4569-b38c-bcbf41ffaa1e","resolution":{"observed_at":"2026-08-06T11:45:29.686144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05911","last_updated":"2023-09-12T02:01:31Z","snapshot_observed_at":"2026-08-05T14:05:50.537550Z","submitted_at":"2023-09-12T02:01:31Z","title":"Quality-Agnostic Deepfake Detection with Intra-model Collaborative Learning","version":1},"cited_work":{"arxiv_id":"2309.05911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05911","snapshot_observed_at":"2026-08-06T11:45:29.439208Z","title":"Quality-Agnostic Deepfake Detection with Intra-model Collaborative Learning","venue":"cs.CV","work_id":"2da2087b-b093-4b55-a291-ed959f5616d0","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.851771Z"},"links":{"cited_paper":"/paper/2309.05911","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f84361b4a780692db29f735310eaee83cdea49db9011df5d8c9f2150a3ec1342","observation_id":"2144c11a-1e7a-471a-b944-a6a88d556c84","resolution":{"observed_at":"2026-08-06T11:45:29.508268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04364","last_updated":"2025-03-02T02:32:25Z","snapshot_observed_at":"2026-07-06T17:13:08.935785Z","submitted_at":"2024-01-09T05:32:22Z","title":"SoK: Systematization and Benchmarking of Deepfake Detectors in a Unified Framework","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04364","snapshot_observed_at":"2026-08-06T11:45:25.863676Z","title":"M., Kim, J., Tariq, S., Moore, K., Abuadbba, A., and Woo, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.863676Z"},"links":{"cited_paper":"/paper/2401.04364","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f79830730ba414e02494be99bb1e61b031da4fc3451d4aa2cab628bff73357c3","observation_id":"c24bd814-709e-4af0-8fdc-4b0ca17eda71","resolution":{"observed_at":"2026-08-06T11:45:25.863676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T11:45:25.877668Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.877668Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8e89e9ebbd64828be73598cafa431908ba1e054d3e03e4dc52a49f9d93b9517c","observation_id":"ed8c2d38-64ab-4837-a083-f34616d960c3","resolution":{"observed_at":"2026-08-06T11:45:25.877668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T11:45:25.889383Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.889383Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c4d3084de05fbb2586a932b314f5d99538be6f7d017dc2299a643071cf0f63e2","observation_id":"e1e77963-6d23-4f0a-b758-3e67b2ed4824","resolution":{"observed_at":"2026-08-06T11:45:25.889383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13457","last_updated":"2020-09-15T07:43:58Z","snapshot_observed_at":"2026-08-08T08:09:14.122603Z","submitted_at":"2019-12-31T17:57:46Z","title":"FaceShifter: Towards High Fidelity And Occlusion Aware Face Swapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13457","snapshot_observed_at":"2026-08-06T11:45:25.901767Z","title":"Faceshifter: Towards high fidelity and occlusion aware face swapping","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.901767Z"},"links":{"cited_paper":"/paper/1912.13457","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ae1f95de5bc317a4062da93f654ee6beecd4a8dd4a9d59558b10883bcffef435","observation_id":"36db16bf-6175-4ae9-b121-c67e21cdd468","resolution":{"observed_at":"2026-08-06T11:45:25.901767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12962","last_updated":"2020-03-16T16:20:16Z","snapshot_observed_at":"2026-07-06T08:25:19.287839Z","submitted_at":"2019-09-27T21:26:34Z","title":"Celeb-DF: A Large-scale Challenging Dataset for DeepFake Forensics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12962","snapshot_observed_at":"2026-08-06T11:45:25.914487Z","title":"Celeb-df: A large-scale challenging dataset for deepfake forensics, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.914487Z"},"links":{"cited_paper":"/paper/1909.12962","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:6c49da84f7a23efe1ec5c6649449b888678300f12bbe95f4e51bcdd17eecea95","observation_id":"606c5138-2cf8-44d8-9ca0-55a6f0032203","resolution":{"observed_at":"2026-08-06T11:45:25.914487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13306","last_updated":"2024-09-08T12:07:52Z","snapshot_observed_at":"2026-08-07T20:34:56.945035Z","submitted_at":"2024-04-20T07:28:55Z","title":"FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13306","snapshot_observed_at":"2026-08-06T11:45:25.927366Z","title":"Fakebench: Uncover the achilles' heels of fake images with large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.927366Z"},"links":{"cited_paper":"/paper/2404.13306","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:0282e4ed64893bdc2dfe5bf111c5030f7abbdf6e50c227414dd1d757aba0affb","observation_id":"996d382f-c1f8-4f29-8a5c-71f8774efeb0","resolution":{"observed_at":"2026-08-06T11:45:25.927366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-06T11:45:25.938042Z","title":"L., and Dollár, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.938042Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:27b7023ead0b8c7e885b9b755c1dd457daf2ad8ba7420fb21e5444d40fb584c1","observation_id":"0cf3b36d-95ea-4b86-a22c-14056a2d00d8","resolution":{"observed_at":"2026-08-06T11:45:25.938042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T11:45:25.943440Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.943440Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d3ce9c6912ffe4c8fd6607fb5d9a62e8762f75ab9c84416fde212721de0aa6dd","observation_id":"cdd91f71-5351-4fcd-b5ae-b8fd53c40d37","resolution":{"observed_at":"2026-08-06T11:45:25.943440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T11:45:25.948778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.948778Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:81bccefd696870f844893d020a276ad1d77bde61e7d6df3a6320cefc5913eeb1","observation_id":"c501240a-4cca-4e0c-829a-ec230b320b43","resolution":{"observed_at":"2026-08-06T11:45:25.948778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.954993Z","title":"Few-shot unsupervised image-to-image translation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.954993Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ad9bab752b80efaa7696a50dd0f7e0a2b75e29a62aca9a3a5a2657d4c2279112","observation_id":"631ab8f8-0e07-46cf-9371-b5c8d1eb3843","resolution":{"observed_at":"2026-08-06T11:45:25.954993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06965","last_updated":"2025-04-03T07:47:44Z","snapshot_observed_at":"2026-07-06T18:28:38.016649Z","submitted_at":"2024-06-11T05:48:04Z","title":"Evolving from Single-modal to Multi-modal Facial Deepfake Detection: Progress and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06965","snapshot_observed_at":"2026-08-06T11:45:25.964923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.964923Z"},"links":{"cited_paper":"/paper/2406.06965","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8e33315f8b7b3fe870c200b58096324606ac772c7c05ce8bfabf55a9b8ea20a6","observation_id":"f2da1ff6-0ed7-4b07-b2b5-e1504fdbd827","resolution":{"observed_at":"2026-08-06T11:45:25.964923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T11:45:26.074973Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.074973Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f35032e5c4fbdfaed749641cf67bfeeda551d75d2b09f1ebbf50093376531ecc","observation_id":"76fd7a13-8000-4891-b1a5-b0bed43d032a","resolution":{"observed_at":"2026-08-06T11:45:26.074973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.328280Z","title":"Fooocus-inswapper","venue":null,"work_id":"3688d94a-43b8-4b89-94ce-8d28d97eb7f0","year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.125985Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ffdb7a9c139b318213e2cc2f787989d8fb90092c881e2079c71519c1d604be28","observation_id":"bb2d4660-7db9-4f29-8878-8f7f4573df07","resolution":{"observed_at":"2026-08-06T11:45:32.390904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11215","last_updated":"2018-10-26T07:50:29Z","snapshot_observed_at":"2026-07-06T07:10:45.055300Z","submitted_at":"2018-10-26T07:50:29Z","title":"Capsule-Forensics: Using Capsule Networks to Detect Forged Images and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.11215","snapshot_observed_at":"2026-08-06T11:45:26.202575Z","title":"H., Yamagishi, J., and Echizen, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.202575Z"},"links":{"cited_paper":"/paper/1810.11215","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:cc5d4d1d165820c3c717a06871ec4979514e714e3d2a87b86a790d4593376f88","observation_id":"064f268a-0ad8-4701-91ee-f6a3e1b5aa67","resolution":{"observed_at":"2026-08-06T11:45:26.202575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.194514Z","title":"FSGAN : Subject agnostic face swapping and reenactment","venue":null,"work_id":"6dc5f3f3-61df-4801-b44b-c01db5e8a98f","year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.280102Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:83a2421c080275a2d7cd7b01360730850ebe52eaef56d99d40983dc80c05fe72","observation_id":"581ba759-aa66-46fc-a5b2-70c0b24226bb","resolution":{"observed_at":"2026-08-06T11:45:32.259174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.066316Z","title":"Fsganv2: Improved subject agnostic face swapping and reenactment","venue":null,"work_id":"9ad2e7e2-34a4-4ca4-b9a1-2a136cfd66f8","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.330327Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:7182e166a605573fd7fe12488be7db40696e94066c3c38bda3e76fb5f5e35a3c","observation_id":"2e08be8a-56bb-4e43-b094-e8cfd1618678","resolution":{"observed_at":"2026-08-06T11:45:32.100286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.914888Z","title":"Introducing chatgpt","venue":null,"work_id":"27eb4a10-4a41-4908-b15e-3a4e749290b8","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.359014Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:82fda0813752284df17e1cc3925b728029d1f391fb3c85a0c1e466c1e42644da","observation_id":"db642755-0f83-40e3-8fe4-4ec1faf97c69","resolution":{"observed_at":"2026-08-06T11:45:32.014403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05535","last_updated":"2021-06-29T07:07:57Z","snapshot_observed_at":"2026-08-05T10:35:32.217815Z","submitted_at":"2020-05-12T03:26:55Z","title":"DeepFaceLab: Integrated, flexible and extensible face-swapping framework","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05535","snapshot_observed_at":"2026-08-06T11:45:26.439544Z","title":"S., RP, L., Jiang, J., et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.439544Z"},"links":{"cited_paper":"/paper/2005.05535","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:b96e0d9869a65e1254f1e16597cb42a13f2a7abcb1b0eb8b50eca2388cdb81ea","observation_id":"d1aa9c40-b75d-485c-8c1f-c4007b004385","resolution":{"observed_at":"2026-08-06T11:45:26.439544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21905","last_updated":"2025-08-04T13:19:11Z","snapshot_observed_at":"2026-08-06T12:20:10.342179Z","submitted_at":"2025-07-29T15:17:00Z","title":"Evaluating Deepfake Detectors in the Wild","version":2},"cited_work":{"arxiv_id":"2507.21905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21905","snapshot_observed_at":"2026-08-06T11:45:29.115849Z","title":"Evaluating Deepfake Detectors in the Wild","venue":"cs.CV","work_id":"68c6c6b6-a590-4035-80bf-6fe5bf44cbe8","year":2025},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.498459Z"},"links":{"cited_paper":"/paper/2507.21905","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:320934b6f447aae37192bb801a055ae4ba33affe408036d72f5a00e93f4f1aaf","observation_id":"33751ec3-8a2c-4f31-ad8a-6747091f1f93","resolution":{"observed_at":"2026-08-06T11:45:29.158094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09355","last_updated":"2020-10-27T04:04:29Z","snapshot_observed_at":"2026-07-06T09:39:21.915461Z","submitted_at":"2020-07-18T07:39:08Z","title":"Thinking in Frequency: Face Forgery Detection by Mining Frequency-aware Clues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.09355","snapshot_observed_at":"2026-08-06T11:45:26.632123Z","title":"Thinking in frequency: Face forgery detection by mining frequency-aware clues, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.632123Z"},"links":{"cited_paper":"/paper/2007.09355","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e51cf0dd2757183ee1b21fabe6c1b3b11e4db7edf727521e7e8246498c8ba5dc","observation_id":"f92bcbd5-5b25-464d-817f-ace6d45dfcc0","resolution":{"observed_at":"2026-08-06T11:45:26.632123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T11:45:26.709415Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.709415Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:5c46482f83d4ecd6e28aade11116bdb4a278ec0204846f90c7075b0c16824bf9","observation_id":"bd5085ee-21ed-4f5f-a7b2-d8558e971fa0","resolution":{"observed_at":"2026-08-06T11:45:26.709415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14571","last_updated":"2024-01-22T07:24:58Z","snapshot_observed_at":"2026-07-06T14:10:36.326803Z","submitted_at":"2022-10-26T09:01:19Z","title":"Towards the Detection of Diffusion Model Deepfakes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14571","snapshot_observed_at":"2026-08-06T11:45:26.801372Z","title":"Towards the detection of diffusion model deepfakes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.801372Z"},"links":{"cited_paper":"/paper/2210.14571","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:af697071b447e4cd50e93933a6816962d801c195e89641e94a0edeaef876db9e","observation_id":"ccdb35f6-3104-4fad-9ed3-3bf5dbd09092","resolution":{"observed_at":"2026-08-06T11:45:26.801372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.807145Z","title":"Faceforensics++: Learning to detect manipulated facial images","venue":null,"work_id":"2957e3a8-c028-4312-9ecb-d13cbd5602f0","year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.901204Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f168d8e693cfc31089fe8f9f8d68ba70af3f61acc40db1b2389c91509bd4f1a0","observation_id":"ca7f0598-1c21-4f49-9ebc-54636cc792c2","resolution":{"observed_at":"2026-08-06T11:45:31.860567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.640049Z","title":null,"venue":null,"work_id":"aba1412c-7924-4894-bd5b-c3d5ebb0b597","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.971110Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ef53f70a56c34b50be2e975ebcc0f1143360412d61dbc8a1c1e99b1d62c44f67","observation_id":"89ef0a4a-58d0-4d95-9dd6-5493dc68dff5","resolution":{"observed_at":"2026-08-06T11:45:31.706159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.500941Z","title":null,"venue":null,"work_id":"6e1294ec-e198-45a9-a47f-1e0e8a90ab39","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.044896Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:04eb790e3db58704727e3abe2456c78909192de9214a4410524a168f18db92a5","observation_id":"70d74ecb-469d-4760-a5de-5d403bb00f20","resolution":{"observed_at":"2026-08-06T11:45:31.569019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.366692Z","title":"Roop for stablediffusion","venue":null,"work_id":"cd3ef592-e667-4c85-9b40-fff9d5f995e5","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.111281Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:4e96d40640651a7af375f8b419cc8c6e4d5f45575b880eedac78584bb0e504c0","observation_id":"8da331f3-dbfb-458c-bdb3-a00c3f153202","resolution":{"observed_at":"2026-08-06T11:45:31.428041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04178","last_updated":"2025-04-19T05:46:00Z","snapshot_observed_at":"2026-08-02T07:57:41.501565Z","submitted_at":"2024-02-06T17:31:36Z","title":"SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04178","snapshot_observed_at":"2026-08-06T11:45:27.190125Z","title":"Shield : An evaluation benchmark for face spoofing and forgery detection with multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.190125Z"},"links":{"cited_paper":"/paper/2402.04178","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:6de2360e9da54f8523274379ab88c58975a23b7e2f4ca829ad6f1fa252472c9c","observation_id":"122db774-57d1-4d8f-89b3-effffe2f5bc6","resolution":{"observed_at":"2026-08-06T11:45:27.190125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.200163Z","title":"and Yamasaki, T","venue":null,"work_id":"5865a953-315c-4bae-b9e1-1d6d47cbfb59","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.273097Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:5244b48c7f6120b421cb5abdfa5366f876f82a996f7fb2085061dc3bd2f7fa9f","observation_id":"64b52fa6-2b9d-43ce-8700-ff621625e2f3","resolution":{"observed_at":"2026-08-06T11:45:31.281946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.063066Z","title":"Adaptive face forgery detection in cross domain","venue":null,"work_id":"aadaf3f2-4146-4a19-afc0-59d04e0277ab","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.387175Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c8585ad1b5c9da7892e5454649264291a7b936226d597a98ead2d3cd38adac9e","observation_id":"f056eaa5-f34c-492e-88fd-0efcd9cf4eeb","resolution":{"observed_at":"2026-08-06T11:45:31.118386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.950707Z","title":"Fraud report 2024","venue":null,"work_id":"7d3ab030-91ed-45f7-be74-b133a40d80b6","year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.407631Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:afb78382f273d33254918926151b3c1d0f27499cf1847ecef91e6768e8b7a459","observation_id":"edb631dc-2b45-49da-a226-7e20bd135df4","resolution":{"observed_at":"2026-08-06T11:45:30.996970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i3.16367","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:28.522892Z","title":"Domain general face forgery detection by learning to weight","venue":null,"work_id":"dfaf611b-02aa-4a3a-a7e1-5e567fd6aa04","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.489858Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:4ee71921912b6efb31642ae1ca16bd5589d89a35b7d1745cf3c6e6eaa38562d5","observation_id":"be557504-c761-459d-8f67-7c4e1c4a3be6","resolution":{"observed_at":"2026-08-06T11:45:28.584047Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13522","last_updated":"2021-12-27T05:44:40Z","snapshot_observed_at":"2026-08-03T19:40:12.454695Z","submitted_at":"2021-12-27T05:44:40Z","title":"Dual Contrastive Learning for General Face Forgery Detection","version":1},"cited_work":{"arxiv_id":"2112.13522","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.13522","snapshot_observed_at":"2026-08-06T11:45:28.933919Z","title":"Dual Contrastive Learning for General Face Forgery Detection","venue":"cs.CV","work_id":"ee8b2983-efa9-412a-9119-969089b6b09c","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.567870Z"},"links":{"cited_paper":"/paper/2112.13522","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:729e305958457c5381c8acc2d5e5cd5bb8b056ba7a674e8257c19fb2de8ee18d","observation_id":"51bca2af-f6cf-4721-be78-48c4e8a13c70","resolution":{"observed_at":"2026-08-06T11:45:29.000170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16545","last_updated":"2024-02-07T07:52:10Z","snapshot_observed_at":"2026-07-06T16:00:34.266685Z","submitted_at":"2023-07-31T10:22:33Z","title":"Towards General Visual-Linguistic Face Forgery Detection","version":2},"cited_work":{"arxiv_id":"2307.16545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16545","snapshot_observed_at":"2026-08-06T11:45:28.808353Z","title":"Towards General Visual-Linguistic Face Forgery Detection","venue":"cs.CV","work_id":"8ec9e262-d509-4660-bb05-3c35c3b66be6","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.637771Z"},"links":{"cited_paper":"/paper/2307.16545","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3554fc9a22792810b8cec1220b3f50498bf4a0ebbccf4b0d0b00a57d1138051e","observation_id":"3242dacc-bdc1-486f-b0c9-dcd10431dfe6","resolution":{"observed_at":"2026-08-06T11:45:28.846168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:27.732169Z","title":"One detector to rule them all: Towards a general deepfake attack detection framework","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.732169Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e6a77182767b53d775f47c5ba38f4924ecf9549f4522899f5671486e31ee7678","observation_id":"3e93d223-f7f7-4b26-a4c5-f38dde8a10f4","resolution":{"observed_at":"2026-08-06T11:45:27.732169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T11:45:27.765687Z","title":"Gemini: A family of highly capable multimodal models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.765687Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:7fbc322ecb51feab8ac93fa95b4c3b6215a289ca4044b3ec1073b3a3f9b6f69a","observation_id":"fed6a2f4-8f47-4efe-998d-c09bc89ce5ff","resolution":{"observed_at":"2026-08-06T11:45:27.765687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T11:45:27.834401Z","title":"Gpt-4 technical report, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.834401Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3390441b0543275ae02fded36cd7ac5be4d84d637aebfb210e44ca7ee5d59e26","observation_id":"e797c0e1-2da1-41fe-9ec7-02a7f135025d","resolution":{"observed_at":"2026-08-06T11:45:27.834401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:27.912205Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.912205Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:1c0f9fcab2a95bec3c54a9582f20f538948b3aea909d905af9765e88c8543360","observation_id":"6b9e6bf8-f24e-49ac-878b-58e01ebc5c4c","resolution":{"observed_at":"2026-08-06T11:45:27.912205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.820947Z","title":"M2tr: Multi-modal multi-scale transformers for deepfake detection","venue":null,"work_id":"2c763fd1-a784-46db-8e8f-e649c7b44d97","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.938985Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:1cdb358c3e0b6939cf9cf508b450f9f15dcb03848d8c0f177ca81bb9874e1041","observation_id":"033ec6ec-0010-48b7-b332-bde310235ddd","resolution":{"observed_at":"2026-08-06T11:45:30.853215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T11:45:27.994616Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.994616Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:afbe84c3db1909f0869d6562977e90731428d60702b8425b78b25af4e8bbf7d0","observation_id":"cd3f2ce5-148b-4507-b408-577e93957ad0","resolution":{"observed_at":"2026-08-06T11:45:27.994616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.689833Z","title":"Few-shot classification with feature map reconstruction networks","venue":null,"work_id":"fa66d91c-ee10-4988-841f-fc0f70d48c19","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.087381Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:b2ccc053c7d6b4cff3b2f301f2797edbbd99e863175a0375a79493d16113157e","observation_id":"e5e3ceea-3043-4d6a-98e6-93a516439731","resolution":{"observed_at":"2026-08-06T11:45:30.738678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09193","last_updated":"2023-11-15T18:39:21Z","snapshot_observed_at":"2026-08-02T16:45:54.807090Z","submitted_at":"2023-11-15T18:39:21Z","title":"The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09193","snapshot_observed_at":"2026-08-06T11:45:28.127701Z","title":"C., and Nie, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.127701Z"},"links":{"cited_paper":"/paper/2311.09193","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:aa6d2bd3c8af34093b3e94d8eda3efed2be160ee5459845b0d7fe7d5e207624c","observation_id":"a19da922-fc32-42d2-91b9-f0850cb05a4b","resolution":{"observed_at":"2026-08-06T11:45:28.127701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-06T11:45:28.242603Z","title":"Hallucination is inevitable: An innate limitation of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.242603Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:490d3126d825c25ed1be168acfe2cb5ef3cebe26fb4a02535b1349f8dea93e18","observation_id":"2ce05cdf-f5ef-464c-98cd-7653e1b92e5b","resolution":{"observed_at":"2026-08-06T11:45:28.242603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T11:45:28.288418Z","title":"Coca: Contrastive captioners are image-text foundation models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.288418Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f6e03d9f928655777477d96064becf833c57c85dc2b18e0e72c4c14cfff74c70","observation_id":"015561f2-1b4b-4833-8f37-51bee7b415cc","resolution":{"observed_at":"2026-08-06T11:45:28.288418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00126","last_updated":"2024-07-18T07:59:36Z","snapshot_observed_at":"2026-08-07T17:25:22.476729Z","submitted_at":"2024-01-31T19:11:58Z","title":"Common Sense Reasoning for Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00126","snapshot_observed_at":"2026-08-06T11:45:28.334369Z","title":"Common sense reasoning for deep fake detection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.334369Z"},"links":{"cited_paper":"/paper/2402.00126","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:4e99d339c04a0a080f00010d5121dfc77d7fb71fb7d634db17421af5f8f748bd","observation_id":"8ea7e7c9-e6d1-45e1-b5f2-89e8f7455b46","resolution":{"observed_at":"2026-08-06T11:45:28.334369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.607853Z","title":"Multi-attentional deepfake detection","venue":null,"work_id":"26eebd2b-6087-439c-a22d-8f3c01ce5968","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.405188Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:10280e07fdedfdf88e34d01478c4791e343b05b8e06802147d8b8f5436a0f75c","observation_id":"cb7fd093-b6b8-40de-988b-423837addb8b","resolution":{"observed_at":"2026-08-06T11:45:30.657639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:04:41.472848Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":9,"verified_fuzzy":17},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2507.22469."}