{"as_of":"2026-08-08T21:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:847bdcc7e8a337693fba5456db417a3876d91f47b7885e3faa9c9c89113b4cc5","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:00.996471Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T15:08:25.309094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T15:13:25.040118Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"cited_work":{"arxiv_id":"2505.15233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15233","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cad: A general multimodal framework for video deepfake detection via cross-modal alignment and distillation","venue":null,"work_id":"1ba2a34b-4ebf-418e-8ef7-e518fca5759d","year":2025},"citing_paper":{"arxiv_id":"2605.17133","last_updated":"2026-05-16T19:46:33Z","snapshot_observed_at":"2026-08-05T10:23:49.044022Z","submitted_at":"2026-05-16T19:46:33Z","title":"CAM-VFD: Cross-Attention Multimodal Video Forgery Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T15:08:25.309094Z"},"links":{"cited_paper":"/paper/2505.15233","citing_paper":"/paper/2605.17133"},"observation_digest":"sha256:aace61ffd386cd6399990fd3dc6c96b57b01a93e15b4c60e502385c0f140c5cb","observation_id":"4929d710-214b-4f3a-b5a0-17abcb6b57a5","resolution":{"observed_at":"2026-05-20T15:13:25.042025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15233/citation-record","integrity":"/paper/2505.15233/integrity","json":"/paper/2505.15233/citation-record.json","paper":"/paper/2505.15233"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.329144Z","title":"Mesonet: a compact facial video forgery detection network","venue":null,"work_id":"66d9d108-a81c-42c5-97c5-c754bbae8d57","year":2018},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.074983Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:bc74119d52ee2c37856235c2e821fe68e7baa28bc3774bbd1cde2acb9300c6ea","observation_id":"bb4cd9f1-cff9-435c-89b3-9c71e68d3766","resolution":{"observed_at":"2026-08-07T15:27:04.335259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.308137Z","title":"A review of modern audio deepfake detection methods: challenges and future directions","venue":null,"work_id":"077e39b9-aacb-480e-8be6-5bce77dba2f5","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.150530Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:b73c767f1583fd69d21b9dc0746c3bcc0266179504a0cf1309c06cbfb8e58a00","observation_id":"c58e74d7-cdc7-43a4-8e66-492732a5fe8c","resolution":{"observed_at":"2026-08-07T15:27:04.316636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.286377Z","title":"Do you really mean that? content driven audio-visual deepfake dataset and multimodal method for temporal forgery localization","venue":null,"work_id":"a000739c-d627-4dea-9844-2b4311c09620","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.322384Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:1aea32d381330b52f1aa090ae188c123d57831ca034c8698d640b078a5889ed5","observation_id":"1f187ee3-29bd-4605-9309-632285bf018e","resolution":{"observed_at":"2026-08-07T15:27:04.292173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:54.433137Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.433137Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:90e7bb37c6394db8cbcbe623947046f1461e1e7a55d1c0fa712de57c9aca5e1e","observation_id":"fe38a54f-d59a-4ce4-8404-a8aa568b0c69","resolution":{"observed_at":"2026-08-07T15:26:54.433137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.257598Z","title":null,"venue":null,"work_id":"cb668a0a-0a1b-4b4a-a2d2-1026d5053f77","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.539628Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:01adae99175bb9cd8eb839a8859b767bc08990facbe59cc5e5f1012e32d0aee1","observation_id":"d6ce7981-1a59-44ce-bea4-20bcf51e17cb","resolution":{"observed_at":"2026-08-07T15:27:04.263567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.241152Z","title":"Self-supervised learning of adversarial example: Towards good generalizations for deepfake detection","venue":null,"work_id":"0a8f430f-80ed-4b38-8807-faf832e2aafe","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.649874Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:9b0bb3aa6bea79400c2a451eb51367bc7fe113d9a1baa158818195246d2193fa","observation_id":"933e19fd-3ba1-4275-9383-5013726f029d","resolution":{"observed_at":"2026-08-07T15:27:04.246938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-07T15:26:54.756360Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.756360Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:9d3d2dd9e0f94c27954bac1629de6f2913d6e914be3a02b7061b9a427a2e42e8","observation_id":"32a37ffa-7e7c-4397-b206-ab43e5cbd069","resolution":{"observed_at":"2026-08-07T15:26:54.756360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.224276Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":"779ad701-198f-4fb7-87e9-6a123191ffe3","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.856339Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:ac2f7bd07d35d1f3dc9ad9839030d7ba65a4a103e16914bee6f550f75e247d2b","observation_id":"50ac14fd-fba5-4306-a83f-f50b062b16be","resolution":{"observed_at":"2026-08-07T15:27:04.230249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.209033Z","title":"Sophia Koepke, Ying Shan, and Zeynep Akata","venue":null,"work_id":"1566ccc0-dd00-4f9d-9724-faf7c43d7bd5","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.977105Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:42644effa8131b50b1a3b3e9360cafe8f0ce40680521bbdbed714f657eaf22fc","observation_id":"a8f0832a-cbc0-436c-8860-320875445262","resolution":{"observed_at":"2026-08-07T15:27:04.213684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.192020Z","title":"V oice-face homogeneity tells deepfake","venue":null,"work_id":"99427ec6-5f37-442d-9d7d-dc9f09fa822e","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.048303Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:f793b25e8681387fe630c9f43bf64639aab06e5cfde38769175e5a8162fa1d4c","observation_id":"64487f5f-8e60-4cc6-bc87-df0abcfee9a4","resolution":{"observed_at":"2026-08-07T15:27:04.197708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17052","last_updated":"2024-08-30T07:22:11Z","snapshot_observed_at":"2026-08-06T19:08:44.864897Z","submitted_at":"2024-08-30T07:22:11Z","title":"Can We Leave Deepfake Data Behind in Training Deepfake Detector?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17052","snapshot_observed_at":"2026-08-07T15:26:55.184286Z","title":"Can we leave deepfake data behind in training deepfake detector? arXiv preprint arXiv:2408.17052, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.184286Z"},"links":{"cited_paper":"/paper/2408.17052","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:c4c837b4abd61d3df968f2022372816625ce627e993d44188e97a5aaa9a38d0b","observation_id":"5769a50b-9188-4a15-8163-a547698489f2","resolution":{"observed_at":"2026-08-07T15:26:55.184286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.175283Z","title":"Xception: Deep learning with depthwise separable convolutions","venue":null,"work_id":"1b17ef47-76ba-4ec2-a92f-05600e916132","year":2017},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.302595Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:f7676f97dcdfc36a5dc286594fa2b99487a6ee3824be0ac3e9d5cd3e2563463d","observation_id":"129e1880-4817-4737-ae70-a38b7652923e","resolution":{"observed_at":"2026-08-07T15:27:04.180876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.149567Z","title":"Not made for each other- audio-visual dissonance-based deepfake detection and localization","venue":null,"work_id":"65d68efd-df58-4eff-b19b-39a3f6d90bdf","year":2020},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.405611Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:35737e90a9c9aef6d8b1c0252cfa63cc610d017af1a3c2f5f98015e9af7992b1","observation_id":"8284eb72-ad9e-472d-a7aa-63f5969c98d0","resolution":{"observed_at":"2026-08-07T15:27:04.155779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.133127Z","title":"Audio-visual person-of-interest deepfake detection","venue":null,"work_id":"2af5becf-0528-4a65-9799-b32cbc897f92","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.485300Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:63ac5564a9c963e872dd5d2be4d6cbcccadd8aafa4e75310aa2065e191888bcd","observation_id":"56d9c05b-5efd-4049-9806-edda9d0c0262","resolution":{"observed_at":"2026-08-07T15:27:04.138476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.111580Z","title":"Dong, Jin Wang, Renhe Ji, Jiajun Liang, Haoqiang Fan, and Zheng Ge","venue":null,"work_id":"6566650f-e94a-42f5-8732-df58fe074cfc","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.597172Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:07f02b122a95157f1b7eb3c5ee160cff5fdd23f6f06799277a6dd543cc861bc6","observation_id":"5eb7d261-3663-4989-872a-9a2da6120e54","resolution":{"observed_at":"2026-08-07T15:27:04.119110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.092874Z","title":"www.github.com/MarekKowalski/FaceSwap Accessed 2021-04-24","venue":null,"work_id":"c84af964-905e-48e7-acac-7e33b270e4a6","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.697949Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:e2f4a04409c8a5d4ec21a08c3e93cb2cd5600cda85b7efea3020884fc37ce510","observation_id":"5b2b32de-9a52-488c-848a-68dffb596ebb","resolution":{"observed_at":"2026-08-07T15:27:04.099701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.072634Z","title":"Self-supervised video forensics by audio-visual anomaly detection","venue":null,"work_id":"32c9a384-ded3-4092-8576-09fc710fd149","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.778876Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:02c01cbf3f157a7e2af34a009d10388b9e996c286a8f05937e134d406a4da3d1","observation_id":"85c18813-1f05-4efb-ba7f-1188277e5ec9","resolution":{"observed_at":"2026-08-07T15:27:04.079789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07835","last_updated":"2018-03-21T10:27:04Z","snapshot_observed_at":"2026-07-06T06:29:25.325858Z","submitted_at":"2018-03-21T10:27:04Z","title":"Joint 3D Face Reconstruction and Dense Alignment with Position Map Regression Network","version":1},"cited_work":{"arxiv_id":"1803.07835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.07835","snapshot_observed_at":"2026-08-07T15:27:01.725357Z","title":"Joint 3D Face Reconstruction and Dense Alignment with Position Map Regression Network","venue":"cs.CV","work_id":"ade58a2e-3329-41ed-b53e-71bce8d68563","year":2018},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.856641Z"},"links":{"cited_paper":"/paper/1803.07835","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:7f5943c1ebdca70a7911fa6689b5b1ec23159cc88407898b69213b694a4de929","observation_id":"2a551dd0-faf3-411d-88b2-5fbe681f7e98","resolution":{"observed_at":"2026-08-07T15:27:01.797723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.053011Z","title":"Imagebind one embedding space to bind them all","venue":null,"work_id":"d6e3083c-4366-4d19-8a55-87ffd06c5de2","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.927230Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:20baf89b43a441751c73e4c3039333536bde769fc9a13eff8156f4e2b393e96e","observation_id":"910b8953-1a46-46c7-80d4-6a8afc3b5515","resolution":{"observed_at":"2026-08-07T15:27:04.058641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.032367Z","title":"Leveraging real talking faces via self-supervision for robust forgery detection","venue":null,"work_id":"33ab420a-945e-4575-9092-efadacd6db72","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.007650Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:c9e5b59902b137fc71743674366c0b42868d00cfd5e70a9328b2e28082b9c06f","observation_id":"1d42e731-48c8-4c7c-adb2-ceddac4857b8","resolution":{"observed_at":"2026-08-07T15:27:04.039846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:04.007560Z","title":"Lips don’t lie: A generalisable and robust approach to face forgery detection","venue":null,"work_id":"55589795-78fa-4e7f-8efb-d684706a3fc7","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.106380Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:d0dc5d1294ac050215d36ab7a09245c0302233d1753c55525a4595b30aa699b1","observation_id":"242ef530-74f6-4b75-955b-c98b0fde5954","resolution":{"observed_at":"2026-08-07T15:27:04.016350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.985923Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"f85db1be-dd75-4a12-8a5c-d0aa21532151","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.188215Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:c0435d2e0da26c81b58807e266337ab7f911882f9b3fba34f40b871b6023a299","observation_id":"459ebd5f-63b3-4792-9178-d88286def08e","resolution":{"observed_at":"2026-08-07T15:27:03.992759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.966876Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"edc29470-3c4c-4b5a-9efe-3fc7407e827f","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.329894Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:bec98204625054bb27844272dd0c90b1981c09cd71617115f8b8af1700fbefcb","observation_id":"c7900e5d-7aea-49b9-9312-8e74246eb0b9","resolution":{"observed_at":"2026-08-07T15:27:03.972701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.400893Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.400893Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:3c9a9c6eec4eb43f8fd8cf8c2a4ac52e955f41e9a3ddccc80dc8c6dac51680d1","observation_id":"105c5295-9d6b-4502-bb53-817ee1220e08","resolution":{"observed_at":"2026-08-07T15:26:56.400893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.939154Z","title":"Avfakenet: A unified end-to-end dense swin transformer deep learning model for audio-visual deepfakes detection","venue":null,"work_id":"135b0646-57be-41e8-9c8e-a45588de4f9b","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.513786Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:62d4adfec0cfad3206af8b1cf6018e555ffb91a382532a6f1236f13304f75923","observation_id":"02a2a4a0-ad58-4f6e-846c-7aec0d9ea89c","resolution":{"observed_at":"2026-08-07T15:27:03.944903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.596373Z","title":"Information theory and statistical mechanics","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.596373Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:644de98e944a1d0a5eda11eb8ef1b775d803dc4d59d16261d614e5fd96bd5e87","observation_id":"4c94acf6-c13d-49e4-b28c-c07b57924b0c","resolution":{"observed_at":"2026-08-07T15:26:56.596373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.907080Z","title":null,"venue":null,"work_id":"583c7fb2-1313-44d4-b3c4-96fd384c2e54","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.679484Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:fbae1d412c8d71106d8c7cba3b5ff96c33a35e3f3a2ed983e22a4d96379ddf78","observation_id":"ceb33f51-45cd-4bcf-8c1c-5be15e06db80","resolution":{"observed_at":"2026-08-07T15:27:03.913566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-07T15:26:56.756989Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.756989Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:06fce1e877c366cef09ff100c07035b43d2b5aa636dd984101849ebe5c05f11e","observation_id":"6a14a426-5563-4cd0-8978-90fd0c27ee70","resolution":{"observed_at":"2026-08-07T15:26:56.756989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.885140Z","title":"Fast face-swap using convolu- tional neural networks","venue":null,"work_id":"627f40d4-27f7-40ed-8770-b5522208c0ad","year":2017},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.853865Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:5329568b71ae52cfa3f6a7419b01ebc4c3dcefb7651ee3dca8170e4d15c3ae02","observation_id":"aed45079-acd6-41b8-a7b5-9021e513db61","resolution":{"observed_at":"2026-08-07T15:27:03.893130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.868188Z","title":"Face x-ray for more general face forgery detection","venue":null,"work_id":"32865fe2-b875-46b3-be46-ccf9241c29a9","year":2020},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.962771Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:0b7a762a96291372717fc7a4b8e3adb4bdab16c46ba37173f26615f99a023af8","observation_id":"9a0605a9-493f-4e9d-8144-64663846db63","resolution":{"observed_at":"2026-08-07T15:27:03.874270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13914","last_updated":"2025-07-14T22:26:06Z","snapshot_observed_at":"2026-08-07T18:45:59.738066Z","submitted_at":"2024-04-22T06:52:12Z","title":"A Survey on Speech Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13914","snapshot_observed_at":"2026-08-07T15:26:57.093958Z","title":"Audio anti-spoofing detection: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.093958Z"},"links":{"cited_paper":"/paper/2404.13914","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:2ee5e630e9882964d0504aef8f8b3f25b8852fed75081b5353c786add915207c","observation_id":"15b3d7be-6001-44bf-b67b-a03298ab009d","resolution":{"observed_at":"2026-08-07T15:26:57.093958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.847992Z","title":"Celeb-df: A large-scale challenging dataset for deepfake forensics","venue":null,"work_id":"cb667271-92b6-4ada-a8c3-7012664019d1","year":2020},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.170497Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:4c23383daecea823b3553e0f7bb05ad7194b2e09bef7b9e140fad82094540fd1","observation_id":"a63c7869-feb6-493e-b625-b0cb81abfd36","resolution":{"observed_at":"2026-08-07T15:27:03.853254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.830856Z","title":"Lips are lying: Spotting the temporal inconsistency between audio and visual in lip-syncing deepfakes","venue":null,"work_id":"90df4d06-fdf7-47c4-a106-7755c61078d8","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.249489Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:9e56cc351de2f4eb31d879177c9d21bca16c78432cad4c7fb0ac98acd11eb7f2","observation_id":"22291b3e-f02a-49b8-9700-1ad0cdd5a626","resolution":{"observed_at":"2026-08-07T15:27:03.836537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.811358Z","title":"Exploiting visual artifacts to expose deepfakes and face manipulations","venue":null,"work_id":"384f928d-6ba3-45f6-a703-4e49579782b6","year":2019},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.377989Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:e3abd981e2f60d3798d6f294a41179d0987b4b18c51f346698bfda71ef1f734b","observation_id":"b27d098b-b827-4513-b161-e801418e734b","resolution":{"observed_at":"2026-08-07T15:27:03.817396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.793241Z","title":"Emo- tions don’t lie: An audio-visual deepfake detection method using affective cues","venue":null,"work_id":"9b230a64-9f87-460c-b57b-0901c42f6927","year":2020},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.468124Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:4ea13ee4421dbc41d4841f8ff8d994965e41ed0efbd5d306e2b81d258a91c301","observation_id":"ef0db15d-c892-49c4-9f39-138ae7df8e3c","resolution":{"observed_at":"2026-08-07T15:27:03.798323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.564874Z","title":"Does audio deepfake detection generalize? arXiv preprint arXiv:2203.16263, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.564874Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:9c21fecdd21c9a166d80b059180a3750146e3e081a8704afec8e5fddf28fb2bb","observation_id":"9bc000c9-199a-4dc6-81f0-9058d7085044","resolution":{"observed_at":"2026-08-07T15:26:57.564874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.774982Z","title":"Nguyen, Junichi Yamagishi, and Isao Echizen","venue":null,"work_id":"30a2fd13-5217-4906-af59-ae157bc77df6","year":2019},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.664207Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:387cb499e5cf15b78548116cc94f8955384bd0de7d4ca91951c11a8b3db0b43d","observation_id":"1761e696-aaa8-4fd5-9b5c-63c1bf77c4c1","resolution":{"observed_at":"2026-08-07T15:27:03.780765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.753717Z","title":"Towards universal fake image detectors that generalize across generative models","venue":null,"work_id":"060f0dff-a05a-427e-afab-9e2d0a0975f8","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.758259Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:30d52e77315b04cfad73ed92eb0458bbfe3231903b1edc42b884c4168febe77a","observation_id":"f62a7ef7-de00-4d25-b642-f086ef6c0a94","resolution":{"observed_at":"2026-08-07T15:27:03.759973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.728595Z","title":"Avff: Audio-visual feature fusion for video deepfake detection","venue":null,"work_id":"72a0d524-e3bc-44c5-9725-c2df90723dc1","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.831456Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:746edfa6ef783abc72087a2643d5f41cf6b6caaaf04c876eeb718b8d6043a31c","observation_id":"b33bf91a-4459-486a-a57f-7206d11da1d0","resolution":{"observed_at":"2026-08-07T15:27:03.738263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.703807Z","title":"Gpt-4: A large multimodal model","venue":null,"work_id":"4673d274-d77f-4f70-a8b6-1103bc8a9044","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.907416Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:21bd8286c3e500948dce91a0ffda874756563502a2ffa2173ae835c36c568584","observation_id":"2e33d572-82a6-49c0-a661-9a5ed21294cf","resolution":{"observed_at":"2026-08-07T15:27:03.709277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.992374Z","title":"Deepfake generation and detection: A benchmark and survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:57.992374Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:02f4affd7de692801cb173773d7676a5110643ee1d80470fd0e5fb12e76278fb","observation_id":"a961ec6c-c6cd-4f8e-8810-3f959b1956e7","resolution":{"observed_at":"2026-08-07T15:26:57.992374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.681669Z","title":"Namboodiri, and C.V","venue":null,"work_id":"641a3ff6-fff4-4a3e-94b1-5b6b9c71e19b","year":2020},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.114333Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:af74fc227d85df0536f8b3dd945d880baf41e3e9b659b950afe9c59fe4c9c360","observation_id":"4939c70d-d9cf-4849-abff-6806947f0f82","resolution":{"observed_at":"2026-08-07T15:27:03.690146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.660472Z","title":"Audio-visual deep neural network for robust person verification","venue":null,"work_id":"f8801570-03a5-4bed-b6d9-e7fb5200f0e9","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.192243Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:58b4d807d0684d82cddc2ade704ff4e35a19d28e02e36f232a7c4f1012fab862","observation_id":"ce7db574-1fc5-4d78-8ee6-13722ead2071","resolution":{"observed_at":"2026-08-07T15:27:03.667273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.637450Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4e377d4a-9389-42c6-9c9c-1ee1481bfedc","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.255476Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:d38c2d736403ace2e6109a335bdb623425301d84aa50d76328279f1b0cccde21","observation_id":"998addff-3393-417d-b781-5e3d60ff255a","resolution":{"observed_at":"2026-08-07T15:27:03.644870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.327095Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.327095Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:139bf1b799b9806e1ad38e3e8affa70955bd0b5e56bccf0b2424ec34b2ae9e4f","observation_id":"ed3b185b-2c25-44f5-8a5d-80711d7b9155","resolution":{"observed_at":"2026-08-07T15:26:58.327095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.600981Z","title":"Faceforensics++: Learning to detect manipulated facial images","venue":null,"work_id":"8256685b-9585-4a08-8f88-ff39eceda435","year":2019},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.398378Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:8bc40587e3fada119412276be9cc89e607f9a786af7b66a5188bd233d66637aa","observation_id":"27b2ac9b-a357-416b-8236-577cc5b91d59","resolution":{"observed_at":"2026-08-07T15:27:03.606717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.580187Z","title":"A comprehensive overview of deepfake: Generation, detection, datasets, and opportunities","venue":null,"work_id":"b06387eb-4e52-49a4-aae2-7c8028abe693","year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.461992Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:6d6750f27efef0c49f30af5615c89d1e7abaaf91f2261b6972837d675907d70f","observation_id":"4221d3cd-8174-470c-804c-b320f7db35c7","resolution":{"observed_at":"2026-08-07T15:27:03.586152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.518035Z","title":"Detecting deepfakes with self-blended images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.518035Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:480c1a94b1c6d272157d7f63fdfb32430ce6175a768dc2814322cf82339a9b13","observation_id":"5bdf06cd-1658-4f2d-a4ef-2585d7efe552","resolution":{"observed_at":"2026-08-07T15:26:58.518035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.541163Z","title":"Representative forgery mining for fake face detection","venue":null,"work_id":"60bde062-7b7f-4590-9f45-237c586f1be0","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.570297Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:97ee90cd02ac9f11646545e05484cb34fc3c68be439e36ad339eeb814c47f029","observation_id":"1a3c8a52-071e-4a1b-9382-492116dc065e","resolution":{"observed_at":"2026-08-07T15:27:03.548967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18572","last_updated":"2024-11-27T18:16:11Z","snapshot_observed_at":"2026-08-03T14:10:18.815452Z","submitted_at":"2024-11-27T18:16:11Z","title":"Exploring Depth Information for Detecting Manipulated Face Videos","version":1},"cited_work":{"arxiv_id":"2411.18572","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18572","snapshot_observed_at":"2026-08-07T15:27:01.283805Z","title":"Exploring Depth Information for Detecting Manipulated Face Videos","venue":"cs.CV","work_id":"cb26d70e-9c21-445a-8120-e2955706b4fa","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.647254Z"},"links":{"cited_paper":"/paper/2411.18572","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:274a9d1d606e6542ffa80268779fdc435db931230c75e85700ae34dc93aa3729","observation_id":"97f193b6-0890-403e-8b58-e6db7fecf709","resolution":{"observed_at":"2026-08-07T15:27:01.335494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.514554Z","title":"Tan, and Haizhou Li","venue":null,"work_id":"8b02363b-13c0-4753-8071-47ed45ea2ed6","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.706727Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:5e912f8aca0e4bf42f4935de00356dd68836418025ca53569b4a401ca9868623","observation_id":"ae051bda-29c8-4dc1-a08a-1e6535fcd5a8","resolution":{"observed_at":"2026-08-07T15:27:03.522275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.490053Z","title":"Deep spatial gradient and temporal depth learning for face anti-spoofing","venue":null,"work_id":"a473480b-1fe1-41f4-b0f6-458fc06803d6","year":2020},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.768804Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:67944ee7cf702c20e33ca7cbdd1089325622dbf99fb7ad51fb9f06bf5cc4363e","observation_id":"0ad396e1-9008-44d0-909e-bce6a7cfc442","resolution":{"observed_at":"2026-08-07T15:27:03.497856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.461541Z","title":"Altfreezing for more general video face forgery detection","venue":null,"work_id":"baddd6ea-b934-473f-b666-e1ba02af2529","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.844117Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:ebd1a6a0b4c267da5077b995c95bf664773277a8314019cc794026d4ddc180ad","observation_id":"8654a873-3fb6-43db-b586-f4a3d6f549a9","resolution":{"observed_at":"2026-08-07T15:27:03.470186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11126","last_updated":"2021-03-11T13:45:17Z","snapshot_observed_at":"2026-08-07T03:50:56.678417Z","submitted_at":"2021-02-22T15:56:05Z","title":"Deepfake Video Detection Using Convolutional Vision Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11126","snapshot_observed_at":"2026-08-07T15:26:58.916792Z","title":"Deepfake video detection using convolutional vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.916792Z"},"links":{"cited_paper":"/paper/2102.11126","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:24ff8a4fe7ada81d5ffe1ce47f326a307d61a4bdcf461f788174aa314f4958c2","observation_id":"febc692d-c351-4c3a-85a6-300c68ce4ca3","resolution":{"observed_at":"2026-08-07T15:26:58.916792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.436827Z","title":"Binaural audio-visual localization","venue":null,"work_id":"9f08b274-75a8-4418-a969-aad2c91a9c00","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:58.988970Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:0dcc6337e050176ff3c434f45d14385c36a3e7831fb41d0635a22648f44d6535","observation_id":"ddcbe21a-8038-433e-9d37-8d3b1f313f5f","resolution":{"observed_at":"2026-08-07T15:27:03.445286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.412140Z","title":"Identity- driven multimedia forgery detection via reference assistance","venue":null,"work_id":"594c92de-c402-46b9-a1da-c28f2059505b","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.078297Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:bf0ed5e606c66a2fda830931848a8803a77ba5bc7ac64560043c2da5d30ad8db","observation_id":"b4697dcc-b1a5-47a8-ad45-b2d8fffe439d","resolution":{"observed_at":"2026-08-07T15:27:03.421904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.381897Z","title":"Tall: Thumbnail layout for deepfake video detection","venue":null,"work_id":"87f05e0f-aecd-498c-a997-cbccc118ffb8","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.161502Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:b7602b40de9212a7f9bf82b5c5ebd5d6fcf08646537fb6a22f32b5f8a0a99f82","observation_id":"15ce0a97-bc90-4e7e-ac37-97abf628d8bb","resolution":{"observed_at":"2026-08-07T15:27:03.390976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.354120Z","title":"Transcending forgery specificity with latent space augmentation for generalizable deepfake detection","venue":null,"work_id":"fbc5206b-a51c-483f-b4ad-53b6aa78bf5b","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.229390Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:09b75eaf1866989a949cfcbd1b2ef3aebadf76ea2de8aae9328143350f891e43","observation_id":"c6811e39-49e0-4c8c-af3b-f003898121cd","resolution":{"observed_at":"2026-08-07T15:27:03.362476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13495","last_updated":"2024-10-31T09:11:37Z","snapshot_observed_at":"2026-08-07T23:00:42.616018Z","submitted_at":"2024-06-19T12:35:02Z","title":"DF40: Toward Next-Generation Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13495","snapshot_observed_at":"2026-08-07T15:26:59.305225Z","title":"Df40: Toward next-generation deepfake detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.305225Z"},"links":{"cited_paper":"/paper/2406.13495","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:23d0287b2033dfef49c5197f657258e0cfe3436470766f5da592d41c61f4c71c","observation_id":"971ad1d4-6480-44f9-a694-e2f7f915d7e2","resolution":{"observed_at":"2026-08-07T15:26:59.305225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02782","last_updated":"2025-05-02T04:42:06Z","snapshot_observed_at":"2026-08-07T16:10:49.986016Z","submitted_at":"2025-04-03T17:23:16Z","title":"GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02782","snapshot_observed_at":"2026-08-07T15:26:59.364495Z","title":"Gpt-imgeval: A comprehensive benchmark for diagnosing gpt4o in image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.364495Z"},"links":{"cited_paper":"/paper/2504.02782","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:0a83edc8c7ec73b919c3c91de07e5494d8d9d7d363ab1df117a71bead77a2842","observation_id":"1d877f55-ac55-496c-9d20-c55c0911f808","resolution":{"observed_at":"2026-08-07T15:26:59.364495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:03.129133Z","title":"Ucf: Uncovering common features for generalizable deepfake detection","venue":null,"work_id":"d46135ca-a9e2-4210-8ae6-568a3828831b","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.442188Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:7168b008877ab62ba908129b2a7379254a20eced8783b104dcc2d8d9cc89c03c","observation_id":"d25b769b-48ca-4156-bb5f-d47bcb261003","resolution":{"observed_at":"2026-08-07T15:27:03.337860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17065","last_updated":"2024-11-30T10:48:35Z","snapshot_observed_at":"2026-08-08T19:43:47.155729Z","submitted_at":"2024-08-30T07:49:57Z","title":"Generalizing Deepfake Video Detection with Plug-and-Play: Video-Level Blending and Spatiotemporal Adapter Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17065","snapshot_observed_at":"2026-08-07T15:26:59.498474Z","title":"Generalizing deepfake video detection with plug-and-play: Video-level blending and spatiotemporal adapter tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.498474Z"},"links":{"cited_paper":"/paper/2408.17065","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:98701d5cd40e62ecc67435e7fb708b8d7c265bafc25f1323a60b782da53b873a","observation_id":"9c056045-81dc-401a-a5b1-e90a2e2f039f","resolution":{"observed_at":"2026-08-07T15:26:59.498474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.959032Z","title":"Avoid-df: Audio-visual joint learning for detecting deepfake","venue":null,"work_id":"b7698a5a-a343-4d27-8f03-7789faafc5d6","year":2015},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.566845Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:15deb644b47cba19a6d629214c9f5e806bdb0b88e3f0550c204a30ef296612b9","observation_id":"ad1cfbbd-6071-4c67-919d-5c751b1c3a31","resolution":{"observed_at":"2026-08-07T15:27:03.032256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.881209Z","title":"Exposing deep fakes using inconsistent head poses","venue":null,"work_id":"1f29a97c-ffbd-4198-9f55-fd1ebe1350d1","year":2019},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.676740Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:e59a2d247f38a633808ef59c0ff31fa56ad96adbad5e8c4983cc00ac2731c289","observation_id":"be58bad2-38dc-4944-941b-4c71e3c5c80e","resolution":{"observed_at":"2026-08-07T15:27:02.912242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14970","last_updated":"2023-08-29T01:50:01Z","snapshot_observed_at":"2026-07-06T16:11:31.948429Z","submitted_at":"2023-08-29T01:50:01Z","title":"Audio Deepfake Detection: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14970","snapshot_observed_at":"2026-08-07T15:26:59.790961Z","title":"Audio deepfake detection: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.790961Z"},"links":{"cited_paper":"/paper/2308.14970","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:07964c86e0141e3b91436fd772088dff41cd12a5ac15c67f352871213b1118ab","observation_id":"4939e96a-4e65-4f9e-b493-fec38e132990","resolution":{"observed_at":"2026-08-07T15:26:59.790961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.790376Z","title":"Learning natural consistency representation for face forgery video detection","venue":null,"work_id":"2334c058-6263-4310-98e6-78850d1dd657","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.977050Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:b095df5f4c78d45a28b296fc5e805d21a6dbca800abb7cac3ccbb872eac69f5d","observation_id":"f57e4aa7-b32c-4034-9cac-eafa94f7c76a","resolution":{"observed_at":"2026-08-07T15:27:02.835435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20833","last_updated":"2025-06-03T07:52:18Z","snapshot_observed_at":"2026-08-06T11:17:53.912892Z","submitted_at":"2024-12-30T09:58:27Z","title":"Inclusion 2024 Global Multimedia Deepfake Detection Challenge: Towards Multi-dimensional Face Forgery Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20833","snapshot_observed_at":"2026-08-07T15:27:00.152871Z","title":"Inclusion 2024 global multimedia deepfake detection: Towards multi-dimensional facial forgery detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.152871Z"},"links":{"cited_paper":"/paper/2412.20833","citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:dfc71b496a6a02c96f4cc6e7e8debfb57281cb71d0fa9f850bc63d452a89e203","observation_id":"0a1ded16-7871-485e-a9f1-31875ef21b89","resolution":{"observed_at":"2026-08-07T15:27:00.152871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.623623Z","title":"Multi-attentional deepfake detection","venue":null,"work_id":"e148cbd9-09ff-4a95-adbe-ab8d89e75b30","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.352741Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:69bace41a2d7e5a8af2695e87ef9be8b85fb9a2536e6c4536bd85cf8174a23af","observation_id":"7b594adb-5bb3-4472-b87f-5e8c0bae3f49","resolution":{"observed_at":"2026-08-07T15:27:02.717608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.519430Z","title":"Attention-based spatial-temporal multi-scale network for face anti-spoofing","venue":null,"work_id":"c9909379-beeb-48e2-9c6d-5dd70707bee6","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.559647Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:f32593ebe73ece40a570637a979bfa5ed1f2984d771777a8831386351ca4fda1","observation_id":"e5f35ecf-5e29-4f4a-aa9d-05a896ab8679","resolution":{"observed_at":"2026-08-07T15:27:02.577494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.414968Z","title":"Exploring temporal coherence for more general video face forgery detection","venue":null,"work_id":"95b716f5-62b6-43e8-bac3-74357a0a749e","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.736070Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:05a333d23e07ddaf572d1955c5384cfaf383940144cf95b504c1713bd1a26772","observation_id":"98e6c56d-f524-4cca-8c56-5edb2bfa5436","resolution":{"observed_at":"2026-08-07T15:27:02.445239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.338867Z","title":"Learning deep features for discriminative localization","venue":null,"work_id":"cf07bd76-4320-4d15-a2a5-b1923440d3e7","year":2016},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.875898Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:d04bd3031a880f80204a9090b4708e3049f15e6d1b2613f74f776de9250c52fa","observation_id":"ddf7a907-6417-4d79-bc02-88e3e060afbe","resolution":{"observed_at":"2026-08-07T15:27:02.349469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.220535Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"a5fae5de-7db4-43bc-b035-91f401c4f86a","year":2023},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.979116Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:27fe008d4b31c102b981e901695232b812c65b8ef5dc677b64dacae230cdc6fc","observation_id":"80b7e914-261f-4337-9107-8595853eb3e8","resolution":{"observed_at":"2026-08-07T15:27:02.294628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:02.081447Z","title":"Joint audio-visual deepfake detection","venue":null,"work_id":"c5b608e3-8c90-424d-84d9-17d28a9032f0","year":2021},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.986411Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:5ca3eef867e73d9c335b9066b793c2f18440dc29f0182cd36bf60cc4410698a9","observation_id":"80b73bbd-895d-4d40-88b8-38d16dff6ea2","resolution":{"observed_at":"2026-08-07T15:27:02.134020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:01.952528Z","title":"Lan- guagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":"2947849a-db29-4edf-a9fb-0e02a3a9a9e9","year":2024},"citing_paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:00.996471Z"},"links":{"citing_paper":"/paper/2505.15233"},"observation_digest":"sha256:24ed8ffa3365056a3769b0622fa3b3eb40c8cf637ee2a8bf4b817a8703e658f6","observation_id":"ec5cef83-b4fd-464f-a38d-b37ac7d8645e","resolution":{"observed_at":"2026-08-07T15:27:02.020529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15233","last_updated":"2025-05-21T08:11:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:32:36.181532Z","submitted_at":"2025-05-21T08:11:07Z","title":"CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":53},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 1 inbound Pith citation observation for arXiv:2505.15233."}