{"as_of":"2026-08-09T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa517227853dabe65164c5b731b5a0855d69b0b2eba15dea02779fb7e1c80efc","coverage":[{"denominator":201,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:12:22.843020Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T11:05:19.011287Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T11:54:38.827618Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"cited_work":{"arxiv_id":"2502.05240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05240","snapshot_observed_at":"2026-06-30T11:54:38.827618Z","title":"unnatural","venue":null,"work_id":"0bc17887-eaf6-4775-a6aa-5afa02616103","year":2025},"citing_paper":{"arxiv_id":"2512.15693","last_updated":"2026-05-15T14:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:48:26Z","title":"Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-21T16:43:11.995960Z"},"links":{"cited_paper":"/paper/2502.05240","citing_paper":"/paper/2512.15693"},"observation_digest":"sha256:d9bedaf237257b2721cef3c0cd338198e905c62027bd01e21cf9ea76fc4b7de5","observation_id":"60e4348a-d7bd-4c3a-80c5-bdc8f182ab7d","resolution":{"observed_at":"2026-05-21T16:44:15.984595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"cited_work":{"arxiv_id":"2502.05240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05240","snapshot_observed_at":"2026-06-30T11:54:38.827618Z","title":"unnatural","venue":null,"work_id":"0bc17887-eaf6-4775-a6aa-5afa02616103","year":2025},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2502.05240","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:bde145d73706705da28b7f984b739d57608e90978ee75b06f92ae9290f59b4f7","observation_id":"4607f999-6e92-40f8-8e3a-c21fe5e90f2a","resolution":{"observed_at":"2026-05-11T17:06:04.230379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"cited_work":{"arxiv_id":"2502.05240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05240","snapshot_observed_at":"2026-06-30T11:54:38.827618Z","title":"unnatural","venue":null,"work_id":"0bc17887-eaf6-4775-a6aa-5afa02616103","year":2025},"citing_paper":{"arxiv_id":"2605.25281","last_updated":"2026-05-26T16:00:26Z","snapshot_observed_at":"2026-08-07T06:12:58.984848Z","submitted_at":"2026-05-24T22:26:23Z","title":"READER: Reasoning-Enhanced AI-Generated Text Detection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T11:05:19.011287Z"},"links":{"cited_paper":"/paper/2502.05240","citing_paper":"/paper/2605.25281"},"observation_digest":"sha256:31137a8c89a52d7ee2f276d995668c839e0b06ce7a40e3d85544c971b917a452","observation_id":"015db01b-905b-478f-b1de-d7d7b0bffa45","resolution":{"observed_at":"2026-06-30T11:54:38.829046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05240/citation-record","integrity":"/paper/2502.05240/integrity","json":"/paper/2502.05240/citation-record.json","paper":"/paper/2502.05240"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.330332Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.330332Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ed80c6c5a919f7f40c39dab4044586627343838e76a0e0fb2fc8b5d5b5e1af96","observation_id":"a05485b9-ba1a-4f7c-85fb-90abb7d244f1","resolution":{"observed_at":"2026-08-08T21:12:22.330332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.335290Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.335290Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:f9eb0bbbab26ebeae61659094b56a7bb2cb5987bf023f366d532448c0a01c665","observation_id":"c049a956-3b30-4ccf-9ee7-6d51d98df14a","resolution":{"observed_at":"2026-08-08T21:12:22.335290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.339349Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.339349Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:98066ef7a947c9f513ad3141ed41b0b0a854eca0820cc0a1fe460a2213ff6f87","observation_id":"da24a3ef-f25a-4ddd-a7d0-edd48527df4c","resolution":{"observed_at":"2026-08-08T21:12:22.339349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.344830Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.344830Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:f2d0abed1aed2de86e93fd1f291e8eb0f0854987c8d171f95a4d829bac4528a8","observation_id":"11772ca8-03f4-4ed9-a9fe-b330e1dd8514","resolution":{"observed_at":"2026-08-08T21:12:22.344830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.350661Z","title":"Pluralistic aging diffusion autoencoder","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.350661Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:67d887f15d219d15a478ea54a2b3bc9f319d263508724232159bcc8cb3750f66","observation_id":"f7bcf616-0315-43b8-9771-5d079d79f78f","resolution":{"observed_at":"2026-08-08T21:12:22.350661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.355306Z","title":"Global and local consistent wavelet-domain age synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.355306Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:1406057c98362ccb62738d8bef491dcc775b7e4168384b34cb043bebeccab48a","observation_id":"c3d42e60-fb26-4ece-9ce9-e380a07b34b4","resolution":{"observed_at":"2026-08-08T21:12:22.355306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00432","last_updated":"2024-10-22T07:59:51Z","snapshot_observed_at":"2026-07-06T18:23:48.473551Z","submitted_at":"2024-06-01T13:10:43Z","title":"Localize, Understand, Collaborate: Semantic-Aware Dragging via Intention Reasoner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00432","snapshot_observed_at":"2026-08-08T21:12:22.360505Z","title":"Localize, understand, collaborate: Semantic-aware dragging via intention reasoner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.360505Z"},"links":{"cited_paper":"/paper/2406.00432","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:4edee85b1cb4253ca504ccd479e43348146d6dca05c3ac07e3acfe78437b6727","observation_id":"ab19450f-490f-4b26-a809-488d84b435b4","resolution":{"observed_at":"2026-08-08T21:12:22.360505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.365536Z","title":"Combating misinformation in the era of generative ai models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.365536Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:3d9e5db38a014f64b445a2ee0a187364457fa180b5952bb0902e5eae76d655ef","observation_id":"3079a0ad-4eee-4163-b745-767054a9acfc","resolution":{"observed_at":"2026-08-08T21:12:22.365536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.369863Z","title":"Deep learning technology for face forgery detection: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.369863Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:4fab865a3c6e0e3bcd2f18544db4bffeaae2f1349ab76c636c632da657daa836","observation_id":"d28f340c-767b-4a0d-9d9a-2db00f39a504","resolution":{"observed_at":"2026-08-08T21:12:22.369863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.374003Z","title":"Communicating the cultural other: Trust and bias in generative ai and large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.374003Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:963e0591d2878bf62e93f000817f7a2d9ada3767cb8e99ace71457c6c1ef8f29","observation_id":"d6292ac0-5dd2-4af0-8982-40d23927983a","resolution":{"observed_at":"2026-08-08T21:12:22.374003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.378256Z","title":"Generative ai meets copyright","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.378256Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:d084ee9a34e653a8d67106a3059c4b51738fa94c95d9cfde51d9555ad795f6bb","observation_id":"0ef591d9-9a6b-49e2-8556-ce79d7c23b86","resolution":{"observed_at":"2026-08-08T21:12:22.378256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09259","last_updated":"2024-12-09T14:22:14Z","snapshot_observed_at":"2026-08-09T06:09:32.355513Z","submitted_at":"2024-11-14T07:51:51Z","title":"Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09259","snapshot_observed_at":"2026-08-08T21:12:22.382439Z","title":"Jailbreak attacks and defenses against multimodal generative models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.382439Z"},"links":{"cited_paper":"/paper/2411.09259","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:64640e21e4e8352a741e6563087e5215c6472219f642606868fe2929227040ca","observation_id":"fa1d2957-556e-42e4-843f-05f67e725e3e","resolution":{"observed_at":"2026-08-08T21:12:22.382439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.386367Z","title":"Online detection of ai-generated images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.386367Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ec2b6c9056b58ee3f7b53882db990161ef3eaf105adc5b57536ea3b699bc02c0","observation_id":"12767eeb-dadd-4fa6-93f9-19d7702cd3be","resolution":{"observed_at":"2026-08-08T21:12:22.386367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.390227Z","title":"An empirical study of ai-generated text detection tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.390227Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:625ad3c2031f26fc2b30534827d418561ffe00e5af7c83958279b6c6e8e493fe","observation_id":"ca38bf36-9e65-4f14-94e1-e0d8c9a7d7df","resolution":{"observed_at":"2026-08-08T21:12:22.390227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-07-06T20:00:37.331726Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-08T21:12:22.394230Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.394230Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:118d07428d7fe0f60e563accb580d21cc353c570366ef1aa7ba0256936d6bbab","observation_id":"f6ac4806-3d66-4213-bf96-9480f05b34b3","resolution":{"observed_at":"2026-08-08T21:12:22.394230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00045","last_updated":"2025-07-26T02:37:03Z","snapshot_observed_at":"2026-07-06T17:23:18.724263Z","submitted_at":"2024-01-22T15:08:19Z","title":"Detecting Multimedia Generated by Large AI Models: A Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00045","snapshot_observed_at":"2026-08-08T21:12:22.398590Z","title":"Detecting multimedia generated by large ai models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.398590Z"},"links":{"cited_paper":"/paper/2402.00045","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:2f3821d9333282124a2abb307673d1c1ddeea92408aefeabc957caae972c6f29","observation_id":"d5bd5c36-2147-4430-9236-d04ba2567d70","resolution":{"observed_at":"2026-08-08T21:12:22.398590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.402602Z","title":"A survey of defenses against ai-generated visual media: Detection, disruption, and authentication","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.402602Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:b0de89170407a3dbcb57d8d50a660b488e2d7f4ebb0aa57b036b1ef76e895b96","observation_id":"fc98ebcb-fcd4-4125-9497-24ceeb4135b1","resolution":{"observed_at":"2026-08-08T21:12:22.402602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00711","last_updated":"2024-05-03T04:47:01Z","snapshot_observed_at":"2026-07-06T18:08:21.770341Z","submitted_at":"2024-04-25T04:44:09Z","title":"Fake Artificial Intelligence Generated Contents (FAIGC): A Survey of Theories, Detection Methods, and Opportunities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00711","snapshot_observed_at":"2026-08-08T21:12:22.407293Z","title":"Fake artificial intelligence generated contents (faigc): A survey of theories, detection methods, and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.407293Z"},"links":{"cited_paper":"/paper/2405.00711","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:7c1ba79498b26fcd56d0125a0f2130c12d26f0cc1bb96df52e40141286a26247","observation_id":"42979b47-816a-4bb3-b967-bb46b95435e2","resolution":{"observed_at":"2026-08-08T21:12:22.407293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T21:12:22.412016Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.412016Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:6fd42af87b7c3ea57c6e58b994200847108d13adf012e01e97b8ad5d053dc381","observation_id":"b24ed57a-6f4d-4b51-80c5-705ae92cdaf1","resolution":{"observed_at":"2026-08-08T21:12:22.412016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.416723Z","title":"Claude 3.5: Sonnet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.416723Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:d4767d83ff647a7ca38c9de0c1e727b8f4eb24fbbb8a0a8f8ce1ce05a790a45f","observation_id":"41bf45a3-c1d3-472d-ae0c-42bdf13bb932","resolution":{"observed_at":"2026-08-08T21:12:22.416723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.420944Z","title":"All the news that’s fit to fabricate: Ai-generated text as a tool of media misinformation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.420944Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:9c4d4678d270c9f11efd1d5d4fed37819604967e710b56890004ccb3031c2fc5","observation_id":"51560cc7-fdb1-4986-bdba-18fc23204298","resolution":{"observed_at":"2026-08-08T21:12:22.420944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.425093Z","title":"Program code generation with generative ais","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.425093Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:770b3e09c2fbd93ddbb42bc4d527ecdddac88324c258ca54071b8120c0d2be35","observation_id":"d9327d13-c18e-4416-b9ba-6836a61430bb","resolution":{"observed_at":"2026-08-08T21:12:22.425093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.429211Z","title":"Collage is the new writing: Exploring the fragmentation of text and user interfaces in ai tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.429211Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:139ce3dc0bde5a0a798ee4dd0f71e13ed617eccb71656b7c109d7860dc65d8ec","observation_id":"f6a5c91e-e10c-4b49-b34f-1c2ff5afb66f","resolution":{"observed_at":"2026-08-08T21:12:22.429211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.433254Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.433254Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:d29868635b5c59c1debe16426f6d4622d7be4975fad9b52576ec96fa73936c0e","observation_id":"5e27a907-c01a-4c0e-b616-8efcfe99f608","resolution":{"observed_at":"2026-08-08T21:12:22.433254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.437483Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.437483Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:d314a2ce07d9b591c57b5577a82d392dc604e4be2940328308ecf8817883ad11","observation_id":"cafd85fd-e198-46c3-b23c-96e76566fdf4","resolution":{"observed_at":"2026-08-08T21:12:22.437483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-08T21:12:22.441094Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.441094Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:c21c3b050e53c3737abf34749cf038afd30e1065bc64bdcd472673e34f61ffee","observation_id":"1a6add62-7936-4f88-89a8-5e27cc98ad11","resolution":{"observed_at":"2026-08-08T21:12:22.441094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.444940Z","title":"DeepMind","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.444940Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:fc422138a4d68a2b0a4ea78e6d6ff4603ba79536b3404bf8b908cfa9a8bab91f","observation_id":"2201bd10-8e8f-439d-a991-b12ff993fff2","resolution":{"observed_at":"2026-08-08T21:12:22.444940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.448617Z","title":"Midjourney","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.448617Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:35fb3cd7ac04afd80b056b61b7c09bb685f2f7ccd6206cb9fadaecacc3b69b27","observation_id":"3bd7f7f4-d0a3-4f50-a0d4-09a04809773b","resolution":{"observed_at":"2026-08-08T21:12:22.448617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T21:12:22.452251Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.452251Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:4f293cb29e3ec6d5c2697b158b979d7a3715ec856efc29b89a0923771bca4ef2","observation_id":"58ec89a6-38b1-4f08-aae3-5078b0901591","resolution":{"observed_at":"2026-08-08T21:12:22.452251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.456040Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.456040Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:3a781c12c77e7aad3b19ae626c1d836381fd3efb5ed0d687ae8ca58e5503ecf2","observation_id":"232de6b9-9720-4156-b30e-8735668e6fea","resolution":{"observed_at":"2026-08-08T21:12:22.456040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-08T21:12:22.459513Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.459513Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ac7914ff0979c26bc2a566668d34a76df1acc12fbca810c3d0ae369bfb8aafc2","observation_id":"51b3d717-7f44-43fa-a438-0dda29ae3edc","resolution":{"observed_at":"2026-08-08T21:12:22.459513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-08T21:12:22.463887Z","title":"Make- a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.463887Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:22f377da6b5ca7db325af8cd904af3e41653ba8c1e0a4fb5f94365d8e4718007","observation_id":"beb79927-b0f6-40ab-9d99-dd37855d74b5","resolution":{"observed_at":"2026-08-08T21:12:22.463887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.468504Z","title":"Dall·e 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.468504Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:7abe01b5598783b7af176736c79c9e0e662ef3722b5a95e71449cb19dde81027","observation_id":"2298f2ee-25dc-4877-ae98-66dba5524a99","resolution":{"observed_at":"2026-08-08T21:12:22.468504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.472912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.472912Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:65753c434d271dc6fbe3b2b8d29e1d817bea6b85031dc763053108c036e50a34","observation_id":"35f76bf6-57b0-4510-812b-4e4019560cc4","resolution":{"observed_at":"2026-08-08T21:12:22.472912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T21:12:22.477753Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.477753Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ae2b40fb73699416425918e844023129b12d7bc2d69fbcb40c6262d12ec4a92e","observation_id":"f5de5cd2-8e6b-45aa-b09e-7be150203c31","resolution":{"observed_at":"2026-08-08T21:12:22.477753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.482414Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.482414Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:efb5aec376b5149a487e6b651e0de0621bfec8d705ac80b7d6889a2f4df72ff8","observation_id":"60b97434-6b6e-4cb1-886a-f10dea0a7c4c","resolution":{"observed_at":"2026-08-08T21:12:22.482414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.486954Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.486954Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:690ef5935e3f7b16e73ea4330b9277cb10ddd969a94f07d52e4ea45874d12891","observation_id":"b3993d1f-5478-498c-810a-039c67f137ec","resolution":{"observed_at":"2026-08-08T21:12:22.486954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01409","last_updated":"2021-04-03T13:53:19Z","snapshot_observed_at":"2026-08-06T19:08:17.273949Z","submitted_at":"2021-04-03T13:53:19Z","title":"Diff-TTS: A Denoising Diffusion Model for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01409","snapshot_observed_at":"2026-08-08T21:12:22.491013Z","title":"Diff-tts: A denoising diffusion model for text-to- speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.491013Z"},"links":{"cited_paper":"/paper/2104.01409","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:fd18544a3c9a94676dca7ebfe1640b3abd4bb5778d09976d87c87d3266e5cd46","observation_id":"f2ba1678-4716-4563-8a31-4ac646a617a2","resolution":{"observed_at":"2026-08-08T21:12:22.491013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.494851Z","title":"Audioldm: text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.494851Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:852b2b5567d2120b35beddafb4e023618a23f93d8d82863c1a1cd986ea589700","observation_id":"92092498-bc2e-49e6-9806-1a4a4b703b0e","resolution":{"observed_at":"2026-08-08T21:12:22.494851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.498430Z","title":"Make-an-audio: text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.498430Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:1db90a02181211ba4b0e36496e0d860565de587a5bb23bab66ea778e94ca47a9","observation_id":"fdc13d22-27a8-4849-b3db-9a8b62510a23","resolution":{"observed_at":"2026-08-08T21:12:22.498430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-08T21:12:22.502166Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.502166Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:68f392f1b0b69110e6125515740d010b3d406c992efa5818b9af9a04006f08b8","observation_id":"3ac16a45-5bd5-4f75-a9ae-0834e90d4fc4","resolution":{"observed_at":"2026-08-08T21:12:22.502166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14335","last_updated":"2023-11-26T14:12:37Z","snapshot_observed_at":"2026-07-06T15:58:55.330444Z","submitted_at":"2023-07-26T17:54:04Z","title":"WavJourney: Compositional Audio Creation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14335","snapshot_observed_at":"2026-08-08T21:12:22.506015Z","title":"Wavjourney: Compositional audio creation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.506015Z"},"links":{"cited_paper":"/paper/2307.14335","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:dbbcb058b967b42bb8a8c23456794311db3a4f8e991401a94b1c3cee656e9202","observation_id":"6c3330d6-bba7-4f8a-a7fb-1dc252bf505d","resolution":{"observed_at":"2026-08-08T21:12:22.506015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-08T21:12:22.509705Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.509705Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:cd6b1bd3c96c5e6e53988a5fa8ad729c419c1400946bcfd2a35d61d1a51e3636","observation_id":"9cc133a0-5e46-45ce-98ad-a3c78c6985f1","resolution":{"observed_at":"2026-08-08T21:12:22.509705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.513933Z","title":"Explainability for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.513933Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:d2aebcbf2fcdc1c67c8788678293ae95de56b076e901295696b00fccb314be9e","observation_id":"de0cd808-7e0f-4832-addb-20995a7d00e1","resolution":{"observed_at":"2026-08-08T21:12:22.513933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18226","last_updated":"2025-03-11T08:08:05Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-26T11:07:25Z","title":"HowkGPT: Investigating the Detection of ChatGPT-generated University Student Homework through Context-Aware Perplexity Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18226","snapshot_observed_at":"2026-08-08T21:12:22.517911Z","title":"Howkgpt: Investigating the detection of chatgpt- generated university student homework through context-aware perplexity analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.517911Z"},"links":{"cited_paper":"/paper/2305.18226","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:2107829e71d418468dc91b82cfb9d99f6ce549aba335d5d58602f6a563691d67","observation_id":"b186ff9c-f6ba-4ef7-b70b-238c5dc1beb8","resolution":{"observed_at":"2026-08-08T21:12:22.517911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17359","last_updated":"2023-10-04T16:36:09Z","snapshot_observed_at":"2026-08-06T09:46:48.055328Z","submitted_at":"2023-05-27T03:58:29Z","title":"DNA-GPT: Divergent N-Gram Analysis for Training-Free Detection of GPT-Generated Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17359","snapshot_observed_at":"2026-08-08T21:12:22.522274Z","title":"Dna-gpt: Divergent n-gram analysis for training-free detection of gpt-generated text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.522274Z"},"links":{"cited_paper":"/paper/2305.17359","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:e0f065c45e456c24ae4d1e13ec0d89c8755950f2c6923a37e3654edc599db98f","observation_id":"1425f8bd-a6bc-4377-9358-8925b655f665","resolution":{"observed_at":"2026-08-08T21:12:22.522274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05540","last_updated":"2023-05-23T11:18:30Z","snapshot_observed_at":"2026-07-06T15:40:31.399348Z","submitted_at":"2023-05-23T11:18:30Z","title":"DetectLLM: Leveraging Log Rank Information for Zero-Shot Detection of Machine-Generated Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05540","snapshot_observed_at":"2026-08-08T21:12:22.527056Z","title":"Detectllm: Leveraging log rank information for zero-shot detection of machine- generated text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.527056Z"},"links":{"cited_paper":"/paper/2306.05540","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:68e0141f039026330f1fe9aca8521e7f834cfd0a736730782f3a2f2a51bd5db1","observation_id":"3f22f26a-d16f-43ee-b480-07ce0fd0acb2","resolution":{"observed_at":"2026-08-08T21:12:22.527056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.531462Z","title":"Detectgpt: Zero-shot machine-generated text detection using probability curvature","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.531462Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:533f94ccd9a6312fb35b4cc41a1e68087fcf4ab342ceb516c17eeb90451bd98f","observation_id":"ee04c8a1-631b-481f-baf7-55f9ad90a60e","resolution":{"observed_at":"2026-08-08T21:12:22.531462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05130","last_updated":"2024-12-16T02:20:31Z","snapshot_observed_at":"2026-08-03T21:21:39.149039Z","submitted_at":"2023-10-08T11:41:28Z","title":"Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05130","snapshot_observed_at":"2026-08-08T21:12:22.535389Z","title":"Fast-detectgpt: Efficient zero-shot detection of machine- generated text via conditional probability curvature","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.535389Z"},"links":{"cited_paper":"/paper/2310.05130","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:9212b76073d829349e28918d2af63086408cca2bc4d8bd85202e812f5c4e13eb","observation_id":"6e71886d-1c83-41c6-bd27-b0e2222b7e0a","resolution":{"observed_at":"2026-08-08T21:12:22.535389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09732","last_updated":"2025-04-21T02:36:09Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T05:26:36Z","title":"LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09732","snapshot_observed_at":"2026-08-08T21:12:22.539676Z","title":"Loki: A comprehensive synthetic data detection benchmark using large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.539676Z"},"links":{"cited_paper":"/paper/2410.09732","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:c17020d60de5d327fd13a1643bcd0e1a45c7a8b1557dce7434ef24e31081eab9","observation_id":"cd6fe240-c67f-4603-9bf7-0b6b2a7b3bb5","resolution":{"observed_at":"2026-08-08T21:12:22.539676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.543660Z","title":"Fighting fire with fire: can chatgpt detect ai-generated text? ACM SIGKDD Explorations Newsletter, 25(2):14–21, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.543660Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:454c49890042c4df57686105be4e0e17333f3e090f84b372be47abc96d0c2773","observation_id":"56ed2f15-9300-4826-9c33-fd7a013c60a8","resolution":{"observed_at":"2026-08-08T21:12:22.543660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.547760Z","title":"Detection vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.547760Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:cda89a131d7db5c7422174210d7321f86696365ee238cba0eaebe7c94fbdaaed","observation_id":"cc153f4f-b0c7-4828-a5b3-97ac7ce41622","resolution":{"observed_at":"2026-08-08T21:12:22.547760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14479","last_updated":"2023-10-23T01:23:10Z","snapshot_observed_at":"2026-08-04T20:54:50.593714Z","submitted_at":"2023-10-23T01:23:10Z","title":"DetectGPT-SC: Improving Detection of Text Generated by Large Language Models through Self-Consistency with Masked Predictions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14479","snapshot_observed_at":"2026-08-08T21:12:22.551830Z","title":"Detectgpt-sc: Improving detection of text generated by large language models through self- consistency with masked predictions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.551830Z"},"links":{"cited_paper":"/paper/2310.14479","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:9dc09093387a0eb27c728fd4b030b427ead7a153825d954b81317374b274aeb8","observation_id":"2a502feb-6837-49a3-bb2d-9be79cfc85d9","resolution":{"observed_at":"2026-08-08T21:12:22.551830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.555764Z","title":"Simllm: Detecting sentences generated by large language models using similarity between the generation and its re-generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.555764Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:2510e60b21216db60bf609a90ad4bdd25631176a8363a7e763072a6b000dbe61","observation_id":"2cae0c00-d71f-4d6c-84d2-8ea568907df5","resolution":{"observed_at":"2026-08-08T21:12:22.555764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.559380Z","title":"Beat llms at their own game: Zero-shot llm-generated text detection via querying chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.559380Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:9eeefa163d2acd5f9ed32d4a806ddc7fa0d0823d1006871a06e2e751c099720e","observation_id":"a4ff63e9-95d6-4276-84b9-0914bd04bc20","resolution":{"observed_at":"2026-08-08T21:12:22.559380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12970","last_updated":"2024-04-14T22:34:37Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T18:57:53Z","title":"Raidar: geneRative AI Detection viA Rewriting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12970","snapshot_observed_at":"2026-08-08T21:12:22.563047Z","title":"Raidar: generative ai detection via rewriting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.563047Z"},"links":{"cited_paper":"/paper/2401.12970","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:a93678dccf2b855b57d9667d28a6d8ccadebff5be3c1298edc481a1c8f7cc0b0","observation_id":"2d1142e0-3df0-4cfd-a1a9-9cbf40aa539b","resolution":{"observed_at":"2026-08-08T21:12:22.563047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04237","last_updated":"2025-02-15T04:11:44Z","snapshot_observed_at":"2026-08-06T13:05:00.036188Z","submitted_at":"2024-08-08T05:53:39Z","title":"Learning to Rewrite: Generalized LLM-Generated Text Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04237","snapshot_observed_at":"2026-08-08T21:12:22.567591Z","title":"Learning to rewrite: Generalized detection of LLM-generated text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.567591Z"},"links":{"cited_paper":"/paper/2408.04237","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:df8d1b792f52b1b879f03254758809a8450895364ab6ef6ba4b86ff28f55c53a","observation_id":"600dca26-f865-498b-a58e-ab5ed498a0d3","resolution":{"observed_at":"2026-08-08T21:12:22.567591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.571980Z","title":"Llm-as-a-coauthor: Can mixed human-written and machine-generated text be detected? In Findings of the Association for Computational Linguistics: NAACL 2024 , pages 409–436, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.571980Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ba91d2408f5702271a02707196c01eb9b1ab6edcaa88fdb8e7d1c9eb49aa1bed","observation_id":"4fea5176-f2b7-41e9-8515-2956d49ab8ef","resolution":{"observed_at":"2026-08-08T21:12:22.571980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04284","last_updated":"2025-03-14T11:52:30Z","snapshot_observed_at":"2026-07-06T18:58:18.051281Z","submitted_at":"2024-08-08T07:43:17Z","title":"LLM-DetectAIve: a Tool for Fine-Grained Machine-Generated Text Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04284","snapshot_observed_at":"2026-08-08T21:12:22.575914Z","title":"Llm-detectaive: a tool for fine-grained machine-generated text detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.575914Z"},"links":{"cited_paper":"/paper/2408.04284","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:142a41b060c6b8b9f62c5fe4dc9d2d76b8b67660d382859b4d349d8e2acc2efb","observation_id":"fda5103d-3f0e-4b42-9aa9-d6b999a77fba","resolution":{"observed_at":"2026-08-08T21:12:22.575914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04032","last_updated":"2025-03-17T12:05:36Z","snapshot_observed_at":"2026-07-06T19:46:15.364468Z","submitted_at":"2024-11-06T16:31:28Z","title":"Beemo: Benchmark of Expert-edited Machine-generated Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04032","snapshot_observed_at":"2026-08-08T21:12:22.677752Z","title":"Beemo: Benchmark of expert-edited machine-generated outputs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.677752Z"},"links":{"cited_paper":"/paper/2411.04032","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:3bb369e4329401638c8827f53423b56011a51a97535acead04b6823c6272fd9a","observation_id":"57c0922e-fc10-404a-bffc-abb46d3fd55c","resolution":{"observed_at":"2026-08-08T21:12:22.677752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14259","last_updated":"2025-02-06T06:19:10Z","snapshot_observed_at":"2026-08-03T14:04:24.819943Z","submitted_at":"2024-10-18T08:14:10Z","title":"Beyond Binary: Towards Fine-Grained LLM-Generated Text Detection via Role Recognition and Involvement Measurement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14259","snapshot_observed_at":"2026-08-08T21:12:22.682394Z","title":"Beyond binary: Towards fine-grained llm-generated text detection via role recognition and involvement measurement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.682394Z"},"links":{"cited_paper":"/paper/2410.14259","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:22049c77f51fd2794ebc1dcfed8aa2de5709b876e48989e9378131cdadbcf1b3","observation_id":"e20029ae-7054-41e4-8093-15d124e15a64","resolution":{"observed_at":"2026-08-08T21:12:22.682394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.686384Z","title":"A watermark for large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.686384Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ec383be87121b5155dfe82acf91662682df363e390a1a894f006b9dcb1dbf4c2","observation_id":"a6912873-8a98-47dc-9611-81b9798a131b","resolution":{"observed_at":"2026-08-08T21:12:22.686384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.690453Z","title":"On the reliability of watermarks for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.690453Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:e558399966a85471deb49fc739ae83f224ae885d7d85dffbb483c6e95795b64b","observation_id":"895b5a19-051f-4b66-8d5f-d2eb73ee560f","resolution":{"observed_at":"2026-08-08T21:12:22.690453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.694048Z","title":"Undetectable watermarks for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.694048Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:a92f746c963fac9f5ae525c694288d9c113e4b8fc7a0e8c8883ed39094fcdf45","observation_id":"15a9a157-5b84-4db3-8d8f-1a22975d70e1","resolution":{"observed_at":"2026-08-08T21:12:22.694048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.697583Z","title":"Provable robust watermarking for ai-generated text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.697583Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:ef5918a5c8fc5ed5d0b4685a3ec3583cb86af4e0e695b63a87b9158b24298202","observation_id":"05444cb2-5196-4843-9fe1-67255f58c0d2","resolution":{"observed_at":"2026-08-08T21:12:22.697583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09739","last_updated":"2024-12-17T16:52:12Z","snapshot_observed_at":"2026-08-08T23:02:57.472467Z","submitted_at":"2024-09-15T14:10:01Z","title":"PersonaMark: Personalized LLM watermarking for model protection and user attribution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09739","snapshot_observed_at":"2026-08-08T21:12:22.701113Z","title":"Personamark: Personalized llm watermarking for model protection and user attribution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.701113Z"},"links":{"cited_paper":"/paper/2409.09739","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:1a7c9e7ae711cb1b114f475e3c7336ae669f2bf2eda1552c63ce7e72962d6cba","observation_id":"4fd8acf1-52b3-4a50-8063-13edfbb16be1","resolution":{"observed_at":"2026-08-08T21:12:22.701113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18259","last_updated":"2025-06-24T15:45:05Z","snapshot_observed_at":"2026-07-06T18:37:17.280637Z","submitted_at":"2024-06-26T11:11:47Z","title":"Detecting Machine-Generated Texts: Not Just \"AI vs Humans\" and Explainability is Complicated","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18259","snapshot_observed_at":"2026-08-08T21:12:22.704973Z","title":"ai vs humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.704973Z"},"links":{"cited_paper":"/paper/2406.18259","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:cd2eb38d030aa4252f4f7f96f3629ec289c5476569cbc045c829c1dd5bd0a8d0","observation_id":"1842f3d5-d893-4acd-bbb8-54b0b4be4569","resolution":{"observed_at":"2026-08-08T21:12:22.704973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23728","last_updated":"2026-04-14T14:22:50Z","snapshot_observed_at":"2026-08-01T23:52:01.112271Z","submitted_at":"2024-10-31T08:30:55Z","title":"GigaCheck: Detecting LLM-generated Content via Object-Centric Span Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23728","snapshot_observed_at":"2026-08-08T21:12:22.709359Z","title":"Gigacheck: Detecting llm-generated content","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.709359Z"},"links":{"cited_paper":"/paper/2410.23728","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:87c9c611a288cf99c73accd601de4c61134a40d7004970c4919d9cede8e94231","observation_id":"53158559-7dc8-41ba-ace0-ba5a28d157e7","resolution":{"observed_at":"2026-08-08T21:12:22.709359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04178","last_updated":"2025-04-19T05:46:00Z","snapshot_observed_at":"2026-08-02T07:57:41.501565Z","submitted_at":"2024-02-06T17:31:36Z","title":"SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04178","snapshot_observed_at":"2026-08-08T21:12:22.714024Z","title":"Shield: An evaluation benchmark for face spoofing and forgery detection with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.714024Z"},"links":{"cited_paper":"/paper/2402.04178","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:fef6e35e154e5703433f0be320221fb9b2e73177242785d8b6414263f5139ae6","observation_id":"3e430203-9d05-406b-8f8f-ede864074d6c","resolution":{"observed_at":"2026-08-08T21:12:22.714024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.718375Z","title":"Can chatgpt detect deepfakes? a study of using multimodal large language models for media forensics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.718375Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:87d08cb8e5c7bc47cf20db8e23e14f36f6431156e90232b2e325a327c88e31dd","observation_id":"252ba75c-58bc-463f-a97a-0e21c0945473","resolution":{"observed_at":"2026-08-08T21:12:22.718375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12806","last_updated":"2024-03-19T15:07:08Z","snapshot_observed_at":"2026-07-06T17:47:02.560132Z","submitted_at":"2024-03-19T15:07:08Z","title":"VisualCritic: Making LMMs Perceive Visual Quality Like Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12806","snapshot_observed_at":"2026-08-08T21:12:22.722591Z","title":"Visualcritic: Making lmms perceive visual quality like humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.722591Z"},"links":{"cited_paper":"/paper/2403.12806","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:92385790b63b3924764b08147dd7a5e66a17c0e821a574fa4d8470e72515bb77","observation_id":"aa6b48a0-10f1-404c-a408-1cabdff20425","resolution":{"observed_at":"2026-08-08T21:12:22.722591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10238","last_updated":"2026-04-07T07:54:13Z","snapshot_observed_at":"2026-07-06T19:32:51.287674Z","submitted_at":"2024-10-14T07:56:51Z","title":"ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10238","snapshot_observed_at":"2026-08-08T21:12:22.726828Z","title":"Forgerygpt: Multimodal large language model for explainable image forgery detection and localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.726828Z"},"links":{"cited_paper":"/paper/2410.10238","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:494ac51e1f0f31544b9da09d2c6b5368f63e0ca58db88ea6592ccbad11648342","observation_id":"834a1b86-6ed8-4b6f-a782-bd0e157a72e0","resolution":{"observed_at":"2026-08-08T21:12:22.726828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03809","last_updated":"2024-12-05T02:05:33Z","snapshot_observed_at":"2026-07-06T20:01:54.557848Z","submitted_at":"2024-12-05T02:05:33Z","title":"EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM","version":1},"cited_work":{"arxiv_id":"2412.03809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03809","snapshot_observed_at":"2026-08-08T21:12:25.162545Z","title":"EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM","venue":"cs.CV","work_id":"6f1d0c70-d4c4-459b-a97c-21eae614e340","year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.731142Z"},"links":{"cited_paper":"/paper/2412.03809","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:8e4380c952b3cd097eca29b32b9c77ece665da2e6ba79d304d88c18982bdbb21","observation_id":"2d9c046d-3e90-4551-827c-fb6c54b8ae83","resolution":{"observed_at":"2026-08-08T21:12:25.167719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06126","last_updated":"2025-05-29T03:20:42Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T15:28:33Z","title":"X2-DFD: A framework for eXplainable and eXtendable Deepfake Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06126","snapshot_observed_at":"2026-08-08T21:12:22.735068Z","title":"X 2-DFD: A framework for e X plainable and e X tendable Deepfake Detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.735068Z"},"links":{"cited_paper":"/paper/2410.06126","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:fc9cf6497610077e38e4dcfda7d2a3dc42f8d7cb8a2b851d4f87471b05ef1d18","observation_id":"bca85028-2868-439a-b263-cb89993d6008","resolution":{"observed_at":"2026-08-08T21:12:22.735068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10072","last_updated":"2024-11-21T14:37:25Z","snapshot_observed_at":"2026-07-06T19:02:56.021845Z","submitted_at":"2024-08-19T15:15:20Z","title":"FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10072","snapshot_observed_at":"2026-08-08T21:12:22.739045Z","title":"Ffaa: Multimodal large language model based explainable open- world face forgery analysis assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.739045Z"},"links":{"cited_paper":"/paper/2408.10072","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:35460df0d7901d05015ffa434bef9144567e236f769b05bffc1f645d74b47202","observation_id":"6e1e105e-a98c-4012-a648-353467401110","resolution":{"observed_at":"2026-08-08T21:12:22.739045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02761","last_updated":"2025-04-12T08:08:04Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:34Z","title":"FakeShield: Explainable Image Forgery Detection and Localization via Multi-modal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02761","snapshot_observed_at":"2026-08-08T21:12:22.743227Z","title":"Fakeshield: Explainable image forgery detection and localization via multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.743227Z"},"links":{"cited_paper":"/paper/2410.02761","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:1182aa172cdf709f9b03f8b80979ab3e41e1442a4407d1bb8b3cad0a2a69a542","observation_id":"1f4f3d88-5d2f-4208-870f-2d5cd567ae5e","resolution":{"observed_at":"2026-08-08T21:12:22.743227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04292","last_updated":"2025-06-25T21:47:50Z","snapshot_observed_at":"2026-08-08T00:30:13.050953Z","submitted_at":"2024-12-05T16:12:25Z","title":"SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04292","snapshot_observed_at":"2026-08-08T21:12:22.747278Z","title":"Sida: Social media image deepfake detection, localization and explanation with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.747278Z"},"links":{"cited_paper":"/paper/2412.04292","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:4ffffb52590b6469fb965bb797a84481a38c5be5820b9d2449ba6a90f2efa832","observation_id":"cd488899-735a-4bb6-a1a4-644ef36e28e9","resolution":{"observed_at":"2026-08-08T21:12:22.747278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19685","last_updated":"2026-04-20T14:24:19Z","snapshot_observed_at":"2026-07-06T20:13:45.123960Z","submitted_at":"2024-12-27T15:23:39Z","title":"Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19685","snapshot_observed_at":"2026-08-08T21:12:22.751776Z","title":"A large-scale interpretable multi-modality benchmark for facial image forgery localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.751776Z"},"links":{"cited_paper":"/paper/2412.19685","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:253cc08c4f8a1a412ff7839d44e740ed1b9384ae424be793c1e4086633faf85a","observation_id":"a7fd9ee0-b7d6-4a13-bb98-1dd9330a54b5","resolution":{"observed_at":"2026-08-08T21:12:22.751776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.756275Z","title":"Forgerysleuth: Empowering multimodal large language models for image manipulation detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.756275Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:670b1eb187196906b51976ea4bf7f4d5db37c2b47cb5f20661773134432dac68","observation_id":"c3a0395e-5f0a-4820-86f6-3be69a506ff0","resolution":{"observed_at":"2026-08-08T21:12:22.756275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23623","last_updated":"2025-06-19T12:51:03Z","snapshot_observed_at":"2026-07-06T19:42:38.715005Z","submitted_at":"2024-10-31T04:20:47Z","title":"On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23623","snapshot_observed_at":"2026-08-08T21:12:22.760504Z","title":"On learning multi-modal forgery representation for diffusion generated video detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.760504Z"},"links":{"cited_paper":"/paper/2410.23623","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:a139b6091a9b0fb703ae35e93973dd745e5efb959ee6bc355e9e65e2035b3e09","observation_id":"9ac9fe25-38df-42ac-b3a2-0202d9c65f02","resolution":{"observed_at":"2026-08-08T21:12:22.760504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10326","last_updated":"2025-03-24T20:26:56Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:01Z","title":"VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10326","snapshot_observed_at":"2026-08-08T21:12:22.765077Z","title":"Vane-bench: Video anomaly evaluation benchmark for conversational lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.765077Z"},"links":{"cited_paper":"/paper/2406.10326","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:bdbb70cfdcba24f5c7799b93c8c5ad141cb2c8d9756fa43d924412eb037a0af5","observation_id":"8d9df4eb-32ea-4b5e-b28e-f9dc0a3edb19","resolution":{"observed_at":"2026-08-08T21:12:22.765077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02411","last_updated":"2024-07-03T03:48:18Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T16:34:14Z","title":"Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs","version":2},"cited_work":{"arxiv_id":"2407.02411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02411","snapshot_observed_at":"2026-08-08T21:12:24.808523Z","title":"Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs","venue":"cs.CV","work_id":"aec80614-eb34-40ce-b8c7-77734e840a9f","year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.769455Z"},"links":{"cited_paper":"/paper/2407.02411","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:25cf0edefd238ce30ac0beb7cdebfcf03ea0e400e6619cf81a096e10bd8a6b6a","observation_id":"0643c725-c24b-416e-9c99-4358fa52cbeb","resolution":{"observed_at":"2026-08-08T21:12:24.813497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14080","last_updated":"2025-02-25T03:22:49Z","snapshot_observed_at":"2026-08-03T14:19:01.294128Z","submitted_at":"2024-08-26T08:02:57Z","title":"SONICS: Synthetic Or Not -- Identifying Counterfeit Songs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14080","snapshot_observed_at":"2026-08-08T21:12:22.774060Z","title":"Sonics: Synthetic or not–identifying counterfeit songs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.774060Z"},"links":{"cited_paper":"/paper/2408.14080","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:c4ad803517941938023339693beb9a7a63ef520ec29dd2de0515cbb852268b85","observation_id":"e72797f6-df93-4958-918b-e1975e647749","resolution":{"observed_at":"2026-08-08T21:12:22.774060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.778474Z","title":"Sniffer: Multimodal large language model for explainable out-of-context misin- formation detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.778474Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:7ef7384ff71596727c8e9bd96a347f741231a207a669d0b2c3a3e844e8a47283","observation_id":"4f787bc6-4362-40fe-8795-7e39912ca20d","resolution":{"observed_at":"2026-08-08T21:12:22.778474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.782506Z","title":"Cheap-fake detection with llm using prompt engineering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.782506Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:d2572ce4306865e39c40453f17516d5b33c913d8d2e8413a089236437a90fe7b","observation_id":"c7db6c9c-1b9a-40d7-9368-ac87816ce48c","resolution":{"observed_at":"2026-08-08T21:12:22.782506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09266","last_updated":"2024-11-14T08:07:02Z","snapshot_observed_at":"2026-07-06T19:50:15.546603Z","submitted_at":"2024-11-14T08:07:02Z","title":"How Good is ChatGPT at Audiovisual Deepfake Detection: A Comparative Study of ChatGPT, AI Models and Human Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09266","snapshot_observed_at":"2026-08-08T21:12:22.786308Z","title":"How good is chatgpt at audiovisual deepfake detection: A comparative study of chatgpt, ai models and human perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.786308Z"},"links":{"cited_paper":"/paper/2411.09266","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:38bb67a7b8e7a11b583d2c4922dea5e8f769cdd2f54883cbf845d2247d7cd833","observation_id":"97905d3d-cbd7-4ae6-9066-5b59977b82b9","resolution":{"observed_at":"2026-08-08T21:12:22.786308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16824","last_updated":"2024-11-14T16:35:48Z","snapshot_observed_at":"2026-07-06T18:05:42.862609Z","submitted_at":"2024-04-25T17:59:45Z","title":"V2A-Mark: Versatile Deep Visual-Audio Watermarking for Manipulation Localization and Copyright Protection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16824","snapshot_observed_at":"2026-08-08T21:12:22.790237Z","title":"V2a-mark: Versatile deep visual-audio watermarking for manipulation localization and copyright protection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.790237Z"},"links":{"cited_paper":"/paper/2404.16824","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:4e9579c281695fd0f9f25746c33a45fcd540547993aa481dfb50ceb67cab9dcc","observation_id":"bf7d651e-b657-431c-a4fd-431e3d83cc28","resolution":{"observed_at":"2026-08-08T21:12:22.790237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.794355Z","title":"Three ways chatgpt helps me in my academic writing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.794355Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:a75fb5709822e1050c274d7b6bd67ccd6a68f9fc22f3f92123cae7713b77e30c","observation_id":"62d549fc-cd53-41ab-a1cc-fb9cf99c0794","resolution":{"observed_at":"2026-08-08T21:12:22.794355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.798267Z","title":"Fake it till you make it: Curricular dynamic forgery augmentations towards general deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.798267Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:f35f6748d975aac308991b3f5054fdc28c05117b39fa1e1524fd202a510cad12","observation_id":"ce8183ab-c59e-45c5-bb1b-56443a489b21","resolution":{"observed_at":"2026-08-08T21:12:22.798267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-08T21:12:22.802431Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.802431Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:df3767e35aaa47cf9ef73a762590050fd49f8e77627845020882f84e57a27cf3","observation_id":"9573671c-4511-4233-b5bb-cc2db817550c","resolution":{"observed_at":"2026-08-08T21:12:22.802431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-08T21:12:22.806707Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.806707Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:9311a306c040ad7bf34696c9c874580576b5bed73b24de19a854b17a83558071","observation_id":"ab54ac0d-ebe1-437f-8111-43b7e2ae88b5","resolution":{"observed_at":"2026-08-08T21:12:22.806707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-08T21:12:22.811057Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.811057Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:5d7c18e5831b350e3d97a3208de2c4b44db277a099fa6b73bfeb0fb91ee77edf","observation_id":"986a7053-ddd1-41f8-8517-e1156e916994","resolution":{"observed_at":"2026-08-08T21:12:22.811057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.815382Z","title":"What matters in detecting ai-generated videos like sora? arXiv preprint arXiv:2406.19568, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.815382Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:da46bbcba8050dadaed3507245780d9b6ad73d46db3262867b1ea462812282cf","observation_id":"1e4f4d40-a7a0-4150-9ea1-f9d8cf12088c","resolution":{"observed_at":"2026-08-08T21:12:22.815382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-08T21:12:22.819751Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.819751Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:c11bb31f007c01e7292dc90d3eeacae2dafd2aa761ec6fcc4167f55660da8194","observation_id":"60d48127-c6c0-4ff8-8c5e-99d08bac4985","resolution":{"observed_at":"2026-08-08T21:12:22.819751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-08T21:12:22.824098Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.824098Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:3b384c31d8edcc99d7195ecbb3650a01d1efc352e78d917db5740ce3bf9a8b37","observation_id":"0584da7b-ea17-4e07-a9b1-c028c05681c0","resolution":{"observed_at":"2026-08-08T21:12:22.824098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.828379Z","title":"Fka-owl: Ad- vancing multimodal fake news detection through knowledge-augmented lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.828379Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:5781a98c5314a0471a9ea1d03e8ae13e320a0ed30a3740f5893fbd7ea4eef741","observation_id":"fb46dc72-e4a3-41da-b80e-96a982b89a7c","resolution":{"observed_at":"2026-08-08T21:12:22.828379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2309.03815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:24.480731Z","title":"T2iw: Joint text to image & watermark generation","venue":null,"work_id":"a3e30be1-c48d-434a-916f-c0b9d519facf","year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.831878Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:5905ee5c4cddfae446429f8b8fb5a879dda39d916da1456c06b360d4ff21685c","observation_id":"5683646d-37ee-40d6-ad4c-8374e047db01","resolution":{"observed_at":"2026-08-08T21:12:24.488572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05863","last_updated":"2023-11-10T04:27:27Z","snapshot_observed_at":"2026-07-06T16:45:36.159896Z","submitted_at":"2023-11-10T04:27:27Z","title":"Watermarking Vision-Language Pre-trained Models for Multi-modal Embedding as a Service","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05863","snapshot_observed_at":"2026-08-08T21:12:22.835232Z","title":"Watermarking vision-language pre-trained models for multi-modal embedding as a service","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.835232Z"},"links":{"cited_paper":"/paper/2311.05863","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:4db02706ecd1055da41745f9e1dbe091a750c36904c54704f9bc091cc52ecf46","observation_id":"d05f5801-5bab-4378-9a04-251f70e22827","resolution":{"observed_at":"2026-08-08T21:12:22.835232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20964","last_updated":"2024-10-28T12:34:49Z","snapshot_observed_at":"2026-08-02T19:56:32.150900Z","submitted_at":"2024-10-28T12:34:49Z","title":"DeTeCtive: Detecting AI-generated Text via Multi-Level Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20964","snapshot_observed_at":"2026-08-08T21:12:22.838957Z","title":"Detective: Detecting ai-generated text via multi-level contrastive learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.838957Z"},"links":{"cited_paper":"/paper/2410.20964","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:5e12766077fa4da7a48099389b1aa67f1bd81d7c5bcc7d5c621b23a4cee2d294","observation_id":"de5c2dba-80bb-4b0b-b8cb-7c6e162512c5","resolution":{"observed_at":"2026-08-08T21:12:22.838957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:12:22.843020Z","title":"Detecting and unmasking ai-generated texts through explainable artificial intelligence using stylistic features","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:22.843020Z"},"links":{"citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:f964abe20b35af85ba21d010ea5f37fc2d636a0875726f3e51c4e90a4ac549ac","observation_id":"972f170c-bae0-48d6-a6b3-e2f049642934","resolution":{"observed_at":"2026-08-08T21:12:22.843020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:35:47.860082Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":201},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 201 outbound references and 3 inbound Pith citation observations for arXiv:2502.05240."}