{"as_of":"2026-08-09T20:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee1e8f45a66cdcbe16dd3cd56e41f0953193b9d45b2c468d4bf71749c235b856","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:32:59.902041Z","state":"measured"},{"denominator":114,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":114,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:42:14.399692Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:51.414826Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T02:02:32.806844Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:0bf106878e468f54a84e6c49d8084c5b1a15cce533bdf9170a98a2fb5b08b872","observation_id":"cf77b0b1-0b64-4414-9adf-d433445025e4","resolution":{"observed_at":"2026-05-16T02:02:32.882486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-08-04T14:42:14.399692Z","title":"Aigi-holmes: Towards explainable and generaliz- able ai-generated image detection via multimodal large language models.arXiv preprint arXiv:2507.02664, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:14.399692Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:9edd9c8a1424f4d8b15b2a2c8b32855fb29c7a88b177a528a9542b931b2c6a0c","observation_id":"717419ce-fb9a-4cd0-aee4-7922a2de0c3e","resolution":{"observed_at":"2026-08-04T14:42:14.399692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2511.00181","last_updated":"2026-04-07T09:06:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-31T18:36:49Z","title":"From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T02:04:49.742067Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2511.00181"},"observation_digest":"sha256:32257d6dcff3500a3472aab3afbec8370c6c857edbfbfd6ca3caed5ab4e967cd","observation_id":"22f248dc-3206-448a-94ec-43a694ccbc0f","resolution":{"observed_at":"2026-05-18T02:05:38.971627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2602.01738","last_updated":"2026-04-15T07:37:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-02T07:20:02Z","title":"Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T08:40:09.385451Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2602.01738"},"observation_digest":"sha256:b703bdaaeac2f3cf2fc0c59febd62faeb2acde359d045a9e8f763c99dc9bf25c","observation_id":"32efcb18-ae33-4740-ba80-fd7dbaf002ad","resolution":{"observed_at":"2026-05-16T08:40:46.275871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-13T19:51:45.257204Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models.arXiv preprint arXiv:2507.02664, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23115","last_updated":"2026-07-03T11:05:22Z","snapshot_observed_at":"2026-08-09T00:00:13.011780Z","submitted_at":"2026-03-24T12:10:21Z","title":"AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T19:51:45.257204Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2603.23115"},"observation_digest":"sha256:dc297b5aae7d26e00bcc3c20c421e5631470d2aa8c7efabc302043b6bb5e1bfa","observation_id":"1c90226d-7d59-4714-820d-736e88d06853","resolution":{"observed_at":"2026-07-13T19:51:45.257204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2604.12353","last_updated":"2026-04-14T06:41:39Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:41:39Z","title":"Combating Pattern and Content Bias: Adversarial Feature Learning for Generalized AI-Generated Image Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:01:21.206132Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2604.12353"},"observation_digest":"sha256:ae74ea5c5f1ecfc5b8373f6651321e867e3351485f1b12963dab8808ece56917","observation_id":"f31db478-16d8-49ea-8974-78a9083c3e72","resolution":{"observed_at":"2026-05-11T11:21:00.844239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2604.16987","last_updated":"2026-08-06T06:53:47Z","snapshot_observed_at":"2026-08-09T20:09:54.641529Z","submitted_at":"2026-04-18T13:22:42Z","title":"DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T07:51:04.580617Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2604.16987"},"observation_digest":"sha256:58c842e425a460a88c12e718ad7f0a1fccad015f31d560cc4e9a278886843f57","observation_id":"cbd7adff-412a-4626-9c58-005925ad1bec","resolution":{"observed_at":"2026-05-10T07:52:13.639002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2604.21904","last_updated":"2026-04-23T17:49:25Z","snapshot_observed_at":"2026-08-04T02:51:46.295152Z","submitted_at":"2026-04-23T17:49:25Z","title":"UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-09T22:21:10.133655Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2604.21904"},"observation_digest":"sha256:560f623658d24eba869d176df6b1322c440b56b9d8bc8e14416cda53d788f6f9","observation_id":"49f413dc-93e3-429a-ac94-460ba94dcb91","resolution":{"observed_at":"2026-05-09T22:44:15.275289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2604.27903","last_updated":"2026-04-30T14:12:49Z","snapshot_observed_at":"2026-07-06T23:13:15.994987Z","submitted_at":"2026-04-30T14:12:49Z","title":"HiMix: Hierarchical Artifact-aware Mixup for Generalized Synthetic Image Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T07:20:45.720262Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2604.27903"},"observation_digest":"sha256:7fd68ac3bf5ebbe271c224ac2a6b5519acabb15872a48b234bf4af529e2f2709","observation_id":"00a6b45b-8045-473b-9da0-1b97f5ff62b5","resolution":{"observed_at":"2026-05-12T10:11:27.955386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2605.16080","last_updated":"2026-05-15T15:43:44Z","snapshot_observed_at":"2026-08-02T02:50:58.644997Z","submitted_at":"2026-05-15T15:43:44Z","title":"ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T19:31:12.594807Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2605.16080"},"observation_digest":"sha256:90aa13e5ca71d54b204d462c9449c8930c7089cde8a2895b181521827f447b27","observation_id":"352d11e6-59ea-4abc-95b4-a13070f211d5","resolution":{"observed_at":"2026-05-20T19:33:42.103759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2605.26421","last_updated":"2026-05-26T01:20:18Z","snapshot_observed_at":"2026-08-05T18:52:32.523775Z","submitted_at":"2026-05-26T01:20:18Z","title":"HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-29T18:51:53.451225Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2605.26421"},"observation_digest":"sha256:a65a0a3db9bffade06167f94f7b9c15a607aa071111ecd03bf97780f20757af0","observation_id":"55c8399d-5fa3-469c-b04c-3efc89764c06","resolution":{"observed_at":"2026-06-29T18:53:51.103256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2606.08634","last_updated":"2026-06-07T13:56:17Z","snapshot_observed_at":"2026-08-02T04:03:59.312875Z","submitted_at":"2026-06-07T13:56:17Z","title":"SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T18:45:40.075404Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2606.08634"},"observation_digest":"sha256:725535e9bfeaab5b6cefaeb6fceac8e914840b033800f1127528fd61f3086365","observation_id":"f1fda93a-867c-472a-b6b1-6c3bc088dda5","resolution":{"observed_at":"2026-07-02T22:37:26.083247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.02664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-04T13:09:51.414826Z","title":"Aigi-holmes: Towards explainable and gener- alizable ai-generated image detection via multimodal large language models","venue":null,"work_id":"692679f6-9f0f-4da3-86d9-d175f13b653e","year":2025},"citing_paper":{"arxiv_id":"2606.26552","last_updated":"2026-06-25T02:59:33Z","snapshot_observed_at":"2026-08-07T15:04:40.783984Z","submitted_at":"2026-06-25T02:59:33Z","title":"Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T05:25:25.193161Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2606.26552"},"observation_digest":"sha256:e3e5ffc5275630a06bdeb430b23d7a56689b60d55748ee813931d3be3830b37b","observation_id":"9e3eeb88-e730-45fb-87d8-bbdcb19f0a1b","resolution":{"observed_at":"2026-07-04T13:09:51.416394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02664","snapshot_observed_at":"2026-07-12T01:35:43.979206Z","title":"Aigi-holmes: Towards explainable and generalizable ai-generated image detection via multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03562","last_updated":"2026-07-03T18:52:42Z","snapshot_observed_at":"2026-08-07T06:14:13.409347Z","submitted_at":"2026-07-03T18:52:42Z","title":"XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T01:35:43.979206Z"},"links":{"cited_paper":"/paper/2507.02664","citing_paper":"/paper/2607.03562"},"observation_digest":"sha256:971d7564579dd4844b51d721c3eb20638e5a1a766f85b1eaf18c604a28a45e3d","observation_id":"8a145448-fa20-439a-878e-5518dca59064","resolution":{"observed_at":"2026-07-12T01:35:43.979206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02664/citation-record","integrity":"/paper/2507.02664/integrity","json":"/paper/2507.02664/citation-record.json","paper":"/paper/2507.02664"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:32:59.573870Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.573870Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:d5f257915aa414abf4555971bb1368577c601221bd1a614e6912df4c0587f9c8","observation_id":"bf18de45-b5c9-4c1c-8199-5dcb47548cb6","resolution":{"observed_at":"2026-08-06T20:32:59.573870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.578009Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.578009Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:235c030485bb58c8fede6b1d26b6df6b7804c997a3041ea8fa075cb477168078","observation_id":"24dc84c7-df66-41ac-bd29-34820d952a00","resolution":{"observed_at":"2026-08-06T20:32:59.578009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.581793Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.581793Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:c972c2e6f1e585ec25dd34a4d9b637058cbe01cab34d4566bebee2f9bd82c2a0","observation_id":"162de45e-5a5c-4ab0-9d52-24267c4d407d","resolution":{"observed_at":"2026-08-06T20:32:59.581793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.585070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.585070Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:1846d10f12221fee6f29327b71ec4cec63e8907cb7991f4fe6d1e5077aaef40f","observation_id":"cfba07a0-821b-4c49-95e6-71f22ff0651d","resolution":{"observed_at":"2026-08-06T20:32:59.585070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17419","last_updated":"2024-08-21T07:42:02Z","snapshot_observed_at":"2026-08-07T20:34:56.788333Z","submitted_at":"2023-10-26T14:23:45Z","title":"AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17419","snapshot_observed_at":"2026-08-06T20:32:59.588251Z","title":"Antifakeprompt: Prompt-tuned vision-language models are fake image detectors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.588251Z"},"links":{"cited_paper":"/paper/2310.17419","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:28fbf5bf15ea680b1677be2a7d87750275b7a28d48397fff4bde4f6fcab10203","observation_id":"62937a4d-2bd7-419b-8ebf-0be5525f27e2","resolution":{"observed_at":"2026-08-06T20:32:59.588251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.591831Z","title":"Drct: Diffusion reconstruction contrastive training towards universal detection of diffusion generated images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.591831Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:71b616fac7c658309c21a30eac18dd00f63aeb78201003316db1efbb1be59ff8","observation_id":"38b2d0f9-4ff5-45f0-bf37-62620c07583e","resolution":{"observed_at":"2026-08-06T20:32:59.591831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.595207Z","title":"DRCT: Diffusion reconstruction contrastive training towards universal detection of diffusion generated images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.595207Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:4cfe395b1435748b706d2f7b735197348339adbeb2db70cc4f0100ce93c475b4","observation_id":"fba692d6-aa99-4a80-8d68-4f7aac894ecf","resolution":{"observed_at":"2026-08-06T20:32:59.595207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.598533Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision-language benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.598533Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:bad39644c6b994ed36cd540f257b7c78273670880827d6c9f5ff6c28633f3004","observation_id":"e784e9d2-522e-41b0-997e-f447d06b9fb5","resolution":{"observed_at":"2026-08-06T20:32:59.598533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.601951Z","title":"Pixart- σ : Weak-to-strong training of diffusion transformer for 4k text-to-image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.601951Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:6b37224cff4040e7e483a925bc9f9bd49043be52d6355baf839a9a2e1b4a2d05","observation_id":"a8846ba0-0a23-42c0-bc19-cb3e9cd1392e","resolution":{"observed_at":"2026-08-06T20:32:59.601951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.605398Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.605398Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:8c2b19935d24b1eff27dabfa269eae4c4d07305e49e6bd3fdfa27032604a5fb7","observation_id":"09981557-512c-477c-be74-e905c3f284f3","resolution":{"observed_at":"2026-08-06T20:32:59.605398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.608465Z","title":"Diffusionfake: En- hancing generalization in deepfake detection via guided sta- ble diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.608465Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:db46426486d0677b0bd888d1327d0042ea71eb97231ca67af09dfd64fecb98f9","observation_id":"af90fba2-33cc-4c1a-bd60-a85a00ec8228","resolution":{"observed_at":"2026-08-06T20:32:59.608465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T20:32:59.611645Z","title":"Janus- pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.611645Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:4da4e259be89c37f7bbc7a0c182a43a15f279d33ba2c5fc4bd774ad5322dd303","observation_id":"775353a2-cf17-42df-b5a0-dd88d20214c4","resolution":{"observed_at":"2026-08-06T20:32:59.611645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06126","last_updated":"2025-05-29T03:20:42Z","snapshot_observed_at":"2026-08-09T09:24:04.744041Z","submitted_at":"2024-10-08T15:28:33Z","title":"X2-DFD: A framework for eXplainable and eXtendable Deepfake Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06126","snapshot_observed_at":"2026-08-06T20:32:59.615052Z","title":"arXiv preprint arXiv:2410.06126, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.615052Z"},"links":{"cited_paper":"/paper/2410.06126","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:4d81afe63bc42b42dee82b518e42ba665305331f5b5a78363dfd1db762a3792f","observation_id":"b3719b7d-9473-4744-a02a-16cb6fd44af5","resolution":{"observed_at":"2026-08-06T20:32:59.615052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18471","last_updated":"2024-03-27T11:32:44Z","snapshot_observed_at":"2026-07-06T17:51:52.326981Z","submitted_at":"2024-03-27T11:32:44Z","title":"DiffusionFace: Towards a Comprehensive Dataset for Diffusion-Based Face Forgery Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18471","snapshot_observed_at":"2026-08-06T20:32:59.618501Z","title":"Diffusionface: Towards a comprehensive dataset for diffusion-based face forgery analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.618501Z"},"links":{"cited_paper":"/paper/2403.18471","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:bb3336fa67ac5dd357a3fa52dc840ebf99a345e5c89758b53cf223d36bba03b3","observation_id":"d2f9eae6-8744-4b8d-9f39-89203f394c51","resolution":{"observed_at":"2026-08-06T20:32:59.618501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T20:32:59.621908Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.621908Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:0dc3bb9fdd7e1fa2fbbe81907998a61db53f063afdb7b3d2c879d59d73a0e5af","observation_id":"2ee08d7c-7c20-4644-93ff-6c2fb13d2190","resolution":{"observed_at":"2026-08-06T20:32:59.621908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T20:32:59.625282Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.625282Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:dd8d885417168841465b5b136897c828ba6888b1dd4f84e1ec3b3091f5e35434","observation_id":"90a84e48-dd61-4f43-b121-32097f98daff","resolution":{"observed_at":"2026-08-06T20:32:59.625282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.628963Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.628963Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:ea6d0bbb9c66ce5e3919922e6fe8d61e9c3f5c83cf3251ebba2654024fd415bd","observation_id":"253b277c-0c2b-4646-bec1-829054648f76","resolution":{"observed_at":"2026-08-06T20:32:59.628963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.632099Z","title":"Raising the bar of ai-generated image detection with clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.632099Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:e00904008314497b34e964818cd5afd434838d7a38c2abaa3aaed19261175aed","observation_id":"dc8f6aba-06a3-4cab-988d-8b978ed2ea57","resolution":{"observed_at":"2026-08-06T20:32:59.632099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T20:32:59.635304Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.635304Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:416ad9dd108f8bf06cff8add2025b3b4bb2778dcd443e1669ee7368052424688","observation_id":"0947bf08-dec3-4833-9929-4e0dd35d8078","resolution":{"observed_at":"2026-08-06T20:32:59.635304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.638883Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.638883Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:cccfc253d2e124943dacaa2f82b7ce699f86f203b343aac9815cd9f472e75ef8","observation_id":"24c4ce53-a6e1-470f-88bf-912f4cbfc342","resolution":{"observed_at":"2026-08-06T20:32:59.638883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.642050Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.642050Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:e42122bf07a93430fc34db348bb48971323b2272abfc50e96cfe36c693bf8944","observation_id":"f2af373f-17fe-4771-8d81-24b3077be257","resolution":{"observed_at":"2026-08-06T20:32:59.642050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.644968Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.644968Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:863d3e1a9a0124d554d993c9a66a268c59ed036a70a4eed3bce1da09405350d6","observation_id":"205ee1f5-cc9f-44ef-b424-5c9de0b1440d","resolution":{"observed_at":"2026-08-06T20:32:59.644968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.648545Z","title":"Humanrefiner: Benchmarking abnormal human generation and refining with coarse-to-fine pose-reversible guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.648545Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:d09ac96a1f7804a902c03c72668b5822b22afd1fce8a1450fd60f4ec79abffb5","observation_id":"70009202-5096-40cf-932b-6593bda404ff","resolution":{"observed_at":"2026-08-06T20:32:59.648545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.651598Z","title":"Leveraging frequency analysis for deep fake image recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.651598Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:b434763fda1a33b72e53253977800ed80bf6c19a207d2d0b7f45659abebbcc38","observation_id":"9b83f890-8cab-4bc3-bd4c-b57ea099b6f8","resolution":{"observed_at":"2026-08-06T20:32:59.651598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.654970Z","title":"Rich models for steganal- ysis of digital images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.654970Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:b168a67b3873e577b1bc222b5dab890b07c912651ba0e931cbebcb4c791e8074","observation_id":"59c21f27-ac6a-4f6c-adb4-e4c6183e545a","resolution":{"observed_at":"2026-08-06T20:32:59.654970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-08-09T08:24:08.295414Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-06T20:32:59.658017Z","title":"Commonsense-t2i challenge: Can text-to- image generation models understand commonsense? arXiv preprint arXiv:2406.07546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.658017Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:372c9b6e8a9afda5b3c7e597c1e60f6df6e572e2ab5128a44138410b3ab801f2","observation_id":"ba2461e4-cd1c-4b4a-9292-c133b1004b66","resolution":{"observed_at":"2026-08-06T20:32:59.658017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.661293Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.661293Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:67623d4aa985a3b8a9627684651d0de983ced3f7af583b7d96fba3c98dc34b27","observation_id":"c4aa0a5a-671b-4923-b42e-3548a0aa927a","resolution":{"observed_at":"2026-08-06T20:32:59.661293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.664131Z","title":"Rethinking vision-language model in face forensics: Multi-modal interpretable forged face detector","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.664131Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:1f6aa9632aa06c1a22debc5acd2ef392b20a2abf39bc784865f8098401b3de39","observation_id":"ff9f7c27-7208-4d51-82f7-f3a49ec50a33","resolution":{"observed_at":"2026-08-06T20:32:59.664131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.667178Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.667178Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:5d6c54c53b3e7fb7d4ab7e5349e7d0594e1ac6127bf048d70f1b694afc77d892","observation_id":"c9fe9f35-c17c-437b-bcc7-34b0940853b5","resolution":{"observed_at":"2026-08-06T20:32:59.667178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11843","last_updated":"2024-02-19T05:13:39Z","snapshot_observed_at":"2026-08-08T03:09:47.134976Z","submitted_at":"2024-02-19T05:13:39Z","title":"WildFake: A Large-scale Challenging Dataset for AI-Generated Images Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11843","snapshot_observed_at":"2026-08-06T20:32:59.670390Z","title":"Wildfake: A large-scale chal- lenging dataset for ai-generated images detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.670390Z"},"links":{"cited_paper":"/paper/2402.11843","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:5e13125ba05ddbfefe29bf07cf741281db115ddf1ebafa56d225034463d9aa64","observation_id":"6fc2b604-70b8-412b-84c0-f25953950fc0","resolution":{"observed_at":"2026-08-06T20:32:59.670390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T20:32:59.673870Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.673870Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:bd5c213df637c0c6de26383b9cc2c937176024c818ecca6d5eba99acfb9e2bb6","observation_id":"16d2975c-2f59-4c49-89f9-a5ea769a9cf2","resolution":{"observed_at":"2026-08-06T20:32:59.673870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04292","last_updated":"2025-06-25T21:47:50Z","snapshot_observed_at":"2026-08-08T00:30:13.050953Z","submitted_at":"2024-12-05T16:12:25Z","title":"SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04292","snapshot_observed_at":"2026-08-06T20:32:59.677565Z","title":"Sida: Social media image deepfake detection, localization and explanation with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.677565Z"},"links":{"cited_paper":"/paper/2412.04292","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:abd5084ff66adc7951667fa67915e017ee534cba2b1595cf685d267a8a57e7dc","observation_id":"0a0d4f9b-6bd4-4a23-bb23-ca640ff6e814","resolution":{"observed_at":"2026-08-06T20:32:59.677565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10072","last_updated":"2024-11-21T14:37:25Z","snapshot_observed_at":"2026-08-09T09:24:32.055520Z","submitted_at":"2024-08-19T15:15:20Z","title":"FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10072","snapshot_observed_at":"2026-08-06T20:32:59.681512Z","title":"Ffaa: Multimodal large language model based explainable open-world face forgery analysis assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.681512Z"},"links":{"cited_paper":"/paper/2408.10072","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:d00eefd4900ad607ea41863ff59f7105ea915937423b4005f9b5e39c8130a632","observation_id":"eb244630-5c76-459a-ae57-2792eebd0114","resolution":{"observed_at":"2026-08-06T20:32:59.681512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:32:59.685883Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.685883Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:55411a2d64f2306b6ded5cbfca70510abad40beb37371e8d4df4282dce03e43b","observation_id":"43cbb4e5-1ff3-41ba-a220-22d7ae004327","resolution":{"observed_at":"2026-08-06T20:32:59.685883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.689148Z","title":"Can chatgpt detect deepfakes? a study of using multimodal large language models for media forensics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.689148Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:d85c7161d037a0eb4b08f056d5959c986287b6e2ec665d6a9581ab34d12140cc","observation_id":"428e9d3f-54c9-4946-b907-c2918ea52b7b","resolution":{"observed_at":"2026-08-06T20:32:59.689148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T20:32:59.692101Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.692101Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:7b98d0389922bb83e53c84636d1850470ee7b657ae41a0cf5eb72ffc84656d2a","observation_id":"0cf21fe3-f83f-4a54-a47c-30ef19bdfccd","resolution":{"observed_at":"2026-08-06T20:32:59.692101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.695260Z","title":"Fusing global and local features for gen- eralized ai-synthesized image detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.695260Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:60b42dffb5678aaf649eb53854d4559b1199d9292111e59558d24a3a544a92e9","observation_id":"d442126f-5c1a-41b8-b5c7-7277343f45db","resolution":{"observed_at":"2026-08-06T20:32:59.695260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08651","last_updated":"2024-06-12T21:23:27Z","snapshot_observed_at":"2026-07-06T18:29:58.140132Z","submitted_at":"2024-06-12T21:23:27Z","title":"How to Distinguish AI-Generated Images from Authentic Photographs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08651","snapshot_observed_at":"2026-08-06T20:32:59.698262Z","title":"How to distinguish ai-generated images from authentic photographs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.698262Z"},"links":{"cited_paper":"/paper/2406.08651","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:160f188c8e210757787e342a38d50223e1b6d7666fb4ba44e2a4e09634332815","observation_id":"3e98058d-6ce9-436d-96a1-d14afec93561","resolution":{"observed_at":"2026-08-06T20:32:59.698262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11989","last_updated":"2025-02-17T16:28:15Z","snapshot_observed_at":"2026-08-07T18:11:51.740488Z","submitted_at":"2025-02-17T16:28:15Z","title":"Characterizing Photorealism and Artifacts in Diffusion Model-Generated Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11989","snapshot_observed_at":"2026-08-06T20:32:59.701474Z","title":"Characterizing photorealism and artifacts in diffusion model- generated images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.701474Z"},"links":{"cited_paper":"/paper/2502.11989","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:0bf98c77c63136760f75c756409eab1bcf22557e6113033051e068ddb3c30946","observation_id":"5ca5957d-38b1-484b-9a27-6ce0e50ae895","resolution":{"observed_at":"2026-08-06T20:32:59.701474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15264","last_updated":"2025-03-19T14:37:21Z","snapshot_observed_at":"2026-08-07T16:51:50.553183Z","submitted_at":"2025-03-19T14:37:21Z","title":"LEGION: Learning to Ground and Explain for Synthetic Image Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15264","snapshot_observed_at":"2026-08-06T20:32:59.704798Z","title":"Legion: Learning to ground and explain for synthetic image detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.704798Z"},"links":{"cited_paper":"/paper/2503.15264","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:a47c155d85077bb0e50b579c2a95482bb79a4cd4152441357238847b3a36aa4c","observation_id":"08d60ac3-1c67-41e7-920d-3382ada4a436","resolution":{"observed_at":"2026-08-06T20:32:59.704798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10196","last_updated":"2018-02-26T15:33:34Z","snapshot_observed_at":"2026-07-06T06:06:26.276752Z","submitted_at":"2017-10-27T15:28:35Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10196","snapshot_observed_at":"2026-08-06T20:32:59.708504Z","title":"Progressive growing of gans for improved quality, stability, and variation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.708504Z"},"links":{"cited_paper":"/paper/1710.10196","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:90a54bf05ca9440bc5fb2895d3e8928f74acc119304ceab7d3d8eb8e8da6ae5b","observation_id":"c5840a65-9461-4661-a47e-dfb89c6ce056","resolution":{"observed_at":"2026-08-06T20:32:59.708504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.711803Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.711803Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:2002d2f3942d5243d7ba104fc96fc1f077e953ea5194553a3df85472e811558a","observation_id":"e8904857-31c4-4fbc-a38c-dd04b94cb28c","resolution":{"observed_at":"2026-08-06T20:32:59.711803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01959","last_updated":"2024-04-07T05:26:08Z","snapshot_observed_at":"2026-07-06T17:54:35.642265Z","submitted_at":"2024-04-02T13:54:22Z","title":"Bi-LORA: A Vision-Language Approach for Synthetic Image Detection","version":2},"cited_work":{"arxiv_id":"2404.01959","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01959","snapshot_observed_at":"2026-08-06T20:33:00.568699Z","title":"Bi-LORA: A Vision-Language Approach for Synthetic Image Detection","venue":"cs.CV","work_id":"2d7a7797-fcd0-4ec7-b82d-3aa61da9cd69","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.715016Z"},"links":{"cited_paper":"/paper/2404.01959","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:59c0de357361985d0342f25cb6716704de0c59f7c6c8c1114c3f5eb9d14f4176","observation_id":"9ec78d96-bc70-475c-b31d-992dade3de7c","resolution":{"observed_at":"2026-08-06T20:33:00.572913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.718441Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.718441Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:221c67e028efafe278d2b0e73f9dc93778ab2df3452b077c8eed6e2e07535f19","observation_id":"15790d8d-a759-45da-af88-2557723479da","resolution":{"observed_at":"2026-08-06T20:32:59.718441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.721368Z","title":"Leveraging rep- resentations from intermediate encoder-blocks for synthetic image detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.721368Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:be0f346384c7e2a3f0fa67c15bc2cc31381e0049a18431a216b4a0c4473a0c5d","observation_id":"2a6243fc-f494-4e64-8db9-e426794e2031","resolution":{"observed_at":"2026-08-06T20:32:59.721368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15867","last_updated":"2025-09-03T01:51:37Z","snapshot_observed_at":"2026-08-07T16:50:04.694516Z","submitted_at":"2025-03-20T05:40:42Z","title":"TruthLens: Visual Grounding for Universal DeepFake Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15867","snapshot_observed_at":"2026-08-06T20:32:59.724346Z","title":"Truthlens: Explainable deepfake detection for face manipulated and fully synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.724346Z"},"links":{"cited_paper":"/paper/2503.15867","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:442d40f58a0ca376875a4324192e8b20ae5dc8509964823334933ca0d46cb5d9","observation_id":"237b939b-fafc-4d0f-ab1f-857659f14ba9","resolution":{"observed_at":"2026-08-06T20:32:59.724346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.727650Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.727650Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:7a6a72df90cb0431b0c17a6b2f604bf0925518c362dabdd05abebe910301bda0","observation_id":"0caa36ec-13ad-4b7f-b4fa-7ec493d05fc0","resolution":{"observed_at":"2026-08-06T20:32:59.727650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.731400Z","title":"Quality-agnostic deepfake detection with intra-model collaborative learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.731400Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:bae20e7a803337edfb20b9a6bd883b4e64e2c8da62a7164ca00babd91cdb5416","observation_id":"235b17dd-e4a5-4369-86ea-b2ed15da53c2","resolution":{"observed_at":"2026-08-06T20:32:59.731400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10238","last_updated":"2026-04-07T07:54:13Z","snapshot_observed_at":"2026-07-06T19:32:51.287674Z","submitted_at":"2024-10-14T07:56:51Z","title":"ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10238","snapshot_observed_at":"2026-08-06T20:32:59.734994Z","title":"Forgerygpt: Multimodal large language model for explainable image forgery detection and localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.734994Z"},"links":{"cited_paper":"/paper/2410.10238","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:ddee686f90b3117739bb5677f17e63143c483ab0d3af67bc8c6255b52d2dc2a5","observation_id":"9254fb3b-d578-4edd-99a9-f7e9182709e2","resolution":{"observed_at":"2026-08-06T20:32:59.734994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06741","last_updated":"2025-01-04T06:17:20Z","snapshot_observed_at":"2026-08-06T16:33:04.894283Z","submitted_at":"2024-08-13T09:01:12Z","title":"Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06741","snapshot_observed_at":"2026-08-06T20:32:59.738700Z","title":"Improving synthetic image detection to- wards generalization: An image transformation perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.738700Z"},"links":{"cited_paper":"/paper/2408.06741","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:d8715bfeda67c3fd1c3c54a7fa2e2dbf0072f93189133b9bb719eeb1ff00b84c","observation_id":"7ba93730-4209-44c3-b7ef-2653c7ddd834","resolution":{"observed_at":"2026-08-06T20:32:59.738700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13306","last_updated":"2024-09-08T12:07:52Z","snapshot_observed_at":"2026-08-07T20:34:56.945035Z","submitted_at":"2024-04-20T07:28:55Z","title":"FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13306","snapshot_observed_at":"2026-08-06T20:32:59.741798Z","title":"Fakebench: Uncover the achilles’ heels of fake images with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.741798Z"},"links":{"cited_paper":"/paper/2404.13306","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:68cd60e1ea7365c9e26e85cf532d40ea3d2d7324541f84850f402153148435d3","observation_id":"ee9525fc-0118-44bb-b92e-196f41600804","resolution":{"observed_at":"2026-08-06T20:32:59.741798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19685","last_updated":"2026-04-20T14:24:19Z","snapshot_observed_at":"2026-07-06T20:13:45.123960Z","submitted_at":"2024-12-27T15:23:39Z","title":"Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19685","snapshot_observed_at":"2026-08-06T20:32:59.744923Z","title":"A large-scale interpretable multi- modality benchmark for facial image forgery localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.744923Z"},"links":{"cited_paper":"/paper/2412.19685","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:c974258919a8b5d8c79a478896736f0fb040c0a9c929eac0063259fa0435bb79","observation_id":"5af2d433-2746-482c-9cb3-b157c4c82e6c","resolution":{"observed_at":"2026-08-06T20:32:59.744923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.748485Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.748485Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:ea4091458e0cba6286387824a9c0c5bbc5702bcd3203f5fde3838ca64bc1ba5d","observation_id":"e0313932-c95c-45ff-9308-5c20c023154e","resolution":{"observed_at":"2026-08-06T20:32:59.748485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.751370Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.751370Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:513341ec70f239f146e70011f88ff05d2ab8a5240f115b3df406e7cbe2f8c33f","observation_id":"c6675cbb-1d59-46ce-b472-7970de119378","resolution":{"observed_at":"2026-08-06T20:32:59.751370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:32:59.754137Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.754137Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:55dea4ef0b809c093178b8bfa0b8bb610e718496605b4f0f1ca91c78d6e81bd7","observation_id":"bfdf9b51-a4f3-4b77-83d7-37ca3b5ab571","resolution":{"observed_at":"2026-08-06T20:32:59.754137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.163973Z","title":"Detecting generated images by real images","venue":null,"work_id":"6e98a484-7bee-4c8d-9c74-b49364434f17","year":2022},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.757087Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:a6eeba6385c785115f3f1ad9ddb1a02b0a0d08e4cbf0c7b40ab030875f98ff00","observation_id":"f560e15e-156a-4259-b054-2f17e8b36cf9","resolution":{"observed_at":"2026-08-06T20:33:01.167545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16649","last_updated":"2023-12-27T17:36:32Z","snapshot_observed_at":"2026-08-04T02:22:10.070427Z","submitted_at":"2023-12-27T17:36:32Z","title":"Forgery-aware Adaptive Transformer for Generalizable Synthetic Image Detection","version":1},"cited_work":{"arxiv_id":"2312.16649","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.16649","snapshot_observed_at":"2026-08-06T20:33:00.489159Z","title":"Forgery-aware Adaptive Transformer for Generalizable Synthetic Image Detection","venue":"cs.CV","work_id":"db6c6aec-7a1d-4b98-9fcd-5d5d300e0adb","year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.760120Z"},"links":{"cited_paper":"/paper/2312.16649","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:5b225c2c7cb88f4719310e5940a011bdf0313e4522eefd1d20f385a4b991f8d1","observation_id":"31aa60ca-45b8-4db6-a315-505e0635efa9","resolution":{"observed_at":"2026-08-06T20:33:00.492836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.153379Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"25b44e28-35cc-4008-96a1-9a51afd2b9a0","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.763125Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:dfefdc09df90118b8144606d41485ebd401e781a538cba7178ff10271e733ea0","observation_id":"9998f32f-a3a3-4e75-9201-6dd2d24227e3","resolution":{"observed_at":"2026-08-06T20:33:01.156722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.142770Z","title":"Visual instruction tuning","venue":null,"work_id":"daadc335-d8db-4654-abef-8454b5e68353","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.766196Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:9e404cf6c32f3edcacaff3b83c53d6d1d23d18cd925563b850944c8cb2acaf7b","observation_id":"0d6d297b-15c0-4ddc-b503-224c677cd394","resolution":{"observed_at":"2026-08-06T20:33:01.146079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.132086Z","title":"Forgery-aware adaptive transformer for generalizable synthetic image detection","venue":null,"work_id":"a6d708da-b105-4ef2-b3a2-7bcc2d580a71","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.769016Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:dcfbdc69758de821256ae6da8297ff579e52e1487753ad25a3d232520c3339d0","observation_id":"b3cfb5f5-4bde-4019-bf56-943a14e4438d","resolution":{"observed_at":"2026-08-06T20:33:01.135531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.119259Z","title":"Lareˆ 2: Latent reconstruction error based method for diffusion-generated image detection","venue":null,"work_id":"c52f1bd0-fdc5-47dd-9241-58f308deb251","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.772023Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:ff92dbb34af4076f3493d7c9c85d6dc3dcf53fddbb5e2a87b81a8a616bbe9412","observation_id":"7451c2d2-ec02-45e3-a76c-50aa0cabaad1","resolution":{"observed_at":"2026-08-06T20:33:01.123713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-06T20:32:59.775335Z","title":"Phybench: A physical common- sense benchmark for evaluating text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.775335Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:300de6ec7a4d9ea5085852acac6bac80f6b55c849d8ea9b462266ea1cadb109e","observation_id":"359f02be-c6c2-47a8-bead-1c7c0d943920","resolution":{"observed_at":"2026-08-06T20:32:59.775335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.108775Z","title":"Pixtral large","venue":null,"work_id":"8feb8944-b456-4753-aa8e-b89fd3648f03","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.778857Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:4204d5b57366418e3d5cc198a9f1c797725010addc1b3c8ba05ce50933e93a33","observation_id":"e3851425-54f6-4a7d-b536-5296419f5bae","resolution":{"observed_at":"2026-08-06T20:33:01.111911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.098247Z","title":"Towards uni- versal fake image detectors that generalize across generative models","venue":null,"work_id":"e2e7083c-b82c-4f49-9623-f15dc3fcb3b8","year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.781879Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:67090b0c6f26f60a725701ce3c0a167f003f50f0b7f763dac91680eb1701620c","observation_id":"103f23d5-53ec-4a65-9423-3b04fbbdff87","resolution":{"observed_at":"2026-08-06T20:33:01.101917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.785036Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.785036Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:fa46f1ee0d6c71ced7a597a0a74f412a409885fe442541be189c3e247fca8f73","observation_id":"33b8d622-6547-4c37-acbd-fe46a74882e4","resolution":{"observed_at":"2026-08-06T20:32:59.785036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02013","last_updated":"2025-05-04T06:58:21Z","snapshot_observed_at":"2026-08-07T15:56:40.774752Z","submitted_at":"2025-05-04T06:58:21Z","title":"MLLM-Enhanced Face Forgery Detection: A Vision-Language Fusion Solution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02013","snapshot_observed_at":"2026-08-06T20:32:59.788697Z","title":"Mllm- enhanced face forgery detection: A vision-language fusion solution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.788697Z"},"links":{"cited_paper":"/paper/2505.02013","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:65eb48981f7bb47bddbbea8d653e7ad74f7271e4f8747e7c504bea4518aa8750","observation_id":"5760a12c-3724-4208-bac8-4effde0fe299","resolution":{"observed_at":"2026-08-06T20:32:59.788697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14816","last_updated":"2025-01-15T16:54:36Z","snapshot_observed_at":"2026-07-06T20:10:04.155304Z","submitted_at":"2024-12-19T13:10:03Z","title":"TextSleuth: Towards Explainable Tampered Text Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14816","snapshot_observed_at":"2026-08-06T20:32:59.792302Z","title":"Explainable tam- pered text detection via multimodal large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.792302Z"},"links":{"cited_paper":"/paper/2412.14816","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:4c83ce4642d4cbd2adb1058eaa448c0d543a9f96ee21b4dae5e4ebd26c083ea4","observation_id":"763a2d9b-7ac8-42e0-8dcf-11e977c22615","resolution":{"observed_at":"2026-08-06T20:32:59.792302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.081564Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"cd759e4a-267b-43f5-af20-81fe667d6299","year":2021},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.795561Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:4092c9c7ea27e071ad97e7d5ef7570c8d5d073abfa7a51168ac7f28cb0ace44a","observation_id":"a229feac-c959-4a24-b6c6-bb02a0d497de","resolution":{"observed_at":"2026-08-06T20:33:01.084693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.071814Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"3cb1837a-8726-4223-a733-e42c1e18b1bf","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.798340Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:37a851d8f383379a8d9ca1af3a041d53a65fa93846991942d36381e6910b8dc9","observation_id":"c3f26e67-5fcd-42b6-bd5f-8a5d34a83d03","resolution":{"observed_at":"2026-08-06T20:33:01.074937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14571","last_updated":"2024-01-22T07:24:58Z","snapshot_observed_at":"2026-07-06T14:10:36.326803Z","submitted_at":"2022-10-26T09:01:19Z","title":"Towards the Detection of Diffusion Model Deepfakes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14571","snapshot_observed_at":"2026-08-06T20:32:59.801516Z","title":"Towards the detection of diffusion model deepfakes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.801516Z"},"links":{"cited_paper":"/paper/2210.14571","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:06cf75d737d0c52c8e8502649ebb5be777c3645f628330240376476927fab216","observation_id":"f6ac9256-87de-46f6-b910-57c11a07fcdb","resolution":{"observed_at":"2026-08-06T20:32:59.801516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.804848Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.804848Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:091a87957475d0250def1c4039f7f31f5abb8b3fffe9622c36602d4f80bbbdea","observation_id":"4353b18f-eb95-4c04-9b71-9405f8892941","resolution":{"observed_at":"2026-08-06T20:32:59.804848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.056393Z","title":"Forsyth, and Anand Bhattad","venue":null,"work_id":"bd76b0c7-a347-46d0-bb25-5bfabb36ddab","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.807883Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:5ab054222d024a13a9b173587c6d9ba809f9c6ce655b57903ca70e534a8c21b6","observation_id":"8a9eca91-bf23-4d25-a0a5-f6561b37f845","resolution":{"observed_at":"2026-08-06T20:33:01.059560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06998","last_updated":"2023-01-09T16:33:43Z","snapshot_observed_at":"2026-07-06T14:04:44.193264Z","submitted_at":"2022-10-13T13:08:54Z","title":"DE-FAKE: Detection and Attribution of Fake Images Generated by Text-to-Image Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06998","snapshot_observed_at":"2026-08-06T20:32:59.811059Z","title":"De-fake: Detection and attribution of fake images generated by text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.811059Z"},"links":{"cited_paper":"/paper/2210.06998","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:34e2cc503c10f17a958293590fe9c2e5760888e2062a0119574733dc2f5c10cf","observation_id":"bc0b7c4f-02be-4255-b10d-948078d48ed0","resolution":{"observed_at":"2026-08-06T20:32:59.811059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.047351Z","title":"On learn- ing multi-modal forgery representation for diffusion gener- ated video detection","venue":null,"work_id":"c6f4ad0c-a4cf-4133-8c99-98e2414d20ff","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.814685Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:8932a4e1e385c82c0a8db3e45e2122d86439dcddfe1cad72eba15bc080d1307a","observation_id":"93253187-7552-4283-a9cf-21c80c7b187c","resolution":{"observed_at":"2026-08-06T20:33:01.050447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.038052Z","title":"Domain general face forgery detection by learning to weight","venue":null,"work_id":"7d80742b-fa88-4bae-9b5d-5af51b534f25","year":2021},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.817761Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:f05fb1b2f3a47c75c82e8190eee67acb757c6bc8c9f20c200a957c798337c968","observation_id":"af340e18-710b-4cee-95e7-bce3f0a769ba","resolution":{"observed_at":"2026-08-06T20:33:01.041312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.029069Z","title":"An information theoretic approach for attention-driven face forgery detection","venue":null,"work_id":"24684e86-73aa-4805-bab5-cc970dc31a7e","year":2022},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.820826Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:3d7f740ed0d4d19cea7f61435dac68e3dd8d97111fbacf7f2c3e7e18df18d44b","observation_id":"262edbe9-792b-4716-b717-65b780e46b99","resolution":{"observed_at":"2026-08-06T20:33:01.031892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.019780Z","title":"Dual contrastive learning for general face forgery detection","venue":null,"work_id":"51fac968-f9c0-4036-a91f-dd729c6f20e0","year":2022},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.826232Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:be48d873d50eddc5fe48264baed94a680c59134280d4822cf049206aca7f3b03","observation_id":"1c8a4c04-533e-45fb-9421-5a1056aa956f","resolution":{"observed_at":"2026-08-06T20:33:01.022964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:01.009922Z","title":"Continual face forgery detection via historical distribution preserving","venue":null,"work_id":"167cefa9-aca8-49e2-a54f-51036944406b","year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.829800Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:08a36d9472bbfaec495e8484648b744196e1b51f686d8e23adfa1c9b3eacbd17","observation_id":"e689e653-d150-4ac3-bb89-9b46da03a1c4","resolution":{"observed_at":"2026-08-06T20:33:01.012965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.999237Z","title":"Towards gen- eral visual-linguistic face forgery detection","venue":null,"work_id":"f67edcc1-677c-4ad5-a6aa-fe54e10c1542","year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.832711Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:9988e94758a5e084babc57ef3ccf48b90b95775898a4d4861742cf1a9cfeb4a4","observation_id":"86bff1e5-b6d8-4484-a2ab-bc93aff45cd5","resolution":{"observed_at":"2026-08-06T20:33:01.002434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T20:32:59.835972Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.835972Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:cd6eac7c9aee56f92d151bb8da4a05fbdee94e0cdcbd5775a13308e3f6f2b6bd","observation_id":"9180ea56-d09b-402b-8583-4fbefa1375ee","resolution":{"observed_at":"2026-08-06T20:32:59.835972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.839374Z","title":"Forgerysleuth: Em- powering multimodal large language models for image ma- nipulation detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.839374Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:75796b807f330f7241cdc80f4dc011eba185def5114feff455e668a05cb2dc5f","observation_id":"3ffc4d4a-5dc9-4669-b868-2b2a8b0bafba","resolution":{"observed_at":"2026-08-06T20:32:59.839374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.989194Z","title":"Learning on gradients: Generalized ar- tifacts representation for gan-generated images detection","venue":null,"work_id":"8884e44c-40e7-4882-a0ae-0ebd97f5aea8","year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.842126Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:3652241539107de718637284639a543a5f64a09d454674c057596dbe590c99a1","observation_id":"4b779937-6a21-497d-a00a-165b8450b0c3","resolution":{"observed_at":"2026-08-06T20:33:00.992655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.979466Z","title":"Rethinking the up-sampling operations in cnn-based generative network for generaliz- able deepfake detection","venue":null,"work_id":"fa8a64a3-cf58-4e26-8f2d-22061ee69eb0","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.845280Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:c62268ef01a26600f5a7052583d7c1f3b6ad8eef3ed2248c700308d6be66b918","observation_id":"1d509aa4-09b9-4252-869a-ab0927ab1a55","resolution":{"observed_at":"2026-08-06T20:33:00.982916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.969877Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"cc510fcd-71b5-45b6-8968-5e7db53c1a7c","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.848144Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:8fc1a84c6599e186f94f08f968ab44c75abbad2f429e3854eec82d18e4bee84e","observation_id":"87712d91-621b-4cdc-9de0-5421d67aa766","resolution":{"observed_at":"2026-08-06T20:33:00.973050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:32:59.851177Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.851177Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:368f19208c634d75ea7503b5bc002baf13bb3ac250bb22694179042e4b648fe2","observation_id":"c331c4ef-5f0d-4885-8015-dc306921171d","resolution":{"observed_at":"2026-08-06T20:32:59.851177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.959243Z","title":"Cider: Consensus-based image description eval- uation","venue":null,"work_id":"59a1d5a7-8c66-480e-adc6-031a730fb9db","year":2015},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.854864Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:417a2e5c2e574b46725ec741cd62085ab2e8b6d634514c088531810d443b6097","observation_id":"288e8920-6de6-4f12-9350-0fc47387d92c","resolution":{"observed_at":"2026-08-06T20:33:00.963028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:32:59.858177Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.858177Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:ccab7dbf57c58f1e0a8b53c18bbfb326d71b960434a56cbef3c370f1866182e1","observation_id":"ba473801-4117-4cf4-8b04-659cb258ef77","resolution":{"observed_at":"2026-08-06T20:32:59.858177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.843685Z","title":"Cnn-generated images are surprisingly easy to spot...for now","venue":null,"work_id":"402d8590-b1de-44dc-a6f3-c42d48e2b857","year":2020},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.861930Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:3da06620b8301aa93f846d4039be59de947eaeb819b9c829f7628fa8c914d1bd","observation_id":"4ea7777c-ff1c-471b-b371-895b3d6027b1","resolution":{"observed_at":"2026-08-06T20:33:00.846959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.833818Z","title":"Cnn-generated images are surprisingly easy to spot","venue":null,"work_id":"d8fada26-035f-42c2-811f-568de8e5db40","year":2020},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.865196Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:d3225d0d45b12d24271d52da9c1543005615d74af33e52e1bf999073eb422a54","observation_id":"356001e0-3719-422f-83ba-d0e37f2e91b0","resolution":{"observed_at":"2026-08-06T20:33:00.837316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T20:32:59.868555Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.868555Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:e6384f65cdd83df75e3510e00e4b916cc00d401ac2129dd049c555217ab44799","observation_id":"bb08f85e-747f-40b4-9bad-c66492e076a3","resolution":{"observed_at":"2026-08-06T20:32:59.868555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:33:00.822444Z","title":"Dire for diffusion-generated image detection","venue":null,"work_id":"adc1e816-bd13-4d7b-a5db-0ed5b3729e45","year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.872015Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:2000ffd155328b21a63fa08f98db15fdf42ddf93f6cde19c883c06142e39152d","observation_id":"a546b1dc-21fd-47c1-a582-36e640c72017","resolution":{"observed_at":"2026-08-06T20:33:00.826604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:32:59.875201Z","title":"Spot the fake: Large multimodal model-based synthetic image detection with artifact explanation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.875201Z"},"links":{"citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:2e6391c10b865a9cffa5642c381e55ba6532498fa3eab9d79d66b4e2a59a8ea5","observation_id":"ba0d9275-e4bb-4158-b2f9-2ca8fd01cd01","resolution":{"observed_at":"2026-08-06T20:32:59.875201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T20:32:59.878311Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.878311Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:5fb53b344c189d0ea9b8c13ae15c50e3bec9908b1c4e3a97e45b0b5ad6a00560","observation_id":"72a52d92-8a8e-455b-9313-5330184df741","resolution":{"observed_at":"2026-08-06T20:32:59.878311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-06T20:32:59.881643Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.881643Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:20ae0a51821d3530e9a7f5182bd6e3f584bf06d9642f3744f2596bbc4c205f43","observation_id":"2fead64d-dbc4-4359-9ee6-64e76241c392","resolution":{"observed_at":"2026-08-06T20:32:59.881643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13800","last_updated":"2025-04-30T03:27:31Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T08:13:27Z","title":"Generalizable Synthetic Image Detection via Language-guided Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13800","snapshot_observed_at":"2026-08-06T20:32:59.884961Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.884961Z"},"links":{"cited_paper":"/paper/2305.13800","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:475978546701558231660c3c0b4fe5d6a84adb74be55398d989a27dfe03c0521","observation_id":"32dcce6b-f9b7-4476-8f52-d18f6030c0db","resolution":{"observed_at":"2026-08-06T20:32:59.884961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T20:32:59.888709Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.888709Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:5239544ad96f441a7ab16b458ae4d6f8948450e62d932ec1302f5307d722e551","observation_id":"1af30db1-49b8-4051-a307-80a1b7486826","resolution":{"observed_at":"2026-08-06T20:32:59.888709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02761","last_updated":"2025-04-12T08:08:04Z","snapshot_observed_at":"2026-08-09T09:23:59.595271Z","submitted_at":"2024-10-03T17:59:34Z","title":"FakeShield: Explainable Image Forgery Detection and Localization via Multi-modal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02761","snapshot_observed_at":"2026-08-06T20:32:59.892241Z","title":"Fakeshield: Explainable image forgery detection and localization via multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.892241Z"},"links":{"cited_paper":"/paper/2410.02761","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:50244d1894815fdc110caa0f3a3cf60b4f38c00426ee4ef09f3326eb777b771c","observation_id":"8d88d57a-974c-4bdd-a4f7-dc141395ceb4","resolution":{"observed_at":"2026-08-06T20:32:59.892241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19435","last_updated":"2025-02-15T16:01:36Z","snapshot_observed_at":"2026-08-06T05:38:31.927956Z","submitted_at":"2024-06-27T17:59:49Z","title":"A Sanity Check for AI-generated Image Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19435","snapshot_observed_at":"2026-08-06T20:32:59.895700Z","title":"A sanity check for ai-generated image detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.895700Z"},"links":{"cited_paper":"/paper/2406.19435","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:0f2e2e77c9ab7a2527af2147427d237a38b4adccd4cdc34b784d43b9f8ff244e","observation_id":"247e88b8-b63c-4fa0-bc0b-617df9dc5b87","resolution":{"observed_at":"2026-08-06T20:32:59.895700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17261","last_updated":"2025-05-30T15:15:51Z","snapshot_observed_at":"2026-08-09T06:20:45.427077Z","submitted_at":"2024-11-26T09:37:59Z","title":"HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator","version":2},"cited_work":{"arxiv_id":"2411.17261","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17261","snapshot_observed_at":"2026-08-06T20:33:00.156462Z","title":"HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator","venue":"cs.CV","work_id":"5a53c096-ffdd-43e8-8b25-f8d9b277fd46","year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.899078Z"},"links":{"cited_paper":"/paper/2411.17261","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:99df0e9bbf2e4971c7eb3ebdb7f1c9c240bf4bb0e3be1875883abab0ae8bc7a4","observation_id":"2ae1b896-d112-441f-87ce-11e16dd70ec1","resolution":{"observed_at":"2026-08-06T20:33:00.161053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09732","last_updated":"2025-04-21T02:36:09Z","snapshot_observed_at":"2026-08-09T09:24:59.615897Z","submitted_at":"2024-10-13T05:26:36Z","title":"LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09732","snapshot_observed_at":"2026-08-06T20:32:59.902041Z","title":"Loki: A comprehensive synthetic data detection benchmark using large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.902041Z"},"links":{"cited_paper":"/paper/2410.09732","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:400a677a78971c8d4f088195e10d01f5477f430b2e1f8a79a1385679e48a6f1f","observation_id":"ddfbbf04-9097-4eec-acfd-d9fcb6ce32d4","resolution":{"observed_at":"2026-08-06T20:32:59.902041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:11:16.716146Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 14 inbound Pith citation observations for arXiv:2507.02664."}