{"as_of":"2026-08-04T23:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c87db2fcd9ab2b478b94b7c6cdba877108155ba2866c4330eaa02df53d56d3c9","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T13:43:29.519792Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.26772/citation-record","integrity":"/paper/2604.26772/integrity","json":"/paper/2604.26772/citation-record.json","paper":"/paper/2604.26772"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dualsight: Learning to disentangle artifact and semantic fea- tures for detection of diffusion-generated images","venue":null,"work_id":"f40dec18-3bac-4453-95c2-5e2d9c4fe073","year":2026},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:f9729432709416e8448660a3ffb7cb5a577fa8b876231a68709c6c300431e019","observation_id":"ba2775b2-87f4-4ea4-bb83-61bb9a58c03e","resolution":{"observed_at":"2026-05-27T05:18:49.714617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexivit: One model for all patch sizes","venue":null,"work_id":"37f45255-531d-4a61-9aaa-a1b463cec54c","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:0dff6a2ae3c1e7d74d212915043e052efdea0f2affd7ba8b1701c6c823ce4c8f","observation_id":"2f7bfe9c-8e4c-4d10-84c6-767fd6708f3f","resolution":{"observed_at":"2026-05-27T05:18:49.655674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megalith-10m: A dataset of public domain photographs.https://huggingface.co/ datasets / madebyollin / megalith - 10m","venue":null,"work_id":"84e258b4-0686-44fd-b817-462f1eba2ca6","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:22c1d701a41eed3f8170366ad9ae92aa33e3c819d26304fd27f6e269e1ac811f","observation_id":"d555a1e7-cb7f-41c8-b4c7-d0aca50b2636","resolution":{"observed_at":"2026-05-27T05:18:49.658496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perception encoder: The best visual embeddings are not at the output of the net- work","venue":null,"work_id":"33e48b86-0649-4b19-9656-2135b452a3ad","year":null},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:60269ce1103558c31529c9770df00dbefb6772f5093940eae4d54e33b3b8e455","observation_id":"6979c177-a45a-4c56-82a6-eab8916b183a","resolution":{"observed_at":"2026-05-27T05:18:49.666192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image manipulation detection by multi-view multi-scale supervision","venue":null,"work_id":"22c460d4-c601-41c8-b114-9100b210d890","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:3b0c2ae86ab340bf9be28da8b56b2f795efd73e52a78db347d9e693c4fe48a52","observation_id":"9bfe3b2b-95b9-44af-9183-dc3fba15ae1a","resolution":{"observed_at":"2026-05-27T05:18:49.668753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xception: Deep learning with depthwise separable convolutions","venue":null,"work_id":"a2238430-37f8-4b1a-a9c9-1ad781022c9c","year":2017},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:914b924553386ac99973191d9422f237bbef673722b3c0ca3e340f986ef89db6","observation_id":"d5834b7a-9a33-4ccb-afc6-ecb9d6a5e408","resolution":{"observed_at":"2026-05-27T05:18:49.646358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":"ced1d567-455c-49d9-99bb-d2898d786db4","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:cb36472523381e116226e67bdb469919d7201738f1096c8158a104d7e31bf8bb","observation_id":"48f6c3e6-bc15-4d4e-a15e-d5f5a4c08384","resolution":{"observed_at":"2026-05-27T05:18:49.652658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"45badba5-bb5d-4875-9db5-acd00f12cd45","year":2009},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:fc86a375d4fe6ad179277c874cff5890bad4ca9a72d8db2dbe702a95d6f17173","observation_id":"ffa5b08e-7b03-487b-a270-00d838b2ab35","resolution":{"observed_at":"2026-05-27T05:18:49.638019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"9e8fae19-fa7e-4190-9958-302884a3c4f7","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:5c6f6fbb218468f072e53f9bb73e336a056d010e32276a48f64795d113689741","observation_id":"76b8c671-ea14-41ae-b990-1b7ba91b5771","resolution":{"observed_at":"2026-05-27T05:18:49.643013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PLG-ViT: Vision transformer with parallel local and global self-attention.Sensors, 23(7):3447","venue":null,"work_id":"5e330087-8e6c-4030-bc9a-2fb80cf3c153","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:f0e24d0f8cc4ea04d9f0e42aafece27002c1c24f81e84b2029576ccb8e7e82a8","observation_id":"562cd66e-2447-4639-bebd-a372826d1b19","resolution":{"observed_at":"2026-05-27T05:18:49.671526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"2b1d8e73-002f-43e3-b1a6-07125ca6a794","year":null},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:b0a08f696a594cf005df1ada4028ac8e47d45bcc88e25aae5ee11bb3f26c0aba","observation_id":"58c73a59-0a63-423d-bbab-f984e69c07aa","resolution":{"observed_at":"2026-05-27T05:18:49.700189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging fre- quency analysis for deep fake image recognition","venue":null,"work_id":"8b441354-e381-43a2-bf93-a7c42d0768f5","year":2020},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:798b4d9547b799cfced3922e16fc451524cbb536cbc114be0cba9b400571a643","observation_id":"67382d3c-05a5-451b-ab00-a5b92d91d3a5","resolution":{"observed_at":"2026-05-27T05:18:49.772233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trufor: Leveraging all-round clues for trustworthy image forgery detection and localiza- tion","venue":null,"work_id":"4e58cf5d-8a3c-4d0e-8d1a-27a131dc2db4","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:bbc915cb0376fbd8bd1b26112fdc4a49c0a1e0a6039db9235f3b660068ce786e","observation_id":"3a95912a-f8ee-4362-84b8-20fa912bc552","resolution":{"observed_at":"2026-05-27T05:18:49.790271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"5dfe1911-85b7-4a51-bc32-2e544e62b2df","year":2016},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:b906d60c8f925e17522c89f8008d55656f749f4466f2a1c18de2825496f5424b","observation_id":"51b368f7-25cc-4236-b497-8d84467a1515","resolution":{"observed_at":"2026-05-27T05:18:49.787329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":"a6d9e6a2-91c2-4f68-b704-c4969dfaebc8","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:add7ea8dd78ae23e1091c5ed005d02c7a50a8e65b1cd32b1c26887e2fdd290e7","observation_id":"5797d444-2f9d-40fe-b4e0-f87e08547637","resolution":{"observed_at":"2026-05-27T05:18:49.784262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":"084ac313-5192-401c-b4be-0021b9b156c8","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:029a9c1139079347bce30133d8f8862e1b850a7075db542aa39a0282d5ff6e7b","observation_id":"b60451f9-37ff-4e9d-8fb1-92dac4dbd311","resolution":{"observed_at":"2026-05-27T05:18:49.792867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progressive growing of gans for improved quality, stability, and variation","venue":null,"work_id":"a47404a5-5ab8-4593-a5eb-3e32f7cf9099","year":2018},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:b21b433a40f5a4949a8b1b7fc8e25fc92c4ae576eb2178cef86b5d141d3193b7","observation_id":"7f3a1a55-644f-4280-ac5b-295db924b39a","resolution":{"observed_at":"2026-05-27T05:18:49.798366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"8cd0f2fd-3bb8-4bd8-ad56-26439c2afd0b","year":2019},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:9f7c11351f01fb494b52600b2a6f2420f7754e8babb672e5a0e5db9d204b6291","observation_id":"11d6409f-f127-4962-86e0-78dd0081a697","resolution":{"observed_at":"2026-05-27T05:18:49.775002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging rep- resentations from intermediate encoder-blocks for synthetic image detection","venue":null,"work_id":"2897e80b-2204-4952-8958-074972c3a5d7","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:4d4c9332a9d4c146af9e8380beaeb07bf50142d228aa3de7c8263cda1c98f3c2","observation_id":"70743b41-928b-4bae-bff2-73701f24cf9d","resolution":{"observed_at":"2026-05-27T05:18:49.766761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning jpeg compression artifacts for image manipulation detection and localization","venue":null,"work_id":"e6cbe8b7-3a3f-4ad9-8902-16e2f92bc891","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:c029e6c9dcca24cbf1e07db2d019fc84f35189179353408c05868505cf003442","observation_id":"966f5a3d-7d52-4d06-92d9-3da72c4427ab","resolution":{"observed_at":"2026-05-27T05:18:49.760610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux.https://github.com/ black-forest-labs/flux","venue":null,"work_id":"934ef222-700c-465b-a405-33184745880b","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:a94f12ef1067c5059658fe14d39a54e4a3fe80aa9f3d7bd72e1e620be39fa585","observation_id":"39ddbb5c-35e8-4117-9fa7-b76fb8a9e8c2","resolution":{"observed_at":"2026-05-27T05:18:49.751709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FLUX.2: Frontier Visual Intelligence","venue":null,"work_id":"f9ad14a4-33db-4012-8e8b-333e0a87db84","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:2e0879c2c1d4df859684e7e83d181304eff05a39af24a03fb09e668ac0548c44","observation_id":"bb4fba4d-40a4-4e65-b6a0-f4b5587d607d","resolution":{"observed_at":"2026-05-27T05:18:49.748133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting generated images by real im- ages","venue":null,"work_id":"1a996dce-7d5e-4605-9192-8a3a6c2b8c11","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:4f5ee4f1834435ad93261a06d88f9ec97270b2840937a6d8d919888a5575bb73","observation_id":"5d9e2dd4-0324-44f6-a3f0-4fe809e3f851","resolution":{"observed_at":"2026-05-27T05:18:49.754668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial- phase shallow learning: rethinking face forgery detection in frequency domain","venue":null,"work_id":"4fe64ac9-ea91-4d6d-b471-9a6e7bfe5f0c","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:ebbbff10d81555e34dd241883c9bcf73a7967a9a3b50dc466285dc630d8e6f42","observation_id":"86c8f1d7-b55b-4b14-8912-6dec3f17acbb","resolution":{"observed_at":"2026-05-27T05:18:49.757179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pscc-net: Progressive spatio-channel correlation network for image manipulation detection and localization.IEEE Trans- actions on Circuits and Systems for Video Technology","venue":null,"work_id":"4571546c-a168-4e8e-8f40-f48f20d1287a","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:5de494074326db115e5363d2ad48e87b9155cd09864591e4b515f4a39add2885","observation_id":"053b2085-722e-4714-aea8-98f66f488dd5","resolution":{"observed_at":"2026-05-27T05:18:49.763589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Global tex- ture enhancement for fake face detection in the wild","venue":null,"work_id":"61667b88-4b82-41ec-bc8d-36259fe73f7b","year":2020},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:3c71486cff18fc591369127ebc03d017cdee829d425fe00ca9e0ff8cb0e1a814","observation_id":"3ba6a313-2a9a-45b5-954f-1a171a6ce96c","resolution":{"observed_at":"2026-05-27T05:18:49.769467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"ab14c42a-407d-4e62-b945-3936b02d1327","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:4a536cfffa5bd79719a87c8bfc8e3ac21e09391cfbbceb4cb87a02c1060fab78","observation_id":"f8328d7e-8575-487d-bbb5-81ed9811e516","resolution":{"observed_at":"2026-05-27T05:18:49.739042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gener- alizing face forgery detection with high-frequency features","venue":null,"work_id":"d6023698-9590-49ca-8a34-4473a88c8481","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:20730be92232bbe775e4b31fa49ec43748b5adf13247e8e54e02c0ddb4fb09f1","observation_id":"1b2f0b12-2a9b-4bab-acfe-43a39be3dfb9","resolution":{"observed_at":"2026-05-27T05:18:49.741817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14863","last_updated":"2024-11-24T11:40:23Z","snapshot_observed_at":"2026-07-06T15:59:15.017142Z","submitted_at":"2023-07-27T13:49:27Z","title":"IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer","version":4},"cited_work":{"arxiv_id":"2307.14863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.14863","snapshot_observed_at":"2026-07-04T08:49:41.474429Z","title":"arXiv preprint arXiv:2307.14863 (2023)","venue":null,"work_id":"e302ceaf-ab1f-4b85-8aab-2759786e3cce","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"cited_paper":"/paper/2307.14863","citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:2457dd651072c2c69ca62b629984c4c32d51a85e9cc3c990a9cd1ca2d2098f4d","observation_id":"2f1cc256-1a7c-402c-ad12-b55a326f8708","resolution":{"observed_at":"2026-05-12T08:51:23.990273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards uni- versal fake image detectors that generalize across genera- tive models","venue":null,"work_id":"a2b2968a-0dda-49ac-a956-b3d0e0ff8e45","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:6405d237b8410b2c7ce626b506c728e0f05efdae98cf76d43293255b6df7ac8e","observation_id":"575b0dfb-cb0e-49c2-b9a2-c63517098e5f","resolution":{"observed_at":"2026-05-27T05:18:49.744975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:b2b429ad5a95090a15b8b0d0df195aef2c61789a66a2e463a52175bca081b1ee","observation_id":"cc45ddf4-460d-4c10-8e30-e0bd593e493d","resolution":{"observed_at":"2026-05-12T08:51:23.994482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"291ed36c-bea4-4a48-8a81-5fd0def36e4c","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:e4a34dd207841463ba2f6a7518605457c9697b0d7cc1354aaf550d4dc79c32ba","observation_id":"772ffac2-95e1-489a-8ae3-d6ad02049599","resolution":{"observed_at":"2026-05-27T05:18:49.723230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"a0b3af86-612b-4468-82cd-255cd66209f1","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:1ccda13b79a77716a50bb28f2ca9e89fdcc8db6a89bfdcdc7dabbdd09ede2688","observation_id":"e9e71246-4deb-4cf6-adac-d603497a679e","resolution":{"observed_at":"2026-05-27T05:18:49.726185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking in frequency: Face forgery detection by mining frequency-aware clues","venue":null,"work_id":"6c5bbbcc-a050-4b43-a85e-8a902928c7ea","year":2020},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:49197c3be46534f7c931f0d7862cae7db92c82807963bad32aa1cff5d5db391c","observation_id":"92bd785f-9137-40e6-b01a-b47b8333bde7","resolution":{"observed_at":"2026-05-27T05:18:49.732647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"9bff6eea-4230-4555-a277-7719e5e76743","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:3031df399eccae6db00b743e2712f526faa9428c98e04404c662dee9c2ada894","observation_id":"ba1b44c9-a049-4a25-ab6f-a10b3f4c9e86","resolution":{"observed_at":"2026-05-27T05:18:49.717408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 2: Seg- ment anything in images and videos","venue":null,"work_id":"21f4a715-550d-494a-92a9-6212d4539e49","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:8a3e8f6c9d8faf1871ad46de9fce0316879734c61bfdcf56000595381402d1ad","observation_id":"5c23e6b2-2716-4c78-9b27-5c6c3f232f36","resolution":{"observed_at":"2026-05-27T05:18:49.720164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen- erating diverse high-fidelity images with vq-vae-2.Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"1b2ebf3f-141e-4ad4-96fc-d2916a4be4b7","year":2019},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:ac9c09fdf9aeba002e76e4fca090b19f205469d9f41ef17a57dd46e71c2c460e","observation_id":"3eeaf519-08ff-4f69-8510-7e7d1e4566a9","resolution":{"observed_at":"2026-05-27T05:18:49.729233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"34b342f8-9044-458e-bbf6-efe5bbc0532b","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:4412903ca69ac7e3a1d0029d35dc724da69d3035f7b037d9d8672b31ea6adb66","observation_id":"34777e2a-c324-4048-90b6-1b7e90995a08","resolution":{"observed_at":"2026-05-27T05:18:49.736026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:8bf9c5786bf8e880583eac8ca93ffe42706b58455e748e7a0b48f35b2ce88c70","observation_id":"dbc1bb5c-6120-4777-8e98-bbf0346d9a24","resolution":{"observed_at":"2026-05-12T08:51:23.977835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"De- clip: Decoding clip representations for deepfake localization","venue":null,"work_id":"bda82297-b9ce-4c8d-ba33-69b4faf78fe7","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:7b95c10fe2b3e55a9a77dd47e6c9d9ad69bffa7888989d428aed3f43e6c09869","observation_id":"85acefe1-1967-4af6-b069-e3bdd5c7199c","resolution":{"observed_at":"2026-05-27T05:18:49.781340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"d1af47bd-dd90-4dff-826b-302fd98831d3","year":null},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:2968be8e3d585938fbac0a991176ba92fe93007f79a6125901443be0905b8001","observation_id":"233de5c0-6732-4c05-b538-90c6f3a1ae68","resolution":{"observed_at":"2026-05-27T05:18:49.703572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frequency-aware deepfake de- tection: Improving generalizability through frequency space domain learning","venue":null,"work_id":"25f459f5-adcd-4f1e-b33a-86ec7d674967","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:fef59d458078b50f670220c057e6afe0cfa31946bb6829643f0cd3aac3dca33a","observation_id":"fed01212-0070-461d-bbb0-960e13d8ef3a","resolution":{"observed_at":"2026-05-27T05:18:49.706441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the up-sampling operations in cnn-based generative network for generalizable deepfake detection","venue":null,"work_id":"d0b5c640-12af-41ff-bb4b-5cf48bd74bc7","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:448220aa9aeb7b023a09c17d3e9095b6fa3ff1fafc469e5141e7727e9d4eb237","observation_id":"9961ecc3-9aac-42f0-91ff-2d41999bda8f","resolution":{"observed_at":"2026-05-27T05:18:49.691402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C2p-clip: Inject- ing category common prompt in clip to enhance generaliza- tion in deepfake detection","venue":null,"work_id":"66aa7186-cf22-49ab-aaa5-10f38b924043","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:2d27d2fde7e3e1d27f4ee48968fabee9ec5148bb4f937d6d7917be3db199ca29","observation_id":"5c04c026-8e26-4dea-a7ca-51335a98db6c","resolution":{"observed_at":"2026-05-27T05:18:49.694348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"f8cf1233-4aed-4fac-bdfd-fd4819537ab8","year":2021},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:cda8d7a0ca7ea3b8ab0eb3732e6d8f15c2d0e79c09c0cc592644c54b0499867f","observation_id":"243c87f9-879a-4054-a4ea-3d45d8530039","resolution":{"observed_at":"2026-05-27T05:18:49.697152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:a6c16fe5e335ac8d3e1bf48ae72fc1764e1632fbc4c1c4e7b10443d89fa85e7b","observation_id":"12d511f3-b5cd-4854-a7e5-8ff4c8fd7b8e","resolution":{"observed_at":"2026-05-12T08:51:23.985286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning.Neural Information Processing Sys- tems (NeurIPS)","venue":null,"work_id":"9837f27b-7422-4ac5-923c-5ee367a02abe","year":2017},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:27cb3f0369e597afa7dc2adceb3056230fd3392721e220334a8266e3ff8c1439","observation_id":"524fc084-25d8-4457-a082-93f74e102ff8","resolution":{"observed_at":"2026-05-27T05:18:49.681769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"2040351f-11c7-4345-9fb1-0bba96c43c7d","year":2017},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:4b69b066aae63ceda4e361160ebd2da2984b38b6c946061a23b342aa288f49fb","observation_id":"49ed6475-2336-49bd-ad97-669a674244f6","resolution":{"observed_at":"2026-05-27T05:18:49.679306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ob- jectformer for image manipulation detection and localiza- tion","venue":null,"work_id":"d603bec4-6515-4cf4-80d8-059e008fb83d","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:76c41469e7bee703dddf30fc5e0f0ca8bf7c94bfc114353254efc9c45ae357c3","observation_id":"2bd86032-5b60-4bb1-ac8d-3e12d396d722","resolution":{"observed_at":"2026-05-27T05:18:49.684494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cnn-generated images are sur- prisingly easy to spot","venue":null,"work_id":"eff89067-9dbf-4143-b25d-3b9856655a08","year":2020},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:d345a030a19fc66765357576bdae7f18112c472b35efa3787224c44f7f1b9b2f","observation_id":"68c94d8a-7020-4e9d-b8ae-dab2d521375b","resolution":{"observed_at":"2026-05-27T05:18:49.687609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opensdi: Spotting diffusion-generated images in the open world","venue":null,"work_id":"9e184657-c48a-4f2c-aaef-73f491e6b70b","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:5b9a7876b1367b269650affd58f4c6e4c8f329b5b9775e857c6910a449672f3d","observation_id":"ba5dab2d-96ab-4705-98d4-9c6a9b3a1227","resolution":{"observed_at":"2026-05-27T05:18:49.711651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dire for diffusion-generated image detection","venue":null,"work_id":"70e5dbd1-ba83-4911-b652-be49dfaa98e5","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:1a65ea1446eda72d10f04aa53331494260add87c2e228e0555e71da7fb0c8bd9","observation_id":"46602a95-9f63-49a8-b126-fba4bbd858e9","resolution":{"observed_at":"2026-05-27T05:18:49.676795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A sanity check for ai- generated image detection","venue":null,"work_id":"39fcd299-7544-4913-bb11-0e7757687aa7","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:5a6571fe6eb669f254eb5efc090554d062bf88e658485331310af7289fdc6d0e","observation_id":"0e056a40-b3a6-4098-98ea-2a675182f0d7","resolution":{"observed_at":"2026-05-27T05:18:49.660752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfake detection that generalizes across benchmarks","venue":null,"work_id":"54ab366b-9c68-46f3-a5d6-22b2b42c3028","year":2026},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:ec81a17b5e79807b4efb345f483c428838410be593b53c200c81f99f8defd33a","observation_id":"2c52bb6e-85c7-4a99-a887-c74573f4e2d0","resolution":{"observed_at":"2026-05-27T05:18:49.663242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-rank few- shot adaptation of vision-language models","venue":null,"work_id":"1de3bd77-8634-4647-9678-6098b61f0ada","year":2024},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:53169e9810a21b4aafe36fbe2e8aef39420383221e0418c23234b906f9b1e1e3","observation_id":"2b42e7be-d220-46db-a15c-be85cac78500","resolution":{"observed_at":"2026-05-27T05:18:49.674132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision transformers","venue":null,"work_id":"99f2d788-fd3b-4108-8409-04c7846cf126","year":2022},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:11e2b7c181043a1f74ff99c1f1db52a867a22f5e4c79cc76d0950731a1998470","observation_id":"3c070f49-8828-4e22-9411-0db5b5299350","resolution":{"observed_at":"2026-05-27T05:18:49.635670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"607c0c39-ad5e-4444-9e34-b1541b4e4a0d","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:b4cfb06b755656abcb5820cf8a6093d3a6312dda5b51d5da53a98b1cded664a7","observation_id":"e718d3f1-8a4f-4b20-954f-fa494d02a0a9","resolution":{"observed_at":"2026-05-27T05:18:49.656340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detect- ing and simulating artifacts in gan fake images","venue":null,"work_id":"dd374389-8930-49cb-b0eb-e86e697acae0","year":2019},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:482acffaa5f59346909f5d2ea73449d6cf615d80fcce019daa424b369696582a","observation_id":"209e0ffc-661b-4f12-a047-8d298dd05a4e","resolution":{"observed_at":"2026-05-27T05:18:49.649435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detect- ing and simulating artifacts in gan fake images","venue":null,"work_id":"39375b09-4333-4227-85a2-0f61bd26130a","year":2019},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:e17c4c17636cace612ebfa1345e4b89185b8e2fc9e710d24181bfa6c3e353858","observation_id":"0792f568-3b51-4b21-ac9f-9b85cbf82be9","resolution":{"observed_at":"2026-05-27T05:18:49.709138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12397","last_updated":"2024-03-07T14:26:32Z","snapshot_observed_at":"2026-07-06T16:50:22.657866Z","submitted_at":"2023-11-21T07:12:40Z","title":"PatchCraft: Exploring Texture Patch for Efficient AI-generated Image Detection","version":3},"cited_work":{"arxiv_id":"2311.12397","doi":"10.48550/arxiv.2311.12397","metadata_source":"pith","pith_arxiv_id":"2311.12397","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Patchcraft: Exploring texture patch for efficient ai-generated image detection","venue":"cs.CV","work_id":"f5883221-d53f-4bba-94d4-bcc918a6f4e9","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"cited_paper":"/paper/2311.12397","citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:2b61a0638c2f162cfb89c03b7ef35c1eca1ef99bb1038dd07f340d22560a86e8","observation_id":"b13bd4cd-c948-4a7c-b1d5-332409a68017","resolution":{"observed_at":"2026-05-12T08:51:23.998769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking latent prior bias in detectors for generaliz- able aigc image detection","venue":null,"work_id":"acb1f87e-6da3-4f98-892a-d47833cb5d6d","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:a2f1da99cf8ef3e07feadd9ce62eba272ede493e6c9878de008d0b47987f7c79","observation_id":"badbaabb-b41f-4c3b-8feb-6d3141e5c49c","resolution":{"observed_at":"2026-05-27T05:18:49.777993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brought a gun to a knife fight: Modern vfm baselines outgun specialized detectors on in-the-wild ai image detection","venue":null,"work_id":"5ac89b08-397b-4512-b24f-79b030f5618f","year":2025},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:a1dc8588c75447869b803e3474ea9a6df922b516bf0ba5f03baff7a33971cd33","observation_id":"e5171777-cac1-46e1-b3ce-8e0b0b0b4885","resolution":{"observed_at":"2026-05-12T08:51:23.981624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08880","last_updated":"2023-12-12T11:20:45Z","snapshot_observed_at":"2026-08-04T06:08:04.752826Z","submitted_at":"2023-12-12T11:20:45Z","title":"GenDet: Towards Good Generalizations for AI-Generated Image Detection","version":1},"cited_work":{"arxiv_id":"2312.08880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08880","snapshot_observed_at":"2026-07-01T19:26:00.831092Z","title":"Gen- det: Towards good generalizations for ai-generated image detection","venue":null,"work_id":"984e7462-10f6-4b2f-b20d-5c7f7944bf31","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"cited_paper":"/paper/2312.08880","citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:4cdd8f779825cb16119537ecc82f94cc4f4f2323fd7a2fd110c66c39228daa51","observation_id":"5b2a570e-b191-47f8-80e6-5dc778233dd6","resolution":{"observed_at":"2026-05-12T08:51:24.002782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genimage: A million-scale benchmark for detecting ai-generated image","venue":null,"work_id":"91810f21-92e2-4378-8355-4c2756a83b91","year":2023},"citing_paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-07T13:43:29.519792Z"},"links":{"citing_paper":"/paper/2604.26772"},"observation_digest":"sha256:f3d7fcd4afc9d0fa1143cbddc6854ed783e77e4f84eb356cb71acc201d3d711a","observation_id":"998cf03b-a666-4851-9edd-060f0676374c","resolution":{"observed_at":"2026-05-27T05:18:49.795335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.26772","last_updated":"2026-04-29T15:03:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T08:56:27.915340Z","submitted_at":"2026-04-29T15:03:25Z","title":"TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":57},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2604.26772."}