{"as_of":"2026-08-07T19:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf79a220d7b14a89e76e166e31406f690ffdaad9adfb9d821ffa6cb0d7245258","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:04:20.574759Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T20:02:56.057102Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:08:55.138666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"cited_work":{"arxiv_id":"2509.10278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10278","snapshot_observed_at":"2026-07-03T20:08:55.138666Z","title":null,"venue":null,"work_id":"f08e95d4-967e-472c-af47-b4b2f66210f9","year":2025},"citing_paper":{"arxiv_id":"2607.01442","last_updated":"2026-07-01T20:05:46Z","snapshot_observed_at":"2026-08-05T16:25:01.875940Z","submitted_at":"2026-07-01T20:05:46Z","title":"From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-03T20:02:56.057102Z"},"links":{"cited_paper":"/paper/2509.10278","citing_paper":"/paper/2607.01442"},"observation_digest":"sha256:0dbfbfb0c32c7a570aefe8faf7f0bfac9346d7b4425cc39e9086161ce14eba47","observation_id":"26fe4bc7-e59a-4e4e-acee-314a42cff1f3","resolution":{"observed_at":"2026-07-03T20:08:55.141276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.10278/citation-record","integrity":"/paper/2509.10278/integrity","json":"/paper/2509.10278/citation-record.json","paper":"/paper/2509.10278"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T18:04:18.054749Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.054749Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:da374ca38ffc00d28eef5a15da5cedbbb362e4a32fee8a13c5a0383f6e2ab8c7","observation_id":"70313364-3ac7-4635-bfda-c39daa62fee4","resolution":{"observed_at":"2026-08-04T18:04:18.054749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.254757Z","title":"Textdiffuser- 2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.254757Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:c98d3c40ec3fb59f97274918e65c5e5851854afcc801ae16d7b0715856ca4d83","observation_id":"9c311dd9-9dc4-4572-9b57-9db1271ac223","resolution":{"observed_at":"2026-08-04T18:04:18.254757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.425371Z","title":"Image manipulation detection by multi-view multi-scale supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.425371Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:1d94c0d52ee56a8542026d997d07ff673f20de7115725f3eee1b948fbdca8d63","observation_id":"2053abec-4f97-4f26-b31d-20405ddcceb2","resolution":{"observed_at":"2026-08-04T18:04:18.425371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.518832Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.518832Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:86afbecd6dd6941de02abdface6e91b9415f1432947ba84ac8670b8e35ed842f","observation_id":"af2f30ca-4554-4e2a-9bc9-d1c5b424d0b3","resolution":{"observed_at":"2026-08-04T18:04:18.518832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.632298Z","title":"On the detection of digital face manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.632298Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:7d523d0b8c9d406d19837879f6f05ac614de7743656bff0921df735e17207192","observation_id":"67b6ed52-900b-46f3-8cb4-77cb1ff70fbf","resolution":{"observed_at":"2026-08-04T18:04:18.632298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.712784Z","title":"Mvss-net: Multi-view multi- scale supervised networks for image manipulation detection.IEEE Transactions on Pattern Anal- ysis and Machine Intelligence, 45(3):3539–3553, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.712784Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:e5b2b7a3d7c57f6e2481fc27238a2008fc364994cd839814fa70ad1dd6d57816","observation_id":"f10857ed-5151-46ae-9b21-d3ca7fa3f3a6","resolution":{"observed_at":"2026-08-04T18:04:18.712784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.004846Z","title":"Casia image tampering detection evaluation database","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.004846Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:23970f75e42f119c9662047f8d12704602eb730d11a1d16e3b675cbf1033f56d","observation_id":"9d389dfa-c654-422d-acde-acf72991fc14","resolution":{"observed_at":"2026-08-04T18:04:19.004846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11697","last_updated":"2024-05-21T15:35:26Z","snapshot_observed_at":"2026-08-05T02:50:02.779448Z","submitted_at":"2024-05-19T23:05:53Z","title":"AMMeBa: A Large-Scale Survey and Dataset of Media-Based Misinformation In-The-Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11697","snapshot_observed_at":"2026-08-04T18:04:19.084829Z","title":"Ammeba: A large-scale survey and dataset of media-based misinformation in-the-wild.arXiv preprint arXiv:2405.11697, 1(8), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.084829Z"},"links":{"cited_paper":"/paper/2405.11697","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:7d7445e81a1324746bca016fbf76d28abf03925a16d2853926cbc44a872e2e30","observation_id":"ee526ebb-f2ea-4c8b-9b16-f86c92c165db","resolution":{"observed_at":"2026-08-04T18:04:19.084829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T18:04:19.213306Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.213306Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:826201babf22d8b753e06d2fb857e1d3ceb47d259db94ed07676b97f4f807341","observation_id":"3be553d2-7ed7-42da-8b78-37e74bb50334","resolution":{"observed_at":"2026-08-04T18:04:19.213306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.444751Z","title":"Tru- for: Leveraging all-round clues for trustworthy image forgery detection and localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.444751Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:024ad40954cc95d584349cacd07d1a17b8d3d1579039bbabddbc81553549942c","observation_id":"364d1e11-953a-4e0f-8f92-19b467d019fd","resolution":{"observed_at":"2026-08-04T18:04:19.444751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.577394Z","title":"Hier- archical fine-grained image forgery detection and localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.577394Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:aa75c066b3b36f66a341bc04b93ecbabbb27b7753b90c5871f1284a8bac5be5c","observation_id":"de5a0f2b-6b45-472e-8df7-e002ff5e1642","resolution":{"observed_at":"2026-08-04T18:04:19.577394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04292","last_updated":"2025-06-25T21:47:50Z","snapshot_observed_at":"2026-07-06T20:02:17.096487Z","submitted_at":"2024-12-05T16:12:25Z","title":"SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04292","snapshot_observed_at":"2026-08-04T18:04:19.694757Z","title":"Sida: Social media image deepfake detection, localization and explanation with large multimodal model.arXiv preprint arXiv:2412.04292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.694757Z"},"links":{"cited_paper":"/paper/2412.04292","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:91eb0de8cc66f7654c0029ef8532cc83667d21114c8a6db45c5bca873b71d125","observation_id":"8bc15881-3022-4427-8dcc-7fea0464ccfd","resolution":{"observed_at":"2026-08-04T18:04:19.694757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.870008Z","title":"The point where reality meets fan- tasy: Mixed adversarial generators for image splice detection.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.870008Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:bd1a2d04195bb6897e0426c80732209cc5a3c03722006d75d6b05d925f7877cd","observation_id":"319047f5-1dad-4a24-b3e9-5dafa75af0af","resolution":{"observed_at":"2026-08-04T18:04:19.870008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:20.064836Z","title":"Exploring chatgpt for face presentation attack detection in zero and few-shot in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.064836Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:ffe5e9c333ed2784319db8767d6ab20dc39c285515ccda12adbe6563cbe5ae3b","observation_id":"06f360f2-0ac5-4bdd-8eb3-c4d96ac76b3d","resolution":{"observed_at":"2026-08-04T18:04:20.064836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20808","last_updated":"2025-07-28T13:20:18Z","snapshot_observed_at":"2026-08-06T13:19:34.463833Z","submitted_at":"2025-07-28T13:20:18Z","title":"FantasyID: A dataset for detecting digital manipulations of ID-documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20808","snapshot_observed_at":"2026-08-04T18:04:20.314744Z","title":"Fantasyid: A dataset for detecting digital manipulations of id-documents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.314744Z"},"links":{"cited_paper":"/paper/2507.20808","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:d92d4d6fdb1cb08eec295d6ed91b561e5a7f3314ad95fa764629474c3942933a","observation_id":"fb3976a8-f6d0-4f6d-a82f-60e8bfa54103","resolution":{"observed_at":"2026-08-04T18:04:20.314744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:20.437130Z","title":"Cat-net: Compression artifact tracing network for detection and localization of image splicing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.437130Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:359296db485d45fdd2436116a8cf042dfb2347eccb4e797bcbc5f10260cb1491","observation_id":"99a6db89-cbf4-4995-9191-9f09dc58bc09","resolution":{"observed_at":"2026-08-04T18:04:20.437130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:20.574759Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.574759Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:e3d19b407a537a130db16d350a54a3a6cacca0bbdcb6fa8e7270279d7a8961c8","observation_id":"81f44cdf-b203-4b89-aef2-6b9571f8938c","resolution":{"observed_at":"2026-08-04T18:04:20.574759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T18:04:17.574124Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2509.10278."}