{"as_of":"2026-08-08T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3841a6d639aba273cd1cda9600f379360cc137ec7ac986e2be6af4d348ae0549","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:32:16.575532Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:13:30.825592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2512.11899","doi":"10.48550/arxiv.2512.11899","metadata_source":"arxiv_reference","pith_arxiv_id":"2512.11899","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRRabs/2512.11899(2025).https://doi.org/10","venue":"ArXiv.org","work_id":"284bc8a1-accd-4c21-8756-bb42d5efce5f","year":2025},"citing_paper":{"arxiv_id":"2604.02492","last_updated":"2026-04-02T19:50:59Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T19:50:59Z","title":"Token-Efficient Multimodal Reasoning via Image Prompt Packaging","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T21:52:25.713970Z"},"links":{"cited_paper":"/paper/2512.11899","citing_paper":"/paper/2604.02492"},"observation_digest":"sha256:8b094165cd592938202b94feae09d8470e6c16fd5182fa34e4843868fbeed103","observation_id":"49c11ea9-d6e0-4f52-8736-23b2fab62fae","resolution":{"observed_at":"2026-07-22T03:23:07.125862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2512.11899","doi":"10.48550/arxiv.2512.11899","metadata_source":"arxiv_reference","pith_arxiv_id":"2512.11899","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRRabs/2512.11899(2025).https://doi.org/10","venue":"ArXiv.org","work_id":"284bc8a1-accd-4c21-8756-bb42d5efce5f","year":2025},"citing_paper":{"arxiv_id":"2607.02494","last_updated":"2026-07-02T17:55:24Z","snapshot_observed_at":"2026-08-03T14:52:50.505098Z","submitted_at":"2026-07-02T17:55:24Z","title":"Towards Robustness against Typographic Attack with Training-free Concept Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-03T14:41:21.582578Z"},"links":{"cited_paper":"/paper/2512.11899","citing_paper":"/paper/2607.02494"},"observation_digest":"sha256:11d222e5163906b4bda183170acd211e585b049c3494210a2f1cda5be955bc31","observation_id":"351d7fa3-3160-45e9-b9a4-3a94618d81d5","resolution":{"observed_at":"2026-07-22T03:23:07.125862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.11899","snapshot_observed_at":"2026-08-08T00:13:30.825592Z","title":"In Advances in Neural Information Processing Systems, vol- ume 35, 17612–17625","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04244","last_updated":"2026-08-04T21:55:47Z","snapshot_observed_at":"2026-08-08T22:11:37.143612Z","submitted_at":"2026-08-04T21:55:47Z","title":"SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T00:13:30.825592Z"},"links":{"cited_paper":"/paper/2512.11899","citing_paper":"/paper/2608.04244"},"observation_digest":"sha256:07d666612fb1e95b4a87e6b561de5a871005a48f8fee29f90b3c0f6837a496a6","observation_id":"68e85a4b-f1a1-4ab9-8edb-9d8d4677b56d","resolution":{"observed_at":"2026-08-08T00:13:30.825592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.11899/citation-record","integrity":"/paper/2512.11899/integrity","json":"/paper/2512.11899/citation-record.json","paper":"/paper/2512.11899"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:12.163631Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.163631Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:2aa8bcd92d6ddfb556f6784bdd6c6f06e52cd6dbb02116cd96a194176c06bf6f","observation_id":"b62e09d8-2198-4298-a28d-0503e3fc879f","resolution":{"observed_at":"2026-08-03T17:32:12.163631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:12.213168Z","title":"Defense-prefix for pre- venting typographic attacks on clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.213168Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:1cd7d7f83b73bd5497164d7a0b73c2d58f0105ee0c2e1a63441fb85bd72f02ad","observation_id":"650861ec-712b-40e4-a232-f85000d8a688","resolution":{"observed_at":"2026-08-03T17:32:12.213168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-03T17:32:12.292022Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.292022Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:8a4daa1b77dda8f25356bdf48d09dea41bc64d0e5e6b5fc7b41ef4af59ad2c89","observation_id":"131f41b8-e007-4814-97dc-fba63b42e6ef","resolution":{"observed_at":"2026-08-03T17:32:12.292022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:12.427960Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.427960Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:7644be99dc90ae31ae34e4f4288a62d6380bfcf22afd5293109f50edb28e3177","observation_id":"138f1e21-53c7-4995-93de-e40075da3863","resolution":{"observed_at":"2026-08-03T17:32:12.427960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:12.572998Z","title":"Scene text visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.572998Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:6ec883c8a2e7370cb598ca6c004757e3bdd27d563e07c49c1f64b3b05352e849","observation_id":"51c7affb-f98b-421d-ad81-b510ef3fb9b7","resolution":{"observed_at":"2026-08-03T17:32:12.572998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09665","last_updated":"2018-05-17T01:44:59Z","snapshot_observed_at":"2026-07-06T06:16:16.225385Z","submitted_at":"2017-12-27T20:03:51Z","title":"Adversarial Patch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09665","snapshot_observed_at":"2026-08-03T17:32:12.815967Z","title":"Adversarial patch.arXiv preprint arXiv:1712.09665, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.815967Z"},"links":{"cited_paper":"/paper/1712.09665","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:3db67cbf276ee67a2b0ddfeeb2fb9119a30825685813c881386c8be0ff6027bf","observation_id":"21d4de9c-bfb2-4554-9f91-cb98fd1187ee","resolution":{"observed_at":"2026-08-03T17:32:12.815967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:12.977043Z","title":"Scenetap: Scene- coherent typographic adversarial planner against vision- language models in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:12.977043Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:e63d287bf5eaac205baa438471b977f20ad1f387c11d38cfc54ddfd657a9fdb2","observation_id":"0973c8b4-144f-46c8-ad17-d5e8249779e0","resolution":{"observed_at":"2026-08-03T17:32:12.977043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:13.179174Z","title":"Un- veiling typographic deceptions: Insights of the typographic vulnerability in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:13.179174Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:3bd0f4fea8e47758ddcd6fae78efeb7d0e4af4721c51dbe0cb3cbb0d1c0ba92c","observation_id":"2d0b8aa7-d88f-4a30-82ac-00aab4f201a5","resolution":{"observed_at":"2026-08-03T17:32:13.179174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:13.529564Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:13.529564Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:966e466ad19241258f8a35f936aa3e03985182dff7d27b8173282cbc8fcbcfe7","observation_id":"2968110c-c787-4671-a785-fc8a5fa9e2cb","resolution":{"observed_at":"2026-08-03T17:32:13.529564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:13.735538Z","title":"Sari sandbox: A virtual retail store environment for embodied ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:13.735538Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:bf67bd5baec1d7429983c39142812bf2d1dbb0897e6b2d2ef825c5fefa9cad47","observation_id":"80b386fd-4eb8-40e8-83ab-911388c9cd63","resolution":{"observed_at":"2026-08-03T17:32:13.735538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07270","last_updated":"2024-05-05T20:34:28Z","snapshot_observed_at":"2026-08-07T17:45:50.717841Z","submitted_at":"2024-02-11T18:26:18Z","title":"Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07270","snapshot_observed_at":"2026-08-03T17:32:13.899059Z","title":"Open-ended vqa benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy.arXiv preprint arXiv:2402.07270, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:13.899059Z"},"links":{"cited_paper":"/paper/2402.07270","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:dbdb073c00760566533165d8e3faa77eb6c6269f9320537d29fd5dd32f8e7b95","observation_id":"b7b9e79c-f634-44c5-b915-a523806e4b02","resolution":{"observed_at":"2026-08-03T17:32:13.899059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.046639Z","title":"Multimodal neurons in artificial neural networks.Dis- till, 6(3):e30, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.046639Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:e0cae41b05a70de2dca0c7e7c2d63a980ed7ee9702aa695376540d0a6a620e1a","observation_id":"80961c2b-d8f3-4c6f-a3b3-f968d5e168ce","resolution":{"observed_at":"2026-08-03T17:32:14.046639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.141883Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.141883Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:830f322311c33cd4e8d40d6e09f4cbe3884086eaa2c7822abc2ba91c0c9153c5","observation_id":"3e65586c-d3e4-4fa0-b967-4987a0fe5456","resolution":{"observed_at":"2026-08-03T17:32:14.141883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.202228Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.202228Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:df7f4b724ab43bf94bb76a1fd59956eefc9335ba1821b8cab8a3ea003b9c800c","observation_id":"7e3ace6b-f35b-44bd-9079-c44208936c5b","resolution":{"observed_at":"2026-08-03T17:32:14.202228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.274366Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.274366Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:fbdcfb0fb6f3b1ca2974e56c86b62e92b793bdaaad160d50dd8e2e06758469fc","observation_id":"73c0390c-2e70-4eb3-9100-82770a31394c","resolution":{"observed_at":"2026-08-03T17:32:14.274366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.328818Z","title":"Towards mech- anistic defenses against typographic attacks in clip.arXiv preprint arXiv:2508.20570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.328818Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:de28550fac05600004e1030b4aeb8a5bc3ef7fa45b1970ae14e7fcbf1783b3e2","observation_id":"7ce04df3-e2d0-4fe9-9530-2c399b60e5f0","resolution":{"observed_at":"2026-08-03T17:32:14.328818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T17:32:14.406664Z","title":"5: a vision-language-action model with open-world generaliza- tion, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.406664Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:907c58eb5d7959607e4afd98594ac6ee19352ae4360d43b7d09792868e69daf2","observation_id":"6b47a868-7136-425e-9eb9-6fb24fb95377","resolution":{"observed_at":"2026-08-03T17:32:14.406664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.535410Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.535410Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:30b6e98670e7514cae6d1084ed3bc0300d956a58d5490b2dfa0b41e0e6860b17","observation_id":"b1192ff8-7952-446d-8337-ed1ac55be160","resolution":{"observed_at":"2026-08-03T17:32:14.535410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.609358Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.609358Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:56d87cd3aefd1281df879161bde65b412027be10e2ec8a57d6d012e30674c227","observation_id":"f2d9b2d6-f613-4a79-8c36-a48e44a29391","resolution":{"observed_at":"2026-08-03T17:32:14.609358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.658093Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.658093Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:0f9275af56b69113e07c7eaa7384a641b367bf59769741e191539c64d7d342e0","observation_id":"d04dd6a8-432c-4a20-aeb2-84c187b08f7d","resolution":{"observed_at":"2026-08-03T17:32:14.658093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.738428Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation.Advances in neural infor- mation processing systems, 34:9694–9705, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.738428Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:bc714c870e85bf03c9714d2f4b96330d5dbbe3e9cf3dbf36424d9c20f77f5093","observation_id":"e9afa5a5-68a3-44c6-b85e-50b7316d86ad","resolution":{"observed_at":"2026-08-03T17:32:14.738428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:14.868129Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.868129Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:10fd5e415d02e2de0045cc4ee3569599e29ae204165e145515525bff10ff36b2","observation_id":"ccf4c22d-5771-4006-911d-cdf510307cdc","resolution":{"observed_at":"2026-08-03T17:32:14.868129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.013156Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.013156Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:6f40a951952ae7926b09c6642bee6cedd9b80d7f3f40f8bc51432955f97c2abb","observation_id":"f520a9a5-0818-40f4-ae91-33b9da07f6d8","resolution":{"observed_at":"2026-08-03T17:32:15.013156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.096645Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.096645Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:75f92937cee036176a91a146b478cd1f95c2ecae93ecdc1608d8f9014d571239","observation_id":"06937145-2ced-4d36-ac1f-a495c0bcef7f","resolution":{"observed_at":"2026-08-03T17:32:15.096645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.180825Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.180825Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:fa2d74e7ad8efc580f5e7e5876a8d405e0ece15ca80b504e4e0806845876095b","observation_id":"727b6360-920e-4756-a00a-d1e014e06490","resolution":{"observed_at":"2026-08-03T17:32:15.180825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-03T17:32:15.264270Z","title":"Smolvlm: Redefining small and efficient multimodal models.arXiv preprint arXiv:2504.05299, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.264270Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:7d92383946136222d6d4c701bf65b618e6bd05d7f9477d98a5997cb2f3ad475b","observation_id":"3519e281-73ed-40fa-8c2f-f5447c284c62","resolution":{"observed_at":"2026-08-03T17:32:15.264270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.357052Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.357052Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:04fe530179739680b739029056d74283974ba5ae1f994da72e9ff34121a7c496","observation_id":"b1cd3e02-d5c3-4fbc-932f-2a8abf1f5f63","resolution":{"observed_at":"2026-08-03T17:32:15.357052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-03T17:32:15.434754Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.434754Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:4bfffcaeaa17f64e531728540159902ede206b342eeee4c022a76057b0ce9be2","observation_id":"45cff08e-5b1f-47a5-8fd5-5a3302427dfb","resolution":{"observed_at":"2026-08-03T17:32:15.434754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.520803Z","title":"Dis- entangling visual and written concepts in clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.520803Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:da34ffdad31fe62a55cc255c5aba7d7a67f80cc97ad954ab6d863ad14b0214bc","observation_id":"4d02b1dd-17a3-44fe-96c5-729d8eed5086","resolution":{"observed_at":"2026-08-03T17:32:15.520803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.588713Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.588713Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:75b127ef8c2a5f4d5490aafefa39461d634168d3b9d671d4268e72cb7004b63b","observation_id":"b5bfdb1b-d947-482d-b912-028e20a2ad05","resolution":{"observed_at":"2026-08-03T17:32:15.588713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.635975Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.635975Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:21e8147a80db49fef2c48b93a9f7ce725a9a78992150a882ff4d8afc3ab64a62","observation_id":"eb294161-0c90-45ce-94e8-03e4905e4f15","resolution":{"observed_at":"2026-08-03T17:32:15.635975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00626","last_updated":"2025-02-13T03:11:20Z","snapshot_observed_at":"2026-07-06T17:23:43.676786Z","submitted_at":"2024-02-01T14:41:20Z","title":"Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00626","snapshot_observed_at":"2026-08-03T17:32:15.720550Z","title":"Vision-llms can fool themselves with self-generated typographic attacks.arXiv preprint arXiv:2402.00626, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.720550Z"},"links":{"cited_paper":"/paper/2402.00626","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:f64ae0ad0470a4e5921f0a02b0db5384b0a7892acffa730d901da1c4a745d6a2","observation_id":"bae15cad-b497-4d7f-8413-2808442bd699","resolution":{"observed_at":"2026-08-03T17:32:15.720550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.788848Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.788848Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:bc4607b539edbaab6d682aa44bcb2c2aab7bd43a8360b961b5bab5717d9105f8","observation_id":"d77e97fb-e423-4b34-b146-e0690934aa75","resolution":{"observed_at":"2026-08-03T17:32:15.788848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.820636Z","title":"Roadtext- 1k: Text detection & recognition dataset for driving videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.820636Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:d0a21f4a5fd1a365c74ec516d1db40280f72e121f6602a67f6c1a39e766b8a01","observation_id":"07a456c5-9456-4519-87d3-5d3b50344b24","resolution":{"observed_at":"2026-08-03T17:32:15.820636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.889019Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.889019Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:a4b33e86f8f26441c1236293f235533691e673a6ab6c60156e52e047d7b7429a","observation_id":"86c77226-9f1d-4caa-a05c-7ea2a8226778","resolution":{"observed_at":"2026-08-03T17:32:15.889019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:15.997144Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:15.997144Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:7ac9d0794ccacd48e4261c50ee705e7d6be5bc2e2cfb563481ae46e444827cc4","observation_id":"6111572f-1e48-45e5-aa45-2f7aa93ad864","resolution":{"observed_at":"2026-08-03T17:32:15.997144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:16.115876Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:16.115876Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:0618fd4da2227e75fe4505d630443fa8d91c5339705e03bebef0df05e8dfcbdc","observation_id":"4167bf86-f16d-4b8e-811c-15ec23b1db84","resolution":{"observed_at":"2026-08-03T17:32:16.115876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:16.226671Z","title":"Reading between the lanes: Text videoqa on the road","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:16.226671Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:41a2d2aaa2e4b4e78a72f436d4af6dce2e5a57908037ee6882840dc379b854eb","observation_id":"1ba91600-0ff3-4896-a8aa-28286e15e3d7","resolution":{"observed_at":"2026-08-03T17:32:16.226671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:16.318524Z","title":"Clip in mirror: Disentangling text from visual images through re- flection.Advances in Neural Information Processing Sys- tems, 37:24523–24546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:16.318524Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:43529708ba3213f35870d2a4d9c9ed56924b803278821f7f00d73686137bd19f","observation_id":"6223ad18-9750-4a15-9e0c-5d507c4f92a5","resolution":{"observed_at":"2026-08-03T17:32:16.318524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00088","snapshot_observed_at":"2026-08-03T17:32:16.451887Z","title":"Alpamayo-r1: Bridging reasoning and action prediction for generalizable autonomous driving in the long tail.arXiv preprint arXiv:2511.00088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:16.451887Z"},"links":{"cited_paper":"/paper/2511.00088","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:81a7c4066ffbf60cc32661aa00d3ddd14edd0f556e5a554c1c64c7c8eb46ff6c","observation_id":"6a1f5b2d-c3ea-49d6-940f-8a392d447906","resolution":{"observed_at":"2026-08-03T17:32:16.451887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:16.575532Z","title":"What word is written on the sign?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:16.575532Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:08a72bf08894e1ed45a42fb103cbcd3064723729e9835afe05985fc8b57ab522","observation_id":"a25f49f4-1556-4a45-aaf9-ee80c7fb7b5d","resolution":{"observed_at":"2026-08-03T17:32:16.575532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:32:13.313104Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:13.313104Z"},"links":{"citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:5f03f90c52d87e4b7bc4982f0ddd4c1f61b17a6c73cd02913469040f11141e3a","observation_id":"7d17f6bf-6570-49e6-aca2-ecf4e1f569f4","resolution":{"observed_at":"2026-08-03T17:32:13.313104Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:09:32.162336Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 3 inbound Pith citation observations for arXiv:2512.11899."}