{"as_of":"2026-08-09T14:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dd3cd20f2e0beabc2f0cc34ef0fac08287d38f8a0ceeb79cbefe30377304fe7","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:46:12.113877Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21617/citation-record","integrity":"/paper/2607.21617/integrity","json":"/paper/2607.21617/citation-record.json","paper":"/paper/2607.21617"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:05.563971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:05.563971Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:0e12b6b5617c1c2d778055dda25de5943e997a4e21f495ef833e069e94072376","observation_id":"2506e149-4c5d-4c23-b8c7-5e1bec7c55c7","resolution":{"observed_at":"2026-08-02T12:46:05.563971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:05.652444Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:05.652444Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:4cd9f82773b621137651733fddead03ba0d91dfc68bdf1a376a41c9e40652c50","observation_id":"12ce943d-fa6f-4641-bbe1-d67a27e3d30d","resolution":{"observed_at":"2026-08-02T12:46:05.652444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:05.817702Z","title":"Journal of Foo , volume = 13, number = 1, pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:05.817702Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:570b1aae130e196c7caca098b255057e2669eef38792231bc71b0663270e9866","observation_id":"aa56fc46-2ecc-4925-83b7-d8274caf0537","resolution":{"observed_at":"2026-08-02T12:46:05.817702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:05.895645Z","title":"Journal of Foo , volume = 14, number = 1, pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:05.895645Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:096ece2577f8b01bb4540fed80ab2f2916e8442bd3fb5b98a6865d9b91b6e575","observation_id":"3feaa8fe-548c-4cb2-ae68-fd73b28f048a","resolution":{"observed_at":"2026-08-02T12:46:05.895645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:06.004527Z","title":"Trends in Cognitive Sciences , volume =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.004527Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:db72b1c26ca00b95c4999c38461de1a406822f4ee3d7aeef60381bd6456763b3","observation_id":"4d39162e-ad9d-4bcd-a501-f0a62e46ae3c","resolution":{"observed_at":"2026-08-02T12:46:06.004527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:06.101706Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.101706Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:368612b659a1572213d759fb800b0a40ab3fc709c0c5e8bb634e1efe41c339b2","observation_id":"e75dceea-c1bf-4d75-be06-48461e49af6c","resolution":{"observed_at":"2026-08-02T12:46:06.101706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:06.210404Z","title":"arXiv preprint arXiv:2601.20552 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.210404Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:94a80c72d7f063c158820e0ab967eebdc400b5faea945063f53dc6a4addfcac0","observation_id":"81ad02b1-c20c-4302-9581-236f3c276028","resolution":{"observed_at":"2026-08-02T12:46:06.210404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:06.415503Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.415503Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:ab7f1c34b617385c2a8d4b5f29a64e7ffb2bf31a47ae388e334f69f880cc09bb","observation_id":"495cdd24-5398-410a-bef2-65f8dd430fe7","resolution":{"observed_at":"2026-08-02T12:46:06.415503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:06.591204Z","title":"5: A decoupled vision-language model for efficient high-resolution document parsing , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.591204Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:7045c0c587b038d9ada7bfd3b496fb6d6af4922a775a60fd57d64aa2cb96be30","observation_id":"e5209757-c56d-42c5-b2ce-b6d55e9b39a2","resolution":{"observed_at":"2026-08-02T12:46:06.591204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05137","last_updated":"2025-07-13T05:31:12Z","snapshot_observed_at":"2026-08-07T04:56:55.941717Z","submitted_at":"2024-09-08T15:42:48Z","title":"READoc: A Unified Benchmark for Realistic Document Structured Extraction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05137","snapshot_observed_at":"2026-08-02T12:46:06.801715Z","title":"arXiv preprint arXiv:2409.05137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.801715Z"},"links":{"cited_paper":"/paper/2409.05137","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:c4796b2e4f6cf807d8acdac8854a662ffefe99d9e4b73b0a0911f28c344dad1f","observation_id":"00aff762-07d1-4c8a-b231-06e30cb5a17e","resolution":{"observed_at":"2026-08-02T12:46:06.801715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T12:46:06.931296Z","title":"arXiv preprint arXiv:2308.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:06.931296Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:4b9a493c53e719410857833cb48980e1465d3936136af3ce22642d5d78a79e37","observation_id":"e8fb02da-0a11-4c58-b63e-8f2d9080f8f1","resolution":{"observed_at":"2026-08-02T12:46:06.931296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T12:46:07.069203Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.069203Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:c70fd4ae12980ae843059415e3c4f98762cb9913b0cf99704651a0a6e9d2c954","observation_id":"b1c0290a-9c00-43fa-9366-08f455c5770f","resolution":{"observed_at":"2026-08-02T12:46:07.069203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:07.238033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.238033Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:d007976a37ca463e46507f05c4b32c217e0bd2b6e116968fa962f7b594afa814","observation_id":"58f3bfe7-80bf-4b5e-ad40-49f0033ef59f","resolution":{"observed_at":"2026-08-02T12:46:07.238033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:07.417593Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.417593Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:b97aac580a55eab590d72e9bb6de36c0cce7e216e25c3965f3af39c774314368","observation_id":"f62387f8-0529-431a-a407-c6c2a6b700bb","resolution":{"observed_at":"2026-08-02T12:46:07.417593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:07.559805Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.559805Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:926e05aff890b57ab4da4e237165553cd284a67e7e8fbf40596c87108e1c98a2","observation_id":"a3473b54-a9c2-43a3-8d74-158a70e4d2fe","resolution":{"observed_at":"2026-08-02T12:46:07.559805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:07.675539Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.675539Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:421f491a935a6f64fb8a4e98ba6bfcc2bbbf6fa0e99321d23506f0c4e895f7c1","observation_id":"117d116e-3141-421d-96f4-800bea718c1f","resolution":{"observed_at":"2026-08-02T12:46:07.675539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:07.737098Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.737098Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:2dae9467e17e80445a96214cd8c5903c6535e89af0b9edb8de5e0372ebe8eab1","observation_id":"9fa0babf-6708-4460-93d5-4728f1b8b621","resolution":{"observed_at":"2026-08-02T12:46:07.737098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T12:46:07.800275Z","title":"5: Advancing open-source multimodal models in versatility, reasoning, and efficiency , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.800275Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:1cb4a777e897ae0516e5d6902bce7bd915f58303ce306ff5b686e0fa10544790","observation_id":"d095c590-24f6-470f-a039-d5219e9a0152","resolution":{"observed_at":"2026-08-02T12:46:07.800275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:07.865094Z","title":"Visual Instruction Tuning , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.865094Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:67672e9cca8a45368c8c7db4f2ff226d7a846f7d400aa50e39517c401b0c7d3f","observation_id":"f1f44dd4-73b9-4bac-9200-c35f04826d3f","resolution":{"observed_at":"2026-08-02T12:46:07.865094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T12:46:07.918581Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:07.918581Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:a812f45ac1ddbe3e5e5b70b4fb293afc73b1a964dc3422fc8d67c53c8deec1ad","observation_id":"a88e607f-c268-407b-b433-a6ce145eb330","resolution":{"observed_at":"2026-08-02T12:46:07.918581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:08.056765Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:08.056765Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:df00084f3ecd727e32085afce5fee8968e899b3e913dcf603ab78e5973aa4711","observation_id":"94eab9b6-08c6-4345-8d31-fe76ff7847b2","resolution":{"observed_at":"2026-08-02T12:46:08.056765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:08.181936Z","title":"OCRBench: on the hidden mystery of OCR in large multimodal models , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:08.181936Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:650c3d125f5f309a8127da1af55aa500805035690617eb1e4a58cf1151412f34","observation_id":"cf9bbd9e-5b13-4e88-852f-78888a90c54a","resolution":{"observed_at":"2026-08-02T12:46:08.181936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:08.377781Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:08.377781Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:41529e388416ee1b99cbd42c5fc7c32e0049acdbb26d9be01c42d7135463a207","observation_id":"3266d655-2118-45e4-8058-452e9f17999f","resolution":{"observed_at":"2026-08-02T12:46:08.377781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:08.539837Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:08.539837Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:73461e603a7ed91bbc6337fb6fb2c1d331c0270e0c7e97b9562948fbf66804f8","observation_id":"1b2d3719-4388-4112-93f2-d4aed75c1894","resolution":{"observed_at":"2026-08-02T12:46:08.539837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:08.733743Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:08.733743Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:61592e73e6c5f966a4028fb98997147f59604e54747a9581c15529cd626592f7","observation_id":"96228a5e-dbda-4b47-b000-a1a800e4b1d1","resolution":{"observed_at":"2026-08-02T12:46:08.733743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:08.880444Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:08.880444Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:dd5703ed99474849982aa2be6e83c44778c4befff9d2287bd4846aa844ce38f0","observation_id":"acdba914-2f72-4139-b604-3dcb96c3bd33","resolution":{"observed_at":"2026-08-02T12:46:08.880444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.009817Z","title":"Survey of Hallucination in Natural Language Generation , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.009817Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:25f01c3b70aa765f3afe30f1e743a2505802fb8ac49a67d4b82fd25edfd05ceb","observation_id":"83be50c9-17ef-4e33-92d1-383f440ca962","resolution":{"observed_at":"2026-08-02T12:46:09.009817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.137858Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.137858Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:a6a108371c95dd49b88ee99f4215a4701970b62dc242e8b87d29f6cfdde016f6","observation_id":"cc7a3d58-72f4-4f7a-9a39-c66ac86c1eb2","resolution":{"observed_at":"2026-08-02T12:46:09.137858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.278951Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.278951Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:ec9328fbafd7e3870ca24127a23d9258eb7ba15f54ba6dcf5259870af4709143","observation_id":"7a509ac8-3a29-45a8-88a2-9077eb0490e1","resolution":{"observed_at":"2026-08-02T12:46:09.278951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.381601Z","title":"Linux Journal , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.381601Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:88b125780a38ae9c624cb812255054b4b4039af762ecbf893eaf10f8ab6bb830","observation_id":"6fa70d81-a0e3-4978-a9d0-b120f9b03f9d","resolution":{"observed_at":"2026-08-02T12:46:09.381601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.504605Z","title":"National Science Review , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.504605Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:13cfc9f1e9cb988713fdd34c7aaab36bb69ae8876d2142f752c098ab388260c5","observation_id":"e67333de-d374-4cc8-bede-b4727713c7b8","resolution":{"observed_at":"2026-08-02T12:46:09.504605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.576749Z","title":"IEEE transactions on pattern analysis and machine intelligence , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.576749Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:3110eadb15aa1102c4810eeb5e1cf0beb2e44af2415129be9de192d6a75b1e9d","observation_id":"ccaf5634-fbf2-4422-9539-f4bee3b06dcf","resolution":{"observed_at":"2026-08-02T12:46:09.576749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.648762Z","title":"LayoutLM: Pre-training of Text and Layout for Document Image Understanding , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.648762Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:41270bcde66978b067ee88e5b8f162afa9b3e59f3506bd58f8880545cb231040","observation_id":"f0a64ca0-7550-4def-924a-95cf1737f7f5","resolution":{"observed_at":"2026-08-02T12:46:09.648762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-08-06T19:35:19.984769Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15558","snapshot_observed_at":"2026-08-02T12:46:09.712264Z","title":"arXiv preprint arXiv:2501.15558 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.712264Z"},"links":{"cited_paper":"/paper/2501.15558","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:5cec426ae25805cfe614051761ef140f0a8ac0088b52e83d8f3a952dc2f70e24","observation_id":"350f618f-059a-41b7-ba55-954416cb2379","resolution":{"observed_at":"2026-08-02T12:46:09.712264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.786583Z","title":"arXiv preprint arXiv:2502.18443 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.786583Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:ba63eef3a9acaf71cf6c8a0680290bdd5c119376350eb0a7fb4067e0dfae0b66","observation_id":"f5dcf2d0-eb38-4d89-90a1-76b8b8a6d2bd","resolution":{"observed_at":"2026-08-02T12:46:09.786583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-02T12:46:09.834605Z","title":"arXiv preprint arXiv:2409.18839 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.834605Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:059e719d502b1b785e9e783c3498b8f04f0b80e0c94051767a77b6af6815c1fa","observation_id":"a1d801ed-00cc-44b4-a674-a62160a0b3f4","resolution":{"observed_at":"2026-08-02T12:46:09.834605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-02T12:46:09.903700Z","title":"arXiv preprint arXiv:2009.09941 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.903700Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:e113b663f9719a2b9c8441059113ba7135e310f212bc879e1114ff08e22b58c5","observation_id":"6cf654f6-b8e2-46b7-bfd4-dc8472285628","resolution":{"observed_at":"2026-08-02T12:46:09.903700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:09.982617Z","title":"Ninth international conference on document analysis and recognition (ICDAR 2007) , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:09.982617Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:3aee30eca249789260c0229762998f8b478c3358b6a4efcfe2e7f72eba6de748","observation_id":"3208d8a3-ba0b-4477-a22a-a040458141d6","resolution":{"observed_at":"2026-08-02T12:46:09.982617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:10.083752Z","title":"Proceedings of the 33rd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.083752Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:52a867c9bd5ba1209e353632c2559c6f3b4aedc3f64bf8755f24d97928f2d14a","observation_id":"c6a80f1e-fd10-4168-98e4-4b78c9ac3e91","resolution":{"observed_at":"2026-08-02T12:46:10.083752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:10.148535Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.148535Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:d0ce347f3d55d95f0c0ecde53543c7c4a5e0ce5e7cf247300b5eb716204cd2e7","observation_id":"7fbb042b-3d26-450e-a81c-df8ea532cd38","resolution":{"observed_at":"2026-08-02T12:46:10.148535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:10.215369Z","title":"2021 , publisher =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.215369Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:6bfe95cb787b559f13f94ba5015c5c6b11fa8c96eb9948a9e654c62f3555d3ee","observation_id":"1ff74ba2-0d7b-4154-9a18-52ad8d5f86df","resolution":{"observed_at":"2026-08-02T12:46:10.215369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:10.467072Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.467072Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:a21d56a492d9ddead1751e7f9b586b820001f6049733e0541cbbb0e248e6582d","observation_id":"d790d216-96c4-4b5a-a2b9-a2aa1327bccd","resolution":{"observed_at":"2026-08-02T12:46:10.467072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T12:46:10.631021Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.631021Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:15bd75792a2ef904a5c57d5eba92a9436a7cc9312f40b0b19d21af8aa32552d4","observation_id":"4ff9148a-d2d0-41b5-8e2f-77fde8d1b489","resolution":{"observed_at":"2026-08-02T12:46:10.631021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:10.833031Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.833031Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:bedd1fbd113c7a139fb0061fe2476de8012d49d785e4cedbdafd6daaa590c905","observation_id":"4be17acc-ce43-4ce5-a1d3-191c13f5a822","resolution":{"observed_at":"2026-08-02T12:46:10.833031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02173","last_updated":"2018-02-24T19:44:38Z","snapshot_observed_at":"2026-07-06T06:08:03.192267Z","submitted_at":"2017-11-06T20:59:58Z","title":"Synthetic and Natural Noise Both Break Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02173","snapshot_observed_at":"2026-08-02T12:46:10.997571Z","title":"arXiv preprint arXiv:1711.02173 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:10.997571Z"},"links":{"cited_paper":"/paper/1711.02173","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:b691925bf2aefe183c57681fd4160e8ddd3a5bdd1d8b0111eaf97e4a9b0b2add","observation_id":"7e7b6a7c-e5c9-4bd9-b3dd-fc45d1c41fbb","resolution":{"observed_at":"2026-08-02T12:46:10.997571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.160831Z","title":"Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.160831Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:a4804fb3478c45b45d8f830f4a4d54c59261d175cade15906c546b251c37463a","observation_id":"830efd6d-2cf9-4606-8a6b-4d1427ef2019","resolution":{"observed_at":"2026-08-02T12:46:11.160831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.255823Z","title":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.255823Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:418d72264f8c36cfb2c8bd34922db4fa664d423d90f326ffbfab4393edb0275c","observation_id":"06c4e05f-6f1c-4428-84b8-3618773331e7","resolution":{"observed_at":"2026-08-02T12:46:11.255823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.345358Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.345358Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:1d6bc8ce615851401ddb29d458be036627260424a09a87763eba2ccda90f72b9","observation_id":"3bc4cac9-7383-4f29-b767-246a0b6046e6","resolution":{"observed_at":"2026-08-02T12:46:11.345358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-02T12:46:11.456166Z","title":"arXiv preprint arXiv:2604.15804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.456166Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:6027b86863ae5186f99e33969bdb2ccfd84eece5f349f720eaf51f3e1e87cc82","observation_id":"35c88fa4-4807-4b80-a29a-539699e3a66e","resolution":{"observed_at":"2026-08-02T12:46:11.456166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.588458Z","title":"arXiv preprint arXiv:2510.17771 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.588458Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:167f25d48237af3febc6925232234e4d3150d8525168863baf74651a12b1e4a5","observation_id":"bdbc8cab-a8f3-4595-baf1-9cc026a839ad","resolution":{"observed_at":"2026-08-02T12:46:11.588458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23941","last_updated":"2026-04-19T17:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T18:47:58Z","title":"Vision Language Models are Biased","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23941","snapshot_observed_at":"2026-08-02T12:46:11.638518Z","title":"arXiv preprint arXiv:2505.23941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.638518Z"},"links":{"cited_paper":"/paper/2505.23941","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:8454e7bbccb7113f7d728feadf0ebfdb0cce6317c52d1ffdc81c63eaf6c2aa04","observation_id":"90c8079e-6d5d-48f6-a6c6-372bf49b2598","resolution":{"observed_at":"2026-08-02T12:46:11.638518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.740750Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.740750Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:a21ecfe969433109fe28ca0bf3e70d4a4c23961f47a900575317a212b53a20d1","observation_id":"d01c5297-61e0-4901-bdd7-ef70a5c2b097","resolution":{"observed_at":"2026-08-02T12:46:11.740750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.787638Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.787638Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:16133666ee3181dff31a856cf98b848263407bf52f5aaeb0c4356a72127d19cc","observation_id":"02b638c6-b96b-4c5b-b6dd-8f5c1690261e","resolution":{"observed_at":"2026-08-02T12:46:11.787638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.856663Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.856663Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:9b50cedd6bdb2d364668c28646da768b7e40142e7cd4dc2fd6609aff5cdfc32e","observation_id":"922e6cd1-b60e-4253-ad2c-c0c94c0dc56c","resolution":{"observed_at":"2026-08-02T12:46:11.856663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-02T12:46:11.926310Z","title":"arXiv preprint arXiv:2311.07397 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.926310Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:fe5d61b2273a768d55cb2a64edbd2b0af3a8956d58c76eb41e09a28242ab5b7f","observation_id":"8f392fc2-ebd7-4c9d-b058-17b934684485","resolution":{"observed_at":"2026-08-02T12:46:11.926310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:46:11.997842Z","title":"2026 , howpublished=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:11.997842Z"},"links":{"citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:063a57a2139a5ff80c34bf8b5b531bc93d8d2a9def6c84e32ee40d1a23e98b76","observation_id":"29d1489b-8bfe-4abc-8a9d-3c27e3256531","resolution":{"observed_at":"2026-08-02T12:46:11.997842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T12:46:12.113877Z","title":"arXiv preprint arXiv:2601.03267 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T12:46:12.113877Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.21617"},"observation_digest":"sha256:6578d307ce183949b2d2961b11ce078458680e3e26ffbf11fe6b0ed8e2a97c6d","observation_id":"f9e2377e-e515-40a3-92e3-f7617384f504","resolution":{"observed_at":"2026-08-02T12:46:12.113877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21617","last_updated":"2026-05-29T20:33:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T15:32:04.456746Z","submitted_at":"2026-05-29T20:33:35Z","title":"Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.21617."}