{"as_of":"2026-08-06T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a108ce39c19536eb30ded6b321322122c6fdbdc5efc75463307c06483d3b405a","coverage":[{"denominator":156,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T20:33:26.613927Z","state":"measured"},{"denominator":147,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":147,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:02:43.554226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-06T15:26:01.907887Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16863","last_updated":"2026-06-24T02:13:52Z","snapshot_observed_at":"2026-08-06T15:16:29.727632Z","submitted_at":"2025-07-21T21:50:16Z","title":"Position: Reasoning After Perception Means Reasoning Without Vision","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:26:01.907887Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2507.16863"},"observation_digest":"sha256:fa38dc242a9f60360f4eceff41d50d1273c0ad8d5db5e42d8d3a2eb750ff3f07","observation_id":"4251d243-f06f-4cf6-b766-ce366305b8c1","resolution":{"observed_at":"2026-08-06T15:26:01.907887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T23:03:07.345505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:07.345505Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:c00c232ed0beb7be71b30f8550613871665a59f15141783ee0b405f942732486","observation_id":"cb3702ed-2f72-4b02-b978-4fae2d648b4f","resolution":{"observed_at":"2026-08-05T23:03:07.345505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T10:52:12.595994Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03615","last_updated":"2025-09-03T18:08:41Z","snapshot_observed_at":"2026-08-06T15:56:57.359517Z","submitted_at":"2025-09-03T18:08:41Z","title":"E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:52:12.595994Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2509.03615"},"observation_digest":"sha256:9b87a03b608aacdff2cf110d8abebdc5d5a990b3156b278f045b547bed7425da","observation_id":"8e5fb6f3-e505-484b-b225-79e59fe5bb36","resolution":{"observed_at":"2026-08-05T10:52:12.595994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-04T20:28:56.875999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.875999Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:13a47aa1c1aba40514676e1a85ad2a4d97ec4cbe216cee915d4aabbff46f56d4","observation_id":"84b965d6-31f2-41d0-8c12-0fd77429e975","resolution":{"observed_at":"2026-08-04T20:28:56.875999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-06T11:22:47.957500Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:f4b9fe91d84c384c79b1a78dc4b4644a8614de3c9e4ed85ab7f993c4c1d14c5b","observation_id":"52d0a6e8-8ef2-4742-ab23-e6dc1ea29c06","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-04T08:15:50.222297Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-04T08:15:30.884838Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:50.222297Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:8dba73f2c5e5f80f82091efb519c9bdf662a0f7a2c1dc789f455e94c2ec6ff04","observation_id":"2a83625d-0c7d-4f1f-a2a7-fc122f643337","resolution":{"observed_at":"2026-08-04T08:15:50.222297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2511.14998","last_updated":"2026-04-07T03:13:19Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-19T00:41:14Z","title":"FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:52.701262Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2511.14998"},"observation_digest":"sha256:35895740d0d81690d909278f1a0a23ebec5567c0cb61d4cbb384043b20f94b5f","observation_id":"bdfd32a0-7549-4f8b-b451-84649a85c8d1","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-03T10:43:50.235644Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-06T20:05:00.082163Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.235644Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:74858b91b86f8339b2bdc2bf45acfdee8979fd5ce4941118c0b1fc3fadb86e31","observation_id":"3a3d0f3e-386f-4ee4-bf52-4be9e81254f9","resolution":{"observed_at":"2026-08-03T10:43:50.235644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-03T10:43:42.239857Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-06T03:35:04.691296Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.239857Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:df395e0fc1e19a13eadbfd0b224ca9e2404be512d99233c6a33f7715d0280b12","observation_id":"b38ab542-208f-4b65-bd5f-482472da0d01","resolution":{"observed_at":"2026-08-03T10:43:42.239857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-03T08:15:17.922012Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-03T08:15:07.553014Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:17.922012Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:3845dc10f3523545a9fd6dc2368809287bd9844c7697f1597aad897580896751","observation_id":"22678879-e4ff-48c9-a5e2-c704d1142560","resolution":{"observed_at":"2026-08-03T08:15:17.922012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-02T20:40:30.201984Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning.arXiv preprint arXiv:2501.00321, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-06T01:15:52.220969Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.201984Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:1eb59035d68ae63dfd25ea2d6312e1c050c48d1d639205719f40dc28be9f0e38","observation_id":"a128282c-278f-4391-be66-e1653b7e6678","resolution":{"observed_at":"2026-08-02T20:40:30.201984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-02T18:54:55.565724Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.04205","last_updated":"2026-06-22T03:43:39Z","snapshot_observed_at":"2026-08-02T18:54:54.324790Z","submitted_at":"2026-03-04T15:49:06Z","title":"Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:54:55.565724Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2603.04205"},"observation_digest":"sha256:c5b22ef6a28c43012211690b8eac47e8e65efd61c2604112a5ddad2ead99c60e","observation_id":"7437eefe-2996-476f-b639-1331fd3a71b6","resolution":{"observed_at":"2026-08-02T18:54:55.565724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2603.19790","last_updated":"2026-04-15T01:38:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T09:28:09Z","title":"From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T08:53:18.268970Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2603.19790"},"observation_digest":"sha256:7bda0ae5fe4b4a02571e9aae54c6550cd7b71e6da59d959b6a8bc2460e4df3d4","observation_id":"f2fd8daa-5b75-42dd-b067-53c9c43593f0","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.03339","last_updated":"2026-04-03T07:59:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T07:59:26Z","title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T20:01:57.029143Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.03339"},"observation_digest":"sha256:3b6b6a5312d72dc70798380ba6d14bfb380d5dc76697f6141069ac7e4b7e3f1d","observation_id":"bf1770ba-0932-4a8c-a5bc-fa0648506db0","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.04411","last_updated":"2026-04-06T04:25:52Z","snapshot_observed_at":"2026-07-06T22:53:24.585766Z","submitted_at":"2026-04-06T04:25:52Z","title":"Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T20:02:39.796357Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.04411"},"observation_digest":"sha256:ebd41c42ba92696e5a9032f7a1a48a99f840f3b94a2abd6a373535d18dbd320e","observation_id":"287797b8-4126-43ae-a108-e15a56a75096","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.04733","last_updated":"2026-04-24T20:17:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T15:00:54Z","title":"Discovering Failure Modes in Vision-Language Models using RL","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T19:21:25.761342Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.04733"},"observation_digest":"sha256:33f20e1e9987eff4f95ecf8ab65384fec88b3a8b5b3eba1e7f6713def3a1eed3","observation_id":"6d9f6490-5178-482e-aac2-99e59826f751","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.08538","last_updated":"2026-04-13T17:37:21Z","snapshot_observed_at":"2026-08-02T07:55:28.320539Z","submitted_at":"2026-04-09T17:59:36Z","title":"ParseBench: A Document Parsing Benchmark for AI Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:20:02.687230Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.08538"},"observation_digest":"sha256:f6bfd29b25349bf1dbd4fa2fc809b858f31bc5565c5170f8a4b112f3fbc3a086","observation_id":"86174706-c22b-4937-957e-04dba896f8d5","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.19259","last_updated":"2026-04-21T09:20:55Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T09:20:55Z","title":"Feature Perturbation Pool-based Fusion Network for Unified Multi-Class Industrial Defect Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T03:28:11.747826Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.19259"},"observation_digest":"sha256:2c3cb787a66532aa2279d505c1148fff14349980a5268374f28c3c57e0d53b0e","observation_id":"7568b540-08a7-4087-bd19-df6410f5637e","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.19858","last_updated":"2026-04-23T15:33:31Z","snapshot_observed_at":"2026-08-02T10:08:34.031243Z","submitted_at":"2026-04-21T17:58:58Z","title":"Wan-Image: Pushing the Boundaries of Generative Visual Intelligence","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:16:03.854650Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.19858"},"observation_digest":"sha256:78765b41ab6949d967bc8d0d62b237770523f7b8c06743ee8d5dddd3ccef1f79","observation_id":"41de8ea6-3589-4f42-843e-9ec13c46dfd7","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2604.25359","last_updated":"2026-04-28T08:27:01Z","snapshot_observed_at":"2026-07-06T23:11:16.247497Z","submitted_at":"2026-04-28T08:27:01Z","title":"The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-07T16:33:46.387850Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2604.25359"},"observation_digest":"sha256:5be720100fe33ab71764748914fd89a9e6988e9a77584876f5e59d9153f9c64a","observation_id":"19097b94-2122-42bc-bf6b-ee0f60f5a911","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.00885","last_updated":"2026-04-27T09:11:34Z","snapshot_observed_at":"2026-08-06T18:57:47.379606Z","submitted_at":"2026-04-27T09:11:34Z","title":"Multi-Branch Non-Homogeneous Image Dehazing via Concentration Partitioning and Image Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T20:03:36.551943Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.00885"},"observation_digest":"sha256:9712a565928c30fac5da4e6ea8e03e3f46c34823ac9aa4b0db6c792145fb2e9f","observation_id":"5c239e8e-a2bc-4da1-a3f3-4ad843a89ed1","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.03903","last_updated":"2026-05-05T15:56:12Z","snapshot_observed_at":"2026-07-06T23:16:44.876986Z","submitted_at":"2026-05-05T15:56:12Z","title":"CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-07T16:18:35.484800Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.03903"},"observation_digest":"sha256:be4f6acee757cc92bd5e34397ddcd2a487e0b04275b026ca5306e8b0fc92552f","observation_id":"a58cd611-7ad1-425b-9979-eadc5f85b4d1","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.07492","last_updated":"2026-05-08T09:30:31Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:30:31Z","title":"How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:28:02.152600Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.07492"},"observation_digest":"sha256:bbdedfd29bb2886d17d644f63949440b84d7b90c570885a366c7c9d4a4a36f36","observation_id":"1d3e5138-2a74-4901-b3bb-6cfb06f0d6d2","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.11301","last_updated":"2026-05-11T22:42:12Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-11T22:42:12Z","title":"LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T01:42:54.802658Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.11301"},"observation_digest":"sha256:57b100d8dabfa44f6795660313843754fb8fe5c99206bab65a760a64f72fb0d3","observation_id":"fcb95031-61a2-4374-ac25-a12be3fbc3f2","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.11462","last_updated":"2026-05-12T03:20:41Z","snapshot_observed_at":"2026-08-02T09:58:22.459807Z","submitted_at":"2026-05-12T03:20:41Z","title":"SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:26:47.052025Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.11462"},"observation_digest":"sha256:4680382fc581fdca693808e9a1a420292416dd502d7672c188404b22075233be","observation_id":"20465ccb-766f-4f8c-8d4b-964aceff6cfd","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.11960","last_updated":"2026-05-12T11:14:25Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:14:25Z","title":"Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:48:44.584051Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.11960"},"observation_digest":"sha256:bd17f6f83f3f5a6f07dfd3e7c02b435c34e610f062e608f614beab231f470769","observation_id":"961edea4-ba58-4ac5-ba36-642d9610b59a","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:0c676a57973a8cfaa9d0f67b693b7c53fcf4449cf808ddb5f5de501906e1e5e0","observation_id":"a11a964b-2432-49fb-8b43-141d99e97590","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.18173","last_updated":"2026-05-18T10:15:57Z","snapshot_observed_at":"2026-08-02T16:11:51.976692Z","submitted_at":"2026-05-18T10:15:57Z","title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T11:28:51.711892Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.18173"},"observation_digest":"sha256:4c2c1b2f94d96667acc3182fb9871e13f112574e838c790e1386d2c5e45dd69c","observation_id":"72ee3ef8-91de-4532-97e4-1fae95026bed","resolution":{"observed_at":"2026-05-20T11:33:14.564545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.19929","last_updated":"2026-05-19T14:49:57Z","snapshot_observed_at":"2026-08-02T05:44:37.705586Z","submitted_at":"2026-05-19T14:49:57Z","title":"Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:20:45.264341Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.19929"},"observation_digest":"sha256:6cab42da256765f4382be3b82bd78501ca6fec2c01e3b52f25cfb3503d9a5ab7","observation_id":"1908dd2a-5533-40a5-94c0-d31b6c7cc804","resolution":{"observed_at":"2026-05-20T05:23:03.622203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T08:36:27.676888Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:14d9fddfcadd3d33fe5a41fe6035a1bd419f6ceefb1c69fa34e6abcb1277f005","observation_id":"ac581788-5040-45e4-baf1-5164792e3c2c","resolution":{"observed_at":"2026-05-21T08:39:53.720810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:e5f4b6354bdcb68a5679ad349f198490262709f92bf91de648bf4b721e20039c","observation_id":"2c7155a6-e2c7-4136-89cb-c535243115f1","resolution":{"observed_at":"2026-06-30T18:04:58.316832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.25377","last_updated":"2026-05-25T03:05:04Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T03:05:04Z","title":"Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:38:33.963054Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.25377"},"observation_digest":"sha256:54df09ace42b9e2b7bdfbb1d5a1eccf04e944e335ba90474daee42a859147c84","observation_id":"508fc88b-b751-4b57-ac3b-738d90e61aaf","resolution":{"observed_at":"2026-06-29T22:44:01.536764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.09195","last_updated":"2026-06-08T08:30:51Z","snapshot_observed_at":"2026-07-31T04:06:30.746524Z","submitted_at":"2026-06-08T08:30:51Z","title":"Symbolic and Abstractive Reasoning with Complex Visual Queries","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T16:46:18.863886Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.09195"},"observation_digest":"sha256:98a58f01b840032f15d0c074346737a62d3db9840423c27e3496e4234d650aa6","observation_id":"9c0425b3-386d-4e94-b019-587cb1c8eba5","resolution":{"observed_at":"2026-07-03T01:07:30.854389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T03:57:19.028507Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.15932"},"observation_digest":"sha256:f36f98b160a02a91f5906bf15d85b119f9b6f3445c75da638de1f14ee3630ffb","observation_id":"6335649a-fbfe-4f54-95cb-826b3208204f","resolution":{"observed_at":"2026-07-03T17:38:44.234528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:159e4b02bde21f74e14396fb5674c5f95ae67a19c867fb385a64f4074baaa685","observation_id":"ce72c728-d3ee-41a3-82c3-5ab464911f59","resolution":{"observed_at":"2026-07-03T20:48:56.196839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-06T13:21:30.445520Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T05:32:26.746776Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:425daf12f4284c50350ae8e1755e0695180f5e856c947fe27c6ed72ec779fc05","observation_id":"520f187e-0aa2-493e-b4c8-e41744aa4e95","resolution":{"observed_at":"2026-06-29T15:03:32.178134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.24602","last_updated":"2026-06-23T14:03:56Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T14:03:56Z","title":"ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T00:24:20.208132Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.24602"},"observation_digest":"sha256:89582a846698172df11245f54af57cf078f99e55fc6c69d94eab0342a823594e","observation_id":"e5d92f9b-9172-4b94-b72d-598e7a6f9e3e","resolution":{"observed_at":"2026-07-04T16:39:57.611502Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.26041","last_updated":"2026-06-24T17:15:42Z","snapshot_observed_at":"2026-08-02T15:35:24.404490Z","submitted_at":"2026-06-24T17:15:42Z","title":"How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-25T19:13:27.527971Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.26041"},"observation_digest":"sha256:70d1ef5c8d5d5b24eb4a20dfe7c6fd491bb56ea40aab2dda1052a28a8f605c5a","observation_id":"eb67aa88-af60-4eb3-a6bb-53b07fab1fca","resolution":{"observed_at":"2026-07-04T21:00:09.485484Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.29905","last_updated":"2026-06-29T07:41:39Z","snapshot_observed_at":"2026-08-02T15:11:59.921772Z","submitted_at":"2026-06-29T07:41:39Z","title":"StrucTab: A Structured Optimization Framework for Table Parsing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:22:21.694355Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.29905"},"observation_digest":"sha256:2613228976579bbe8c3113afabb9071113e0b2dda38fd988decc8cdfea6b58e8","observation_id":"76accdc0-19da-428a-9d04-a2fc8aaf6ab5","resolution":{"observed_at":"2026-06-30T06:24:18.911083Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2606.30189","last_updated":"2026-06-29T12:04:01Z","snapshot_observed_at":"2026-07-07T00:04:05.275293Z","submitted_at":"2026-06-29T12:04:01Z","title":"DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:20.803078Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2606.30189"},"observation_digest":"sha256:572a97ab77970b1ac4f71993fb120c2056b5aaa418f6faf04c7a058ee71aa768","observation_id":"4a6d5ac7-5cd0-4b7b-bf0e-a9c6e80ea2ac","resolution":{"observed_at":"2026-06-30T06:04:21.428160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-03T15:00:12.134373Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:757b65d9ef8a355405cf4578cdf700c7d8f008b95afff1248f2d28e947e8a768","observation_id":"5a7eb3c8-ed95-4ac7-8656-369f6381cfac","resolution":{"observed_at":"2026-07-02T19:07:17.443295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2607.01602","last_updated":"2026-07-02T02:04:07Z","snapshot_observed_at":"2026-08-02T11:44:30.389009Z","submitted_at":"2026-07-02T02:04:07Z","title":"ProWAFT: A ROMA-LPD Instance for Workload-Aware and Dynamic Fault Tolerance in FPGA-Based CNN Accelerators","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T15:23:48.748933Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.01602"},"observation_digest":"sha256:3ce955e779041f450fad17d0814f5b8c29bb85186cf32a2e950d57c4ea38d05e","observation_id":"d0f61be4-a898-45e3-ad91-d1ed1b1ed551","resolution":{"observed_at":"2026-07-03T15:28:33.664386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Ocrbench v2: An improved bench- mark for evaluating large multimodal models on visual text localization and reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:cb8f51e4ff5f770d6e4e18e9acf7118e4219658b83708c9046aa4960a8f7f86f","observation_id":"0b898045-7a72-44b1-a8b8-ee2d60cf0b6a","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-02T01:25:27.102713Z","title":"arXiv preprint arXiv:2501.00321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-06T12:12:36.114458Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.102713Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:dc420096fc3d8d79b1068fee59e989d0a4650a6710dfdb7ab2d2be9858213f7c","observation_id":"faaf72c8-c70b-48df-8122-aa6204c9120c","resolution":{"observed_at":"2026-08-02T01:25:27.102713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-01T16:31:12.518516Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-02T14:43:28.084412Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:12.518516Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:c2ede60dc55d2428288af33b70147743f8d45fb845030e14ddaf841a049eadb8","observation_id":"9f6cffe7-2dc7-48dc-89c1-eda5a011adbb","resolution":{"observed_at":"2026-08-01T16:31:12.518516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-04T17:23:16.238872Z","title":"arXiv preprint arXiv:2501.00321 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01979","last_updated":"2026-08-03T09:42:34Z","snapshot_observed_at":"2026-08-06T23:35:43.444749Z","submitted_at":"2026-08-03T09:42:34Z","title":"ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T17:23:16.238872Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2608.01979"},"observation_digest":"sha256:78ca9f3a87b92c83ddf4da67aa24bc2cf2fcf002e482ab7cfd66d2168be67ff6","observation_id":"e7b92d26-7f26-4394-a719-9e30eebff866","resolution":{"observed_at":"2026-08-04T17:23:16.238872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-06T18:02:43.554226Z","title":"InProceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 4178–4188","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-06T23:23:59.325939Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.554226Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:8fd6ce5acf4fd2795f7627446fbc51e1ebd027809698f268201ae834444a2c19","observation_id":"7a482709-b5dd-4cb3-a056-9dfd3d727272","resolution":{"observed_at":"2026-08-06T18:02:43.554226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00321/citation-record","integrity":"/paper/2501.00321/integrity","json":"/paper/2501.00321/citation-record.json","paper":"/paper/2501.00321"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:fcc3a9da930c8ddcd4c4153d605f9d267543eb5101cc11d523c5dc4f38051d90","observation_id":"84db86e9-daa5-45a0-803f-e6dfb24e4819","resolution":{"observed_at":"2026-05-17T20:33:26.710555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:f2b6a7fdb9c66f1f857275cf3f9d56d6cca823de3041c4e215c3c10e911548e3","observation_id":"881d1380-983c-48bb-ad9a-87be81d399d3","resolution":{"observed_at":"2026-05-17T20:33:26.715283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"435448fd-e4c0-479b-9769-6a7e11a7a63d","year":2020},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:6d2eec9fafdad98f9979619223966bf7a9266b217454ee9feeb66787ccef82b6","observation_id":"32c8be8d-283a-4ab9-abe8-09b2c19211bd","resolution":{"observed_at":"2026-05-17T20:33:27.110212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5c47b8eb74e5ebe81f04646990ada683473db39bd02643db24d6eff1a87c1b20","observation_id":"19455080-45aa-42e3-b2d9-c861fbf23001","resolution":{"observed_at":"2026-05-17T20:33:26.720254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"d9185768-bb71-4cd6-8b2d-3856483d4c46","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:7df9977205bab8fafc0b4f8b804e2cb6e4f55b67fd7e45abbe1834dbfac8a876","observation_id":"7e559013-a35b-4d93-bc3a-09416380e193","resolution":{"observed_at":"2026-05-17T20:33:27.002344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"0450d8f6-d411-4b33-979c-33d8b3c4b5f8","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:7502ffc9d2de6a08180e4958a86a34a28d1cd78191060b851d725e719af8f064","observation_id":"8e552762-b7bd-4f7f-93b0-96e847f509e1","resolution":{"observed_at":"2026-05-17T20:33:26.983236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":"2403.04473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":"612fe156-781e-49f3-bac5-03fcb13d115f","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:969988898eea506989c75a391dafdaa32f5bbdc69e010c87280a8b8483c995a9","observation_id":"7731a63b-db2d-49a7-ae06-be6343d86ea3","resolution":{"observed_at":"2026-05-17T20:33:26.724787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:83d4a6828345c5316a94a9b64f13950e7c31407df0ceae5347883db857aacf4c","observation_id":"eb8bb696-acf7-4ff5-84a4-50ac1619a710","resolution":{"observed_at":"2026-05-17T20:33:26.728484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":"2404.16006","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-07-04T19:50:10.187396Z","title":"Mmt-bench: A comprehensive multimodal benchmark for eval- uating large vision-language models towards multitask agi","venue":null,"work_id":"b311f9ac-1b41-40b6-b154-df5836a51696","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c29b36b3a264cf56e3f15a2a2e4f0cf5093f3d067d0a22a27454d212c316f59b","observation_id":"9b89acf0-6d5f-4b6d-9e8a-432c6991a3c8","resolution":{"observed_at":"2026-05-17T20:33:26.733088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards vqa models that can read","venue":null,"work_id":"b747fa6e-5c92-4436-97f2-8c065eba5de0","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:99c221e9677465449abf97fe9c0bf4bdb68d82b909579d554a013937ddba0bbc","observation_id":"ec63bf76-4f80-4d1f-9484-dbeb9663f85a","resolution":{"observed_at":"2026-05-17T20:33:26.972826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"5afb9487-5eb6-4036-89f4-991d0c297b9d","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:89f48dba9d6e1dc80d891c9fb2c62b8fd71114f42ac1e35ee19978a8f2a1a6bb","observation_id":"1b159bc0-d92d-4e80-affe-05fe7b571d58","resolution":{"observed_at":"2026-05-17T20:33:26.946146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the general value of evidence, and bilingual scene-text visual question answering","venue":null,"work_id":"09e3599f-38fe-4299-a05d-423b36a78377","year":2020},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:d6036a50ae38b0a9932c1701de2a31498c41d7a385505532c53c2b2453fe2770","observation_id":"c1e6a0ed-95dc-4834-a1b4-5e7c7570374b","resolution":{"observed_at":"2026-05-17T20:33:27.059090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:1683539ac162ce9107482497c6118c5f3ebea7118de023c136f4adb99f5fbea3","observation_id":"943a1730-bffa-4aa7-96c3-7fce26ec1f0d","resolution":{"observed_at":"2026-05-17T20:33:26.697366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:94314b0a470a62c9c3d102ee793a037c65bae0428c31e8d707e8211bba4aa583","observation_id":"1f421b4f-c3aa-4521-9c22-dc66af286c46","resolution":{"observed_at":"2026-05-17T20:33:26.701581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5fa8ca02ebdb93aecf18a81588d10fab2f7b0aaf522051596365477fb0d99ec3","observation_id":"7fed4a12-5eaf-40e0-bb7f-58a14df4529b","resolution":{"observed_at":"2026-05-17T20:33:26.706356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ConTextual: Evaluating Context- Sensitive Text-Rich Visual Reasoning in Large Multimodal Models","venue":null,"work_id":"408a86f1-baa1-4075-b4ef-55f7020d52a4","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5e124f395287e0d53b28d456dc194e3c6d65d5b2a22c27c43a957100e18e6023","observation_id":"50dd66b5-d3bb-47a1-9419-8a80f935cedb","resolution":{"observed_at":"2026-05-17T20:33:27.031458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14295","last_updated":"2024-05-23T08:15:49Z","snapshot_observed_at":"2026-08-06T05:45:07.767677Z","submitted_at":"2024-05-23T08:15:49Z","title":"Focus Anywhere for Fine-grained Multi-page Document Understanding","version":1},"cited_work":{"arxiv_id":"2405.14295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14295","snapshot_observed_at":"2026-07-08T20:35:34.401926Z","title":"Focus anywhere for fine- grained multi-page document understanding","venue":"cs.CV","work_id":"f9c7794d-c8f0-42dd-b0c1-7bba21f80c07","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2405.14295","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:790b5c1332c6a4062aed3ff6ef6e724f13c31fac414b316c8444584f07733f39","observation_id":"66b56da9-27c4-4e76-a85a-14de545037e6","resolution":{"observed_at":"2026-05-17T20:33:26.738101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":"2404.19205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-07-04T21:00:09.470383Z","title":"arXiv preprint arXiv:2404.19205 , year =","venue":null,"work_id":"6158fe16-6333-4da2-ab5d-d0d3ee6ee6da","year":2026},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:74f8dcc0368cd709bcb1c6e99596bcf16d15ca3300a561854ccd314e8f0b48d7","observation_id":"c4920d74-91e3-436b-8241-f3b90f43cc97","resolution":{"observed_at":"2026-05-17T20:33:26.742622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01326","last_updated":"2024-10-11T14:38:40Z","snapshot_observed_at":"2026-07-06T18:24:26.225262Z","submitted_at":"2024-06-03T13:54:05Z","title":"TabPedia: Towards Comprehensive Visual Table Understanding with Concept Synergy","version":2},"cited_work":{"arxiv_id":"2406.01326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InProceed- ings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 2131–2153, Singapore","venue":null,"work_id":"237eb53a-92d0-49a8-a3fd-64e0dcb684b1","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2406.01326","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:0cf2394a5bd120e54b6e103fe46442eef6d8396ddcb35d3db0fec6013cfcae6e","observation_id":"c094f01d-c59d-4de8-b355-0e88f9ab39cc","resolution":{"observed_at":"2026-05-17T20:33:26.747153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12185","last_updated":"2025-04-27T11:31:23Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T14:48:23Z","title":"ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning","version":6},"cited_work":{"arxiv_id":"2402.12185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12185","snapshot_observed_at":"2026-07-04T16:59:57.579605Z","title":"Chartx & chartvlm: A versatile bench- mark and foundation model for complicated chart reasoning","venue":null,"work_id":"18c69f85-a4de-4a52-920f-b4f5d0dc0508","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2402.12185","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:9fdc78f2a849c37615caeda944f59734178dce05e4bc214a694732b4854d6cc1","observation_id":"a278470e-2183-4ab4-ab02-6f75b4a40463","resolution":{"observed_at":"2026-05-17T20:33:26.751219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-vl","venue":null,"work_id":"9860f200-ef5f-4f35-bc5e-6ef0014c3b6d","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:99549cb61b5d7f83f9ad4b8feb0ac9da8fb3d64ea7ab8ad8846c1786b807ffb8","observation_id":"ad4fec7b-c1d5-43b0-86be-10c82b9e818f","resolution":{"observed_at":"2026-05-17T20:33:27.042447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"118da35a-e97f-46fd-bdf9-ac3f195e24e4","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:6b933d4df55106f7249fa48df1da785ba030c88ad7abb3c81149e5e5cbbee951","observation_id":"a51669fb-7193-4b01-afe5-1ea7351b44cf","resolution":{"observed_at":"2026-05-17T20:33:27.044764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:14accc0bf285e9513e2399666cfdcd71939a48120bf4d74036bf2a707170e8fc","observation_id":"fe5de7f2-d8da-4945-9db7-4404a8086643","resolution":{"observed_at":"2026-05-17T20:33:26.755761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hello GPT-4o","venue":null,"work_id":"0482f650-8c3c-4a7b-af36-096bff85068f","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:191bbf321bf65f8488bdfc01e20fc7df09a3bffaf07cc5d6af8539a2950544bf","observation_id":"0dee846d-ef22-4f7c-b0d4-c58e3a712663","resolution":{"observed_at":"2026-05-17T20:33:27.049155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07626","last_updated":"2025-03-25T06:19:32Z","snapshot_observed_at":"2026-07-06T20:04:43.926718Z","submitted_at":"2024-12-10T16:05:56Z","title":"OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations","version":2},"cited_work":{"arxiv_id":"2412.07626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07626","snapshot_observed_at":"2026-07-04T09:59:45.169409Z","title":"Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, and Tali Dekel","venue":null,"work_id":"a5b25fa8-4e2c-42ce-a802-34140453f053","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.07626","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c65de2cbd1c4e358c138c2da0c912b5a60641826c0fa89a2b788196c9285c81d","observation_id":"2655b100-79ee-4075-a31b-8e8eb81030d6","resolution":{"observed_at":"2026-05-17T20:33:26.760260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02210","last_updated":"2024-12-10T05:01:33Z","snapshot_observed_at":"2026-07-06T20:00:47.730252Z","submitted_at":"2024-12-03T07:03:25Z","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","version":3},"cited_work":{"arxiv_id":"2412.02210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02210","snapshot_observed_at":"2026-07-03T05:47:41.904748Z","title":"Cc-ocr: A comprehensive and challenging ocr benchmark for evaluating large multimodal models in literacy","venue":null,"work_id":"904d3939-c480-4ddf-a962-a461501704de","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.02210","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:b8785494a2ecc81675204774b67b6e0244953748b77704c77471636eb92aa70d","observation_id":"44a67d08-3b66-41b7-a987-03b28e41f3aa","resolution":{"observed_at":"2026-05-17T20:33:26.764403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":"2407.01523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-07-02T16:17:09.161062Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations","venue":null,"work_id":"2246b9f1-e504-4ca8-9082-3ab923759798","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:19992f0af4e6f58c5469ecdbafe5e595912e8f8fb95ba43f812df66c6d99f573","observation_id":"f474b427-eae1-430a-ba6e-6291ebc0328f","resolution":{"observed_at":"2026-05-17T20:33:26.769132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.493","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Table Understanding","venue":null,"work_id":"e60c524b-48aa-4341-9bb6-183334fd4366","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:e9c7e8a57953fee95254bc12ced7692da342864d53b49e5461aea0d45b5a533e","observation_id":"9db08b98-011d-43f9-872c-b2cc8f92729f","resolution":{"observed_at":"2026-05-17T20:33:26.679804Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T21:53:24.131684+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T21:53:24.131684+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","venue":null,"work_id":"591e71eb-b5a9-48ff-a05b-66ff5f342049","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:a669f5dac00b25e153a96a35df88f4df3a300c2320ac7447e2708cf436228718","observation_id":"fb2016e4-1944-4451-ba05-fcd419b06fe1","resolution":{"observed_at":"2026-05-17T20:33:27.061301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:16bd4bf64892d23e8d0033bceb92a99592983376cc8b4f9e091891c3cd90f300","observation_id":"a793304d-b92d-4fa4-8199-35015e9dc1ae","resolution":{"observed_at":"2026-05-17T20:33:26.773900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":"2307.02499","doi":"10.48550/arxiv.2307.02499","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":"arXiv (Cornell University)","work_id":"990d95b3-f658-488d-b1a6-169e9e6aa7fb","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:28bab203f13265a0c1c1332014eda1a1d421f3361e708f45041984667405a4bc","observation_id":"fd1ab135-9013-424b-9169-dbc158c19fcc","resolution":{"observed_at":"2026-05-17T20:33:26.778534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-07-06T16:49:58.524003Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":"2311.11810","doi":"10.48550/arxiv.2311.11810","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"8 Fourier-VLM Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., Wu, Y ., and Ji, R","venue":"arXiv (Cornell University)","work_id":"59e37bff-3f93-4e48-8fd2-30b30846d0dd","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:15edce2d968ea2a5d322921fda9457390a70a6cd335495c7a79fde5e044314dc","observation_id":"82d49e9b-a8ca-4c02-923a-26fdc7ad9a2f","resolution":{"observed_at":"2026-05-17T20:33:26.782173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-07-06T16:29:23.853368Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2310.05126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-07-03T16:18:37.543028Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":"acc4fea5-7f8a-48c1-b1c9-2389be85b798","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:83e1f50f3add45b007bd48ae7e753affe8685dc45454e7b3176b0bb89e8d777d","observation_id":"02db6aa8-8324-41a9-ae1c-46a9a356fac4","resolution":{"observed_at":"2026-05-17T20:33:26.785865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding","venue":null,"work_id":"49fe7dad-ad1d-42ef-a3f6-153ad009cc68","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:72046d01c4e714c24dadb7a85708bab93f0b15a32dadd358b959a53f76f787f1","observation_id":"37bf3566-362d-4ee1-9c88-76f1a5987481","resolution":{"observed_at":"2026-05-17T20:33:27.072582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-06T09:18:14.849071Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":"2403.12895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-07-10T17:07:25.743722Z","title":"arXiv preprint (2024) DOI: 10.48550/ arXiv.2403.12895","venue":"cs.CV","work_id":"89b0a3a7-ff7a-49bf-af40-a8cf7ee77b16","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:150bd6cbe697ed60442aa50d331cfe9426b5d70889f9f37af49ced593643e1fe","observation_id":"a94e4643-1970-4d16-8da9-39b3ed21684b","resolution":{"observed_at":"2026-05-17T20:33:26.789867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dockylin: A large multimodal model for visual document understanding with efficient visual slimming","venue":null,"work_id":"be00fd4c-0b56-43a3-8a91-e9d45e1adb04","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:78db30171dafab211fc590afeff9d95099d7cea23d137a1f8b4248a9911890e4","observation_id":"40ca4e6a-fa75-403d-a7a7-9d83248bd0fb","resolution":{"observed_at":"2026-05-17T20:33:27.076933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15045","last_updated":"2025-03-19T10:05:04Z","snapshot_observed_at":"2026-08-06T18:59:22.667732Z","submitted_at":"2024-08-27T13:13:38Z","title":"DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding","version":3},"cited_work":{"arxiv_id":"2408.15045","doi":"10.48550/arxiv.2408.15045","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Doclayllm: An efficient and effective multi-modal extension of large language models for text-rich document understanding","venue":"arXiv (Cornell University)","work_id":"6ee2679a-f720-4fc3-93c6-11edcfc19b69","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2408.15045","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c11b1c4aebb1f5f07ceea63a82924af027b638031c43bd933c7b9fcec7a5a453","observation_id":"840efc04-9dbd-4cac-bce6-e3a3808c3239","resolution":{"observed_at":"2026-05-17T20:33:26.793729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple yet effective layout token in large language models for document understanding","venue":null,"work_id":"24f42a39-b732-425e-a43c-41ff62f6d3f7","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:b713be9cd7359a2ed0d08fd3c70ac59e77dfc9c708cd17f4f2691da8e0a28b0d","observation_id":"f2fdcb25-4e3c-40db-8244-55ccb432a752","resolution":{"observed_at":"2026-05-17T20:33:27.081005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive markup language generation for contextually- grounded visual document understanding","venue":null,"work_id":"ce2a964f-8212-408b-8a55-76778a1d8f7e","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:31f24bf54327725c220ba44972dca342455880302519609d9213388113519dcd","observation_id":"00d0198c-f48c-4841-a193-53492814b698","resolution":{"observed_at":"2026-05-17T20:33:27.083224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marten: Visual question answering with mask generation for multi-modal document under- standing","venue":null,"work_id":"f6ee3cb0-10c9-4ad8-ab22-9b7e543139c7","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:34fe26a597bc4ac8d0bb98bfe1684d30bb6a89c22cb6cfc37269b1bff1a4359d","observation_id":"b1955ee1-cea6-47ba-ba97-e272513d3b01","resolution":{"observed_at":"2026-05-17T20:33:27.085505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:767a16a70eaf246cf8964c712a96ee110dc89bd6dfaaf3c08903a9492e4f6e47","observation_id":"e60bd23c-2f86-49d6-95c8-0ed0f809b906","resolution":{"observed_at":"2026-05-17T20:33:26.797005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infographicvqa","venue":null,"work_id":"3a274a86-ecaa-4530-a0d8-3a0584013977","year":2022},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:326533cde25ef2380648013114c74b65d36a059b1eb46fff425cb2a7f391b1d9","observation_id":"a97e36e6-a5b2-48e4-8e77-848e7ef7df5f","resolution":{"observed_at":"2026-05-17T20:33:27.089651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the Capabilities of Large Multimodal Models on Dense Text","venue":null,"work_id":"1de109ef-5f8f-44fa-86d7-453288b3bb64","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:e6213400b81383d68141cefbfa215c5f730aeda018ebbabc0c3d2cc8f40e6939","observation_id":"eb36e648-22c6-455b-822a-1135fb48381c","resolution":{"observed_at":"2026-05-17T20:33:27.092114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Onechart: Purify the chart structural extraction via one auxiliary token","venue":null,"work_id":"3d0f90e9-f548-4412-9a7b-023f0542a2b3","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5afe9c3aba79978c13b0189e3531e04e4bbc0edbe718a5bf40401477af7d999c","observation_id":"d178af2b-32f4-4c72-a151-796e3b1f2abe","resolution":{"observed_at":"2026-05-17T20:33:27.094816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Document understanding dataset and evaluation (dude)","venue":null,"work_id":"b95afbf2-ba95-4c3e-9370-33d4b6d42684","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:cfb3e1da280cee15a0295c9a1f5b1a44d9853fd61f9efa07ab4e3d2a19243573","observation_id":"07d29817-b1be-4c1a-bbec-36aef3b6d76c","resolution":{"observed_at":"2026-05-17T20:33:27.097229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"5a0bbafc-b500-4a9f-8ddb-53a20681a162","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5f4c1026c3ca273a8442f3c344abb17e1dce0b3bb8869d7f74a8e0dacdaca1bd","observation_id":"e7154c4e-8d91-4eb6-98a3-b7197d2c7be5","resolution":{"observed_at":"2026-05-17T20:33:27.099615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical multimodal transformers for multipage docvqa","venue":null,"work_id":"c65c8560-ead4-44c3-9f07-76f03e994993","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:ff129d059200fde37d497005889a55189f542447b0abe6cc8eb64ba5c4e2ae68","observation_id":"9f6e4434-1f6d-461d-bb1c-422f535b82a2","resolution":{"observed_at":"2026-05-17T20:33:27.102332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18424","last_updated":"2025-07-15T17:55:08Z","snapshot_observed_at":"2026-07-06T20:12:45.239449Z","submitted_at":"2024-12-24T13:39:32Z","title":"LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating","version":3},"cited_work":{"arxiv_id":"2412.18424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18424","snapshot_observed_at":"2026-06-30T21:05:04.183712Z","title":"Natural Language Engineering, 30(4):870–881","venue":null,"work_id":"8e1af28c-962a-43bd-9103-ccf2ce84907e","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.18424","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:63409b66dd35248118cde127cab3e7af5129a852fe1f23e3d19baf4020ca958c","observation_id":"c0b21ae1-ae24-4b69-9d6f-2453b223b098","resolution":{"observed_at":"2026-05-17T20:33:26.800978Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"7e8c46c3-5ac2-4eed-a9f6-6337d448d058","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:b19dc2b46f8662d54c2c87a3b3eda28cb08b2c88411a3b522f475189720d0866","observation_id":"34cb1f0c-4152-4cd7-bcbe-206f055ac3ba","resolution":{"observed_at":"2026-05-17T20:33:27.107488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:d2c2211a8343d69beb8c321d68fc12bdcb5de5fa59e676e0ab7554a29b9ae094","observation_id":"661e7cc0-3ca7-438a-a978-04ee1868d002","resolution":{"observed_at":"2026-05-17T20:33:26.804574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"2434cace-1e71-423a-a367-ada9266af3a5","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:05dcd525f960a0ab980357da5cd44d9a8bf07f20a97036d69790006d26b9758a","observation_id":"5a385b12-c2d5-42a1-bf5e-1288ca0fa732","resolution":{"observed_at":"2026-05-17T20:33:27.113098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:9943ae009a8a1b301bdf4dfffc99891a24e621051e452de7d5e794ef5c2ee82c","observation_id":"e70fe4f2-ee1e-4a49-ba6e-5e76eff24780","resolution":{"observed_at":"2026-05-17T20:33:26.807978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"f84e957b-5ec2-4130-8c67-f086cf6362c5","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:83f45cbcbefd698bbea42715a025d4d793f70522a8549e50da5aac69582483fd","observation_id":"6a90eab5-3f11-4789-bb32-6123be621949","resolution":{"observed_at":"2026-05-17T20:33:27.118431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":"2410.07073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-07-04T13:59:52.216141Z","title":"Pixtral 12B","venue":"cs.CV","work_id":"9ad2b071-82d8-4cfa-b994-b9975094b575","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:f5b095612138da82fae8e7b67e5d775539f1c14343627c58d7eaf97da7c3dd8b","observation_id":"2dfdd845-0f96-4b05-b5ed-982407f30943","resolution":{"observed_at":"2026-05-17T20:33:26.811367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:79efd6a9cf6e7f4fe34890f7da7b9808ef356cb20bcf9f8bf408e742ffdc5df8","observation_id":"d99554a9-9e11-4b29-b58a-88440b6ad2d3","resolution":{"observed_at":"2026-05-17T20:33:26.814912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:32b57ef13a456ffc47577fafab29b37840829a2b7c6f86b9ec2ff3094a73b806","observation_id":"4f54d04a-5df7-454b-8280-6272c16950d3","resolution":{"observed_at":"2026-05-17T20:33:26.818046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:679bcd9d3208a4f72ee02318148ba265e92989bb940d2c2573862ae6cccab547","observation_id":"3150e90b-6433-49d9-a42d-f2179f727af3","resolution":{"observed_at":"2026-05-17T20:33:26.822335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-06T10:47:13.078840Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:f5b8bfb50263b803828b45f3df53887fe7226f3a933ead4781eed7413e3a9113","observation_id":"b0878f72-9289-411e-b773-26e5a6ef4bc4","resolution":{"observed_at":"2026-05-17T20:33:26.826379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"330ce1c7-ad1c-4554-a77a-219fa94af321","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5cbec61a07d2f2c623dcf064ba9f211e9bea22065485c139a1e6a2bfd5550bc5","observation_id":"f6a59630-a4d6-49c0-a69b-a73d6e7254c1","resolution":{"observed_at":"2026-05-17T20:33:27.132896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:66e815fb92fea6cc974c9cd5144e8bf2ee1fa0c5a75a9c0503663fb19f4f94a2","observation_id":"577cebb0-3551-4368-807d-7bc6469ef662","resolution":{"observed_at":"2026-05-17T20:33:26.829624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5 Sonnet","venue":null,"work_id":"78368e24-baa7-401a-9861-406ff3e1631f","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:74a9a57d0c6c507feeca9ccd5d5665f82eab610ef20fcf2b249ea9987645dbb0","observation_id":"da013c29-5dc4-4a60-9bc0-5cd420e35f58","resolution":{"observed_at":"2026-05-17T20:33:27.138039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-1V","venue":null,"work_id":"9869d3ce-badf-4112-98b4-bb79c6a7ceeb","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:1cc4298986568b6728ac49cf5edcb2d8503944c32ed6f5f91ea10012933c3c69","observation_id":"c8613577-097e-4035-a125-481c9210224e","resolution":{"observed_at":"2026-05-17T20:33:27.140325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-based table recognition: data, model, and evaluation","venue":null,"work_id":"1c81a02e-d865-4775-bc4a-d6eea6e859f0","year":2020},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:4c09a1456fc7ae0cbeca75539beec974ca325b5d4a6751d72059f302d94e642d","observation_id":"32211377-a178-40ad-ae96-9fb0f9d7de21","resolution":{"observed_at":"2026-05-17T20:33:27.143506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"ded716a9-9c5a-41de-80a1-368486cae1f8","year":2002},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:8c9c6b85174843ffb89248e164bbdcf1bf043e0c07525973ec00e60cf2e8bc22","observation_id":"37896fe2-f706-4675-a7c2-2898d5c65f1a","resolution":{"observed_at":"2026-05-17T20:33:27.146163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"METEOR: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"d4cd263c-f74e-4db2-8429-254792c0aa18","year":2005},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:2ec27fcadeb60a3e250f5b78028f1fdc9454647852ca9b68fbb41c7d44fd1912","observation_id":"dcfcacb3-841a-4db7-8457-acf8f6e7948d","resolution":{"observed_at":"2026-05-17T20:33:27.148870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:372c2ee9390e2b4d678256d3f52ec2366118f6def2a8d02bf75c108696588719","observation_id":"65b5187b-86ed-4f2a-96db-a067b88a9121","resolution":{"observed_at":"2026-05-17T20:33:26.833516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition","venue":null,"work_id":"117e7795-767a-4587-b657-3128f7306966","year":2016},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:ccab8168ce4c889fbf18828799901f7257d2731858117ed83808314241869e40","observation_id":"3e182cd3-1e23-49e5-9654-3737dff2599a","resolution":{"observed_at":"2026-05-17T20:33:27.153643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Read like humans: Autonomous, bidi- rectional and iterative language modeling for scene text recognition","venue":null,"work_id":"1c6e327b-6919-4a68-b3c5-dce02212cc13","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c8eae0c5f28a527870885aea93cd905786e068b0c0a04b4de4db0138f0e0a9db","observation_id":"5bde4b28-72e2-42eb-a54b-42c084b4aff6","resolution":{"observed_at":"2026-05-17T20:33:27.156127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aster: An attentional scene text recognizer with flexible rectification","venue":null,"work_id":"2f69fe20-3a10-4118-abab-a594e14fc94b","year":2035},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:8550e08bf6166646860b196b6c3f7c26d1f48c0c3cb05c644b16c213b882bdb2","observation_id":"2fb446a8-a1c8-4a2d-a4d8-8107ef434a1c","resolution":{"observed_at":"2026-05-17T20:33:26.939516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Master: Multi-aspect non-local network for scene text recognition","venue":null,"work_id":"32b8e1bd-25dc-4f43-8e6e-f98740dca50a","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:3cc1ba45272515b4a6b4d44bbbe0e2cd4798b5bd9f4b760ab90c80d2ae6086b8","observation_id":"5f0d324b-1d7e-4a6e-be06-1b35442b0b88","resolution":{"observed_at":"2026-05-17T20:33:26.942767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/124","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SVTR: scene text recognition with a single visual model","venue":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","work_id":"f06ec317-f299-413e-b68c-6973d24759b9","year":2022},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:242ea414af832976e0e88f00a7e04860dea946c9e53b1331840c901ffaa2001b","observation_id":"12223856-c908-429a-8ea2-20456aa9a480","resolution":{"observed_at":"2026-05-17T20:33:26.675900Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abcnet: Real-time scene text spotting with adaptive bezier-curve network","venue":null,"work_id":"0c98cdee-ac1d-455c-a9d2-ea1c21e087e9","year":2020},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:0aaa8b1472af11801df69ac7296781b182fc8b8af57535903e735ad83fe9204e","observation_id":"983b0bd0-82de-424f-a91e-bff1020715b7","resolution":{"observed_at":"2026-05-17T20:33:26.949356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abcnet v2: Adaptive bezier-curve network for real-time end-to-end text spotting","venue":null,"work_id":"3f79ae5e-a479-49ea-800b-d098081b1779","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:671c5377ce5da5c0ce01292a4e16b3b112e5fb5147df74da7981cbe5cd75649a","observation_id":"07fec2f0-bbf4-43e3-b0f8-349df359c188","resolution":{"observed_at":"2026-05-17T20:33:26.952357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text spotting transformers","venue":null,"work_id":"e7dc0209-0bab-4941-941e-117914f3d0a6","year":2022},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:ea2c7f0b8c8b0e062d86cf6136e6b86ba57a12a2752514f90b06af20ecc9d35e","observation_id":"c90d9932-5c5e-4cf5-a7c4-d28606d46b4e","resolution":{"observed_at":"2026-05-17T20:33:26.955050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Total-text: A comprehensive dataset for scene text detection and recognition","venue":null,"work_id":"1742938c-57f4-4dc9-bc6a-cf82515cb29a","year":2017},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:7ae08449a09ff11dbce2e32562522686743b9a5fe0c2c4ab23d5cb965ccb286e","observation_id":"41a82524-2cb0-49af-ab68-504105b1385a","resolution":{"observed_at":"2026-05-17T20:33:26.957603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-01T15:04:20.648996Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":"2409.01704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-07-08T20:35:34.407064Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","venue":"cs.CV","work_id":"67b1592f-02b6-4056-b3fe-cc594e484192","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:53186a20300a6b3ecc6bb6ff658dea081abfd14ddf4345cb8a36fcbb910a25bb","observation_id":"8b2f4c51-28a2-4949-a9d1-5d03b6f70994","resolution":{"observed_at":"2026-05-17T20:50:57.985910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":"335ed117-69fe-49b1-90e9-1e3c36c428b2","year":2013},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c792aa3d3ca806dd14998470c64bd07c1d3025612c4ad349514a0cf5d301138c","observation_id":"b911baa8-73f5-4975-9ec5-87f9729b5a6d","resolution":{"observed_at":"2026-05-17T20:33:26.962754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end scene text recognition using tree-structured models","venue":null,"work_id":"ed4264f3-9cff-449e-89ac-ed9c50dea77b","year":2014},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:03e15ea5366d108809c28fd9b1b7470f2d89ddd2ddcd65d36c777b3386193465","observation_id":"6f338d15-e4a7-43f4-9305-4ccd7c5c1b1d","resolution":{"observed_at":"2026-05-17T20:33:26.965030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text recognition using higher order language priors","venue":null,"work_id":"5c448cae-8639-428f-bbff-10193ae545cd","year":2012},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:3511c97a15a31fae74d3df6f155324bf87c317992b0facc6f6e09fd90790995a","observation_id":"385ea377-1a45-49e5-9769-e0c7c1274abd","resolution":{"observed_at":"2026-05-17T20:33:26.967853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"ab6db3ae-629a-4d6c-aace-1bd75ec66fd8","year":2015},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:bae3a1c580042b381a5afa3bf6eb2adaf66ea155d200254785b346e2433e779a","observation_id":"0f2e0e0b-f52b-4b72-8df7-bb4e3d6ec5c0","resolution":{"observed_at":"2026-05-17T20:33:26.970370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patcog.2019.02.002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Curved scene text detection via transverse and longitudinal sequence connection","venue":"Pattern Recognition","work_id":"19c5bd7d-2557-49c1-ab6a-636927bef9c0","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:50b9b1b8824104b628745ee546a9c4f52bf95058c5106a338b063870d4db0858","observation_id":"7dd7e8c5-71b2-445f-a5b0-f404b1d4efbb","resolution":{"observed_at":"2026-05-17T20:33:26.671202Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:d72f79e3483dd24be358ada3dc69229dccdd48e24ca23dceea0b54ff5d0521b5","observation_id":"c0d259c6-f13f-4a01-86bc-96ac9a44bcdf","resolution":{"observed_at":"2026-05-17T20:33:26.841117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A robust arbitrary text detection system for natural scene images","venue":null,"work_id":"7307988f-75d5-4df9-9941-2ae37a49d1f4","year":null},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:3ddd68ee572eb332a7b7858e1f4680b2a67c9bfdf297145512fc37b13e569e0b","observation_id":"53d94890-9112-4506-a167-363b64c1ea64","resolution":{"observed_at":"2026-05-17T20:33:26.978037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available: https://api.semanticscholar.org/CorpusID:15559857","venue":null,"work_id":"8aea0b4c-a8d4-4a38-be02-3600bfcb24a7","year":null},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:2e696f1595f04d31fdc5bc7f70c4b4acdf757a7a541bd6d2ac7b306425ebee2d","observation_id":"3e2ef60e-aa7f-4e32-8a2b-6fa402dac245","resolution":{"observed_at":"2026-05-17T20:33:26.980472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/iccv","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:26:58.784811Z","title":"PoseNet: A convolutional network for real-time 6-dof camera relocalization","venue":null,"work_id":"135418b1-cafd-49fd-803d-1ca6433d4b1b","year":1990},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:1cbad2b2782c80fd0a938d0f1093ed15ad37d7f55891c74edc5c226b2f067306","observation_id":"4de4d014-8b5a-4139-9a1e-776a1d968bf7","resolution":{"observed_at":"2026-05-17T20:33:26.692682Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward understanding wordart: Corner-guided transformer for scene text recognition","venue":null,"work_id":"6e45fcb5-8db0-4e0b-a822-de8826901b8f","year":2022},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:1a4709d8071daab9f579fe5dd344161663fa1a3be2b4ccec1b6b9ef72792be3d","observation_id":"7fe56763-1822-40f2-8a43-c475d94c5238","resolution":{"observed_at":"2026-05-17T20:33:26.985891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The iam-database: an english sentence database for offline handwriting recognition","venue":null,"work_id":"4c097d5c-1b51-4382-b2a9-e02e273e6c80","year":2002},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:96fa85b61824e3245ce707c34422982317476dc41acad271386f8a713c608a64","observation_id":"1c759e9d-7e79-4c0a-a64e-b895ba9e3e2d","resolution":{"observed_at":"2026-05-17T20:33:26.988283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of ieee international conference on frontiers in handwriting recognition","venue":null,"work_id":"5d25eb79-ecab-4766-87fc-ee28cb5ace85","year":2014},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:63a391356adb4521f5a0270858bf4a9b9de4c74483b7f9d74c7e4cada65ef288","observation_id":"3ea8636d-2722-41a0-ad11-d4012ab98779","resolution":{"observed_at":"2026-05-17T20:33:26.990689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From two to one: A new scene text recognizer with visual language modeling network","venue":null,"work_id":"3ea1217c-9495-489d-8cdc-0ac4886060d6","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:321278a04191764c515d309709e6aa54d173e3ddcaab048a076a1abe122441e5","observation_id":"15fe4a3f-5b4f-478e-bbf7-9858853599e2","resolution":{"observed_at":"2026-05-17T20:33:26.993241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02170","last_updated":"2017-12-06T13:02:43Z","snapshot_observed_at":"2026-08-06T07:21:26.262927Z","submitted_at":"2017-12-06T13:02:43Z","title":"Detecting Curve Text in the Wild: New Dataset and New Solution","version":1},"cited_work":{"arxiv_id":"1712.02170","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.02170","snapshot_observed_at":"2026-07-01T16:55:51.052478Z","title":"Detecting Curve Text in the Wild: New Dataset and New Solution","venue":"cs.CV","work_id":"8ec37892-15a3-4aae-9c49-52f18d112b82","year":2017},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/1712.02170","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:7749b38cfdcd26f733052f11893d753578fe8d7e17a13bf3ead37f2d2a1fe26b","observation_id":"046b2e8c-be9a-47f8-a872-32c9c3744b5d","resolution":{"observed_at":"2026-05-17T20:33:26.844642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards end-to-end unified scene text detection and layout analysis","venue":null,"work_id":"2555c922-3ed9-4f07-8464-7b2ee8a8c0c4","year":2022},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:963b710e2bb93995aee015a7143e0698ae446bfd5e0c178c97361bcd89250189","observation_id":"f97fa4a5-71a0-4486-90e2-e0c8601ae257","resolution":{"observed_at":"2026-05-17T20:33:26.999790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11390-019-1923-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A large chinese text dataset in the wild","venue":"Journal of Computer Science and Technology","work_id":"9dd23fd9-ed22-4477-b019-e30927f70f7c","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:97137e49f4c628d67ebe68705b6a0697381b3dc0951046fd34ef689fd8ec9bda","observation_id":"b2b307b3-5eda-4f9f-84f6-fac6583d7208","resolution":{"observed_at":"2026-05-17T20:33:26.688331Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar2017 competition on reading chinese text in the wild (rctw-17)","venue":null,"work_id":"13975adf-3b3d-4d1e-b6d4-3cece1055fb3","year":2017},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:e2913e644a77514b5005e2163b53ca851bf3ce7cfe356f32111b0b263381425d","observation_id":"e132b10b-e3d0-4cfd-9c65-453e7f2bc014","resolution":{"observed_at":"2026-05-17T20:33:27.005039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.09641","last_updated":"2019-12-20T04:50:17Z","snapshot_observed_at":"2026-08-06T13:30:25.358493Z","submitted_at":"2019-12-20T04:50:17Z","title":"ICDAR 2019 Robust Reading Challenge on Reading Chinese Text on Signboard","version":1},"cited_work":{"arxiv_id":"1912.09641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.09641","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1912.09641 (2019) 8","venue":null,"work_id":"f19d2ec8-ed91-4f3a-972a-3ac0d01e90d7","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/1912.09641","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c9182e53b29dc6ea7a28f74dd04f4f780e99bd4d7d9eda033fa307b3d5ef4595","observation_id":"94fd4264-ba9a-4722-8400-535deb6a62dd","resolution":{"observed_at":"2026-05-17T20:33:26.848540Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.07808","last_updated":"2020-02-13T04:50:38Z","snapshot_observed_at":"2026-07-06T08:22:27.970816Z","submitted_at":"2019-09-17T13:54:24Z","title":"Chinese Street View Text: Large-scale Chinese Text Reading with Partially Supervised Learning","version":2},"cited_work":{"arxiv_id":"1909.07808","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.07808","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chinese street view text: Large-scale chinese text reading with partially supervised learning","venue":null,"work_id":"6ba2a3ba-3dd9-438c-8e4a-fef6f1dbc47c","year":2020},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/1909.07808","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:65082fb61de26ea2dd4bd71a794f34b30e3a839a65439f6b286300d733fd8de6","observation_id":"9f4caf50-a2d2-41ed-9afe-350be61b7857","resolution":{"observed_at":"2026-05-17T20:33:26.852586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08719","last_updated":"2023-05-21T14:22:39Z","snapshot_observed_at":"2026-07-06T15:27:21.186782Z","submitted_at":"2023-05-15T15:29:06Z","title":"M$^{6}$Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout Analysis","version":2},"cited_work":{"arxiv_id":"2305.08719","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08719","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M 6doc: A large-scale multi-format, multi-type, multi-layout, multi-language, multi-annotation category dataset for modern document layout analysis","venue":null,"work_id":"043ce4ab-809b-4107-a927-5afaf90dd8f2","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2305.08719","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:5a62f286f92c8f063af70a49f9c150631b87f3ca8b6a6c49e260e6379284a910","observation_id":"90714572-d6da-4b4f-8a51-8d8188ee570c","resolution":{"observed_at":"2026-05-17T20:33:26.856629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":"b9a6b550-8e0a-4750-b17d-09565ce8c252","year":2017},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:ac1ea2811bf3bcc05cf8ff547760aa51cc35b1f6b8417da10315d4a7d0979498","observation_id":"562740c0-5339-4776-bfc0-5b9fd848ab61","resolution":{"observed_at":"2026-05-17T20:33:27.014000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"0cfa4112-521e-461e-9511-0a6ec0e64a19","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:429b3102c7980fd27daff90645cfdd8c264d9f61b9dad9fad586e3be5230b478","observation_id":"fb0e42b6-1c20-452b-9a78-faa42f6c9d56","resolution":{"observed_at":"2026-05-17T20:33:27.016419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"c3d1d7ba-5d72-4dc9-a00b-24fc5bf41ace","year":2019},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:189abf07412db86f9a6cf6fd6735cdd73f3d60a57f22bc6e61fd0e9ef903670f","observation_id":"6b4b9853-5e77-4f7b-92ff-b0c21fc3ce21","resolution":{"observed_at":"2026-05-17T20:33:27.018868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual information ex- traction in the wild: practical dataset and end-to-end solution","venue":null,"work_id":"07f19b75-260b-4c5e-a57d-548f0bd2c8ed","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:4757318095d74cb63dac49f5a43caacad404ea98b6f9526be41d694a8536ab46","observation_id":"2be0a722-dd3d-4494-afdd-e6946371d6b9","resolution":{"observed_at":"2026-05-17T20:33:27.021439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":0,"verified_exact":37,"verified_fuzzy":55},"total_outbound_references":156},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 156 outbound references and 47 inbound Pith citation observations for arXiv:2501.00321."}