{"as_of":"2026-08-05T07:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:805b93e6445cf6719e36197eef6f47b572ab798c74ec449537e7616bebf042aa","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T13:25:31.884175Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:46:40.906153Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T17:07:25.732459Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2511.14998","last_updated":"2026-04-07T03:13:19Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-19T00:41:14Z","title":"FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:52.701262Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2511.14998"},"observation_digest":"sha256:94c8bfe7814596a4ec56d9f3ed65a4d42f2d9b7386107dcdeaeaccd41652b556","observation_id":"5307e98b-c8c7-4a47-bb0d-32f89cf36d49","resolution":{"observed_at":"2026-05-17T20:20:11.529414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-03T20:28:22.668743Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19945","last_updated":"2026-06-01T20:51:23Z","snapshot_observed_at":"2026-08-03T20:28:17.254775Z","submitted_at":"2025-11-25T05:35:32Z","title":"Low-Resolution Editing is All You Need for High-Resolution Editing","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:28:22.668743Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2511.19945"},"observation_digest":"sha256:b4d06f2a56347425af2c12105d9a911f181c57cbe03fc86a242f2f3e4f37a424","observation_id":"fa00f7a0-fc2c-4669-8566-93e8311d8c49","resolution":{"observed_at":"2026-08-03T20:28:22.668743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-03T14:16:50.808178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-03T14:16:48.399963Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T14:16:50.808178Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2512.21095"},"observation_digest":"sha256:a9398bd563da090aac31bd297e34c17e5a4d91117578f40e4d3321f1ca18fba7","observation_id":"7b66e0d8-457f-4a8e-9507-8d98c1bbc67c","resolution":{"observed_at":"2026-08-03T14:16:50.808178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2601.13606","last_updated":"2026-04-29T05:49:25Z","snapshot_observed_at":"2026-07-06T22:42:12.887517Z","submitted_at":"2026-01-20T05:11:44Z","title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T13:12:01.889341Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2601.13606"},"observation_digest":"sha256:36ff7c3e660bb22a8a0f9074622a05d6c8452e3890a9eed3cda0e8463bc5b0ce","observation_id":"3dcf2ae4-de54-485b-8b49-3ff70fbcc97c","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2601.21957","last_updated":"2026-04-03T06:49:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T16:35:04Z","title":"PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T09:40:09.955493Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2601.21957"},"observation_digest":"sha256:5f4ee1d916291de68ed96a0cbf602830387d0475118a07fff7025e2152b62286","observation_id":"752379fa-e195-4dd4-aaa4-32406bf79e66","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-02T23:44:38.680422Z","title":"arXiv preprint arXiv:2509.22186 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12957","last_updated":"2026-06-29T06:43:50Z","snapshot_observed_at":"2026-08-04T00:07:49.527953Z","submitted_at":"2026-02-13T14:22:10Z","title":"HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T23:44:38.680422Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2602.12957"},"observation_digest":"sha256:f12e522a4a45e11612f1b1a0311bea0316b778f582c164d6768f79f784138909","observation_id":"c18ac8ea-f245-4968-b645-40226da52518","resolution":{"observed_at":"2026-08-02T23:44:38.680422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-03T01:17:21.931070Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13318","last_updated":"2026-02-10T19:49:06Z","snapshot_observed_at":"2026-08-04T04:09:09.542319Z","submitted_at":"2026-02-10T19:49:06Z","title":"DECKBench: Benchmarking Multi-Agent Frameworks for Academic Slide Generation and Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:21.931070Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2602.13318"},"observation_digest":"sha256:ef1b4a7c946f7fb1285cc6d643e4141aafd236c6a70ec7363520f0e5fa69a577","observation_id":"7542957f-7bc6-487a-9840-64a2f94a9087","resolution":{"observed_at":"2026-08-03T01:17:21.931070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-02T19:46:45.507654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01121","last_updated":"2026-07-03T08:44:20Z","snapshot_observed_at":"2026-08-02T19:46:41.368155Z","submitted_at":"2026-03-01T14:13:11Z","title":"HVR-Met: A Hypothesis-Verification-Replanning Agentic System for Extreme Weather Diagnosis","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T19:46:45.507654Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2603.01121"},"observation_digest":"sha256:1cb4f4bb3647fbe85e37cc347062dad946f494a384ea75175f047651c0dd6628","observation_id":"9fb10128-ac5d-4d04-b332-6cae22609192","resolution":{"observed_at":"2026-08-02T19:46:45.507654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-02T18:54:56.763823Z","title":"Mineru2.5: A decoupled vision-language model for efficient high-resolution document parsing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.04205","last_updated":"2026-06-22T03:43:39Z","snapshot_observed_at":"2026-08-02T18:54:54.324790Z","submitted_at":"2026-03-04T15:49:06Z","title":"Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:54:56.763823Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2603.04205"},"observation_digest":"sha256:5dd43281f056f514f53acc5d953a6edd2380df21061f86ecf27e60fe52f4c590","observation_id":"65aa4065-9a5e-4434-97c5-ff115bf9e586","resolution":{"observed_at":"2026-08-02T18:54:56.763823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2603.09677","last_updated":"2026-04-08T07:57:35Z","snapshot_observed_at":"2026-07-06T22:48:30.706783Z","submitted_at":"2026-03-10T13:46:32Z","title":"Logics-Parsing-Omni Technical Report","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T13:37:44.189839Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2603.09677"},"observation_digest":"sha256:bb9440861697596394dd73b8ea534bd7fffd3562989c056f322e65d4eb3c4733","observation_id":"28f09890-f0a7-4b23-bd7f-6bc39be97dee","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2603.13224","last_updated":"2026-05-09T03:24:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-13T17:58:14Z","title":"Visual-ERM: Reward Modeling for Visual Equivalence","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T11:19:42.002790Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2603.13224"},"observation_digest":"sha256:18664ad6e482c2386fb65fc284fbc2be3d902c6cd45026bf4e1b3311941ce617","observation_id":"dba10c65-cbe3-4939-b45d-da9ad6c94229","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2603.24326","last_updated":"2026-04-03T06:49:01Z","snapshot_observed_at":"2026-07-06T22:50:28.640006Z","submitted_at":"2026-03-25T14:08:56Z","title":"Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T00:25:19.782732Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2603.24326"},"observation_digest":"sha256:aebaaacfebd1fe1099a40c1377a4eadcc705022e1ed08fe468450f7df8df3f2c","observation_id":"7e5ca173-117e-4cbd-be28-634907b1b85e","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2604.00161","last_updated":"2026-04-21T01:45:08Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T19:09:55Z","title":"Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:53.449935Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2604.00161"},"observation_digest":"sha256:0fdc91325c053322d6bed693b29abb5e101f9b48ac682027060ea09974fd6f04","observation_id":"eb39dfcf-ab99-401f-b733-d8c5ea767c99","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2604.02692","last_updated":"2026-04-03T03:36:36Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T03:36:36Z","title":"Parser-Oriented Structural Refinement for a Stable Layout Interface in Document Parsing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:44.073353Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2604.02692"},"observation_digest":"sha256:7767f12fc34e897b7a5e01601cd607b9ced12f86ccf740b86a29372156e548c8","observation_id":"5e2c53d9-5a58-4515-a350-7428cee67402","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2604.02794","last_updated":"2026-04-03T07:02:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T07:02:13Z","title":"CharTool: Tool-Integrated Visual Reasoning for Chart Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T20:07:23.153064Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2604.02794"},"observation_digest":"sha256:87b956335083d5595386385e5f73f402349a1bb1b680f862c9164aa8730e7eb7","observation_id":"8f56fab7-0eb4-41c2-8843-e7566bff37e8","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2604.02880","last_updated":"2026-04-17T07:24:14Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T08:44:45Z","title":"InstructTable: Improving Table Structure Recognition Through Instructions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T20:53:57.029294Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2604.02880"},"observation_digest":"sha256:7b33cb15ac94225f24d24160a83aec0ec77ffcd6f9df5bf0046bd0a6f5cb40e5","observation_id":"41be4938-f2d1-4e54-b221-7dbd782dd1e7","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2604.04771","last_updated":"2026-04-09T09:16:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T15:44:18Z","title":"MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:58:41.377996Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2604.04771"},"observation_digest":"sha256:6845916e211f150d3282c335c388318ddbf74dd29d77c934cfdb0241bd2d211e","observation_id":"0cef38e2-9ff6-4cf5-9a26-6595a41f6fd1","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2604.10167","last_updated":"2026-04-11T11:31:11Z","snapshot_observed_at":"2026-07-06T22:58:51.931478Z","submitted_at":"2026-04-11T11:31:11Z","title":"Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:26:44.498777Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2604.10167"},"observation_digest":"sha256:235a5e56df3e4ef4b108e8949ac3dbe79f3effd7b5f11bd8f0df30ca3e59a61a","observation_id":"2733da71-3ba4-4760-9c90-0576bfba7102","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.01345","last_updated":"2026-05-09T06:29:21Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T09:39:42Z","title":"The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T14:18:23.560561Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.01345"},"observation_digest":"sha256:b34363005760786a1bda428ad8716cc2d4fa771680d118022572e876f6ce55de","observation_id":"8c0534f0-97b8-4363-bd27-665910ca53f7","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.01345","last_updated":"2026-05-09T06:29:21Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T09:39:42Z","title":"The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:40:35.576232Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.01345"},"observation_digest":"sha256:647b8788d55098cc76e4688143ad8738230185bf841c0927bc4404932ea3214e","observation_id":"22de78c7-d998-443e-bf55-9c5167dae9d5","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.02392","last_updated":"2026-05-04T09:34:30Z","snapshot_observed_at":"2026-07-06T23:15:27.816549Z","submitted_at":"2026-05-04T09:34:30Z","title":"Is It Novel and Why? Fine-Grained Patent Novelty Prediction Based on Passage Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T18:41:19.441055Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.02392"},"observation_digest":"sha256:e6280e14ebff2ebdafe01edd4d1adcc2bbacf112a495efe534ccd6f1817f7b4a","observation_id":"4f03c4df-cb9e-4ae1-92ef-4c05d49cc088","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.07492","last_updated":"2026-05-08T09:30:31Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:30:31Z","title":"How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:28:02.152600Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.07492"},"observation_digest":"sha256:e39dc7c44d87f95e8e632775d5a8a5e57d50d184329224f9ba4385daf1736d97","observation_id":"7c18a55d-5e74-4ea7-acbf-fe93182b4c01","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.09927","last_updated":"2026-05-11T03:23:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T03:23:46Z","title":"Information Extraction of Nested Complex Structure of Quantum Cascade Lasers via Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:40.693392Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.09927"},"observation_digest":"sha256:45085bc92624abc920f36362c9e914e5cf2c845bb682deeb42db3827753abfa1","observation_id":"cb55df40-c513-486e-9e4b-86746d7b6be5","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.12882","last_updated":"2026-05-13T01:54:42Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T01:54:42Z","title":"CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T20:37:36.144960Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.12882"},"observation_digest":"sha256:a899eda8ae2376f241e14f91c01e3f28796ff8ef241d915a58dfd33711f7cce2","observation_id":"8a5459e4-6c2b-43ee-89df-a22adc55de57","resolution":{"observed_at":"2026-05-17T13:25:32.206292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.17356","last_updated":"2026-05-17T09:50:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:50:16Z","title":"UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T13:42:59.633053Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.17356"},"observation_digest":"sha256:f9e3b583034fba7fcb65243f6dc0bbaf45463ac11c79948d5450159eddf2c571","observation_id":"29fb8c45-ea74-4d90-837b-d875804041a2","resolution":{"observed_at":"2026-05-20T13:43:19.443498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.21481","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-02T10:16:35.192642Z","submitted_at":"2026-05-20T17:59:03Z","title":"AiraXiv: An AI-Driven Open-Access Platform for Human and AI Scientists","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-21T03:58:01.585170Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.21481"},"observation_digest":"sha256:96515b0bdfda591d831f8f22f83852d995804e86a6651dae60d15a1de7244f63","observation_id":"6c7d8c8c-3cab-46f4-95f8-798f47a7e05e","resolution":{"observed_at":"2026-05-21T03:59:32.440279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.22100","last_updated":"2026-05-28T08:19:59Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T07:36:41Z","title":"MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T05:58:04.055855Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.22100"},"observation_digest":"sha256:5952e613514c14229de632b008891d3e844ea80e75ba17adc6d0b00c72601ebf","observation_id":"e8c0c729-5609-4b36-9035-54bf283284c9","resolution":{"observed_at":"2026-05-22T06:01:08.740255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.22100","last_updated":"2026-05-28T08:19:59Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T07:36:41Z","title":"MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T17:37:33.750306Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.22100"},"observation_digest":"sha256:b5e8d97a6a10650d5a79ee842b6dcf4e706f1deca706ed4ed7f9bb36dfaa002c","observation_id":"67fa30c4-b48b-47a9-a754-8e52982c1b40","resolution":{"observed_at":"2026-07-01T15:05:48.205995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2605.27978","last_updated":"2026-05-27T05:16:21Z","snapshot_observed_at":"2026-08-04T08:59:45.162198Z","submitted_at":"2026-05-27T05:16:21Z","title":"ABot-OCR Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:17.221676Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2605.27978"},"observation_digest":"sha256:1dbe1442b4cebe977ee08071d6a8ecb723975e71250b68338d58e668a6d0dfed","observation_id":"aed0d763-fb88-4e84-b5cf-0af1f25bea24","resolution":{"observed_at":"2026-06-29T13:33:28.142642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2606.03054","last_updated":"2026-06-02T02:44:27Z","snapshot_observed_at":"2026-08-02T04:55:02.222478Z","submitted_at":"2026-06-02T02:44:27Z","title":"ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T10:38:41.735204Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2606.03054"},"observation_digest":"sha256:a5238d9c43757637d4f5e678acd496f07f31b6e2c6bd7dfb214fea2d9740d891","observation_id":"b12a3b30-40e9-4781-86b7-51ab969ef015","resolution":{"observed_at":"2026-07-02T02:46:28.922465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2606.03264","last_updated":"2026-06-02T07:27:03Z","snapshot_observed_at":"2026-07-06T23:43:31.629075Z","submitted_at":"2026-06-02T07:27:03Z","title":"PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:39:14.444486Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2606.03264"},"observation_digest":"sha256:1f38eff2a84881e7f2e6c652f2f6734425c4c5461148d4dde1cf5b93ee424a5e","observation_id":"a994715f-010f-4de8-9c72-e7859120a4ad","resolution":{"observed_at":"2026-07-02T02:46:28.765289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2606.23344","last_updated":"2026-06-22T13:48:39Z","snapshot_observed_at":"2026-07-06T23:58:07.236199Z","submitted_at":"2026-06-22T13:48:39Z","title":"RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T09:19:38.285839Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2606.23344"},"observation_digest":"sha256:1e577415b25629fa14738890956e90332fbf176c064a8e5a740e23e17f36297a","observation_id":"2834b552-aa6c-49cf-907d-485eda7aab09","resolution":{"observed_at":"2026-07-04T09:59:45.192479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2606.29905","last_updated":"2026-06-29T07:41:39Z","snapshot_observed_at":"2026-08-02T15:11:59.921772Z","submitted_at":"2026-06-29T07:41:39Z","title":"StrucTab: A Structured Optimization Framework for Table Parsing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:22:21.694355Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2606.29905"},"observation_digest":"sha256:8aaa2aea54cf82a5a3ad9bd9ceb6108cd4eda805a43cabadcd79b0c5acfae66f","observation_id":"ad8863fc-922d-48e5-b117-06ef60504f21","resolution":{"observed_at":"2026-06-30T06:24:18.949444Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":"2509.22186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-07-10T17:07:25.732459Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","venue":"cs.CV","work_id":"6e06ed47-1ffa-419d-a9b6-145d5184c6cf","year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-04T04:16:32.610236Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T17:02:28.089092Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1cf216e7cad0bcfbcbc39945e936d435c0d862ae78586e44edf4aa0f01ad82d8","observation_id":"37d3c6b0-0e50-44ae-bfc2-b56fce723207","resolution":{"observed_at":"2026-07-10T17:07:25.733862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-02T08:03:48.857432Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-04T04:16:32.610236Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:48.857432Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:adcd67bc6f367364459726074a3a4682b3e2911b39a3f4b5cb0e27998433f50c","observation_id":"a5f84112-a861-4163-80f5-bffd6f2b7a51","resolution":{"observed_at":"2026-08-02T08:03:48.857432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-05T00:46:40.906153Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00536","last_updated":"2026-08-01T08:45:41Z","snapshot_observed_at":"2026-08-05T06:24:40.252523Z","submitted_at":"2026-08-01T08:45:41Z","title":"DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:46:40.906153Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2608.00536"},"observation_digest":"sha256:1856fe758c961c1a937617306e316889364672a8f6be05f6e72c5ad03f7cfe1c","observation_id":"191f36d1-a339-466d-a0fd-6d10bd7dc35b","resolution":{"observed_at":"2026-08-05T00:46:40.906153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.22186/citation-record","integrity":"/paper/2509.22186/integrity","json":"/paper/2509.22186/citation-record.json","paper":"/paper/2509.22186"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:dd6d6c3758d3ddd5ef188924713c53ab81ed38185f903c2110621a45604cf6bd","observation_id":"0eb17dcd-cb96-42cf-bbf4-6cc66047925f","resolution":{"observed_at":"2026-05-17T13:25:31.932307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09621","last_updated":"2022-12-19T17:00:54Z","snapshot_observed_at":"2026-08-05T03:51:47.756359Z","submitted_at":"2022-12-19T17:00:54Z","title":"Wukong-Reader: Multi-modal Pre-training for Fine-grained Visual Document Understanding","version":1},"cited_work":{"arxiv_id":"2212.09621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.09621","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wukong-reader: Multi-modal pre-training for fine-grained visual document understanding","venue":null,"work_id":"5ab3d15a-640e-4244-810e-cc619f52dad4","year":2022},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2212.09621","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ee89809d549f2506f7e9a6b7e3b34a8fa01ecb06eac92de5b896f9e91678d9c5","observation_id":"573fdc67-6c36-4bd9-8f60-ebeefafb04cb","resolution":{"observed_at":"2026-05-17T13:25:31.943757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:e4acd9bc3b9bfb374b815c118faa819c4a0c5c242877ab412c7c3d2b772361ca","observation_id":"ba8d191b-7eb0-4511-8ae0-dc7bc2157634","resolution":{"observed_at":"2026-05-17T13:25:31.951234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":"2308.13418","doi":"10.48550/arxiv.2308.13418","metadata_source":"pith","pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nougat: Neural Optical Understanding for Academic Documents","venue":"cs.LG","work_id":"26c3b627-7e97-40d7-bab3-020936b8196b","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:222241ea956ed07823f65d0d5dc6bbeb7eb7c4dcd88e8790a69f2c410ba8112d","observation_id":"b6b4b551-4d46-423c-9d97-1092ce276f30","resolution":{"observed_at":"2026-05-17T13:25:31.958813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocrflux.https://github.com/chatdoc-com/OCRFlux","venue":null,"work_id":"c9d28b27-542c-4250-990f-746ad3563e7c","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:3172f92b734b66d24b14fbad015cd50275ef9d19fe2018b89a92846e85fb4731","observation_id":"093bba68-43e4-4f8e-96c6-192b8f2bf9cc","resolution":{"observed_at":"2026-05-17T13:25:32.117297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-07-06T20:26:21.639525Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2501.15558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15558","snapshot_observed_at":"2026-07-03T16:18:37.548550Z","title":"Ocean-ocr: Towards general ocr application via a vision-language model.arXiv preprint arXiv:2501.15558","venue":null,"work_id":"0f256bf5-e790-4a27-bee6-b65f4ac2bb55","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2501.15558","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:8f1be70201402a839f7da1c42b882c0efd399868d91e3eca6fa115310fae9595","observation_id":"04421ea2-b829-40fd-b508-4093dac1d46d","resolution":{"observed_at":"2026-05-17T13:25:32.114062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:61a4cfc6dc1a7741d3c8d86bc51312920865b17f907290891424e9d7d8b98c2e","observation_id":"61d5631e-b4a9-418b-8c94-bb801dfea1f4","resolution":{"observed_at":"2026-05-17T13:25:31.965726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.05595","doi":"10.48550/arxiv.2507.05595.url:http://arxiv.org/","metadata_source":"pith","pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-07-11T02:17:46.362300Z","title":"PaddleOCR 3.0 Technical Report","venue":"cs.CV","work_id":"444c549c-1895-4cae-a2d3-c13d7ed5f462","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:db4491ff79f4febdd2c6f9dbf597a36bcb97384a8cea0b4ddcbe093885e608c7","observation_id":"cb70f3ae-da33-464a-b1c6-7fe38e5f921b","resolution":{"observed_at":"2026-05-17T13:25:31.970747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision grid transformer for document layout analysis","venue":null,"work_id":"bae21eb9-6980-46d4-8c60-fad2159b6091","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ae0355f343ce0ea850a6f702c8748d8a57d20cce5d3d87e2d145f91244805810","observation_id":"03980eac-ab61-4aaa-ac6c-c7734cf21115","resolution":{"observed_at":"2026-05-17T13:25:32.130041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution.Advances in Neural Information Processing Systems, 36: 2252–2274","venue":null,"work_id":"a1724de3-7ed2-436b-8f0f-4e270d63892d","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:dacadcb1f446681d28ae50ed905a1fec124526c1bc4f1857a3600f748d33d8e7","observation_id":"d12d51b4-6981-43e9-8205-ede07f0f853a","resolution":{"observed_at":"2026-05-17T13:25:32.133324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-02T03:07:04.142667Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"cited_work":{"arxiv_id":"2505.14059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14059","snapshot_observed_at":"2026-07-04T16:49:57.078776Z","title":"Dolphin: Document image parsing via heterogeneous anchor prompting","venue":null,"work_id":"7b0162e1-d951-4222-9213-1f55bfd2ea95","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2505.14059","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:16af64a65a41e8005232ed0cc1a96b7b511be6341f1db1c376cb7eef4cf21715","observation_id":"4f1bfba0-f5f8-4ac1-a8d4-0c2ccefa47ee","resolution":{"observed_at":"2026-05-17T13:25:31.976486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:9e13c595f45b601340bac6794b1cc7872855bdce697a1d59df9be59b008871b6","observation_id":"52d0a6e8-8ef2-4742-ab23-e6dc1ea29c06","resolution":{"observed_at":"2026-05-17T20:33:27.157097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:58e0008b543266f89417fcc45e2b04c5b7b506297bc19207b321dc295afb035a","observation_id":"4e95f10a-35a2-499a-9591-3c343fe030d8","resolution":{"observed_at":"2026-05-17T13:25:31.987859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"3c4ae282-64ab-48fd-bdff-51a631e31efb","year":2022},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:c05fd09ea5ca51d48a70e76f328281ccef72a711c12c17d3ca458af1050c397b","observation_id":"9a30f1f2-85b5-438b-b26f-f390800d78d4","resolution":{"observed_at":"2026-05-17T13:25:32.146259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"e79da9d4-2249-4d83-9a5a-cd364da5d3c0","year":2022},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:66efbfd5ce35292f0365303ea1be14ae50bbedd405598fc3eb73d2f7fc91c39e","observation_id":"f0fc35e4-6a7a-4ce7-9598-8220d09b31e4","resolution":{"observed_at":"2026-05-17T13:25:32.149454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gon- zalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"72acff3e-b771-4f85-83dc-4a217c66696d","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:72a0a878ed37fa8eebe7e7c9e0a632cad365cf1a5c145b64e2d2fe24522a4d46","observation_id":"4ef1a096-d4b0-416e-9151-791e8128886c","resolution":{"observed_at":"2026-05-17T13:25:32.152409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:46.911382Z","title":"arXiv preprint arXiv:2506.05218 , year=","venue":null,"work_id":"e1783180-c7e4-4eda-92a0-bea7df4e8d95","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:073d1806f78b48b85224461b7f2e1f0cd14ef27ca0ecc1572b54f50c44b89f53","observation_id":"bc1d039a-6fc1-438f-8669-2cf20ed0aabd","resolution":{"observed_at":"2026-05-17T13:25:31.993644Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doctr: Document transformer for structured information extraction in documents","venue":null,"work_id":"537ad344-2e58-4dee-87e5-095d71b7cf18","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:139a20f47f5bf6b36dac4eb9e95a4160a3a8499d48efe205f4dfd0e15b4602fc","observation_id":"a57bb7ce-7adb-4547-b85c-afe3fb10108d","resolution":{"observed_at":"2026-05-17T13:25:32.158551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12599","last_updated":"2024-01-23T09:54:36Z","snapshot_observed_at":"2026-07-06T17:19:14.478786Z","submitted_at":"2024-01-23T09:54:36Z","title":"Revolutionizing Retrieval-Augmented Generation with Enhanced PDF Structure Recognition","version":1},"cited_work":{"arxiv_id":"2401.12599","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12599","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revolutionizing retrieval-augmented generation with enhanced pdf structure recognition","venue":null,"work_id":"a916371e-8365-4648-a051-2ab7afca2906","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2401.12599","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:fe82cf64ee0887553e2f6daf7efd45af8e647c8d8c9a983d53d549fdf8be1399","observation_id":"ec8a855e-69e8-422c-933d-891fe3663a54","resolution":{"observed_at":"2026-05-17T13:25:31.999250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hrvda: High-resolution visual document assistant","venue":null,"work_id":"3b63f062-69fb-4a78-8624-4a48d804d698","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:84403e7ce4e7170242e05e87a94b4e5437a06a243403d8a023e1f25f0da46530","observation_id":"4fe99761-6a07-45a8-8934-3a22c03b774e","resolution":{"observed_at":"2026-05-17T13:25:32.164376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18382","last_updated":"2025-03-24T06:39:51Z","snapshot_observed_at":"2026-07-06T20:57:34.762004Z","submitted_at":"2025-03-24T06:39:51Z","title":"PP-FormulaNet: Bridging Accuracy and Efficiency in Advanced Formula Recognition","version":1},"cited_work":{"arxiv_id":"2503.18382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18382","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pp-formulanet: Bridging accuracy and efficiency in advanced formula recognition","venue":null,"work_id":"9c3331b1-6a98-4a0b-b971-b1ddfd9492a2","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2503.18382","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:d386ddcf285051d8a1e4b1a2a3ab0263b173a2f8b385796c0719bef8acd3c56e","observation_id":"08762d7b-06fd-4937-88ce-1226f17b3ba2","resolution":{"observed_at":"2026-05-17T13:25:32.004800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01215","last_updated":"2025-09-01T07:54:18Z","snapshot_observed_at":"2026-08-03T21:46:04.208590Z","submitted_at":"2025-09-01T07:54:18Z","title":"POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion","version":1},"cited_work":{"arxiv_id":"2509.01215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01215","snapshot_observed_at":"2026-07-02T02:46:28.788373Z","title":"arXiv preprint arXiv:2509.01215 , year=","venue":null,"work_id":"0d5cc528-e64f-4b61-a453-8cffdb19a917","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2509.01215","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:3ae025ebc5bca838aae207541b4e08c72fe77c8dce068e19f3a222c1ccc3b9f4","observation_id":"58d19e35-81c9-4ed9-8fd8-5295c7f7a36d","resolution":{"observed_at":"2026-05-17T13:25:32.010747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":"2403.04473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":"612fe156-781e-49f3-bac5-03fcb13d115f","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:bd9bee24e93e9af187942337dfb6a6b9544228e59807304accf814d842e73669","observation_id":"b1e09e38-907f-449a-b072-d1c13ad8f18f","resolution":{"observed_at":"2026-05-17T13:25:32.017809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17887","last_updated":"2025-01-27T19:40:00Z","snapshot_observed_at":"2026-07-30T22:36:20.561157Z","submitted_at":"2025-01-27T19:40:00Z","title":"Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion","version":1},"cited_work":{"arxiv_id":"2501.17887","doi":"10.48550/arxiv.2501.17887","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Docling: An efficient open- source toolkit for ai-driven document conversion","venue":"ArXiv.org","work_id":"d139a974-3108-4df8-89d1-c9c1e87ecfd4","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2501.17887","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ffb35e69ed3b813130ba8011b58ea02f36dfb861b017ec33c33487889b244fbe","observation_id":"5792a4b9-125a-4cde-b6e3-c5956b76c387","resolution":{"observed_at":"2026-05-17T13:25:32.023399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimized table tokenization for table structure recognition","venue":null,"work_id":"611ff53e-e6d7-486a-914d-742d33dab41f","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:d992be1e9c59af19e103e5d2de72b0355dadb68f8a96ce6f722e1f0393ac0cea","observation_id":"09fd7087-0dfa-44e7-961e-d63ffb8bf3c4","resolution":{"observed_at":"2026-05-17T13:25:32.180701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nanonets-ocr-s","venue":null,"work_id":"4707ff56-a4ba-4826-86b8-dd9383f36f9a","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:19f18019d7d17e6285a48f9a844cfb8ea640b225f166ef1cddd57e5dfe036e30","observation_id":"41e4b1c1-372c-463b-9a14-04b5ad310093","resolution":{"observed_at":"2026-05-17T13:25:32.183669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathpix.https://mathpix.com/","venue":null,"work_id":"298ea5e8-f7c1-4bb0-a59c-577970d6fd75","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ffffc6c3a294875774060b416212f47e681a012a81fee08fef49cc90984949d0","observation_id":"b0937d3c-f884-40f6-949d-b11cc6de362d","resolution":{"observed_at":"2026-05-17T13:25:32.186530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-07-06T20:52:51.138710Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:a90db5d907e6b25c4577523ca8099077af587fca6fefe56c14a8e30f0d4f0f92","observation_id":"2243c99a-0e45-49f1-8fff-ddf6d83300a6","resolution":{"observed_at":"2026-05-17T13:25:32.028685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-04T05:11:37.861610Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ae4a2cf1ebf10a15b3c9d5a6e31c5a6781f5816572ce7c141cd2398fa6ea1f7a","observation_id":"e7ab0eda-b5a6-4a65-9a70-0eda9239920e","resolution":{"observed_at":"2026-05-17T13:25:32.034155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pdf-extract-kit","venue":null,"work_id":"03079e75-41d7-4adb-a919-8b982065c7db","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:3401a7cbe9ff38db99af1724107347a7a6d9d0d1998ff7b94ee573409d4c13c3","observation_id":"d91cfd00-34e8-4325-932e-e93d5f482180","resolution":{"observed_at":"2026-05-17T13:25:32.195460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.613188Z","title":"Omnidocbench: Benchmarking diverse pdf document parsing with comprehensive annotations","venue":null,"work_id":"e3dd7532-3754-4ef4-8d19-ebf70f303b33","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:1a57a7d16eb2b9ad10f54cba0605b75f2016f07bc00cdea15ed80ad72b9115b4","observation_id":"daea5a8c-2d61-4ee5-a13f-614a0f586a9b","resolution":{"observed_at":"2026-05-17T13:25:32.198535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marker.https://github.com/datalab-to/marker","venue":null,"work_id":"742c8a51-bdba-4de9-9ab0-503d587ba9e5","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:9bafaf950564a08251cd28eea301bc3756d58a0eb802fb1ff135b2d4f7f28771","observation_id":"e8807e89-2831-4c1e-b2e3-022393b65b0c","resolution":{"observed_at":"2026-05-17T13:25:32.202008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surya: A lightweight document ocr and analysis toolkit","venue":null,"work_id":"3c2eae13-4972-4dd5-ae26-55e29091c7f5","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:865934eed2a4cf86f3b09d3ba49894a0cfa4577f0be0de4149d44ff3b02bd12c","observation_id":"502ee242-ec00-4bfe-9ecf-fa1f03ab2649","resolution":{"observed_at":"2026-05-17T13:25:32.205165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:24:48.478464Z","title":"Doclaynet: A large human-annotated dataset for document-layout segmentation","venue":null,"work_id":"697390b2-213d-43bd-9418-3528d8165909","year":2022},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:e2eb80be1d1c50312613e85ae16f3bd33eb2b6db5d29608ad103571d554a67da","observation_id":"99dc6d66-502b-470d-823d-2deba20c07b5","resolution":{"observed_at":"2026-05-17T13:25:32.120658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18443","doi":"10.48550/arxiv.2502.18443","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"olmocr: Unlocking trillions of tokens in pdfs with vi- sion language models.arXiv preprint arXiv:2502.18443, 2025a","venue":"ArXiv.org","work_id":"bb9c92f3-5210-40cf-b3d5-7463913e3248","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:fff6002a82ed2b2336eb2583ebb03eadd2e47eeb7eda3200b30c4a0da132d07a","observation_id":"42e4aeed-1dbf-42ab-93de-92416fc341fd","resolution":{"observed_at":"2026-05-17T13:25:32.039105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rapid table.https://github.com/RapidAI/RapidTable","venue":null,"work_id":"c7f03c8a-ed57-452a-bac0-012ce3b81d07","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:b4c917fcffc1d51bdd2dc9274f9b342b3705777514a3efdc8e06d14fe4535ed2","observation_id":"81bd3dd6-80a7-4f3e-82db-f6e7427823d2","resolution":{"observed_at":"2026-05-17T13:25:32.126848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dots.ocr: Multilingual document layout parsing in a single vision-language model","venue":null,"work_id":"3d5cc6a0-818a-4185-b33e-21cff5b216a0","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:3a775edbffe58784b14e77a4e2f9324b703fb644a950a152587c32284462a3a1","observation_id":"17d7cbcd-681d-4272-8def-c566e71e047f","resolution":{"observed_at":"2026-05-17T13:25:32.136397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time single image and video super-resolution using an efficient sub-pixel convolu- tional neural network","venue":null,"work_id":"73a33df7-b227-4bab-9dd1-839c6c4ebd5e","year":2016},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:cad07b33924ccd98ab2b78a2af9bc9a35dea73958c989a6ba505ad644a2c785f","observation_id":"ae2b91bf-a4b2-4910-ad9e-61ba3ad00edc","resolution":{"observed_at":"2026-05-17T13:25:32.139697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:2c668fcfb7ece7032df5389c4438e2886caed806c9e4ee025a0c3ed3d27686d9","observation_id":"a093c681-9128-4104-b413-19487e3d56fa","resolution":{"observed_at":"2026-05-17T13:25:32.142960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"03ca5cec-61b6-41ad-b28a-a7b7f90266be","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:b812125ad2deaed0e06332abf0c419853c899a931fdf12c1602fad0c2c7aad95","observation_id":"f70ad65b-3350-45c5-b78d-415902720509","resolution":{"observed_at":"2026-05-17T13:25:32.155543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mistral-ocr","venue":null,"work_id":"5bc838a5-32a4-47eb-807e-37b12b82fff6","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:51b23b6bc37416e3c596f5cac6df2364662f625f91b8aa6f28fb4d61bc4dbdfc","observation_id":"17af5ca7-490f-4b47-a1d1-61f233288be0","resolution":{"observed_at":"2026-05-17T13:25:32.161429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:87a384f9340b6a4e4ddce1b7690ec11a1d400bd7716a2052d35fa1f147e93f85","observation_id":"93f37dde-91f7-4890-874a-25a952bcf41d","resolution":{"observed_at":"2026-05-17T13:25:32.043633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omniparser: A unified framework for text spotting key information extraction and table recognition","venue":null,"work_id":"98ef3a81-a2b0-4b78-a733-2e2a7e704228","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ec1faacce854dd5ba91cef91dbb23319d1fa777d07fe8a1e4d60d161ac79a5b6","observation_id":"d51660c9-a1b7-4d7d-8f49-009a4f899987","resolution":{"observed_at":"2026-05-17T13:25:32.170744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yolov10: Real-time end-to-end object detection.Advances in Neural Information Processing Systems, 37:107984–108011","venue":null,"work_id":"00a4d02c-3d39-4ec3-9562-a6575738a2ab","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:5a7ea1e54ceb4d1f4ecb3f670686eef7008eaee195217456db2437a07248c4fd","observation_id":"e3691aa4-84fc-4532-ae02-70616618af65","resolution":{"observed_at":"2026-05-17T13:25:32.174253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15254","last_updated":"2024-09-05T15:42:25Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-23T17:39:27Z","title":"UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition","version":2},"cited_work":{"arxiv_id":"2404.15254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15254","snapshot_observed_at":"2026-07-10T17:07:25.730038Z","title":"Unimernet: A universal network for real-world mathematical expression recognition","venue":"cs.CV","work_id":"df6ee681-e747-45e6-a94a-c2a1accdbae3","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2404.15254","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:fdc925eb84a8fb7d572342f78670cd13c0e5611e3d4f82c301c85c379dce6ac1","observation_id":"1004e3a8-1653-4f9e-a5dc-a5db11d1fcb3","resolution":{"observed_at":"2026-05-17T13:25:32.049356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":"2409.18839","doi":"10.48550/arxiv.2409.18839","metadata_source":"pith","pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","venue":"cs.CV","work_id":"c1ec615b-d679-40b4-a2fe-c921d3c86546","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:1f7178f6bb4c79d6c2e5113f6ab5119620c25d9356691a1e5961b04ac521035e","observation_id":"c7931339-2df4-41a4-abbe-cc18a883d718","resolution":{"observed_at":"2026-05-17T13:25:32.054130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image over text: Transforming formula recognition evaluation with character detection matching","venue":null,"work_id":"a918f7b9-b1c3-4381-9f08-10e7b6bc5c54","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:5aa9dbdcd085e49b4a796fdb30515e16551d7f1cd1c7df8cce27f774b0507c08","observation_id":"8e7153a0-26d5-4d20-a281-ed8fa869d40a","resolution":{"observed_at":"2026-05-17T13:25:32.192783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:2ff5eec0e25d1ee365be840de143ee5711fee0efe734b4f4a00eb5b9063e5b0d","observation_id":"05f17076-2410-4fd1-9208-3759224807ea","resolution":{"observed_at":"2026-05-17T13:25:32.058911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:ff5ca76da31853b17ca129c86478cd5dd408ac866efd4ae4ed8acab9d8173d19","observation_id":"994d66c7-f5d7-4c88-8908-910037e8a3b0","resolution":{"observed_at":"2026-05-17T13:25:32.063507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11591","last_updated":"2021-08-27T04:56:07Z","snapshot_observed_at":"2026-07-06T11:41:38.428205Z","submitted_at":"2021-08-26T05:52:32Z","title":"LayoutReader: Pre-training of Text and Layout for Reading Order Detection","version":2},"cited_work":{"arxiv_id":"2108.11591","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.11591","snapshot_observed_at":"2026-07-02T14:57:03.917920Z","title":"Layoutreader: Pre-training of text and layout for reading order detection","venue":null,"work_id":"13d5f5de-fb5b-40b5-8e48-708a57bd8a64","year":2021},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2108.11591","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:e602203d0f29cf0e117ce8c4026fa9b2b7957abf0ecfc3c20ac54699d8da6633","observation_id":"95ac9905-f8ce-43f7-aba8-c0db34cf4bc0","resolution":{"observed_at":"2026-05-17T13:25:32.068135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vrdu: A benchmark for visually-rich document understanding","venue":null,"work_id":"04b3b2d5-f3d3-41f8-8203-99d7f4c9f73d","year":2023},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:dc0a138069f538edb385d1813d4bcfd5cd94d84a78906ae0e2f5ec901b730609","observation_id":"30b891ca-a3eb-4600-8eee-a1c01e80bee7","resolution":{"observed_at":"2026-05-17T13:25:32.189732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-01T15:04:20.648996Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":"2409.01704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-07-08T20:35:34.407064Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","venue":"cs.CV","work_id":"67b1592f-02b6-4056-b3fe-cc594e484192","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:da0d5c7d9c624fa43103343ab7bcd3d7a463cc167b7a0e6f4c465facd885ca3c","observation_id":"765ad383-e252-4db4-9a90-bec6d7788331","resolution":{"observed_at":"2026-05-17T20:50:57.985910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02210","last_updated":"2024-12-10T05:01:33Z","snapshot_observed_at":"2026-07-06T20:00:47.730252Z","submitted_at":"2024-12-03T07:03:25Z","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","version":3},"cited_work":{"arxiv_id":"2412.02210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02210","snapshot_observed_at":"2026-07-03T05:47:41.904748Z","title":"Cc-ocr: A comprehensive and challenging ocr benchmark for evaluating large multimodal models in literacy","venue":null,"work_id":"904d3939-c480-4ddf-a962-a461501704de","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2412.02210","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:cbf5dd2725488a0ad8f57543b6690e0fc39ea75ab3b151161c040e1907acc718","observation_id":"5740e854-0131-47fa-9469-3996b278d76e","resolution":{"observed_at":"2026-05-17T13:25:32.078836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:088255062637a6220e9dda612653534233549ed2867154d91acce0c317d53505","observation_id":"20685813-7daa-4a34-9c0f-8b578341645e","resolution":{"observed_at":"2026-05-17T13:25:32.083168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":"2509.18154","doi":"10.48550/arxiv.2509.18154","metadata_source":"pith","pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","venue":"cs.LG","work_id":"21d4b019-63d0-49e5-b51b-350ef4783709","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:253ffc4044706d6af0876855f2494814467dcbc12b644e1e51a544641f25965d","observation_id":"52a366ce-7778-499b-b0a9-3e1c069b89e5","resolution":{"observed_at":"2026-05-17T13:25:32.087706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02592","last_updated":"2025-08-30T07:10:08Z","snapshot_observed_at":"2026-07-06T20:01:01.384985Z","submitted_at":"2024-12-03T17:23:47Z","title":"OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation","version":4},"cited_work":{"arxiv_id":"2412.02592","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02592","snapshot_observed_at":"2026-07-04T10:39:44.691663Z","title":"Ocr hinders rag: Evaluating the cascading impact of ocr on retrieval-augmented generation","venue":null,"work_id":"b8b763d5-dddb-4281-af78-4531e29b7884","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2412.02592","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:2c2be923cd88b2f8b03b11bd37e5bc0d99af1310c899f303755048b8588e81fd","observation_id":"8c64bdec-bfed-4055-8992-c5e8dc0bd9fa","resolution":{"observed_at":"2026-05-17T13:25:32.092351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"cited_work":{"arxiv_id":"2410.21169","doi":"10.48550/arxiv.2410.21169","metadata_source":"pith","pith_arxiv_id":"2410.21169","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","venue":"cs.MM","work_id":"1237b74e-e94a-4846-a4ae-3960929fd6aa","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2410.21169","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:87692f73190c6f59f235e71d1b585818dde267857c38afe1b5d6322d57f7114f","observation_id":"07e0b3f9-3385-4af6-90fe-ea0beeff32d0","resolution":{"observed_at":"2026-05-17T13:25:32.096611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19473","last_updated":"2024-06-21T08:26:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:59:01Z","title":"Retrieval-Augmented Generation for AI-Generated Content: A Survey","version":6},"cited_work":{"arxiv_id":"2402.19473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19473","snapshot_observed_at":"2026-07-04T20:00:08.877185Z","title":"Retrieval-Augmented Generation for AI-Generated Content: A Survey","venue":"cs.CV","work_id":"5440e856-5c59-44cb-8ea8-f1c3591c7425","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2402.19473","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:14945cf8d7c75a8f8d1214e60ded20fab6a842a0386168edfa8ab17b4cd41c32","observation_id":"3b32a8be-a118-49cc-96d6-abb1e6f9bed1","resolution":{"observed_at":"2026-05-17T13:25:32.100715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12628","last_updated":"2024-10-16T14:50:47Z","snapshot_observed_at":"2026-08-03T16:49:45.106682Z","submitted_at":"2024-10-16T14:50:47Z","title":"DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception","version":1},"cited_work":{"arxiv_id":"2410.12628","doi":"10.48550/arxiv.2410.12628","metadata_source":"pith","pith_arxiv_id":"2410.12628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"relevant_bbox_ids","venue":"cs.CV","work_id":"0fc93e88-4049-4a48-91e9-23ddb4673ff8","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2410.12628","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:9db047496595f751c56151d37f9bd417066e10d9f34294b6c39a7ffac3137f9f","observation_id":"942e003c-d139-401d-b390-bb6c219ad5df","resolution":{"observed_at":"2026-05-17T13:25:32.105068Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583","venue":null,"work_id":"ea5e2f86-5980-4e37-b691-a00abcc48ff2","year":2024},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:5d903e0d7d37a66c0e7d05fea9ea2f0c54d5bc8fb6663a70319a8372f613afba","observation_id":"c727ceae-3690-4abf-b417-d1f1dd3bfd21","resolution":{"observed_at":"2026-05-17T13:25:32.177658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.582083Z","title":"Global table extractor (gte): A framework for joint table identification and cell structure recognition using visual context","venue":null,"work_id":"6f321c4a-75e8-4ad1-b3a0-95da899f1d43","year":2021},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:b372f52d45e6985c845f83cabba22a327d954ffcba6bf801fe8998f83dbef60a","observation_id":"15bbe352-60a6-4854-abcf-3d9247b7b49e","resolution":{"observed_at":"2026-05-17T13:25:32.123813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.636943Z","title":"Image-based table recognition: data, model, and evaluation","venue":null,"work_id":"780e00d3-e411-4333-8f05-f51f19233d5c","year":2020},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:1e428ac42eeef3dad8b55e38c198cbb7d4a82c86a082890994ced6d440b5943e","observation_id":"7bf75f20-0a1b-4ae1-89c0-a39023d19af6","resolution":{"observed_at":"2026-05-17T13:25:32.167584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:d61e85b81f83310f80df600749011f077492cf1232292d263690c788061d4dd3","observation_id":"89880a42-32d6-42e5-ae30-76fd55f6602a","resolution":{"observed_at":"2026-05-17T13:25:32.109409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T13:40:59.481125Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":31,"verified_fuzzy":29},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 36 inbound Pith citation observations for arXiv:2509.22186."}