{"as_of":"2026-08-07T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48f384b43cb3d0d146b03f17617e276371a8b92382140a40d680eadad40ef0c0","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T04:45:32.682508Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11562/citation-record","integrity":"/paper/2607.11562/integrity","json":"/paper/2607.11562/citation-record.json","paper":"/paper/2607.11562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:80e22495fd67006645c0e46135c30ad21994f02c9ff10831649141f35dc58a3c","observation_id":"956487cb-9bff-4207-8694-19f36768c8f5","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:7e556aaa59601d8a28be9b22d1d07a8e8bdda6d208692ec8dd3335a78df622ab","observation_id":"db94fda7-7ff5-482a-8bfb-7ca78c7587a6","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"BEiT: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:fa3f190666efb2fb627dc9e981ec46fe743b8217170f2911ec7d9a6e868276a2","observation_id":"c8714cae-c14e-4450-8b26-9b73b2f205d1","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Scene text recognition with permuted autoregressive sequence models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:6a0d1cc68396231403095c40f83c06ac0c5467360e7f791243a871422e257cba","observation_id":"9fe81157-476a-4f73-9f90-ef93006201a7","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Nougat: Neu- ral optical understanding for academic documents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:e25af4432f42e92066b3d193dcf1a604ad9c622c036961231146b72bea6f9352","observation_id":"f0b88761-7919-4e83-bbda-a6ca5d329c8f","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:282d72f3b5d94694242d9f8d724e5bc6633d21c3aad8d4a202aea58b5f6018ec","observation_id":"63566e54-418f-4025-9ebd-a50ec41a9218","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:1ca3a930b6edb10fad2484dce2200f533603ada87f6367944930cb345464bc46","observation_id":"5570681b-8f6e-405a-8024-858bdeaa5c01","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Enhancing tampered text detection through frequency feature fusion and decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:ad0e8680aaf36a4069a3372631b3f0f03e30a8fcd022ef5fe5c7a881ce4aad14","observation_id":"7d445a3c-6f95-4497-96f7-92168485031f","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4089ae1e40efe769dcaf1853ab5d548db9769d642177c3bdda9e1f30ba9e99e3","observation_id":"c69d1d07-5d04-4bb0-82ae-e9562d2c703f","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Per-pixel classification is not all you need for semantic segmentation.Advances in Neural Information Processing Systems, 34:17864–17875, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:f213117398e34f3481922d1ebbad53761a65fff248790c51ee7557b4567dead0","observation_id":"9e94e238-eb65-4307-aa30-b300977122f7","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"M6doc: a large-scale multi-format, multi-type, multi-layout, multi-language, multi-annotation category dataset for modern document layout analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:0fa6f372952242f34b794155d925807be0439862c90e5b5dfd20b3f2a859c93d","observation_id":"15c99d84-fa77-4cec-9adf-5b88bdbe8e62","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:6d416b911bb7269a0a6b2b6e873516a01c06ada1347a052104ef6066c4cb6187","observation_id":"0765eb9d-c493-48ba-94a6-1fe8a336c462","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Total-text: A comprehensive dataset for scene text detection and recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:6c3e7f2e9255b52e12776d0dab2e54c9215c9a907fecea395553ef2a5e4c9b00","observation_id":"cf0b5cba-23cb-4d6e-90b0-c82d2a309265","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Icdar2019 robust reading challenge on arbitrary-shaped text-rrc-art","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:958b2b5e8f06b21649784e63f8ce512c37d8271641c815db43f84010d35bce52","observation_id":"4de5f807-5022-456f-a1e0-95b72d9cd0e7","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21957","last_updated":"2026-04-03T06:49:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T16:35:04Z","title":"PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21957","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Paddleocr-vl-1.5: Towards a multi-task 0.9b vlm for robust in-the-wild document parsing.arXiv preprint arXiv:2601.21957, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2601.21957","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:7992dc47211d6074e69e7faa67df9616464e1db10b1ebb41a16966525c8cec11","observation_id":"8786798c-eef4-4a2e-93b1-922796038491","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Boosting document parsing efficiency and performance with coarse-to-fine visual processing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:a570aba3b8abd9efe1891d813daed36674b8b1da9975b198a7c78c898857eb54","observation_id":"5483938f-14b9-42b2-a50f-e0a1d955a917","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Vision grid transformer for document layout analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:b73d35aecba4eac850fe02e69c89abec427bc5184e069283c8515630c846db08","observation_id":"b8adad7e-7a38-497c-b2d9-b59a41ea8126","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:9572e5906bc0fa463ecdb3d8b04df5f76c5b5ee4f8dfbc2b5c4e462273dbc40b","observation_id":"9b558c00-1ee2-4efc-adc4-cb9060208712","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Decaf: A deep convolutional activation feature for generic visual recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:1eced912c0737565d3e8418502d4e8ab47619868714039aa6fafc382b274d99b","observation_id":"ea56ecce-d9ee-4c57-92ec-f3911336f702","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:519f49bcbdc216393f21f329ef5fac132b375cd004aaa54bb0768cc07ade12ea","observation_id":"d4f1d11a-8712-47a1-b29b-a56f85f0bd87","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Out of length text recognition with sub-string matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:8936faae57ef39e8585fe9bfcd49dbe74966f5b1b7541f1fcce3b5dbc27a3d40","observation_id":"6b5cdcfa-9fb6-498c-b13c-db94b6b22c5a","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Context perception parallel decoder for scene text recognition.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:6ba1eaf58827ca960e7c7000da80112ff5deb61807bfba1051d5f9b3c59e63a2","observation_id":"5e982cc3-5d97-4f1b-87a8-852587c337ed","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Instruction-guided scene text recognition.IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(4):2723–2738, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:b72c31b66d0ca6c4f65182c220544fe83d07477df1a36f99cb9e2e8344f9f2dd","observation_id":"d4194c98-d26d-4048-95c1-a77fd25bef09","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Svtrv2: Ctc beats encoder-decoder models in scene text recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:0f3203d605f6e71c155ee9b3e2d7a4555838b1d1882659d6bedc83e8593eb138","observation_id":"2cf2c263-9db2-4b6b-99c9-7cacee222f4a","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-03T14:16:48.399963Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21095","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Unirec-0.1 b: Unified text and formula recognition with 0.1 b parameters.arXiv preprint arXiv:2512.21095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2512.21095","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:90049193164356f76012dd1f4e3bbc609de6662b2a41576f29e379a08437f4a3","observation_id":"59b938e5-6407-4d77-9935-3a041565c732","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Glm-ocr technical report.arXiv preprint arXiv:2603.10910, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:fd8181b38e474e75c4e2cf5c38bd38792139192de5ce2340fd8e638106f146fd","observation_id":"f145dc73-0f90-4780-8f54-b3f2ef79eeb1","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:d50d86cad20e3deef826dcb84c1ee23d0c4fa5e327e64d630924b212b36f13a6","observation_id":"fff5c9ab-7ed2-48b1-967a-b8c2f5dde944","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Mathwriting: A dataset for handwrit- ten mathematical expression recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4dcb8014efa4be899c7cb94b6c1a6cbd5aef2e9a379d4d8d08c9fad425779240","observation_id":"47b6db9a-c553-4f67-9059-d31968fd052c","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"White, Silvia C","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c02ae30433848b0197d5faf76b7f119de34fd263165ac637d6ea7af5bfb7be57","observation_id":"7b74a901-5379-4562-94b5-d6ad3911972e","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:7859e6779681ed4fcb7e81a3e8f947a573275e3497805ee44bc7f152b18ec53c","observation_id":"084acf49-3b43-4494-9446-2e30697605a2","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:858c63a5f600dd91de7b1bde30ac3312b471c0a50a090bf69cf827d55faeaa25","observation_id":"af881e44-1710-45ab-88b6-af1e529bfda2","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:afececd5a5e191dd40f9a597c96a61ec6e1eb0e2852f9ac46fa29e742597f4bf","observation_id":"3ba7009f-7e4a-48f5-802e-b42fa9396dca","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Speech recognition with deep recurrent neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:f5e0c3009ca2423f0cc7dcae709c31233b4cf21c58efb259cf6f089c6abb1b18","observation_id":"079ba129-1e5f-476b-9197-4c523e07b507","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Unimernet: A universal network for real-world mathematical expression recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:76889ecc2fb5798c037750539ef106680159c1e4c2a0e7688fe42de5dedd9d43","observation_id":"924b39b7-45ae-4723-9350-9dbe46eeb697","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:10176d33ae5ac056e8375b7691add280f5a6e2c039b625c1cf59796e3528e203","observation_id":"208a16f9-688c-4720-bdb5-cafe636234f4","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Icpr2018 contest on robust reading for multi-type web images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c57e5e92f3f50c290d506c0727f6e71cb6eb42f2b5fa4046d25e744cbfe423e6","observation_id":"c11203c2-00a3-4f30-a964-7f5266998a88","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Radiov2.5: Improved baselines for agglomerative vision founda- tion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c4a1e5eeab0ecd94bcb3ecebca0aef9615bafd697f34c2c07a1507117990aca2","observation_id":"5444bede-46bd-447c-a75a-c5d8af7bf177","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:20ff035e5326a1c201d2176c91c86d42332709f0fb173211e9efc719e8318325","observation_id":"412ae612-9dc8-40b0-a639-0999e1c5fa16","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:7a9ad051d64a1b0bbd4c180ebdb830ed0e3b882fbe0268c4145811429afafd86","observation_id":"61516f06-91f8-4f28-844d-dc6468b132b1","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Revisiting scene text recognition: A data perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:3c0629fa46b2c7058bef70d1c5aa80d0253bedc1f8baf4d09215808d5d8075d5","observation_id":"cc7178e2-3580-4242-84b1-5f5fa48438c4","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4c92e859c0ac0a7651559f2b7188f20025c5b2d326fda21c9a870c382910c299","observation_id":"66fabf0d-d267-4115-9e41-5301b98f32d8","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:5c88ea43f769e2d4ac9b9b61c061440bc4e9c6f9fdf218f324f00f61d286b7fc","observation_id":"3277cd3a-9c04-4a71-8da4-7d9890a273ea","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:b4adf31876e0da53c5a657cb25c0068a2bad1b2c172be484f02884f90b6e748f","observation_id":"7e7f5bc5-1c8c-4735-8a4c-e6eef1e25f3d","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:5911d45f0dd3917bead0620b6e862319f9e190d79b6c44a7ec4fa55b4f2692a3","observation_id":"2a2c6ce8-c79e-4450-8adf-cec8c915efe4","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Open images v5 text annotation and yet another mask text spotter","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4be1f055ae3713115e641f4703b5ae56ba27f3ea0470d4bdda1cde3cef4e40f8","observation_id":"7a008935-daa7-4bdf-b6f4-02a4e774caa9","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Cat-net: Compression artifact tracing network for detection and localization of image splicing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:2528da3ce2fcc32dc7c037bb625a35817d51e79a23094c95e8a32a7eee4ab7d6","observation_id":"18557dce-9ea7-425c-9c58-b4f7c57eaf36","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Towards better structured and less noisy web data: Oscar with register annotations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:5ca47df20848f44623656b75c797f352d2f95e768c62c0c17d9b769a4864e089","observation_id":"564d561b-e063-452a-822f-368e60237fd4","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:30296c1c1c4e4eebb905ddbb0bde3576fa2a2de8474242e414c7fc0124930ed8","observation_id":"2ded9b07-7271-4dd3-a061-49d38b8e186e","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Building a test collection for complex document information processing","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:e144e5cc20892f46ed6bb066469059d6ff6b1d3203e174d5ad0a2773854932bc","observation_id":"6b25127e-d632-4c5f-9459-162906b9b441","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04884","last_updated":"2026-08-06T10:55:17Z","snapshot_observed_at":"2026-08-07T08:52:48.353339Z","submitted_at":"2026-07-06T10:06:05Z","title":"HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04884","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Hunyuanocr-1.5: Making lightweight ocr vlms faster and better.arXiv preprint arXiv:2607.04884, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2607.04884","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c3b7cad89de087370475ada1da52a892cbb23cc6b2928fab568f055acb2ade9b","observation_id":"faa64d08-d7f7-47e4-97af-c5ac7fa7ff1d","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Dit: Self-supervised pre-training for document image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:f37053ae148e16a665f9a50385b1922284e09f8d4bfda7c70151be344dcaf09c","observation_id":"8b4844e4-6028-4cf6-a810-4a09f07cb554","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Trocr: Transformer-based optical character recognition with pre- trained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:d6ac3945aee615a16b24fb192c8faa0815209d679948b1a118687ca89db54c45","observation_id":"a596092e-5e08-4b02-9ce0-75614f61e452","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Openvision: A fully-open, cost- effective family of advanced vision encoders for multimodal learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:9aba463ea5e5342ee51b49ba882d7ce639228f428d337c89988fcf0f3ee52815","observation_id":"17d8b603-2104-4512-a017-df91a66ce365","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Exploring plain vision transformer backbones for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:1e81fd89ec0c00f16348110ec681803710fdd73561fc55f6a3c3c5b218593f53","observation_id":"972ce4b4-7d9b-4c2f-8d84-41cb11d90c3f","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"dots.ocr: Multilingual document layout parsing in a single vision-language model.arXiv preprint arXiv:2512.02498, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:281c8bc2fe7d810c31e71200dda047acb7e18caec97d607d0c4af6beeedc9a82","observation_id":"75c1fa4d-8313-48ff-aecb-966bc386a37e","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Mdpbench: A benchmark for multilingual document parsing in real-world scenarios.arXiv preprint arXiv:2603.28130, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:b9d8c7cc4f540fc918cc446eac1b01f4a79d5ca33f2d62ca8dc4e519f5817623","observation_id":"1a3d7953-d21a-49ba-b273-52d579d63f9b","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Monkeyocr: Document parsing with a structure-recognition-relation triplet paradigm.arXiv preprint arXiv:2506.05218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:1e9114c972a9dde512aedd7d8a4e3a9612859543af69e6911bda019bd8451ba3","observation_id":"6227d56c-f8fb-4f99-8f2b-58e87f72a8a1","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:063d2511b42a85d6bc21aea8361d5bfff3450701575cfbd184ddff55d4fd00a4","observation_id":"0eb68467-df77-4ba9-803f-9c9d34794062","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Real-time scene text detection with differentiable binarization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:2ce454449f3c6fb25539885cb872cf40a171abcbfdb694eac5318e33a9286a61","observation_id":"144f30e9-a5b7-4326-88a3-24dcb77487ae","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:40b997a3415269932158383f98fa58989c4e99248a1b9435e8d0b758e9fa62b8","observation_id":"e2980ed5-5696-471b-a537-96f3857086ed","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:1b36485440a858890f37bfef421b36df5279695ac9bcfd396d653c1bc21006f8","observation_id":"6d9657ec-972e-42d9-b38a-3dc965cd5665","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Multi-scenario overlapping text segmen- tation with depth awareness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:6e6183eaf59a87c518f44d431dd5d154b26e00f365a1bc41bedb0a31a2601b16","observation_id":"c7491a30-bd47-4025-b790-957ef6961e93","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Openvision 2: A family of generative pretrained visual encoders for multimodal learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:59314689baab612c7f5000859f6e4fddaadb1587057f8ba238217213faf24487","observation_id":"e298b4ae-4a98-4dba-93b5-159648ec8af2","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Multilingual denoising pre-training for neural machine translation.Transactions of the Association for Computational Linguistics, 8:726–742, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:9337cce71ba2485799c8e7093a04db40638141467a3352cb30c9c9fb3f97b135","observation_id":"9daeb8bc-1982-4271-b4a8-c63c5472b6c1","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Curved scene text detection via transverse and longitudinal sequence connection.Pattern Recognition, 90:337–345, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:733cf7fceafe8f039d0054bb653a283c514af1c834498fd56f833ece98477270","observation_id":"42d42d74-75d9-4113-a0c0-3fdcdee9a47d","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:6047387a840c5a63d66d14f8752811efc9a14957dfd90e1c9441bfeef77cdc87","observation_id":"57fdb7dc-d7e1-4feb-a155-8d432855c425","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document.IEEE Transac- tions on Pattern Analysis and Machine Intelligence, 48(5):6008–6019, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:77de56797bd0cb0815afe5101ce88bb56bb514d562b956c865dd4ee714887a21","observation_id":"caf6b75e-cab9-4e8e-9984-09ba86f7f41b","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:02bda2a3b4c32146e8be8c5b5c5cceb1edc7508758f4f22a243437fedfcc44c6","observation_id":"fcaa1f93-3a10-4c4c-b150-b04ba9dd335c","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:aac8e90bc2c7ad6b97e41d11237c85f2da412f6844f3b50bf3ca636cc480bb38","observation_id":"5f565518-7516-45c3-bbd0-00ff66612847","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Towards end-to-end unified scene text detection and layout analysis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:26892445568c7c71aceb81de55fc633e68d15363585584e1d432f5183b5d87e8","observation_id":"b336712c-f93f-4e92-9be6-207c7451ff63","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Toward real text manipulation detection: New dataset and new solution.Pattern Recognition, 157:110828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c8378da1695b084e89c86f998fa1b601940cebffe92b4a537d0cc858e3b01182","observation_id":"a177eb79-54e5-4330-a81b-ef6bcfe04176","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:f8006612070f28075bca60d7e90577459feafe3109df3656d803057cc1ab64bf","observation_id":"027643cd-dad3-4d0c-a59c-2d95b2fab0ba","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:54f0a36e801703c0dced3e3afa9612182c4becb94e52481b7b453e3a82856890","observation_id":"726ce31e-9039-4cdc-8a26-46d5f706e084","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:9dfc8dacc4c3685f930c38cae1bbcaf4c2c6095a61e848747a5e97319c38dab3","observation_id":"52273c3b-b0fe-478e-8f44-b37eea290133","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Scene text recognition using higher order language priors","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:67c523e62477d55e968f73258a8159da9847c5187b12e76a2c166b82bd7cc5d3","observation_id":"486f3503-e9fa-4868-963f-12630bd07d44","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Mineru2.5: A decoupled vision-language model for efficient high-resolution document parsing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:cb0e86eae64374c10ca97609f08c16ad2ff6573a377cadb3594737e3831edaa2","observation_id":"56fee384-a9b9-465d-ae78-1fde29b31db2","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:ee711ad8ed8d96bbc408ade7e2aa7ed962c39c326dfd96875bc868e10da78b0d","observation_id":"70d33beb-373c-4ec1-866e-3aaef0c7c233","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Omnidocbench: Benchmarking diverse pdf document parsing with comprehensive annotations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:7b1084ae7107e6936f735dd6bcec75d24e5ae840be50554478582f4497d301dd","observation_id":"850e8f6c-6ad3-4b18-bb0f-7bc8f9d7b94d","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Compositional semantic parsing on semi-structured tables","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:d636c9f92535b9815d01262c1f7512fc6cbef3e93f04ee8788eedd967cd3e73c","observation_id":"35a7642d-62b0-4fcc-a69d-e83b270aa870","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Doclaynet: A large human-annotated dataset for document-layout segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c57d85dcf1605be12c94c9a578834aae38e6f0228ae9573c965f89afb3f5cb89","observation_id":"064ab8cd-112e-4251-b2a0-726ce6ab182a","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Recogniz- ing text with perspective distortion in natural scenes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:0e13b7237913ee2d358211fd301e02c79db4ff614e4e5ff58d110cfe8ac2216f","observation_id":"4b0091e8-aa73-44c7-a41d-f62da0244813","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"olmocr: Unlocking trillions of tokens in pdfs with vision language models.arXiv preprint arXiv:2502.18443, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:60a9b7e39d54c63e2e3b2533a34ea84ea6150023d61a376f173c233bfcd56135","observation_id":"a4f5d735-11b3-4965-ac60-9b86b1252f34","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"olmocr 2: Unit test rewards for document ocr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:20cd9598809f7b5218825e68b13bc749758ae1aab80f443c1da99be3a814574a","observation_id":"b3a23569-f991-49a6-900c-d324df1eeefe","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Towards robust tampered text detection in document image: New dataset and new solution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:270a5c3e6e78bb26d4bbed3f497e0f74cafa12e0489dfa1d0788e775487edc20","observation_id":"2a064dbd-0d0f-4f43-9adf-068886e97a4d","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:08a49eb1d153e75a664df9419f615b9b99044310abdb8dd9423d9addef584e12","observation_id":"392ca933-f89d-43f3-a82b-618558fdfbad","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:184e3c8841d6763ab71b97072a2d0500bf1d816c5ed9a9393d3045992ed412c3","observation_id":"91df2e0b-c7d5-4bfa-921d-57421cb11d10","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:0d4d07e223d3b147b562c2721cf5fd4ef94938b434a9e57d81e6f11ef3487646","observation_id":"2733783f-b31b-4c71-a4eb-2cb09c86fb7a","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"A robust arbitrary text detection system for natural scene images.Expert Systems with Applications, 41(18):8027–8048, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:394e66434792316cb1b20c80d2d165f2666d43542fb217a0e3cb01376b550c6a","observation_id":"c54722b0-ffed-417f-b052-83957b64419f","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:b8c0bf6e6d40cb4be176c87f7a9a4c52352e32667effacd5807e54db288ada99","observation_id":"a1fe7fa5-869c-42a3-be32-390deda8a3ba","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Wikimatrix: Mining 135m parallel sentences in 1620 language pairs from wikipedia","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:60b33e1b8eaba620a1b1fa4cb398d1c402d97b7377d1314c2a4f9dae165a47a6","observation_id":"fda23e05-0668-4144-8aa4-635402b19c27","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:4eaf0e25ba74ab951f14ad2fb1eda829c4d91409a167221db07b77d9928350ef","observation_id":"95f0fb92-a295-428f-a230-5edf53b252dd","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:5edacf92c3a4f915f13a0e9400292028a9c8e18211e9e1a2489b5dc9467fc96b","observation_id":"986a6732-752f-4795-84d8-61b6e2cc50cf","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:c9fbef47e36f0639d704c5b96ae99e0b5b9ed3abc0cbf79ad4ea510cd4f28df4","observation_id":"a4ccb308-4618-4552-b641-99b777849004","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Kleister: key information extraction datasets involving long documents with complex layouts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:328a8bb21c5e94ab6fb1298b185cea748bc6094f593874a6d1b531bd35f7cdc5","observation_id":"32c0aab1-af3d-41b6-b8c9-6631daf00e51","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Icdar 2019 competition on large-scale street view text with partial labeling-rrc-lsvt","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:059cbe536bedb0adc8fb5a7df7becefaf56322bda811e40a2e05083acdf1c593","observation_id":"b2d65c39-6b62-4449-bdea-047b42cd2138","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Deepform: Understand structured documents at scale.Weights & Biases report, 4, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:de77eafa8d048423cd5fa02760010f39b9531738b7a2b5ab5999a5a615356583","observation_id":"1dcea6d2-649f-439f-bf23-8555ab3c4094","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Hunyuanocr technical report.arXiv preprint arXiv:2511.19575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:bd9ed9cbe9259d6538f92e5e9963f985746a9f8fec570b45601bd944928ef24e","observation_id":"2e4ede48-72c3-4f26-b347-235866852955","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Kimi k2.5: Visual agentic intelligence.arXiv preprint arXiv:2602.02276, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:733347b884d21fb3be754eee705fedd18ff84b1b0b44154ebae331addea12484","observation_id":"1908098a-9a02-4bdf-b4b0-a2e905dd33c1","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Kwai keye-vl technical report.arXiv preprint arXiv:2507.01949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:f2146bd8329f5f545d206d3ea3b404dcb3112e0745bacf4d3461e95b15be2f57","observation_id":"bf371730-be48-44f0-93b4-d31f8282461e","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:408b6326cffe9fd63b4ed568fef1eef3bd1423354b9278d9001cb6e940da1d63","observation_id":"4d2e50e9-25bc-4e2e-a0bf-22e9519f3f8c","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 0 inbound Pith citation observations for arXiv:2607.11562."}