{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:25VVJVO7LFYZZ674NI2PATX3IY","short_pith_number":"pith:25VVJVO7","schema_version":"1.0","canonical_sha256":"d76b54d5df59719cfbfc6a34f04efb4616c0dfc9842252e62709a19515c11a9d","source":{"kind":"arxiv","id":"2403.12895","version":1},"attestation_state":"computed","paper":{"title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Anwen Hu, Bo Zhang, Chen Li, Fei Huang, Haiyang Xu, Jiabo Ye, Jingren Zhou, Ji Zhang, Liang Zhang, Ming Yan, Qin Jin","submitted_at":"2024-03-19T16:48:40Z","abstract_excerpt":"Structure information is critical for understanding the semantics of text-rich images, such as documents, tables, and charts. Existing Multimodal Large Language Models (MLLMs) for Visual Document Understanding are equipped with text recognition ability but lack general structure understanding abilities for text-rich document images. In this work, we emphasize the importance of structure information in Visual Document Understanding and propose the Unified Structure Learning to boost the performance of MLLMs. Our Unified Structure Learning comprises structure-aware parsing tasks and multi-graine"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.12895","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-03-19T16:48:40Z","cross_cats_sorted":[],"title_canon_sha256":"e6bdb2a13a8c6f06c328294afd80c83e5ff0ae6e102e81af8f9223352706e5db","abstract_canon_sha256":"77a6ac34505e688ad2d20d7354cc029ac0f33ca0d2fa882e216f4acaa5f56f72"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:58:09.207344Z","signature_b64":"STyNugaVD0Jxey1Wl5cYKyHkfsUSrIL2DOv2vmwxFZBezJcbV5vBFve4TsSDyhwvH331D8zCwMMqiq8LPL6jBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d76b54d5df59719cfbfc6a34f04efb4616c0dfc9842252e62709a19515c11a9d","last_reissued_at":"2026-07-05T07:58:09.206603Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:58:09.206603Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Anwen Hu, Bo Zhang, Chen Li, Fei Huang, Haiyang Xu, Jiabo Ye, Jingren Zhou, Ji Zhang, Liang Zhang, Ming Yan, Qin Jin","submitted_at":"2024-03-19T16:48:40Z","abstract_excerpt":"Structure information is critical for understanding the semantics of text-rich images, such as documents, tables, and charts. Existing Multimodal Large Language Models (MLLMs) for Visual Document Understanding are equipped with text recognition ability but lack general structure understanding abilities for text-rich document images. In this work, we emphasize the importance of structure information in Visual Document Understanding and propose the Unified Structure Learning to boost the performance of MLLMs. Our Unified Structure Learning comprises structure-aware parsing tasks and multi-graine"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.12895","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.12895/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.12895","created_at":"2026-07-05T07:58:09.206660+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.12895v1","created_at":"2026-07-05T07:58:09.206660+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.12895","created_at":"2026-07-05T07:58:09.206660+00:00"},{"alias_kind":"pith_short_12","alias_value":"25VVJVO7LFYZ","created_at":"2026-07-05T07:58:09.206660+00:00"},{"alias_kind":"pith_short_16","alias_value":"25VVJVO7LFYZZ674","created_at":"2026-07-05T07:58:09.206660+00:00"},{"alias_kind":"pith_short_8","alias_value":"25VVJVO7","created_at":"2026-07-05T07:58:09.206660+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07836","citing_title":"Infinity-Parser2 Technical Report","ref_index":36,"is_internal_anchor":true},{"citing_arxiv_id":"2410.21169","citing_title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2507.08458","citing_title":"A document is worth a structured record: Principled inductive bias design for document recognition","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2409.01704","citing_title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2501.00321","citing_title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2407.03320","citing_title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01785","citing_title":"Seeing is Coding: On the Effectiveness of Vision Language Models in Code Understanding","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2408.13257","citing_title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2409.18839","citing_title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2306.13549","citing_title":"A Survey on Multimodal Large Language Models","ref_index":158,"is_internal_anchor":false},{"citing_arxiv_id":"2410.17247","citing_title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12882","citing_title":"CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.00161","citing_title":"Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2404.16821","citing_title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05271","citing_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","ref_index":93,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16883","citing_title":"SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models","ref_index":14,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY","json":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY.json","graph_json":"https://pith.science/api/pith-number/25VVJVO7LFYZZ674NI2PATX3IY/graph.json","events_json":"https://pith.science/api/pith-number/25VVJVO7LFYZZ674NI2PATX3IY/events.json","paper":"https://pith.science/paper/25VVJVO7"},"agent_actions":{"view_html":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY","download_json":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY.json","view_paper":"https://pith.science/paper/25VVJVO7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.12895&json=true","fetch_graph":"https://pith.science/api/pith-number/25VVJVO7LFYZZ674NI2PATX3IY/graph.json","fetch_events":"https://pith.science/api/pith-number/25VVJVO7LFYZZ674NI2PATX3IY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY/action/storage_attestation","attest_author":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY/action/author_attestation","sign_citation":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY/action/citation_signature","submit_replication":"https://pith.science/pith/25VVJVO7LFYZZ674NI2PATX3IY/action/replication_record"}},"created_at":"2026-07-05T07:58:09.206660+00:00","updated_at":"2026-07-05T07:58:09.206660+00:00"}