{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:TR6HWDPSSZIVFTER6NA7ROFVSC","short_pith_number":"pith:TR6HWDPS","schema_version":"1.0","canonical_sha256":"9c7c7b0df2965152cc91f341f8b8b590996aab4b9ba7d6596558398fbad30366","source":{"kind":"arxiv","id":"2409.05137","version":3},"attestation_state":"computed","paper":{"title":"READoc: A Unified Benchmark for Realistic Document Structured Extraction","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.CL","authors_text":"Aizier Abulaiti, Hongyu Lin, Jia Zheng, Le Sun, Xianpei Han, Xuanang Chen, Yaojie Lu, Zichao Li","submitted_at":"2024-09-08T15:42:48Z","abstract_excerpt":"Document Structured Extraction (DSE) aims to extract structured content from raw documents. Despite the emergence of numerous DSE systems, their unified evaluation remains inadequate, significantly hindering the field's advancement. This problem is largely attributed to existing benchmark paradigms, which exhibit fragmented and localized characteristics. To address these limitations and offer a thorough evaluation of DSE systems, we introduce a novel benchmark named READoc, which defines DSE as a realistic task of converting unstructured PDFs into semantically rich Markdown. The READoc dataset"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.05137","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-09-08T15:42:48Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"c42e776af3e7b7a03a3fba22d3e12f26fb0f0dfa1f5c2c111094d249a10cca8f","abstract_canon_sha256":"39b2931194635b4997dcc7fe175abe2afa86aa6d68f51cefedb6b7e3a2f27a4d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:35:50.946729Z","signature_b64":"h3a9U09lvmuUm2XSbxqkrigSroDnKpH2wNT7XX0s+ePBjoVtDRSiBr4mi9NjVTXirO65d4OyQ+0rGOM7hppUDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9c7c7b0df2965152cc91f341f8b8b590996aab4b9ba7d6596558398fbad30366","last_reissued_at":"2026-07-05T11:35:50.946245Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:35:50.946245Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"READoc: A Unified Benchmark for Realistic Document Structured Extraction","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.CL","authors_text":"Aizier Abulaiti, Hongyu Lin, Jia Zheng, Le Sun, Xianpei Han, Xuanang Chen, Yaojie Lu, Zichao Li","submitted_at":"2024-09-08T15:42:48Z","abstract_excerpt":"Document Structured Extraction (DSE) aims to extract structured content from raw documents. Despite the emergence of numerous DSE systems, their unified evaluation remains inadequate, significantly hindering the field's advancement. This problem is largely attributed to existing benchmark paradigms, which exhibit fragmented and localized characteristics. To address these limitations and offer a thorough evaluation of DSE systems, we introduce a novel benchmark named READoc, which defines DSE as a realistic task of converting unstructured PDFs into semantically rich Markdown. The READoc dataset"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.05137","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.05137/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.05137","created_at":"2026-07-05T11:35:50.946301+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.05137v3","created_at":"2026-07-05T11:35:50.946301+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.05137","created_at":"2026-07-05T11:35:50.946301+00:00"},{"alias_kind":"pith_short_12","alias_value":"TR6HWDPSSZIV","created_at":"2026-07-05T11:35:50.946301+00:00"},{"alias_kind":"pith_short_16","alias_value":"TR6HWDPSSZIVFTER","created_at":"2026-07-05T11:35:50.946301+00:00"},{"alias_kind":"pith_short_8","alias_value":"TR6HWDPS","created_at":"2026-07-05T11:35:50.946301+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2410.21169","citing_title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","ref_index":122,"is_internal_anchor":false},{"citing_arxiv_id":"2505.11336","citing_title":"XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04948","citing_title":"From PDF to RAG-Ready: Evaluating Document Conversion Frameworks for Domain-Specific Question Answering","ref_index":14,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC","json":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC.json","graph_json":"https://pith.science/api/pith-number/TR6HWDPSSZIVFTER6NA7ROFVSC/graph.json","events_json":"https://pith.science/api/pith-number/TR6HWDPSSZIVFTER6NA7ROFVSC/events.json","paper":"https://pith.science/paper/TR6HWDPS"},"agent_actions":{"view_html":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC","download_json":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC.json","view_paper":"https://pith.science/paper/TR6HWDPS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.05137&json=true","fetch_graph":"https://pith.science/api/pith-number/TR6HWDPSSZIVFTER6NA7ROFVSC/graph.json","fetch_events":"https://pith.science/api/pith-number/TR6HWDPSSZIVFTER6NA7ROFVSC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC/action/storage_attestation","attest_author":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC/action/author_attestation","sign_citation":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC/action/citation_signature","submit_replication":"https://pith.science/pith/TR6HWDPSSZIVFTER6NA7ROFVSC/action/replication_record"}},"created_at":"2026-07-05T11:35:50.946301+00:00","updated_at":"2026-07-05T11:35:50.946301+00:00"}