{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:PEULKRWTVMFV23AFZEBB2NSTF4","short_pith_number":"pith:PEULKRWT","schema_version":"1.0","canonical_sha256":"7928b546d3ab0b5d6c05c9021d36532f38669ac0ff51b1a79babbdb911433aec","source":{"kind":"arxiv","id":"2311.11810","version":4},"attestation_state":"computed","paper":{"title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Can Huang, Hao Feng, Hao Liu, Houqiang Li, Jingqun Tang, Qi Liu, Wengang Zhou","submitted_at":"2023-11-20T14:42:25Z","abstract_excerpt":"This work presents DocPedia, a novel large multimodal model (LMM) for versatile OCR-free document understanding, capable of parsing images up to 2,560$\\times$2,560 resolution. Unlike existing work either struggle with high-resolution documents or give up the large language model thus vision or language ability constrained, our DocPedia directly processes visual input in the frequency domain rather than the pixel space. The unique characteristic enables DocPedia to capture a greater amount of visual and textual information using a limited number of visual tokens. To consistently enhance both pe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.11810","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2023-11-20T14:42:25Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"38d865d328a2a363c620a6597d87d75af77ea9fb229dd4641bc0f115ecb0dd46","abstract_canon_sha256":"5155200d56a5dff37cb5f213986a129130d57dd064a94f2bdc033f3448eb4892"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:39:51.975789Z","signature_b64":"YeokdUuu3kSDd59fFBr7AE49ygaLU1kGUkniCgaDYq6//uedqU0tTiJQCSAHxO79GPIcxtVxHxjBw+XhzMTEAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7928b546d3ab0b5d6c05c9021d36532f38669ac0ff51b1a79babbdb911433aec","last_reissued_at":"2026-07-05T09:39:51.975224Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:39:51.975224Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Can Huang, Hao Feng, Hao Liu, Houqiang Li, Jingqun Tang, Qi Liu, Wengang Zhou","submitted_at":"2023-11-20T14:42:25Z","abstract_excerpt":"This work presents DocPedia, a novel large multimodal model (LMM) for versatile OCR-free document understanding, capable of parsing images up to 2,560$\\times$2,560 resolution. Unlike existing work either struggle with high-resolution documents or give up the large language model thus vision or language ability constrained, our DocPedia directly processes visual input in the frequency domain rather than the pixel space. The unique characteristic enables DocPedia to capture a greater amount of visual and textual information using a limited number of visual tokens. To consistently enhance both pe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.11810","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.11810/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.11810","created_at":"2026-07-05T09:39:51.975290+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.11810v4","created_at":"2026-07-05T09:39:51.975290+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.11810","created_at":"2026-07-05T09:39:51.975290+00:00"},{"alias_kind":"pith_short_12","alias_value":"PEULKRWTVMFV","created_at":"2026-07-05T09:39:51.975290+00:00"},{"alias_kind":"pith_short_16","alias_value":"PEULKRWTVMFV23AF","created_at":"2026-07-05T09:39:51.975290+00:00"},{"alias_kind":"pith_short_8","alias_value":"PEULKRWT","created_at":"2026-07-05T09:39:51.975290+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2410.21169","citing_title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2508.06038","citing_title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18603","citing_title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2507.09861","citing_title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2501.00321","citing_title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","ref_index":32,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4","json":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4.json","graph_json":"https://pith.science/api/pith-number/PEULKRWTVMFV23AFZEBB2NSTF4/graph.json","events_json":"https://pith.science/api/pith-number/PEULKRWTVMFV23AFZEBB2NSTF4/events.json","paper":"https://pith.science/paper/PEULKRWT"},"agent_actions":{"view_html":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4","download_json":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4.json","view_paper":"https://pith.science/paper/PEULKRWT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.11810&json=true","fetch_graph":"https://pith.science/api/pith-number/PEULKRWTVMFV23AFZEBB2NSTF4/graph.json","fetch_events":"https://pith.science/api/pith-number/PEULKRWTVMFV23AFZEBB2NSTF4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4/action/storage_attestation","attest_author":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4/action/author_attestation","sign_citation":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4/action/citation_signature","submit_replication":"https://pith.science/pith/PEULKRWTVMFV23AFZEBB2NSTF4/action/replication_record"}},"created_at":"2026-07-05T09:39:51.975290+00:00","updated_at":"2026-07-05T09:39:51.975290+00:00"}