{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:UDBRHHUCAPZ6CXCLTGNPPWKQAF","short_pith_number":"pith:UDBRHHUC","schema_version":"1.0","canonical_sha256":"a0c3139e8203f3e15c4b999af7d950014be3f557418d27203918c748a8b9cc49","source":{"kind":"arxiv","id":"2007.00398","version":3},"attestation_state":"computed","paper":{"title":"DocVQA: A Dataset for VQA on Document Images","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR"],"primary_cat":"cs.CV","authors_text":"C.V. Jawahar, Dimosthenis Karatzas, Minesh Mathew","submitted_at":"2020-07-01T11:37:40Z","abstract_excerpt":"We present a new dataset for Visual Question Answering (VQA) on document images called DocVQA. The dataset consists of 50,000 questions defined on 12,000+ document images. Detailed analysis of the dataset in comparison with similar datasets for VQA and reading comprehension is presented. We report several baseline results by adopting existing VQA and reading comprehension models. Although the existing models perform reasonably well on certain types of questions, there is large performance gap compared to human performance (94.36% accuracy). The models need to improve specifically on questions "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2007.00398","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2020-07-01T11:37:40Z","cross_cats_sorted":["cs.IR"],"title_canon_sha256":"4b299c78748e7a8562e3cfed69ab2f7a8caad8205aa0f734241a54f8865fd579","abstract_canon_sha256":"362828d4982f691c31931a91461cb5e1ca17b3730f7a524f9120cbcd918bfd08"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:04:27.944364Z","signature_b64":"NUJTLCDRfzlc/mWZS1Kg4sO9hT3lMVysK/UVFi2DOLDvP/gAFR6evxT8HCiLHobmn36c2sX7SrCZlVmUnd8VCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a0c3139e8203f3e15c4b999af7d950014be3f557418d27203918c748a8b9cc49","last_reissued_at":"2026-07-05T02:04:27.943917Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:04:27.943917Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DocVQA: A Dataset for VQA on Document Images","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR"],"primary_cat":"cs.CV","authors_text":"C.V. Jawahar, Dimosthenis Karatzas, Minesh Mathew","submitted_at":"2020-07-01T11:37:40Z","abstract_excerpt":"We present a new dataset for Visual Question Answering (VQA) on document images called DocVQA. The dataset consists of 50,000 questions defined on 12,000+ document images. Detailed analysis of the dataset in comparison with similar datasets for VQA and reading comprehension is presented. We report several baseline results by adopting existing VQA and reading comprehension models. Although the existing models perform reasonably well on certain types of questions, there is large performance gap compared to human performance (94.36% accuracy). The models need to improve specifically on questions "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2007.00398","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2007.00398/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2007.00398","created_at":"2026-07-05T02:04:27.943980+00:00"},{"alias_kind":"arxiv_version","alias_value":"2007.00398v3","created_at":"2026-07-05T02:04:27.943980+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2007.00398","created_at":"2026-07-05T02:04:27.943980+00:00"},{"alias_kind":"pith_short_12","alias_value":"UDBRHHUCAPZ6","created_at":"2026-07-05T02:04:27.943980+00:00"},{"alias_kind":"pith_short_16","alias_value":"UDBRHHUCAPZ6CXCL","created_at":"2026-07-05T02:04:27.943980+00:00"},{"alias_kind":"pith_short_8","alias_value":"UDBRHHUC","created_at":"2026-07-05T02:04:27.943980+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26041","citing_title":"How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17110","citing_title":"Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02484","citing_title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31604","citing_title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25185","citing_title":"The category of Whittaker modules over the Cartan Type Lie algebra $\\bar{S}_2$","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30244","citing_title":"Reinforcement Learning with Robust Rubric Rewards","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2504.09925","citing_title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20950","citing_title":"Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2509.07966","citing_title":"Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2511.01831","citing_title":"Routing-Based Continual Learning for Multimodal Large Language Models","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2511.14998","citing_title":"FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2412.03555","citing_title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2406.16852","citing_title":"Long Context Transfer from Language to Vision","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25186","citing_title":"FCMBench-Video: Benchmarking Document Video Intelligence","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19503","citing_title":"ReaLB: Real-Time Load Balancing for Multimodal MoE Inference","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2407.07726","citing_title":"PaliGemma: A versatile 3B VLM for transfer","ref_index":94,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19945","citing_title":"Visual Reasoning through Tool-supervised Reinforcement Learning","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04075","citing_title":"RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08456","citing_title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08212","citing_title":"Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06912","citing_title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04901","citing_title":"FileGram: Grounding Agent Personalization in File-System Behavioral Traces","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14799","citing_title":"Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF","json":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF.json","graph_json":"https://pith.science/api/pith-number/UDBRHHUCAPZ6CXCLTGNPPWKQAF/graph.json","events_json":"https://pith.science/api/pith-number/UDBRHHUCAPZ6CXCLTGNPPWKQAF/events.json","paper":"https://pith.science/paper/UDBRHHUC"},"agent_actions":{"view_html":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF","download_json":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF.json","view_paper":"https://pith.science/paper/UDBRHHUC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2007.00398&json=true","fetch_graph":"https://pith.science/api/pith-number/UDBRHHUCAPZ6CXCLTGNPPWKQAF/graph.json","fetch_events":"https://pith.science/api/pith-number/UDBRHHUCAPZ6CXCLTGNPPWKQAF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF/action/storage_attestation","attest_author":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF/action/author_attestation","sign_citation":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF/action/citation_signature","submit_replication":"https://pith.science/pith/UDBRHHUCAPZ6CXCLTGNPPWKQAF/action/replication_record"}},"created_at":"2026-07-05T02:04:27.943980+00:00","updated_at":"2026-07-05T02:04:27.943980+00:00"}