{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:UUMINGEWXNBYUNCTBPIR7MHXRD","short_pith_number":"pith:UUMINGEW","schema_version":"1.0","canonical_sha256":"a518869896bb438a34530bd11fb0f788dff5c6ecfc26612870a49a532636a0e5","source":{"kind":"arxiv","id":"2404.19205","version":1},"attestation_state":"computed","paper":{"title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Ka Yeon Song, Moonbin Yim, Yoonsik Kim","submitted_at":"2024-04-30T02:05:18Z","abstract_excerpt":"In this paper, we establish a benchmark for table visual question answering, referred to as the TableVQA-Bench, derived from pre-existing table question-answering (QA) and table structure recognition datasets. It is important to note that existing datasets have not incorporated images or QA pairs, which are two crucial components of TableVQA. As such, the primary objective of this paper is to obtain these necessary components. Specifically, images are sourced either through the application of a \\textit{stylesheet} or by employing the proposed table rendering system. QA pairs are generated by e"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.19205","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-04-30T02:05:18Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"28e6e0925a02a2bf83d4de759d6919fbe78fac8f15d80e782878a635bf1f5462","abstract_canon_sha256":"4e958aa40570001e476448d1bc4638a0c480ae2e0ee3d1c665d9b26cba521c1a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:13:39.892224Z","signature_b64":"H1Ez2SFM1bn90Q4OhAGcyI/hJX3EV9pkXmVrrE8cLIHqJsn+QpPwEHkI1KXlnfMFlmtaww0lonAKM5hfmP1ZAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a518869896bb438a34530bd11fb0f788dff5c6ecfc26612870a49a532636a0e5","last_reissued_at":"2026-07-05T08:13:39.891712Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:13:39.891712Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Ka Yeon Song, Moonbin Yim, Yoonsik Kim","submitted_at":"2024-04-30T02:05:18Z","abstract_excerpt":"In this paper, we establish a benchmark for table visual question answering, referred to as the TableVQA-Bench, derived from pre-existing table question-answering (QA) and table structure recognition datasets. It is important to note that existing datasets have not incorporated images or QA pairs, which are two crucial components of TableVQA. As such, the primary objective of this paper is to obtain these necessary components. Specifically, images are sourced either through the application of a \\textit{stylesheet} or by employing the proposed table rendering system. QA pairs are generated by e"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.19205","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.19205/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.19205","created_at":"2026-07-05T08:13:39.891775+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.19205v1","created_at":"2026-07-05T08:13:39.891775+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.19205","created_at":"2026-07-05T08:13:39.891775+00:00"},{"alias_kind":"pith_short_12","alias_value":"UUMINGEWXNBY","created_at":"2026-07-05T08:13:39.891775+00:00"},{"alias_kind":"pith_short_16","alias_value":"UUMINGEWXNBYUNCT","created_at":"2026-07-05T08:13:39.891775+00:00"},{"alias_kind":"pith_short_8","alias_value":"UUMINGEW","created_at":"2026-07-05T08:13:39.891775+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26041","citing_title":"How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11652","citing_title":"IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09578","citing_title":"TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01018","citing_title":"WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2509.07966","citing_title":"Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2510.09671","citing_title":"Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2501.00321","citing_title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02371","citing_title":"Internalized Reasoning for Long-Context Visual Document Understanding","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03660","citing_title":"TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08146","citing_title":"VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08138","citing_title":"DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05955","citing_title":"TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05668","citing_title":"Large Vision-Language Models Get Lost in Attention","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01018","citing_title":"WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16099","citing_title":"DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD","json":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD.json","graph_json":"https://pith.science/api/pith-number/UUMINGEWXNBYUNCTBPIR7MHXRD/graph.json","events_json":"https://pith.science/api/pith-number/UUMINGEWXNBYUNCTBPIR7MHXRD/events.json","paper":"https://pith.science/paper/UUMINGEW"},"agent_actions":{"view_html":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD","download_json":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD.json","view_paper":"https://pith.science/paper/UUMINGEW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.19205&json=true","fetch_graph":"https://pith.science/api/pith-number/UUMINGEWXNBYUNCTBPIR7MHXRD/graph.json","fetch_events":"https://pith.science/api/pith-number/UUMINGEWXNBYUNCTBPIR7MHXRD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD/action/storage_attestation","attest_author":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD/action/author_attestation","sign_citation":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD/action/citation_signature","submit_replication":"https://pith.science/pith/UUMINGEWXNBYUNCTBPIR7MHXRD/action/replication_record"}},"created_at":"2026-07-05T08:13:39.891775+00:00","updated_at":"2026-07-05T08:13:39.891775+00:00"}