{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:KNUN3WD7E64VJXZYNREGY7SM62","short_pith_number":"pith:KNUN3WD7","schema_version":"1.0","canonical_sha256":"5368ddd87f27b954df386c486c7e4cf6864819b6bf22c864ad47e34f2dd3dab5","source":{"kind":"arxiv","id":"2311.16483","version":1},"attestation_state":"computed","paper":{"title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Bin Fu, Chi Zhang, Gang Yu, Hanwang Zhang, Xin Chen, Xu Yang, Yucheng Han, Zhibin Wang","submitted_at":"2023-11-27T15:20:23Z","abstract_excerpt":"Multi-modal large language models have demonstrated impressive performances on most vision-language tasks. However, the model generally lacks the understanding capabilities for specific domain data, particularly when it comes to interpreting chart figures. This is mainly due to the lack of relevant multi-modal instruction tuning datasets. In this article, we create a high-quality instruction-tuning dataset leveraging GPT-4. We develop a multi-step data generation process in which different steps are responsible for generating tabular data, creating chart figures, and designing instruction tuni"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.16483","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.CV","submitted_at":"2023-11-27T15:20:23Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"db4d122da08c8175781d6012c26d739a304aa2004a01262bea1e77c2e00d854e","abstract_canon_sha256":"1e45ae62122f34f7e32f86129f8c4fc3fed9a0c1a5158d478b5b3cdba35eedd7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:17:42.499859Z","signature_b64":"M2cU3l2Ztd+hf1nFaAJ1+XCLfBmGoTfIUFozNdtwAqG7Sf1thwMLF69D2iMZjY6wkASNA6DdI4UCotGZdPKUDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5368ddd87f27b954df386c486c7e4cf6864819b6bf22c864ad47e34f2dd3dab5","last_reissued_at":"2026-07-05T07:17:42.499377Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:17:42.499377Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Bin Fu, Chi Zhang, Gang Yu, Hanwang Zhang, Xin Chen, Xu Yang, Yucheng Han, Zhibin Wang","submitted_at":"2023-11-27T15:20:23Z","abstract_excerpt":"Multi-modal large language models have demonstrated impressive performances on most vision-language tasks. However, the model generally lacks the understanding capabilities for specific domain data, particularly when it comes to interpreting chart figures. This is mainly due to the lack of relevant multi-modal instruction tuning datasets. In this article, we create a high-quality instruction-tuning dataset leveraging GPT-4. We develop a multi-step data generation process in which different steps are responsible for generating tabular data, creating chart figures, and designing instruction tuni"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.16483","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.16483/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.16483","created_at":"2026-07-05T07:17:42.499433+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.16483v1","created_at":"2026-07-05T07:17:42.499433+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.16483","created_at":"2026-07-05T07:17:42.499433+00:00"},{"alias_kind":"pith_short_12","alias_value":"KNUN3WD7E64V","created_at":"2026-07-05T07:17:42.499433+00:00"},{"alias_kind":"pith_short_16","alias_value":"KNUN3WD7E64VJXZY","created_at":"2026-07-05T07:17:42.499433+00:00"},{"alias_kind":"pith_short_8","alias_value":"KNUN3WD7","created_at":"2026-07-05T07:17:42.499433+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05290","citing_title":"ChatImage: Navigating Long-Form LLM Answers through Interactive Images","ref_index":33,"is_internal_anchor":true},{"citing_arxiv_id":"2606.15932","citing_title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09174","citing_title":"Demonstrating chart-plot: Closing the Last Mile of Academic Chart Generation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28551","citing_title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","ref_index":92,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01599","citing_title":"TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01348","citing_title":"ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28551","citing_title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","ref_index":92,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23694","citing_title":"ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29808","citing_title":"Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28874","citing_title":"From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26994","citing_title":"ChartAct: A Benchmark for Dynamic Chart Understanding","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23694","citing_title":"ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2410.21169","citing_title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2508.07630","citing_title":"InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2312.13771","citing_title":"AppAgent: Multimodal Agents as Smartphone Users","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2512.19173","citing_title":"CycleChart: A Unified Consistency-Based Learning Framework for Bidirectional Chart Understanding and Generation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2601.13606","citing_title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02794","citing_title":"CharTool: Tool-Integrated Visual Reasoning for Chart Understanding","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25884","citing_title":"QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22192","citing_title":"CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01882","citing_title":"Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62","json":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62.json","graph_json":"https://pith.science/api/pith-number/KNUN3WD7E64VJXZYNREGY7SM62/graph.json","events_json":"https://pith.science/api/pith-number/KNUN3WD7E64VJXZYNREGY7SM62/events.json","paper":"https://pith.science/paper/KNUN3WD7"},"agent_actions":{"view_html":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62","download_json":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62.json","view_paper":"https://pith.science/paper/KNUN3WD7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.16483&json=true","fetch_graph":"https://pith.science/api/pith-number/KNUN3WD7E64VJXZYNREGY7SM62/graph.json","fetch_events":"https://pith.science/api/pith-number/KNUN3WD7E64VJXZYNREGY7SM62/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62/action/storage_attestation","attest_author":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62/action/author_attestation","sign_citation":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62/action/citation_signature","submit_replication":"https://pith.science/pith/KNUN3WD7E64VJXZYNREGY7SM62/action/replication_record"}},"created_at":"2026-07-05T07:17:42.499433+00:00","updated_at":"2026-07-05T07:17:42.499433+00:00"}