{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:3WBREGZIJMCSUGBCUZZCAFKJGK","short_pith_number":"pith:3WBREGZI","schema_version":"1.0","canonical_sha256":"dd83121b284b052a1822a6722015493285e29805ead275e305953603c439dfe8","source":{"kind":"arxiv","id":"2403.00231","version":3},"attestation_state":"computed","paper":{"title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Lei Li, Lingpeng Kong, Peiyi Wang, Qi Liu, Runxin Xu, Xiachong Feng, Yuqi Wang","submitted_at":"2024-03-01T02:21:30Z","abstract_excerpt":"Large vision-language models (LVLMs) excel across diverse tasks involving concrete images from natural scenes. However, their ability to interpret abstract figures, such as geometry shapes and scientific plots, remains limited due to a scarcity of training datasets in scientific domains. To fill this gap, we introduce Multimodal ArXiv, consisting of ArXivCap and ArXivQA, for enhancing LVLMs scientific comprehension. ArXivCap is a figure-caption dataset comprising 6.4M images and 3.9M captions, sourced from 572K ArXiv papers spanning various scientific domains. Drawing from ArXivCap, we introdu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.00231","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-03-01T02:21:30Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"2e2f6a3d7b80c3a72a5c484a93a922ec06c892ec7509e2dd5e8fd96dbe5ff088","abstract_canon_sha256":"294a4d8d1a1cb175790584f6de9a71469bcd70262fa1b52dbfcce5fb970e4099"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:26:20.871260Z","signature_b64":"GbshuBQPUFYVBKH9h4ANELqnwsr6adbAHbK5xCGpwh82yZnFSb1Ujx8TEs1vPx3hj5CSjoz9/xi8ht0SJ99zDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dd83121b284b052a1822a6722015493285e29805ead275e305953603c439dfe8","last_reissued_at":"2026-07-05T08:26:20.870790Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:26:20.870790Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Lei Li, Lingpeng Kong, Peiyi Wang, Qi Liu, Runxin Xu, Xiachong Feng, Yuqi Wang","submitted_at":"2024-03-01T02:21:30Z","abstract_excerpt":"Large vision-language models (LVLMs) excel across diverse tasks involving concrete images from natural scenes. However, their ability to interpret abstract figures, such as geometry shapes and scientific plots, remains limited due to a scarcity of training datasets in scientific domains. To fill this gap, we introduce Multimodal ArXiv, consisting of ArXivCap and ArXivQA, for enhancing LVLMs scientific comprehension. ArXivCap is a figure-caption dataset comprising 6.4M images and 3.9M captions, sourced from 572K ArXiv papers spanning various scientific domains. Drawing from ArXivCap, we introdu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.00231","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.00231/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.00231","created_at":"2026-07-05T08:26:20.870843+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.00231v3","created_at":"2026-07-05T08:26:20.870843+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.00231","created_at":"2026-07-05T08:26:20.870843+00:00"},{"alias_kind":"pith_short_12","alias_value":"3WBREGZIJMCS","created_at":"2026-07-05T08:26:20.870843+00:00"},{"alias_kind":"pith_short_16","alias_value":"3WBREGZIJMCSUGBC","created_at":"2026-07-05T08:26:20.870843+00:00"},{"alias_kind":"pith_short_8","alias_value":"3WBREGZI","created_at":"2026-07-05T08:26:20.870843+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18216","citing_title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","ref_index":107,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11853","citing_title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14938","citing_title":"Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2410.05970","citing_title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2502.02871","citing_title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2504.09925","citing_title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19852","citing_title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20177","citing_title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2511.13415","citing_title":"Attention Grounded Enhancement for Visual Document Retrieval","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14164","citing_title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","ref_index":116,"is_internal_anchor":false},{"citing_arxiv_id":"2406.16860","citing_title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2511.05271","citing_title":"DeepEyesV2: Toward Agentic Multimodal Model","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2410.13848","citing_title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04172","citing_title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21304","citing_title":"PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2412.10302","citing_title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08211","citing_title":"SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2408.01800","citing_title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05271","citing_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","ref_index":132,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02730","citing_title":"Perceptual Flow Network for Visually Grounded Reasoning","ref_index":22,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK","json":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK.json","graph_json":"https://pith.science/api/pith-number/3WBREGZIJMCSUGBCUZZCAFKJGK/graph.json","events_json":"https://pith.science/api/pith-number/3WBREGZIJMCSUGBCUZZCAFKJGK/events.json","paper":"https://pith.science/paper/3WBREGZI"},"agent_actions":{"view_html":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK","download_json":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK.json","view_paper":"https://pith.science/paper/3WBREGZI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.00231&json=true","fetch_graph":"https://pith.science/api/pith-number/3WBREGZIJMCSUGBCUZZCAFKJGK/graph.json","fetch_events":"https://pith.science/api/pith-number/3WBREGZIJMCSUGBCUZZCAFKJGK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK/action/storage_attestation","attest_author":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK/action/author_attestation","sign_citation":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK/action/citation_signature","submit_replication":"https://pith.science/pith/3WBREGZIJMCSUGBCUZZCAFKJGK/action/replication_record"}},"created_at":"2026-07-05T08:26:20.870843+00:00","updated_at":"2026-07-05T08:26:20.870843+00:00"}