{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ULHYZZW6IA7FWCTKZTQJO7O4UX","short_pith_number":"pith:ULHYZZW6","schema_version":"1.0","canonical_sha256":"a2cf8ce6de403e5b0a6acce0977ddca5d79ea035a6f9bf3eb37257ab94a5a98f","source":{"kind":"arxiv","id":"2412.14835","version":1},"attestation_state":"computed","paper":{"title":"Progressive Multimodal Reasoning via Active Retrieval","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV","cs.IR"],"primary_cat":"cs.CL","authors_text":"Chenghao Zhang, Guanting Dong, Ji-Rong Wen, Mengjie Deng, Yutao Zhu, Zhicheng Dou","submitted_at":"2024-12-19T13:25:39Z","abstract_excerpt":"Multi-step multimodal reasoning tasks pose significant challenges for multimodal large language models (MLLMs), and finding effective ways to enhance their performance in such scenarios remains an unresolved issue. In this paper, we propose AR-MCTS, a universal framework designed to progressively improve the reasoning capabilities of MLLMs through Active Retrieval (AR) and Monte Carlo Tree Search (MCTS). Our approach begins with the development of a unified retrieval module that retrieves key supporting insights for solving complex reasoning problems from a hybrid-modal retrieval corpus. To br"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.14835","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-12-19T13:25:39Z","cross_cats_sorted":["cs.AI","cs.CV","cs.IR"],"title_canon_sha256":"be55c230d8b6daaebe7ce514a5e6ebfabffdfb4543f7d454eb779b854905bd6f","abstract_canon_sha256":"7bc299ae20d5dbd5955f2b6d3165bb89755d4dd2d7092f1dd4952b78c5d2df02"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:51:53.440093Z","signature_b64":"UZO3yujJweFDsgaFHfQgzHeSTelr4r80Pyw7mZ2wZI8XGZg8c1cmrxlF1yExpHCXQpuQDeafG/HNs8T6qCYABA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a2cf8ce6de403e5b0a6acce0977ddca5d79ea035a6f9bf3eb37257ab94a5a98f","last_reissued_at":"2026-07-05T09:51:53.439651Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:51:53.439651Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Progressive Multimodal Reasoning via Active Retrieval","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV","cs.IR"],"primary_cat":"cs.CL","authors_text":"Chenghao Zhang, Guanting Dong, Ji-Rong Wen, Mengjie Deng, Yutao Zhu, Zhicheng Dou","submitted_at":"2024-12-19T13:25:39Z","abstract_excerpt":"Multi-step multimodal reasoning tasks pose significant challenges for multimodal large language models (MLLMs), and finding effective ways to enhance their performance in such scenarios remains an unresolved issue. In this paper, we propose AR-MCTS, a universal framework designed to progressively improve the reasoning capabilities of MLLMs through Active Retrieval (AR) and Monte Carlo Tree Search (MCTS). Our approach begins with the development of a unified retrieval module that retrieves key supporting insights for solving complex reasoning problems from a hybrid-modal retrieval corpus. To br"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.14835","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.14835/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.14835","created_at":"2026-07-05T09:51:53.439707+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.14835v1","created_at":"2026-07-05T09:51:53.439707+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.14835","created_at":"2026-07-05T09:51:53.439707+00:00"},{"alias_kind":"pith_short_12","alias_value":"ULHYZZW6IA7F","created_at":"2026-07-05T09:51:53.439707+00:00"},{"alias_kind":"pith_short_16","alias_value":"ULHYZZW6IA7FWCTK","created_at":"2026-07-05T09:51:53.439707+00:00"},{"alias_kind":"pith_short_8","alias_value":"ULHYZZW6","created_at":"2026-07-05T09:51:53.439707+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11470","citing_title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2502.13957","citing_title":"Supervising the search process produces reliable and generalizable information-seeking agents","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12605","citing_title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","ref_index":93,"is_internal_anchor":false},{"citing_arxiv_id":"2501.05366","citing_title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX","json":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX.json","graph_json":"https://pith.science/api/pith-number/ULHYZZW6IA7FWCTKZTQJO7O4UX/graph.json","events_json":"https://pith.science/api/pith-number/ULHYZZW6IA7FWCTKZTQJO7O4UX/events.json","paper":"https://pith.science/paper/ULHYZZW6"},"agent_actions":{"view_html":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX","download_json":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX.json","view_paper":"https://pith.science/paper/ULHYZZW6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.14835&json=true","fetch_graph":"https://pith.science/api/pith-number/ULHYZZW6IA7FWCTKZTQJO7O4UX/graph.json","fetch_events":"https://pith.science/api/pith-number/ULHYZZW6IA7FWCTKZTQJO7O4UX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX/action/storage_attestation","attest_author":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX/action/author_attestation","sign_citation":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX/action/citation_signature","submit_replication":"https://pith.science/pith/ULHYZZW6IA7FWCTKZTQJO7O4UX/action/replication_record"}},"created_at":"2026-07-05T09:51:53.439707+00:00","updated_at":"2026-07-05T09:51:53.439707+00:00"}