{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:UB2L5KJTYSIVJ4YG324HFI4V6R","short_pith_number":"pith:UB2L5KJT","schema_version":"1.0","canonical_sha256":"a074bea933c49154f306deb872a395f46bdc6732f1534821b267b113f7c3affa","source":{"kind":"arxiv","id":"2501.06186","version":1},"attestation_state":"computed","paper":{"title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ahmed Heakl, Dinura Dissanayake, Fahad Shahbaz Khan, Hisham Cholakkal, Ivan Laptev, Jean Lahoud, Ketan More, Mohammed Zumri, Mubarak Shah, Noor Ahsan, Omkar Thawakar, Rao Muhammad Anwer, Ritesh Thawkar, Salman Khan, Yuhao Li","submitted_at":"2025-01-10T18:59:51Z","abstract_excerpt":"Reasoning is a fundamental capability for solving complex multi-step problems, particularly in visual contexts where sequential step-wise understanding is essential. Existing approaches lack a comprehensive framework for evaluating visual reasoning and do not emphasize step-wise problem-solving. To this end, we propose a comprehensive framework for advancing step-by-step visual reasoning in large language models (LMMs) through three key contributions. First, we introduce a visual reasoning benchmark specifically designed to evaluate multi-step reasoning tasks. The benchmark presents a diverse "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.06186","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-01-10T18:59:51Z","cross_cats_sorted":[],"title_canon_sha256":"c533093a0ba5949ec5f8a21c8d33d9211036024b4b8e2ab53d51bfe19882b465","abstract_canon_sha256":"5f21656e70ca6ae8c59d6bd4cf420ff3974002a70beb6e0393cca73b7f0b1dc7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:59:34.405652Z","signature_b64":"JHy91/vbBM9Qx+unOYgxYHFxT0s1uDs6rW3LG2Yu3Oq94vD2ErV0cvMWJtt9+Rgymr8VViatkVV8qA0u1LzYCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a074bea933c49154f306deb872a395f46bdc6732f1534821b267b113f7c3affa","last_reissued_at":"2026-07-05T09:59:34.405094Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:59:34.405094Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ahmed Heakl, Dinura Dissanayake, Fahad Shahbaz Khan, Hisham Cholakkal, Ivan Laptev, Jean Lahoud, Ketan More, Mohammed Zumri, Mubarak Shah, Noor Ahsan, Omkar Thawakar, Rao Muhammad Anwer, Ritesh Thawkar, Salman Khan, Yuhao Li","submitted_at":"2025-01-10T18:59:51Z","abstract_excerpt":"Reasoning is a fundamental capability for solving complex multi-step problems, particularly in visual contexts where sequential step-wise understanding is essential. Existing approaches lack a comprehensive framework for evaluating visual reasoning and do not emphasize step-wise problem-solving. To this end, we propose a comprehensive framework for advancing step-by-step visual reasoning in large language models (LMMs) through three key contributions. First, we introduce a visual reasoning benchmark specifically designed to evaluate multi-step reasoning tasks. The benchmark presents a diverse "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.06186","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.06186/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.06186","created_at":"2026-07-05T09:59:34.405154+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.06186v1","created_at":"2026-07-05T09:59:34.405154+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.06186","created_at":"2026-07-05T09:59:34.405154+00:00"},{"alias_kind":"pith_short_12","alias_value":"UB2L5KJTYSIV","created_at":"2026-07-05T09:59:34.405154+00:00"},{"alias_kind":"pith_short_16","alias_value":"UB2L5KJTYSIVJ4YG","created_at":"2026-07-05T09:59:34.405154+00:00"},{"alias_kind":"pith_short_8","alias_value":"UB2L5KJT","created_at":"2026-07-05T09:59:34.405154+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17539","citing_title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","ref_index":90,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20177","citing_title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2506.06856","citing_title":"Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2503.05132","citing_title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2503.17352","citing_title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2509.22746","citing_title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2509.23322","citing_title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2505.21374","citing_title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12937","citing_title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2602.07605","citing_title":"Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2503.10615","citing_title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12605","citing_title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","ref_index":97,"is_internal_anchor":false},{"citing_arxiv_id":"2502.17419","citing_title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","ref_index":236,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00877","citing_title":"OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04500","citing_title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","ref_index":67,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R","json":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R.json","graph_json":"https://pith.science/api/pith-number/UB2L5KJTYSIVJ4YG324HFI4V6R/graph.json","events_json":"https://pith.science/api/pith-number/UB2L5KJTYSIVJ4YG324HFI4V6R/events.json","paper":"https://pith.science/paper/UB2L5KJT"},"agent_actions":{"view_html":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R","download_json":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R.json","view_paper":"https://pith.science/paper/UB2L5KJT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.06186&json=true","fetch_graph":"https://pith.science/api/pith-number/UB2L5KJTYSIVJ4YG324HFI4V6R/graph.json","fetch_events":"https://pith.science/api/pith-number/UB2L5KJTYSIVJ4YG324HFI4V6R/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R/action/storage_attestation","attest_author":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R/action/author_attestation","sign_citation":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R/action/citation_signature","submit_replication":"https://pith.science/pith/UB2L5KJTYSIVJ4YG324HFI4V6R/action/replication_record"}},"created_at":"2026-07-05T09:59:34.405154+00:00","updated_at":"2026-07-05T09:59:34.405154+00:00"}