{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SNBHDPWVP4QWOYYSUKU4QMJQDH","short_pith_number":"pith:SNBHDPWV","schema_version":"1.0","canonical_sha256":"934271bed57f21676312a2a9c8313019c541394922d5066a0afd525e4c3f41d8","source":{"kind":"arxiv","id":"2505.04921","version":2},"attestation_state":"computed","paper":{"title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Baotian Hu, Baoxing Huai, Borui Jiang, Haoyuan Shi, Jifang Wang, Lanqing Hong, Longyue Wang, Min Zhang, Shenyuan Jiang, Shouzheng Huang, Weihua Luo, Wenhan Luo, Xinping Zhao, Xintong Wang, Xinyu Chen, Xuanyu Zhang, Yunxin Li, Zheng Zhang, Zhenran Xu, Zhenyu Liu, Zhuotao Tian, Zitao Li","submitted_at":"2025-05-08T03:35:23Z","abstract_excerpt":"Reasoning lies at the heart of intelligence, shaping the ability to make decisions, draw conclusions, and generalize across domains. In artificial intelligence, as systems increasingly operate in open, uncertain, and multimodal environments, reasoning becomes essential for enabling robust and adaptive behavior. Large Multimodal Reasoning Models (LMRMs) have emerged as a promising paradigm, integrating modalities such as text, images, audio, and video to support complex reasoning capabilities and aiming to achieve comprehensive perception, precise understanding, and deep reasoning. As research "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.04921","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-05-08T03:35:23Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"3c1ca2d83d1de87da3dae53de846821cbab6054cbd0061df120c49e1c40a2d09","abstract_canon_sha256":"1f72515fbb85dff561661d7ab6db71121390a15fd28ff7fe2c66c9a572c84a31"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:32:29.017240Z","signature_b64":"eqYqaLtxsUDeJYssoKOUQolgInqIxk+Cc0+smesIQ2XQfBODFGNmrRYMr9Qr9qAerrIf1twL9ZkJWGk6RTBmDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"934271bed57f21676312a2a9c8313019c541394922d5066a0afd525e4c3f41d8","last_reissued_at":"2026-07-05T11:32:29.016718Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:32:29.016718Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Baotian Hu, Baoxing Huai, Borui Jiang, Haoyuan Shi, Jifang Wang, Lanqing Hong, Longyue Wang, Min Zhang, Shenyuan Jiang, Shouzheng Huang, Weihua Luo, Wenhan Luo, Xinping Zhao, Xintong Wang, Xinyu Chen, Xuanyu Zhang, Yunxin Li, Zheng Zhang, Zhenran Xu, Zhenyu Liu, Zhuotao Tian, Zitao Li","submitted_at":"2025-05-08T03:35:23Z","abstract_excerpt":"Reasoning lies at the heart of intelligence, shaping the ability to make decisions, draw conclusions, and generalize across domains. In artificial intelligence, as systems increasingly operate in open, uncertain, and multimodal environments, reasoning becomes essential for enabling robust and adaptive behavior. Large Multimodal Reasoning Models (LMRMs) have emerged as a promising paradigm, integrating modalities such as text, images, audio, and video to support complex reasoning capabilities and aiming to achieve comprehensive perception, precise understanding, and deep reasoning. As research "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.04921","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.04921/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.04921","created_at":"2026-07-05T11:32:29.016779+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.04921v2","created_at":"2026-07-05T11:32:29.016779+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.04921","created_at":"2026-07-05T11:32:29.016779+00:00"},{"alias_kind":"pith_short_12","alias_value":"SNBHDPWVP4QW","created_at":"2026-07-05T11:32:29.016779+00:00"},{"alias_kind":"pith_short_16","alias_value":"SNBHDPWVP4QWOYYS","created_at":"2026-07-05T11:32:29.016779+00:00"},{"alias_kind":"pith_short_8","alias_value":"SNBHDPWV","created_at":"2026-07-05T11:32:29.016779+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.06540","citing_title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2606.27330","citing_title":"Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07433","citing_title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07643","citing_title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24562","citing_title":"PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25571","citing_title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27960","citing_title":"Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23294","citing_title":"NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2509.23322","citing_title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2512.03438","citing_title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10106","citing_title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17914","citing_title":"Beyond Binary Contrast: Modeling Continuous Skeleton Action Spaces with Transitional Anchors","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11240","citing_title":"Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08209","citing_title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","ref_index":18,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH","json":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH.json","graph_json":"https://pith.science/api/pith-number/SNBHDPWVP4QWOYYSUKU4QMJQDH/graph.json","events_json":"https://pith.science/api/pith-number/SNBHDPWVP4QWOYYSUKU4QMJQDH/events.json","paper":"https://pith.science/paper/SNBHDPWV"},"agent_actions":{"view_html":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH","download_json":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH.json","view_paper":"https://pith.science/paper/SNBHDPWV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.04921&json=true","fetch_graph":"https://pith.science/api/pith-number/SNBHDPWVP4QWOYYSUKU4QMJQDH/graph.json","fetch_events":"https://pith.science/api/pith-number/SNBHDPWVP4QWOYYSUKU4QMJQDH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH/action/storage_attestation","attest_author":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH/action/author_attestation","sign_citation":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH/action/citation_signature","submit_replication":"https://pith.science/pith/SNBHDPWVP4QWOYYSUKU4QMJQDH/action/replication_record"}},"created_at":"2026-07-05T11:32:29.016779+00:00","updated_at":"2026-07-05T11:32:29.016779+00:00"}