{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:FXIGCMTII3Q2EXBXE6TBBM3AF7","short_pith_number":"pith:FXIGCMTI","schema_version":"1.0","canonical_sha256":"2dd061326846e1a25c3727a610b3602fcf1eeb34878f489d1fae69601334dfba","source":{"kind":"arxiv","id":"2410.03321","version":1},"attestation_state":"computed","paper":{"title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Lei Zhang, Minheng Ni, Wangmeng Zuo, Yutao Fan","submitted_at":"2024-10-04T11:18:41Z","abstract_excerpt":"As large-scale models evolve, language instructions are increasingly utilized in multi-modal tasks. Due to human language habits, these instructions often contain ambiguities in real-world scenarios, necessitating the integration of visual context or common sense for accurate interpretation. However, even highly intelligent large models exhibit significant performance limitations on ambiguous instructions, where weak reasoning abilities of disambiguation can lead to catastrophic errors. To address this issue, this paper proposes Visual-O1, a multi-modal multi-turn chain-of-thought reasoning fr"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.03321","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-04T11:18:41Z","cross_cats_sorted":[],"title_canon_sha256":"194aea88f7e9ddb7ab4c038362f7e5be414b41bc5b6daf10e00a378a21267e5e","abstract_canon_sha256":"944d1d27299f7406f111c8be63206a611e156db1e93efe244194170551e21aec"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:15:47.612871Z","signature_b64":"mB8AC2ojpPuJJb069rossvb/IHNC1ps4XUcMpLE33uP0Hv35BixZ20uOaqFg72lE5vQkIO6HMYW0dodU4vA+CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2dd061326846e1a25c3727a610b3602fcf1eeb34878f489d1fae69601334dfba","last_reissued_at":"2026-07-05T09:15:47.612405Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:15:47.612405Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Lei Zhang, Minheng Ni, Wangmeng Zuo, Yutao Fan","submitted_at":"2024-10-04T11:18:41Z","abstract_excerpt":"As large-scale models evolve, language instructions are increasingly utilized in multi-modal tasks. Due to human language habits, these instructions often contain ambiguities in real-world scenarios, necessitating the integration of visual context or common sense for accurate interpretation. However, even highly intelligent large models exhibit significant performance limitations on ambiguous instructions, where weak reasoning abilities of disambiguation can lead to catastrophic errors. To address this issue, this paper proposes Visual-O1, a multi-modal multi-turn chain-of-thought reasoning fr"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.03321","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.03321/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.03321","created_at":"2026-07-05T09:15:47.612471+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.03321v1","created_at":"2026-07-05T09:15:47.612471+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.03321","created_at":"2026-07-05T09:15:47.612471+00:00"},{"alias_kind":"pith_short_12","alias_value":"FXIGCMTII3Q2","created_at":"2026-07-05T09:15:47.612471+00:00"},{"alias_kind":"pith_short_16","alias_value":"FXIGCMTII3Q2EXBX","created_at":"2026-07-05T09:15:47.612471+00:00"},{"alias_kind":"pith_short_8","alias_value":"FXIGCMTI","created_at":"2026-07-05T09:15:47.612471+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24539","citing_title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2509.23322","citing_title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12605","citing_title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","ref_index":87,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7","json":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7.json","graph_json":"https://pith.science/api/pith-number/FXIGCMTII3Q2EXBXE6TBBM3AF7/graph.json","events_json":"https://pith.science/api/pith-number/FXIGCMTII3Q2EXBXE6TBBM3AF7/events.json","paper":"https://pith.science/paper/FXIGCMTI"},"agent_actions":{"view_html":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7","download_json":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7.json","view_paper":"https://pith.science/paper/FXIGCMTI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.03321&json=true","fetch_graph":"https://pith.science/api/pith-number/FXIGCMTII3Q2EXBXE6TBBM3AF7/graph.json","fetch_events":"https://pith.science/api/pith-number/FXIGCMTII3Q2EXBXE6TBBM3AF7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7/action/storage_attestation","attest_author":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7/action/author_attestation","sign_citation":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7/action/citation_signature","submit_replication":"https://pith.science/pith/FXIGCMTII3Q2EXBXE6TBBM3AF7/action/replication_record"}},"created_at":"2026-07-05T09:15:47.612471+00:00","updated_at":"2026-07-05T09:15:47.612471+00:00"}