{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:M7O6VYPDPF5PNQIXIFQQ2VGM7X","short_pith_number":"pith:M7O6VYPD","schema_version":"1.0","canonical_sha256":"67ddeae1e3797af6c11741610d54ccfdf8aae9316906f50aa6c49809ef4a022f","source":{"kind":"arxiv","id":"2312.14135","version":2},"attestation_state":"computed","paper":{"title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Penghao Wu, Saining Xie","submitted_at":"2023-12-21T18:55:06Z","abstract_excerpt":"When we look around and perform complex tasks, how we see and selectively process what we see is crucial. However, the lack of this visual search mechanism in current multimodal LLMs (MLLMs) hinders their ability to focus on important visual details, especially when handling high-resolution and visually crowded images. To address this, we introduce V*, an LLM-guided visual search mechanism that employs the world knowledge in LLMs for efficient visual querying. When combined with an MLLM, this mechanism enhances collaborative reasoning, contextual understanding, and precise targeting of specifi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.14135","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2023-12-21T18:55:06Z","cross_cats_sorted":[],"title_canon_sha256":"af4f4f786b4e30bf44b3095475f0584850633866730bf6dfd73a142fb0af8da2","abstract_canon_sha256":"381044713e83d04b261db987328d60ac004ad952d3be9c81b2870df5a3d05893"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:27:55.330696Z","signature_b64":"qVzGP3wvdX15Z67QVdsUuuyY4E1HML4IED8CJbWHeR8F560SFgAenFnzipvnPAeeiskKg2j0zy4C7+vQc94MDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"67ddeae1e3797af6c11741610d54ccfdf8aae9316906f50aa6c49809ef4a022f","last_reissued_at":"2026-07-05T07:27:55.330144Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:27:55.330144Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Penghao Wu, Saining Xie","submitted_at":"2023-12-21T18:55:06Z","abstract_excerpt":"When we look around and perform complex tasks, how we see and selectively process what we see is crucial. However, the lack of this visual search mechanism in current multimodal LLMs (MLLMs) hinders their ability to focus on important visual details, especially when handling high-resolution and visually crowded images. To address this, we introduce V*, an LLM-guided visual search mechanism that employs the world knowledge in LLMs for efficient visual querying. When combined with an MLLM, this mechanism enhances collaborative reasoning, contextual understanding, and precise targeting of specifi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.14135","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.14135/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.14135","created_at":"2026-07-05T07:27:55.330213+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.14135v2","created_at":"2026-07-05T07:27:55.330213+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.14135","created_at":"2026-07-05T07:27:55.330213+00:00"},{"alias_kind":"pith_short_12","alias_value":"M7O6VYPDPF5P","created_at":"2026-07-05T07:27:55.330213+00:00"},{"alias_kind":"pith_short_16","alias_value":"M7O6VYPDPF5PNQIX","created_at":"2026-07-05T07:27:55.330213+00:00"},{"alias_kind":"pith_short_8","alias_value":"M7O6VYPD","created_at":"2026-07-05T07:27:55.330213+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23581","citing_title":"Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21968","citing_title":"Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18974","citing_title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03054","citing_title":"ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07639","citing_title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28741","citing_title":"Self-Prophetic Decoding to Unlock Visual Search in LVLMs","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2505.23678","citing_title":"Grounded Reinforcement Learning for Visual Reasoning","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2510.00054","citing_title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2602.23622","citing_title":"DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18445","citing_title":"What's Holding Back Latent Visual Reasoning?","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18603","citing_title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2509.22746","citing_title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2602.13310","citing_title":"Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2306.13549","citing_title":"A Survey on Multimodal Large Language Models","ref_index":208,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24583","citing_title":"Improving Vision-language Models with Perception-centric Process Reward Models","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2407.07726","citing_title":"PaliGemma: A versatile 3B VLM for transfer","ref_index":147,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10219","citing_title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08456","citing_title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09167","citing_title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08065","citing_title":"Multimodal Latent Reasoning via Predictive Embeddings","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2505.07062","citing_title":"Seed1.5-VL Technical Report","ref_index":149,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07817","citing_title":"GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06912","citing_title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18562","citing_title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","ref_index":213,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22875","citing_title":"SketchVLM: Vision language models can annotate images to explain thoughts and guide users","ref_index":49,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X","json":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X.json","graph_json":"https://pith.science/api/pith-number/M7O6VYPDPF5PNQIXIFQQ2VGM7X/graph.json","events_json":"https://pith.science/api/pith-number/M7O6VYPDPF5PNQIXIFQQ2VGM7X/events.json","paper":"https://pith.science/paper/M7O6VYPD"},"agent_actions":{"view_html":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X","download_json":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X.json","view_paper":"https://pith.science/paper/M7O6VYPD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.14135&json=true","fetch_graph":"https://pith.science/api/pith-number/M7O6VYPDPF5PNQIXIFQQ2VGM7X/graph.json","fetch_events":"https://pith.science/api/pith-number/M7O6VYPDPF5PNQIXIFQQ2VGM7X/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X/action/timestamp_anchor","attest_storage":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X/action/storage_attestation","attest_author":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X/action/author_attestation","sign_citation":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X/action/citation_signature","submit_replication":"https://pith.science/pith/M7O6VYPDPF5PNQIXIFQQ2VGM7X/action/replication_record"}},"created_at":"2026-07-05T07:27:55.330213+00:00","updated_at":"2026-07-05T07:27:55.330213+00:00"}