{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:7H4MTP642SB4IUNXFQRACI5RRR","short_pith_number":"pith:7H4MTP64","schema_version":"1.0","canonical_sha256":"f9f8c9bfdcd483c451b72c220123b18c6159bcf9ac6d5c5c2d90e481de74895a","source":{"kind":"arxiv","id":"2511.19418","version":3},"attestation_state":"computed","paper":{"title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Bomin wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, Xudong Wang, Yiming Qin","submitted_at":"2025-11-24T18:55:19Z","abstract_excerpt":"Vision-Language Models (VLMs) excel at reasoning in linguistic space but struggle with perceptual understanding that requires dense visual perception, e.g., spatial reasoning and geometric awareness. This limitation stems from the fact that current VLMs have limited mechanisms to capture dense visual information across spatial dimensions. We introduce Chain-of-Visual-Thought (COVT), a framework that enables VLMs to reason not only in words but also through continuous visual tokens-compact latent representations that encode rich perceptual cues. Within a small budget of roughly 20 tokens, COVT "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2511.19418","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-11-24T18:55:19Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"9b22c500b98bf270bcb429c3753e1f5863b3e58e6acf4809f841553aadc3af9a","abstract_canon_sha256":"52a3f0f015a9efc287172c18a2b6a231b5367f635f9158337a88b45adec3b576"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-06T01:16:45.445328Z","signature_b64":"5CVXEWR6LjkDcftnbGtrA8i72+GV4T1HVd06UITrDobZg+uOSLkdaoshxVkwmChVV9xMgUgKfoTwdelwjHEJCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f9f8c9bfdcd483c451b72c220123b18c6159bcf9ac6d5c5c2d90e481de74895a","last_reissued_at":"2026-08-06T01:16:45.443571Z","signature_status":"signed_v1","first_computed_at":"2026-08-06T01:16:45.443571Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Bomin wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, Xudong Wang, Yiming Qin","submitted_at":"2025-11-24T18:55:19Z","abstract_excerpt":"Vision-Language Models (VLMs) excel at reasoning in linguistic space but struggle with perceptual understanding that requires dense visual perception, e.g., spatial reasoning and geometric awareness. This limitation stems from the fact that current VLMs have limited mechanisms to capture dense visual information across spatial dimensions. We introduce Chain-of-Visual-Thought (COVT), a framework that enables VLMs to reason not only in words but also through continuous visual tokens-compact latent representations that encode rich perceptual cues. Within a small budget of roughly 20 tokens, COVT "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2511.19418","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2511.19418/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2511.19418","created_at":"2026-08-06T01:16:45.445139+00:00"},{"alias_kind":"arxiv_version","alias_value":"2511.19418v3","created_at":"2026-08-06T01:16:45.445139+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2511.19418","created_at":"2026-08-06T01:16:45.445139+00:00"},{"alias_kind":"pith_short_12","alias_value":"7H4MTP642SB4","created_at":"2026-08-06T01:16:45.445139+00:00"},{"alias_kind":"pith_short_16","alias_value":"7H4MTP642SB4IUNX","created_at":"2026-08-06T01:16:45.445139+00:00"},{"alias_kind":"pith_short_8","alias_value":"7H4MTP64","created_at":"2026-08-06T01:16:45.445139+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":27,"internal_anchor_count":27,"sample":[{"citing_arxiv_id":"2607.08024","citing_title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","ref_index":37,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21734","citing_title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","ref_index":125,"is_internal_anchor":true},{"citing_arxiv_id":"2606.18273","citing_title":"Continuous Audio Thinking for Large Audio Language Models","ref_index":43,"is_internal_anchor":true},{"citing_arxiv_id":"2606.05736","citing_title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","ref_index":25,"is_internal_anchor":true},{"citing_arxiv_id":"2606.05769","citing_title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","ref_index":40,"is_internal_anchor":true},{"citing_arxiv_id":"2606.04433","citing_title":"Stateful Visual Encoders for Vision-Language Models","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2606.30168","citing_title":"Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"2606.00562","citing_title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","ref_index":74,"is_internal_anchor":true},{"citing_arxiv_id":"2605.22012","citing_title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","ref_index":47,"is_internal_anchor":true},{"citing_arxiv_id":"2601.18664","citing_title":"S$^2$GR: Stepwise Semantic-Guided Reasoning in Latent Space for Generative Recommendation","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12374","citing_title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2605.18641","citing_title":"Leveraging Latent Visual Reasoning in Silence","ref_index":20,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12374","citing_title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2602.04476","citing_title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","ref_index":24,"is_internal_anchor":true},{"citing_arxiv_id":"2602.20323","citing_title":"PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning","ref_index":50,"is_internal_anchor":true},{"citing_arxiv_id":"2604.24919","citing_title":"Agentic AI for Remote Sensing: Technical Challenges and Research Directions","ref_index":89,"is_internal_anchor":true},{"citing_arxiv_id":"2604.03307","citing_title":"V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators","ref_index":17,"is_internal_anchor":true},{"citing_arxiv_id":"2605.11856","citing_title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","ref_index":15,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12374","citing_title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2605.08802","citing_title":"CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization","ref_index":18,"is_internal_anchor":true},{"citing_arxiv_id":"2605.08802","citing_title":"CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization","ref_index":18,"is_internal_anchor":true},{"citing_arxiv_id":"2605.09614","citing_title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","ref_index":19,"is_internal_anchor":true},{"citing_arxiv_id":"2604.24919","citing_title":"Agentic AI for Remote Sensing: Technical Challenges and Research Directions","ref_index":89,"is_internal_anchor":true},{"citing_arxiv_id":"2605.02735","citing_title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","ref_index":23,"is_internal_anchor":true},{"citing_arxiv_id":"2605.07106","citing_title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","ref_index":29,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR","json":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR.json","graph_json":"https://pith.science/api/pith-number/7H4MTP642SB4IUNXFQRACI5RRR/graph.json","events_json":"https://pith.science/api/pith-number/7H4MTP642SB4IUNXFQRACI5RRR/events.json","paper":"https://pith.science/paper/7H4MTP64"},"agent_actions":{"view_html":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR","download_json":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR.json","view_paper":"https://pith.science/paper/7H4MTP64","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2511.19418&json=true","fetch_graph":"https://pith.science/api/pith-number/7H4MTP642SB4IUNXFQRACI5RRR/graph.json","fetch_events":"https://pith.science/api/pith-number/7H4MTP642SB4IUNXFQRACI5RRR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR/action/storage_attestation","attest_author":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR/action/author_attestation","sign_citation":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR/action/citation_signature","submit_replication":"https://pith.science/pith/7H4MTP642SB4IUNXFQRACI5RRR/action/replication_record"}},"created_at":"2026-08-06T01:16:45.445139+00:00","updated_at":"2026-08-06T01:16:45.445139+00:00"}