{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:R6SZF4T4233WTC2Y6RQM7GRM4B","short_pith_number":"pith:R6SZF4T4","schema_version":"1.0","canonical_sha256":"8fa592f27cd6f7698b58f460cf9a2ce04428f3815c70d2dec10cc70857b53f0d","source":{"kind":"arxiv","id":"2505.05464","version":2},"attestation_state":"computed","paper":{"title":"Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jinghan Zhang, Junxian He, Manling Li, Miao Xiong, Shiqi Chen, Siyang Gao, Tongyao Zhu, Wei Liu","submitted_at":"2025-05-08T17:56:23Z","abstract_excerpt":"Vision-Language Models (VLMs) combine visual perception with the general capabilities, such as reasoning, of Large Language Models (LLMs). However, the mechanisms by which these two abilities can be combined and contribute remain poorly understood. In this work, we explore to compose perception and reasoning through model merging that connects parameters of different models. Unlike previous works that often focus on merging models of the same kind, we propose merging models across modalities, enabling the incorporation of the reasoning capabilities of LLMs into VLMs. Through extensive experime"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.05464","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-05-08T17:56:23Z","cross_cats_sorted":[],"title_canon_sha256":"5e88e305f31820fe0a76fe5710db68352c5f0b110a3abb6440fc6bc2e99a1ee5","abstract_canon_sha256":"91c5556d93f131f09b62e93d782f21728b53ff13cb435966011f0f5806907439"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:37:19.758245Z","signature_b64":"/HCS9T7Ua4W4dX3Z7QAhMyA9Ro9iyuBN9mgUPXManbP3KfBfoqdAkEabPl/Sur3uLtjN1QM4Sus4SNIsa92YCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8fa592f27cd6f7698b58f460cf9a2ce04428f3815c70d2dec10cc70857b53f0d","last_reissued_at":"2026-07-05T11:37:19.757749Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:37:19.757749Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jinghan Zhang, Junxian He, Manling Li, Miao Xiong, Shiqi Chen, Siyang Gao, Tongyao Zhu, Wei Liu","submitted_at":"2025-05-08T17:56:23Z","abstract_excerpt":"Vision-Language Models (VLMs) combine visual perception with the general capabilities, such as reasoning, of Large Language Models (LLMs). However, the mechanisms by which these two abilities can be combined and contribute remain poorly understood. In this work, we explore to compose perception and reasoning through model merging that connects parameters of different models. Unlike previous works that often focus on merging models of the same kind, we propose merging models across modalities, enabling the incorporation of the reasoning capabilities of LLMs into VLMs. Through extensive experime"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.05464","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.05464/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.05464","created_at":"2026-07-05T11:37:19.757807+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.05464v2","created_at":"2026-07-05T11:37:19.757807+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.05464","created_at":"2026-07-05T11:37:19.757807+00:00"},{"alias_kind":"pith_short_12","alias_value":"R6SZF4T4233W","created_at":"2026-07-05T11:37:19.757807+00:00"},{"alias_kind":"pith_short_16","alias_value":"R6SZF4T4233WTC2Y","created_at":"2026-07-05T11:37:19.757807+00:00"},{"alias_kind":"pith_short_8","alias_value":"R6SZF4T4","created_at":"2026-07-05T11:37:19.757807+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.05744","citing_title":"PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01558","citing_title":"Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31073","citing_title":"ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2503.09567","citing_title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","ref_index":99,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12890","citing_title":"Towards Long-horizon Agentic Multimodal Search","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11399","citing_title":"Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging","ref_index":3,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B","json":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B.json","graph_json":"https://pith.science/api/pith-number/R6SZF4T4233WTC2Y6RQM7GRM4B/graph.json","events_json":"https://pith.science/api/pith-number/R6SZF4T4233WTC2Y6RQM7GRM4B/events.json","paper":"https://pith.science/paper/R6SZF4T4"},"agent_actions":{"view_html":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B","download_json":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B.json","view_paper":"https://pith.science/paper/R6SZF4T4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.05464&json=true","fetch_graph":"https://pith.science/api/pith-number/R6SZF4T4233WTC2Y6RQM7GRM4B/graph.json","fetch_events":"https://pith.science/api/pith-number/R6SZF4T4233WTC2Y6RQM7GRM4B/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B/action/timestamp_anchor","attest_storage":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B/action/storage_attestation","attest_author":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B/action/author_attestation","sign_citation":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B/action/citation_signature","submit_replication":"https://pith.science/pith/R6SZF4T4233WTC2Y6RQM7GRM4B/action/replication_record"}},"created_at":"2026-07-05T11:37:19.757807+00:00","updated_at":"2026-07-05T11:37:19.757807+00:00"}