{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:3FMZOXYOMFQC6QY6A33QJHMINR","short_pith_number":"pith:3FMZOXYO","schema_version":"1.0","canonical_sha256":"d959975f0e61602f431e06f7049d886c66d725e80dff9516c26cbfd765bc49be","source":{"kind":"arxiv","id":"2410.16198","version":1},"attestation_state":"computed","paper":{"title":"Improve Vision Language Model Chain-of-thought Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.AI","authors_text":"Bowen Zhang, Haotian Zhang, Ruohong Zhang, Ruoming Pang, Yanghao Li, Yiming Yang, Yinfei Yang, Zhe Gan, Zhiqing Sun","submitted_at":"2024-10-21T17:00:06Z","abstract_excerpt":"Chain-of-thought (CoT) reasoning in vision language models (VLMs) is crucial for improving interpretability and trustworthiness. However, current training recipes lack robust CoT reasoning data, relying on datasets dominated by short annotations with minimal rationales. In this work, we show that training VLM on short answers does not generalize well to reasoning tasks that require more detailed responses. To address this, we propose a two-fold approach. First, we distill rationales from GPT-4o model to enrich the training data and fine-tune VLMs, boosting their CoT performance. Second, we app"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.16198","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2024-10-21T17:00:06Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"d934249d37ddfb92185e410423c844d24530d4628b00cec809d889109cfae1e5","abstract_canon_sha256":"7bf2f467772a1b249a5f4e5803af3859064fba2ce70f3948809d153cc1279e15"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:23:31.267960Z","signature_b64":"JfDAZeplDde6uydyVW69lBh1Vu/43B8ArCNz8Nwq3w/ofVa1NxmH0LcnzD7lWCXiZWC5RnD2dbsh2my8VsqvDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d959975f0e61602f431e06f7049d886c66d725e80dff9516c26cbfd765bc49be","last_reissued_at":"2026-07-05T09:23:31.267436Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:23:31.267436Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Improve Vision Language Model Chain-of-thought Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.AI","authors_text":"Bowen Zhang, Haotian Zhang, Ruohong Zhang, Ruoming Pang, Yanghao Li, Yiming Yang, Yinfei Yang, Zhe Gan, Zhiqing Sun","submitted_at":"2024-10-21T17:00:06Z","abstract_excerpt":"Chain-of-thought (CoT) reasoning in vision language models (VLMs) is crucial for improving interpretability and trustworthiness. However, current training recipes lack robust CoT reasoning data, relying on datasets dominated by short annotations with minimal rationales. In this work, we show that training VLM on short answers does not generalize well to reasoning tasks that require more detailed responses. To address this, we propose a two-fold approach. First, we distill rationales from GPT-4o model to enrich the training data and fine-tune VLMs, boosting their CoT performance. Second, we app"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.16198","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.16198/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.16198","created_at":"2026-07-05T09:23:31.267499+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.16198v1","created_at":"2026-07-05T09:23:31.267499+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.16198","created_at":"2026-07-05T09:23:31.267499+00:00"},{"alias_kind":"pith_short_12","alias_value":"3FMZOXYOMFQC","created_at":"2026-07-05T09:23:31.267499+00:00"},{"alias_kind":"pith_short_16","alias_value":"3FMZOXYOMFQC6QY6","created_at":"2026-07-05T09:23:31.267499+00:00"},{"alias_kind":"pith_short_8","alias_value":"3FMZOXYO","created_at":"2026-07-05T09:23:31.267499+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25906","citing_title":"OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29425","citing_title":"ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07604","citing_title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","ref_index":126,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20177","citing_title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2509.22746","citing_title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12937","citing_title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2503.12605","citing_title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","ref_index":138,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02371","citing_title":"Internalized Reasoning for Long-Context Visual Document Understanding","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24339","citing_title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04500","citing_title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","ref_index":92,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02035","citing_title":"VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR","json":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR.json","graph_json":"https://pith.science/api/pith-number/3FMZOXYOMFQC6QY6A33QJHMINR/graph.json","events_json":"https://pith.science/api/pith-number/3FMZOXYOMFQC6QY6A33QJHMINR/events.json","paper":"https://pith.science/paper/3FMZOXYO"},"agent_actions":{"view_html":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR","download_json":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR.json","view_paper":"https://pith.science/paper/3FMZOXYO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.16198&json=true","fetch_graph":"https://pith.science/api/pith-number/3FMZOXYOMFQC6QY6A33QJHMINR/graph.json","fetch_events":"https://pith.science/api/pith-number/3FMZOXYOMFQC6QY6A33QJHMINR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR/action/storage_attestation","attest_author":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR/action/author_attestation","sign_citation":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR/action/citation_signature","submit_replication":"https://pith.science/pith/3FMZOXYOMFQC6QY6A33QJHMINR/action/replication_record"}},"created_at":"2026-07-05T09:23:31.267499+00:00","updated_at":"2026-07-05T09:23:31.267499+00:00"}