{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:3MXSXOFT7RLX6ZSM4OJ7ZFSKM3","short_pith_number":"pith:3MXSXOFT","schema_version":"1.0","canonical_sha256":"db2f2bb8b3fc577f664ce393fc964a66dd51983d11444a4a87501264cdf281f3","source":{"kind":"arxiv","id":"2504.07956","version":1},"attestation_state":"computed","paper":{"title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Feng Zhao, Jie Zhao, Lin Chen, Wenxuan Huang, Xikun Bao, Yiming Zhao, Yukun Qi, Yu Zeng, Zehui Chen, Zhongang Qi","submitted_at":"2025-04-10T17:59:03Z","abstract_excerpt":"The advancement of Chain-of-Thought (CoT) reasoning has significantly enhanced the capabilities of large language models (LLMs) and large vision-language models (LVLMs). However, a rigorous evaluation framework for video CoT reasoning remains absent. Current video benchmarks fail to adequately assess the reasoning process and expose whether failures stem from deficiencies in perception or reasoning capabilities. Therefore, we introduce VCR-Bench, a novel benchmark designed to comprehensively evaluate LVLMs' Video Chain-of-Thought Reasoning capabilities. VCR-Bench comprises 859 videos spanning "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.07956","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-04-10T17:59:03Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"a5349b1efd3f5fcd66390fd380ef89978f2090e6dc57416148412ca7d6be4b3d","abstract_canon_sha256":"80364df0d5084037a7f20cddbf548753e26afe3007cf1a29e9d96c97dab3721a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:47:22.612891Z","signature_b64":"NjFKNyhfH8GNNcFNj5CZOCl19w0giCWlU0+I8XqHium96hvZcCjJWCb32Hvk4irArpW3lcBRPOUFtVYF7p3lDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"db2f2bb8b3fc577f664ce393fc964a66dd51983d11444a4a87501264cdf281f3","last_reissued_at":"2026-07-05T10:47:22.612295Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:47:22.612295Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Feng Zhao, Jie Zhao, Lin Chen, Wenxuan Huang, Xikun Bao, Yiming Zhao, Yukun Qi, Yu Zeng, Zehui Chen, Zhongang Qi","submitted_at":"2025-04-10T17:59:03Z","abstract_excerpt":"The advancement of Chain-of-Thought (CoT) reasoning has significantly enhanced the capabilities of large language models (LLMs) and large vision-language models (LVLMs). However, a rigorous evaluation framework for video CoT reasoning remains absent. Current video benchmarks fail to adequately assess the reasoning process and expose whether failures stem from deficiencies in perception or reasoning capabilities. Therefore, we introduce VCR-Bench, a novel benchmark designed to comprehensively evaluate LVLMs' Video Chain-of-Thought Reasoning capabilities. VCR-Bench comprises 859 videos spanning "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.07956","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.07956/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.07956","created_at":"2026-07-05T10:47:22.612376+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.07956v1","created_at":"2026-07-05T10:47:22.612376+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.07956","created_at":"2026-07-05T10:47:22.612376+00:00"},{"alias_kind":"pith_short_12","alias_value":"3MXSXOFT7RLX","created_at":"2026-07-05T10:47:22.612376+00:00"},{"alias_kind":"pith_short_16","alias_value":"3MXSXOFT7RLX6ZSM","created_at":"2026-07-05T10:47:22.612376+00:00"},{"alias_kind":"pith_short_8","alias_value":"3MXSXOFT","created_at":"2026-07-05T10:47:22.612376+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20280","citing_title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08088","citing_title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31504","citing_title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28385","citing_title":"RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16079","citing_title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2511.11113","citing_title":"VIDEOP2R: Video Understanding from Perception to Reasoning","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2505.21374","citing_title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2603.20633","citing_title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03276","citing_title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03276","citing_title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05015","citing_title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16893","citing_title":"EasyVideoR1: Easier RL for Video Understanding","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01657","citing_title":"Act2See: Emergent Active Visual Perception for Video Reasoning","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3","json":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3.json","graph_json":"https://pith.science/api/pith-number/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/graph.json","events_json":"https://pith.science/api/pith-number/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/events.json","paper":"https://pith.science/paper/3MXSXOFT"},"agent_actions":{"view_html":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3","download_json":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3.json","view_paper":"https://pith.science/paper/3MXSXOFT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.07956&json=true","fetch_graph":"https://pith.science/api/pith-number/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/graph.json","fetch_events":"https://pith.science/api/pith-number/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/action/storage_attestation","attest_author":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/action/author_attestation","sign_citation":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/action/citation_signature","submit_replication":"https://pith.science/pith/3MXSXOFT7RLX6ZSM4OJ7ZFSKM3/action/replication_record"}},"created_at":"2026-07-05T10:47:22.612376+00:00","updated_at":"2026-07-05T10:47:22.612376+00:00"}