{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CD3FNEPYPDBCUIVJ6TXH3ZXRYQ","short_pith_number":"pith:CD3FNEPY","schema_version":"1.0","canonical_sha256":"10f65691f878c22a22a9f4ee7de6f1c431bfaab2f6f49800b04995ee4f3a4771","source":{"kind":"arxiv","id":"2505.24718","version":3},"attestation_state":"computed","paper":{"title":"Reinforcing Video Reasoning with Focused Thinking","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hongbo Chen, Jingze Wu, Jisheng Dang, Meng Wang, Nannan Zhu, Tat-Seng Chua, Teng Wang, Wei-Shi Zheng, Xuanhui Lin","submitted_at":"2025-05-30T15:42:19Z","abstract_excerpt":"Recent advancements in reinforcement learning, particularly through Group Relative Policy Optimization (GRPO), have significantly improved multimodal large language models for complex reasoning tasks. However, two critical limitations persist: 1) they often produce unfocused, verbose reasoning chains that obscure salient spatiotemporal cues and 2) binary rewarding fails to account for partially correct answers, resulting in high reward variance and inefficient learning. In this paper, we propose TW-GRPO, a novel framework that enhances visual reasoning with focused thinking and dense reward gr"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.24718","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-30T15:42:19Z","cross_cats_sorted":[],"title_canon_sha256":"5c799f119d9d1da42caccf4a32cd4d016edbc145384e63d59368eb041522eaaa","abstract_canon_sha256":"fc16cc590ac38ed4622b7cff35e3216652017a5da6caa6473040a3dab9f13f85"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:17:46.501662Z","signature_b64":"fXWkVFId+M9OhINIFzovksMx5oV467NASLxq9uRQHlY1iYxRBnaUik4At+Jm1cQgsWlxIhZW0WuOTRl9ZY3oDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"10f65691f878c22a22a9f4ee7de6f1c431bfaab2f6f49800b04995ee4f3a4771","last_reissued_at":"2026-07-05T11:17:46.501064Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:17:46.501064Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reinforcing Video Reasoning with Focused Thinking","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Hongbo Chen, Jingze Wu, Jisheng Dang, Meng Wang, Nannan Zhu, Tat-Seng Chua, Teng Wang, Wei-Shi Zheng, Xuanhui Lin","submitted_at":"2025-05-30T15:42:19Z","abstract_excerpt":"Recent advancements in reinforcement learning, particularly through Group Relative Policy Optimization (GRPO), have significantly improved multimodal large language models for complex reasoning tasks. However, two critical limitations persist: 1) they often produce unfocused, verbose reasoning chains that obscure salient spatiotemporal cues and 2) binary rewarding fails to account for partially correct answers, resulting in high reward variance and inefficient learning. In this paper, we propose TW-GRPO, a novel framework that enhances visual reasoning with focused thinking and dense reward gr"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.24718","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.24718/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.24718","created_at":"2026-07-05T11:17:46.501152+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.24718v3","created_at":"2026-07-05T11:17:46.501152+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.24718","created_at":"2026-07-05T11:17:46.501152+00:00"},{"alias_kind":"pith_short_12","alias_value":"CD3FNEPYPDBC","created_at":"2026-07-05T11:17:46.501152+00:00"},{"alias_kind":"pith_short_16","alias_value":"CD3FNEPYPDBCUIVJ","created_at":"2026-07-05T11:17:46.501152+00:00"},{"alias_kind":"pith_short_8","alias_value":"CD3FNEPY","created_at":"2026-07-05T11:17:46.501152+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07433","citing_title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","ref_index":184,"is_internal_anchor":false},{"citing_arxiv_id":"2505.20715","citing_title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2509.08827","citing_title":"A Survey of Reinforcement Learning for Large Reasoning Models","ref_index":101,"is_internal_anchor":false},{"citing_arxiv_id":"2503.09567","citing_title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","ref_index":152,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01324","citing_title":"Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05117","citing_title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ","json":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ.json","graph_json":"https://pith.science/api/pith-number/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/graph.json","events_json":"https://pith.science/api/pith-number/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/events.json","paper":"https://pith.science/paper/CD3FNEPY"},"agent_actions":{"view_html":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ","download_json":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ.json","view_paper":"https://pith.science/paper/CD3FNEPY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.24718&json=true","fetch_graph":"https://pith.science/api/pith-number/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/graph.json","fetch_events":"https://pith.science/api/pith-number/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/action/storage_attestation","attest_author":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/action/author_attestation","sign_citation":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/action/citation_signature","submit_replication":"https://pith.science/pith/CD3FNEPYPDBCUIVJ6TXH3ZXRYQ/action/replication_record"}},"created_at":"2026-07-05T11:17:46.501152+00:00","updated_at":"2026-07-05T11:17:46.501152+00:00"}