{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:6V67FFXIGVOIS6ZJZX7P2KKV53","short_pith_number":"pith:6V67FFXI","schema_version":"1.0","canonical_sha256":"f57df296e8355c897b29cdfefd2955eeeea95fd9a2902ea0a7c5c908e29525c7","source":{"kind":"arxiv","id":"2505.22113","version":1},"attestation_state":"computed","paper":{"title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Yi Chang, Yuan Wu, Zhiyuan Li","submitted_at":"2025-05-28T08:41:14Z","abstract_excerpt":"Large reasoning models (LRMs) have achieved impressive performance in complex tasks, often outperforming conventional large language models (LLMs). However, the prevalent issue of overthinking severely limits their computational efficiency. Overthinking occurs when models generate excessive and redundant tokens that contribute little to accurate outcomes, especially in simple tasks, resulting in a significant waste of computational resources. To systematically investigate this issue, we introduce Think-Bench, a benchmark designed to evaluate the reasoning efficiency of LRMs. We also propose no"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.22113","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-05-28T08:41:14Z","cross_cats_sorted":[],"title_canon_sha256":"c3dc980f13cca392bf478380e0fbed839f00e31edd992b17dd8fe5f7be1cc17b","abstract_canon_sha256":"eac1df0e4c62575bc8d62bf218eec990598b80763fa333ae7d00936a2e7bba77"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:11:10.113417Z","signature_b64":"jRB5gkM+fA7j+9hzauoFUX/m+6u3rmGEruoFjia6gl++AlE3moGq770lMk6YXmRRbnnejfaZR63rgZu3oZy7Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f57df296e8355c897b29cdfefd2955eeeea95fd9a2902ea0a7c5c908e29525c7","last_reissued_at":"2026-07-05T11:11:10.112904Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:11:10.112904Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Yi Chang, Yuan Wu, Zhiyuan Li","submitted_at":"2025-05-28T08:41:14Z","abstract_excerpt":"Large reasoning models (LRMs) have achieved impressive performance in complex tasks, often outperforming conventional large language models (LLMs). However, the prevalent issue of overthinking severely limits their computational efficiency. Overthinking occurs when models generate excessive and redundant tokens that contribute little to accurate outcomes, especially in simple tasks, resulting in a significant waste of computational resources. To systematically investigate this issue, we introduce Think-Bench, a benchmark designed to evaluate the reasoning efficiency of LRMs. We also propose no"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.22113","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.22113/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.22113","created_at":"2026-07-05T11:11:10.112964+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.22113v1","created_at":"2026-07-05T11:11:10.112964+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.22113","created_at":"2026-07-05T11:11:10.112964+00:00"},{"alias_kind":"pith_short_12","alias_value":"6V67FFXIGVOI","created_at":"2026-07-05T11:11:10.112964+00:00"},{"alias_kind":"pith_short_16","alias_value":"6V67FFXIGVOIS6ZJ","created_at":"2026-07-05T11:11:10.112964+00:00"},{"alias_kind":"pith_short_8","alias_value":"6V67FFXI","created_at":"2026-07-05T11:11:10.112964+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07968","citing_title":"RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14084","citing_title":"CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29067","citing_title":"ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2511.23253","citing_title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2507.04023","citing_title":"Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14084","citing_title":"CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02290","citing_title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12214","citing_title":"Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code","ref_index":28,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53","json":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53.json","graph_json":"https://pith.science/api/pith-number/6V67FFXIGVOIS6ZJZX7P2KKV53/graph.json","events_json":"https://pith.science/api/pith-number/6V67FFXIGVOIS6ZJZX7P2KKV53/events.json","paper":"https://pith.science/paper/6V67FFXI"},"agent_actions":{"view_html":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53","download_json":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53.json","view_paper":"https://pith.science/paper/6V67FFXI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.22113&json=true","fetch_graph":"https://pith.science/api/pith-number/6V67FFXIGVOIS6ZJZX7P2KKV53/graph.json","fetch_events":"https://pith.science/api/pith-number/6V67FFXIGVOIS6ZJZX7P2KKV53/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53/action/storage_attestation","attest_author":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53/action/author_attestation","sign_citation":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53/action/citation_signature","submit_replication":"https://pith.science/pith/6V67FFXIGVOIS6ZJZX7P2KKV53/action/replication_record"}},"created_at":"2026-07-05T11:11:10.112964+00:00","updated_at":"2026-07-05T11:11:10.112964+00:00"}