{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:OVWOYAU26L7ZCK6ALFHNRIJDYX","short_pith_number":"pith:OVWOYAU2","schema_version":"1.0","canonical_sha256":"756cec029af2ff912bc0594ed8a123c5d0d0ed0006d1c0ffc0452420552e7e69","source":{"kind":"arxiv","id":"2505.15684","version":2},"attestation_state":"computed","paper":{"title":"ThinkLess: A Training-Free Inference-Efficient Method for Reducing Reasoning Redundancy","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Gengyang Li, Yifeng Gao, Yuming Li, Yunfang Wu","submitted_at":"2025-05-21T15:58:16Z","abstract_excerpt":"While Chain-of-Thought (CoT) prompting improves reasoning in large language models (LLMs), the excessive length of reasoning tokens increases latency and KV cache memory usage, and may even truncate final answers under context limits. We propose ThinkLess, an inference-efficient framework that terminates reasoning generation early and maintains output quality without modifying the model. Atttention analysis reveals that answer tokens focus minimally on earlier reasoning steps and primarily attend to the reasoning terminator token, due to information migration under causal masking. Building on "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.15684","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-05-21T15:58:16Z","cross_cats_sorted":[],"title_canon_sha256":"d55833a7cf0ea99f653aaeb8dad9982076bc65ee6dafac4cfc6c1884d2cf87ca","abstract_canon_sha256":"6aa4595e13430a4ee838556523fc1dc908077760f585fa08b9c94c233cc62844"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:08:21.563932Z","signature_b64":"hOKFMK3Lkn7d3S/s2PXyShMTZjB8IxFyqpZ53ZE4NfOWJh1U1l5QvMJHTfjAeL86vo9GNASzs/WNMKyXlXkaDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"756cec029af2ff912bc0594ed8a123c5d0d0ed0006d1c0ffc0452420552e7e69","last_reissued_at":"2026-07-05T11:08:21.563464Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:08:21.563464Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ThinkLess: A Training-Free Inference-Efficient Method for Reducing Reasoning Redundancy","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Gengyang Li, Yifeng Gao, Yuming Li, Yunfang Wu","submitted_at":"2025-05-21T15:58:16Z","abstract_excerpt":"While Chain-of-Thought (CoT) prompting improves reasoning in large language models (LLMs), the excessive length of reasoning tokens increases latency and KV cache memory usage, and may even truncate final answers under context limits. We propose ThinkLess, an inference-efficient framework that terminates reasoning generation early and maintains output quality without modifying the model. Atttention analysis reveals that answer tokens focus minimally on earlier reasoning steps and primarily attend to the reasoning terminator token, due to information migration under causal masking. Building on "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.15684","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.15684/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.15684","created_at":"2026-07-05T11:08:21.563520+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.15684v2","created_at":"2026-07-05T11:08:21.563520+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.15684","created_at":"2026-07-05T11:08:21.563520+00:00"},{"alias_kind":"pith_short_12","alias_value":"OVWOYAU26L7Z","created_at":"2026-07-05T11:08:21.563520+00:00"},{"alias_kind":"pith_short_16","alias_value":"OVWOYAU26L7ZCK6A","created_at":"2026-07-05T11:08:21.563520+00:00"},{"alias_kind":"pith_short_8","alias_value":"OVWOYAU2","created_at":"2026-07-05T11:08:21.563520+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2512.10931","citing_title":"Asynchronous Reasoning: Training-Free Interactive Thinking LLMs","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2503.16419","citing_title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06165","citing_title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","ref_index":243,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17297","citing_title":"CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX","json":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX.json","graph_json":"https://pith.science/api/pith-number/OVWOYAU26L7ZCK6ALFHNRIJDYX/graph.json","events_json":"https://pith.science/api/pith-number/OVWOYAU26L7ZCK6ALFHNRIJDYX/events.json","paper":"https://pith.science/paper/OVWOYAU2"},"agent_actions":{"view_html":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX","download_json":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX.json","view_paper":"https://pith.science/paper/OVWOYAU2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.15684&json=true","fetch_graph":"https://pith.science/api/pith-number/OVWOYAU26L7ZCK6ALFHNRIJDYX/graph.json","fetch_events":"https://pith.science/api/pith-number/OVWOYAU26L7ZCK6ALFHNRIJDYX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX/action/storage_attestation","attest_author":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX/action/author_attestation","sign_citation":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX/action/citation_signature","submit_replication":"https://pith.science/pith/OVWOYAU26L7ZCK6ALFHNRIJDYX/action/replication_record"}},"created_at":"2026-07-05T11:08:21.563520+00:00","updated_at":"2026-07-05T11:08:21.563520+00:00"}