{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:P3L7PJBPM6KER3GFMGN4NX3QH6","short_pith_number":"pith:P3L7PJBP","schema_version":"1.0","canonical_sha256":"7ed7f7a42f679448ecc5619bc6df703fbc362c96f017488f78980e81b8080454","source":{"kind":"arxiv","id":"2503.23077","version":3},"attestation_state":"computed","paper":{"title":"Efficient Inference for Large Reasoning Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baolong Bi, Bryan Hooi, Hongcheng Gao, Hongyu Chen, Jiaheng Zhang, Jiaying Wu, Jun Xia, Keqin Li, Liang Li, Ruihan Gong, Stan Z. Li, Yue Liu, Yufei He, Zhiqi Huang","submitted_at":"2025-03-29T13:27:46Z","abstract_excerpt":"Large Reasoning Models (LRMs) significantly improve the reasoning ability of Large Language Models (LLMs) by learning to reason, exhibiting promising performance in solving complex tasks. However, their deliberative reasoning process leads to inefficiencies in token usage, memory consumption, and inference time. Thus, this survey provides a review of efficient inference methods designed specifically for LRMs, focusing on mitigating token inefficiency while preserving the reasoning quality. The overview structure of this paper is shown in Figure~\\ref{fig:paper_structure}. First, we introduce a "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.23077","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-03-29T13:27:46Z","cross_cats_sorted":[],"title_canon_sha256":"ced35cc5343123134a076bdad8bab85b6ddc787237d3e6045023efa19a1e880c","abstract_canon_sha256":"f43256fca1abd741f7c2ed65772d0cd3292c2a4ed30baa14d481fcb19d202729"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:53:00.663290Z","signature_b64":"PWgV53GzyNZt+iiBwbVev95fqA1T9CMzPxJ0b30RmJs/mifIv0TKKgDT6YZ6xPmuhQgGubh6cjfuvGY4cAubDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7ed7f7a42f679448ecc5619bc6df703fbc362c96f017488f78980e81b8080454","last_reissued_at":"2026-07-05T11:53:00.662677Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:53:00.662677Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Efficient Inference for Large Reasoning Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baolong Bi, Bryan Hooi, Hongcheng Gao, Hongyu Chen, Jiaheng Zhang, Jiaying Wu, Jun Xia, Keqin Li, Liang Li, Ruihan Gong, Stan Z. Li, Yue Liu, Yufei He, Zhiqi Huang","submitted_at":"2025-03-29T13:27:46Z","abstract_excerpt":"Large Reasoning Models (LRMs) significantly improve the reasoning ability of Large Language Models (LLMs) by learning to reason, exhibiting promising performance in solving complex tasks. However, their deliberative reasoning process leads to inefficiencies in token usage, memory consumption, and inference time. Thus, this survey provides a review of efficient inference methods designed specifically for LRMs, focusing on mitigating token inefficiency while preserving the reasoning quality. The overview structure of this paper is shown in Figure~\\ref{fig:paper_structure}. First, we introduce a "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.23077","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.23077/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.23077","created_at":"2026-07-05T11:53:00.662745+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.23077v3","created_at":"2026-07-05T11:53:00.662745+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.23077","created_at":"2026-07-05T11:53:00.662745+00:00"},{"alias_kind":"pith_short_12","alias_value":"P3L7PJBPM6KE","created_at":"2026-07-05T11:53:00.662745+00:00"},{"alias_kind":"pith_short_16","alias_value":"P3L7PJBPM6KER3GF","created_at":"2026-07-05T11:53:00.662745+00:00"},{"alias_kind":"pith_short_8","alias_value":"P3L7PJBP","created_at":"2026-07-05T11:53:00.662745+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.00862","citing_title":"CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02835","citing_title":"Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04402","citing_title":"Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2508.10164","citing_title":"Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2509.13332","citing_title":"Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2510.08483","citing_title":"DeepPrune: Parallel Scaling without Inter-trace Redundancy","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6","json":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6.json","graph_json":"https://pith.science/api/pith-number/P3L7PJBPM6KER3GFMGN4NX3QH6/graph.json","events_json":"https://pith.science/api/pith-number/P3L7PJBPM6KER3GFMGN4NX3QH6/events.json","paper":"https://pith.science/paper/P3L7PJBP"},"agent_actions":{"view_html":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6","download_json":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6.json","view_paper":"https://pith.science/paper/P3L7PJBP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.23077&json=true","fetch_graph":"https://pith.science/api/pith-number/P3L7PJBPM6KER3GFMGN4NX3QH6/graph.json","fetch_events":"https://pith.science/api/pith-number/P3L7PJBPM6KER3GFMGN4NX3QH6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6/action/storage_attestation","attest_author":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6/action/author_attestation","sign_citation":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6/action/citation_signature","submit_replication":"https://pith.science/pith/P3L7PJBPM6KER3GFMGN4NX3QH6/action/replication_record"}},"created_at":"2026-07-05T11:53:00.662745+00:00","updated_at":"2026-07-05T11:53:00.662745+00:00"}