{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:V5PEF6CJBHZGOYHMDL5QMZXIV3","short_pith_number":"pith:V5PEF6CJ","schema_version":"1.0","canonical_sha256":"af5e42f84909f26760ec1afb0666e8aed6f71c4551f190f12ca54475f1815f96","source":{"kind":"arxiv","id":"2308.07633","version":4},"attestation_state":"computed","paper":{"title":"A Survey on Model Compression for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Can Ma, Jian Li, Weiping Wang, Xunyu Zhu, Yong Liu","submitted_at":"2023-08-15T08:31:05Z","abstract_excerpt":"Large Language Models (LLMs) have transformed natural language processing tasks successfully. Yet, their large size and high computational needs pose challenges for practical use, especially in resource-limited settings. Model compression has emerged as a key research area to address these challenges. This paper presents a survey of model compression techniques for LLMs. We cover methods like quantization, pruning, and knowledge distillation, highlighting recent advancements. We also discuss benchmarking strategies and evaluation metrics crucial for assessing compressed LLMs. This survey offer"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2308.07633","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-08-15T08:31:05Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"47822b16a9fc0ccd3924a42395ca0f33594aad1aeb1c024d6ea6a95f4d436eb8","abstract_canon_sha256":"13efbcef9eda238a25999d1080f228b8e913aab55a44889e4d1034e8cd1777ee"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:50:07.347459Z","signature_b64":"C0aezDWSfTp8fSDTh6a7nZLEDJba242IP6rExVT7rQcTgmxs900H3uOlEZK4pO1yhgVc6grkMm5muynta3/1Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"af5e42f84909f26760ec1afb0666e8aed6f71c4551f190f12ca54475f1815f96","last_reissued_at":"2026-07-05T08:50:07.346923Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:50:07.346923Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Survey on Model Compression for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Can Ma, Jian Li, Weiping Wang, Xunyu Zhu, Yong Liu","submitted_at":"2023-08-15T08:31:05Z","abstract_excerpt":"Large Language Models (LLMs) have transformed natural language processing tasks successfully. Yet, their large size and high computational needs pose challenges for practical use, especially in resource-limited settings. Model compression has emerged as a key research area to address these challenges. This paper presents a survey of model compression techniques for LLMs. We cover methods like quantization, pruning, and knowledge distillation, highlighting recent advancements. We also discuss benchmarking strategies and evaluation metrics crucial for assessing compressed LLMs. This survey offer"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2308.07633","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2308.07633/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2308.07633","created_at":"2026-07-05T08:50:07.346983+00:00"},{"alias_kind":"arxiv_version","alias_value":"2308.07633v4","created_at":"2026-07-05T08:50:07.346983+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2308.07633","created_at":"2026-07-05T08:50:07.346983+00:00"},{"alias_kind":"pith_short_12","alias_value":"V5PEF6CJBHZG","created_at":"2026-07-05T08:50:07.346983+00:00"},{"alias_kind":"pith_short_16","alias_value":"V5PEF6CJBHZGOYHM","created_at":"2026-07-05T08:50:07.346983+00:00"},{"alias_kind":"pith_short_8","alias_value":"V5PEF6CJ","created_at":"2026-07-05T08:50:07.346983+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08268","citing_title":"Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2606.28529","citing_title":"The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28529","citing_title":"The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2411.10656","citing_title":"Precision or Peril: A PoC of Python Code Quality from Quantized Large Language Models","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2511.06516","citing_title":"You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15104","citing_title":"From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2312.05821","citing_title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2307.06435","citing_title":"A Comprehensive Overview of Large Language Models","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2508.04853","citing_title":"Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2512.22671","citing_title":"Fragile Knowledge, Robust Instruction-Following: The Width Pruning Dichotomy in Llama-3.2","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2404.13501","citing_title":"A Survey on the Memory Mechanism of Large Language Model based Agents","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2404.14294","citing_title":"A Survey on Efficient Inference for Large Language Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04013","citing_title":"RUQuant: Towards Refining Uniform Quantization for Large Language Models","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10091","citing_title":"SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models","ref_index":46,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3","json":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3.json","graph_json":"https://pith.science/api/pith-number/V5PEF6CJBHZGOYHMDL5QMZXIV3/graph.json","events_json":"https://pith.science/api/pith-number/V5PEF6CJBHZGOYHMDL5QMZXIV3/events.json","paper":"https://pith.science/paper/V5PEF6CJ"},"agent_actions":{"view_html":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3","download_json":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3.json","view_paper":"https://pith.science/paper/V5PEF6CJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2308.07633&json=true","fetch_graph":"https://pith.science/api/pith-number/V5PEF6CJBHZGOYHMDL5QMZXIV3/graph.json","fetch_events":"https://pith.science/api/pith-number/V5PEF6CJBHZGOYHMDL5QMZXIV3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3/action/storage_attestation","attest_author":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3/action/author_attestation","sign_citation":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3/action/citation_signature","submit_replication":"https://pith.science/pith/V5PEF6CJBHZGOYHMDL5QMZXIV3/action/replication_record"}},"created_at":"2026-07-05T08:50:07.346983+00:00","updated_at":"2026-07-05T08:50:07.346983+00:00"}