{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:2Y5MH2Q6YD5AQVILQEDNYIAN3G","short_pith_number":"pith:2Y5MH2Q6","schema_version":"1.0","canonical_sha256":"d63ac3ea1ec0fa08550b8106dc200dd9a7d8a266fd13e535663f90c019c41d11","source":{"kind":"arxiv","id":"2306.03078","version":1},"attestation_state":"computed","paper":{"title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Alexander Borzunov, Dan Alistarh, Denis Kuznedelev, Elias Frantar, Ruslan Svirschevski, Saleh Ashkboos, Tim Dettmers, Torsten Hoefler, Vage Egiazarian","submitted_at":"2023-06-05T17:53:28Z","abstract_excerpt":"Recent advances in large language model (LLM) pretraining have led to high-quality LLMs with impressive abilities. By compressing such LLMs via quantization to 3-4 bits per parameter, they can fit into memory-limited devices such as laptops and mobile phones, enabling personalized use. However, quantization down to 3-4 bits per parameter usually leads to moderate-to-high accuracy losses, especially for smaller models in the 1-10B parameter range, which are well-suited for edge deployments. To address this accuracy issue, we introduce the Sparse-Quantized Representation (SpQR), a new compressed"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2306.03078","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-06-05T17:53:28Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"88a8a8290e8d6eccf55142450c02fc06af3ee70c5aa843ab1fd7978bd80ad197","abstract_canon_sha256":"a796ac8b573e3a28c21217e5084cd675727ba964e3a738b6066b50ca88312c41"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:17:34.655489Z","signature_b64":"bszCawOAYZQwSt4ScAHsIjSSfWiPMPfjpruQQb0rSZ/7xsiCdtDjZ3nBEJbIuQq51ui17Omd65zmPkR2qorFCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d63ac3ea1ec0fa08550b8106dc200dd9a7d8a266fd13e535663f90c019c41d11","last_reissued_at":"2026-07-05T06:17:34.654897Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:17:34.654897Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Alexander Borzunov, Dan Alistarh, Denis Kuznedelev, Elias Frantar, Ruslan Svirschevski, Saleh Ashkboos, Tim Dettmers, Torsten Hoefler, Vage Egiazarian","submitted_at":"2023-06-05T17:53:28Z","abstract_excerpt":"Recent advances in large language model (LLM) pretraining have led to high-quality LLMs with impressive abilities. By compressing such LLMs via quantization to 3-4 bits per parameter, they can fit into memory-limited devices such as laptops and mobile phones, enabling personalized use. However, quantization down to 3-4 bits per parameter usually leads to moderate-to-high accuracy losses, especially for smaller models in the 1-10B parameter range, which are well-suited for edge deployments. To address this accuracy issue, we introduce the Sparse-Quantized Representation (SpQR), a new compressed"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2306.03078","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2306.03078/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2306.03078","created_at":"2026-07-05T06:17:34.654968+00:00"},{"alias_kind":"arxiv_version","alias_value":"2306.03078v1","created_at":"2026-07-05T06:17:34.654968+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2306.03078","created_at":"2026-07-05T06:17:34.654968+00:00"},{"alias_kind":"pith_short_12","alias_value":"2Y5MH2Q6YD5A","created_at":"2026-07-05T06:17:34.654968+00:00"},{"alias_kind":"pith_short_16","alias_value":"2Y5MH2Q6YD5AQVIL","created_at":"2026-07-05T06:17:34.654968+00:00"},{"alias_kind":"pith_short_8","alias_value":"2Y5MH2Q6","created_at":"2026-07-05T06:17:34.654968+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":33,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23406","citing_title":"HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02461","citing_title":"OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13054","citing_title":"TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06060","citing_title":"ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04349","citing_title":"MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03328","citing_title":"Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04032","citing_title":"Do Transformers Need Three Projections? Systematic Study of QKV Variants","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09864","citing_title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01412","citing_title":"GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24011","citing_title":"ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14844","citing_title":"XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23078","citing_title":"GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2505.02380","citing_title":"EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20193","citing_title":"Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19929","citing_title":"Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17745","citing_title":"StatQAT: Statistical Quantizer Optimization for Deep Networks","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2507.03052","citing_title":"From 2:4 to 8:16 sparsity patterns in LLMs for Outliers and Weights with Variance Correction","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2404.14294","citing_title":"A Survey on Efficient Inference for Large Language Models","ref_index":196,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17104","citing_title":"TStore: Rethinking AI Model Hub with Tensor-Centric Compression","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11222","citing_title":"ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06052","citing_title":"XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24273","citing_title":"BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24008","citing_title":"Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22906","citing_title":"Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G","json":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G.json","graph_json":"https://pith.science/api/pith-number/2Y5MH2Q6YD5AQVILQEDNYIAN3G/graph.json","events_json":"https://pith.science/api/pith-number/2Y5MH2Q6YD5AQVILQEDNYIAN3G/events.json","paper":"https://pith.science/paper/2Y5MH2Q6"},"agent_actions":{"view_html":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G","download_json":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G.json","view_paper":"https://pith.science/paper/2Y5MH2Q6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2306.03078&json=true","fetch_graph":"https://pith.science/api/pith-number/2Y5MH2Q6YD5AQVILQEDNYIAN3G/graph.json","fetch_events":"https://pith.science/api/pith-number/2Y5MH2Q6YD5AQVILQEDNYIAN3G/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G/action/storage_attestation","attest_author":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G/action/author_attestation","sign_citation":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G/action/citation_signature","submit_replication":"https://pith.science/pith/2Y5MH2Q6YD5AQVILQEDNYIAN3G/action/replication_record"}},"created_at":"2026-07-05T06:17:34.654968+00:00","updated_at":"2026-07-05T06:17:34.654968+00:00"}