{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:4JN4UB677VYEHPUOIMKBW7FDRZ","short_pith_number":"pith:4JN4UB67","schema_version":"1.0","canonical_sha256":"e25bca07dffd7043be8e43141b7ca38e4dc55c6ff4bb5d58c696e0cbc055ddf8","source":{"kind":"arxiv","id":"2304.01089","version":4},"attestation_state":"computed","paper":{"title":"RPTQ: Reorder-based Post-training Quantization for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bingzhe Wu, Guangyu Sun, Jiawei Liu, Jiaxiang Wu, Lin Niu, Qiang Wu, Wenyu Liu, Xinggang Wang, Yuzhang Shang, Zhihang Yuan","submitted_at":"2023-04-03T15:46:15Z","abstract_excerpt":"Large-scale language models (LLMs) have demonstrated impressive performance, but their deployment presents challenges due to their significant memory usage. This issue can be alleviated through quantization. In this paper, we identify that the challenge in quantizing activations in LLMs arises from varying ranges across channels, rather than solely the presence of outliers. To address this challenge, we introduce a quantization method called RPTQ, which utilizes a reorder-based approach. By rearranging the channels and quantizing them in clusters, RPTQ effectively mitigates the impact of range"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2304.01089","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-04-03T15:46:15Z","cross_cats_sorted":[],"title_canon_sha256":"bbb4d9e3dc343ad9336b059bacd1eca0fd951b2187302faa739e8e999b348a36","abstract_canon_sha256":"80477f167d9e0ff0efe1932d3b92884579bb9062f6c7ec4fd90893f12954b6ae"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:11:04.109058Z","signature_b64":"9Vl9izo7uH/DrfFruMUpu+y0BsRZDR8HOtlRh1GTQ8dxc5cefW2Yqp4MxadcSY4ZX9QZc/yurXT3AaZO7B6cDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e25bca07dffd7043be8e43141b7ca38e4dc55c6ff4bb5d58c696e0cbc055ddf8","last_reissued_at":"2026-07-05T06:11:04.108588Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:11:04.108588Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RPTQ: Reorder-based Post-training Quantization for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bingzhe Wu, Guangyu Sun, Jiawei Liu, Jiaxiang Wu, Lin Niu, Qiang Wu, Wenyu Liu, Xinggang Wang, Yuzhang Shang, Zhihang Yuan","submitted_at":"2023-04-03T15:46:15Z","abstract_excerpt":"Large-scale language models (LLMs) have demonstrated impressive performance, but their deployment presents challenges due to their significant memory usage. This issue can be alleviated through quantization. In this paper, we identify that the challenge in quantizing activations in LLMs arises from varying ranges across channels, rather than solely the presence of outliers. To address this challenge, we introduce a quantization method called RPTQ, which utilizes a reorder-based approach. By rearranging the channels and quantizing them in clusters, RPTQ effectively mitigates the impact of range"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2304.01089","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2304.01089/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2304.01089","created_at":"2026-07-05T06:11:04.108647+00:00"},{"alias_kind":"arxiv_version","alias_value":"2304.01089v4","created_at":"2026-07-05T06:11:04.108647+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2304.01089","created_at":"2026-07-05T06:11:04.108647+00:00"},{"alias_kind":"pith_short_12","alias_value":"4JN4UB677VYE","created_at":"2026-07-05T06:11:04.108647+00:00"},{"alias_kind":"pith_short_16","alias_value":"4JN4UB677VYEHPUO","created_at":"2026-07-05T06:11:04.108647+00:00"},{"alias_kind":"pith_short_8","alias_value":"4JN4UB67","created_at":"2026-07-05T06:11:04.108647+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25674","citing_title":"BitNet Text Embeddings","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21257","citing_title":"An Empirical Study of OpenPangu Quantization on Ascend NPUs","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01876","citing_title":"SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21257","citing_title":"An Empirical Study of OpenPangu Quantization on Ascend NPUs","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14590","citing_title":"MixLLM: LLM Quantization with Global Mixed-precision between Output-features and Highly-efficient System Design","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2503.03088","citing_title":"AHCQ-SAM: Toward Accurate and Hardware-Compatible Post-Training Segment Anything Model Quantization","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2511.06516","citing_title":"You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2312.05821","citing_title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20309","citing_title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2404.14294","citing_title":"A Survey on Efficient Inference for Large Language Models","ref_index":207,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04738","citing_title":"OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19167","citing_title":"LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10091","citing_title":"SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07955","citing_title":"Rethinking Residual Errors in Compensation-based LLM Quantization","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13806","citing_title":"Robust Ultra Low-Bit Post-Training Quantization via Stable Diagonal Curvature Estimate","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04738","citing_title":"OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ","json":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ.json","graph_json":"https://pith.science/api/pith-number/4JN4UB677VYEHPUOIMKBW7FDRZ/graph.json","events_json":"https://pith.science/api/pith-number/4JN4UB677VYEHPUOIMKBW7FDRZ/events.json","paper":"https://pith.science/paper/4JN4UB67"},"agent_actions":{"view_html":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ","download_json":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ.json","view_paper":"https://pith.science/paper/4JN4UB67","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2304.01089&json=true","fetch_graph":"https://pith.science/api/pith-number/4JN4UB677VYEHPUOIMKBW7FDRZ/graph.json","fetch_events":"https://pith.science/api/pith-number/4JN4UB677VYEHPUOIMKBW7FDRZ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ/action/storage_attestation","attest_author":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ/action/author_attestation","sign_citation":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ/action/citation_signature","submit_replication":"https://pith.science/pith/4JN4UB677VYEHPUOIMKBW7FDRZ/action/replication_record"}},"created_at":"2026-07-05T06:11:04.108647+00:00","updated_at":"2026-07-05T06:11:04.108647+00:00"}