{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:7RPBKFQUSDHBDSHDUSOOG3WUVH","short_pith_number":"pith:7RPBKFQU","schema_version":"1.0","canonical_sha256":"fc5e15161490ce11c8e3a49ce36ed4a9f3466dc69ab6f4d04990d592bcb8ce4f","source":{"kind":"arxiv","id":"2103.13630","version":3},"attestation_state":"computed","paper":{"title":"A Survey of Quantization Methods for Efficient Neural Network Inference","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Amir Gholami, Kurt Keutzer, Michael W. Mahoney, Sehoon Kim, Zhen Dong, Zhewei Yao","submitted_at":"2021-03-25T06:57:11Z","abstract_excerpt":"As soon as abstract mathematical computations were adapted to computation on digital computers, the problem of efficient representation, manipulation, and communication of the numerical values in those computations arose. Strongly related to the problem of numerical representation is the problem of quantization: in what manner should a set of continuous real-valued numbers be distributed over a fixed discrete set of numbers to minimize the number of bits required and also to maximize the accuracy of the attendant computations? This perennial problem of quantization is particularly relevant whe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2103.13630","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2021-03-25T06:57:11Z","cross_cats_sorted":[],"title_canon_sha256":"177db867ac16af6753fc02dd9fc8facf31fbeafeaf379fa6e249bd8f2eef8c5d","abstract_canon_sha256":"6860b4b6a4a0289b7829952ebf5c91141be3b239cbfdf47d86256bd906c2c92f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:51:21.145799Z","signature_b64":"Uz4I+Nu7kiUP8ktH1LBPD1hKRk2S0q4ozg1x9rVXCqAbp1VvxC2qy2X80Y7Q0tjwKUl5NUWbQJ2opkT1OZL2Dw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fc5e15161490ce11c8e3a49ce36ed4a9f3466dc69ab6f4d04990d592bcb8ce4f","last_reissued_at":"2026-07-05T02:51:21.145300Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:51:21.145300Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Survey of Quantization Methods for Efficient Neural Network Inference","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Amir Gholami, Kurt Keutzer, Michael W. Mahoney, Sehoon Kim, Zhen Dong, Zhewei Yao","submitted_at":"2021-03-25T06:57:11Z","abstract_excerpt":"As soon as abstract mathematical computations were adapted to computation on digital computers, the problem of efficient representation, manipulation, and communication of the numerical values in those computations arose. Strongly related to the problem of numerical representation is the problem of quantization: in what manner should a set of continuous real-valued numbers be distributed over a fixed discrete set of numbers to minimize the number of bits required and also to maximize the accuracy of the attendant computations? This perennial problem of quantization is particularly relevant whe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2103.13630","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2103.13630/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2103.13630","created_at":"2026-07-05T02:51:21.145369+00:00"},{"alias_kind":"arxiv_version","alias_value":"2103.13630v3","created_at":"2026-07-05T02:51:21.145369+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2103.13630","created_at":"2026-07-05T02:51:21.145369+00:00"},{"alias_kind":"pith_short_12","alias_value":"7RPBKFQUSDHB","created_at":"2026-07-05T02:51:21.145369+00:00"},{"alias_kind":"pith_short_16","alias_value":"7RPBKFQUSDHBDSHD","created_at":"2026-07-05T02:51:21.145369+00:00"},{"alias_kind":"pith_short_8","alias_value":"7RPBKFQU","created_at":"2026-07-05T02:51:21.145369+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":29,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26822","citing_title":"Quantization in Federated Learning: Methods, Challenges and Future Directions","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26587","citing_title":"SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference","ref_index":124,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22249","citing_title":"On the Expressive Power of Weight Quantization in Large Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13300","citing_title":"Quantizing Time-Series Models As Dynamical Systems: Trajectory-Based Quantization Sensitivity Score","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10458","citing_title":"Minimum Distortion Quantization with Specified Output Distribution","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08891","citing_title":"PALUTE: Processing-In-Memory Acceleration via Lookup Table for Edge LLM Inference","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01127","citing_title":"$\\text{Log}_\\text{b}$Quant: Quantizing Language Models in Logarithmic Space","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06485","citing_title":"Litespark Inference For CPUs: Ultra-Fast SIMD Framework for Ternary (1.58-bit) Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27937","citing_title":"Machine learning enables experimental access to photon-by-photon arrival times in scintillation detectors","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29537","citing_title":"The Complexity of Verifying Feedforward Neural Networks in Quantised Settings","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2306.00978","citing_title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2511.06516","citing_title":"You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2603.26603","citing_title":"Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15551","citing_title":"Characterizing Learning in Deep Neural Networks using Tractable Algorithmic Complexity Analysis","ref_index":297,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17160","citing_title":"When Bits Break Recourse: Counterfactual-Faithful Quantization","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18474","citing_title":"Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19195","citing_title":"The Thermodynamic Costs of Simple Linear Regression","ref_index":77,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19645","citing_title":"K-Quantization and its Impact on Output Performance","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2507.18553","citing_title":"The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2509.03472","citing_title":"DPQuant: Efficient and Differentially-Private Model Training via Dynamic Quantization Scheduling","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10886","citing_title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13699","citing_title":"Memristor Technologies for Dynamic Vision Sensors: A Critical Assessment and Research Roadmap","ref_index":106,"is_internal_anchor":false},{"citing_arxiv_id":"2208.07339","citing_title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","ref_index":135,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12046","citing_title":"Rethink the Role of Neural Decoders in Quantum Error Correction","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10886","citing_title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","ref_index":34,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH","json":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH.json","graph_json":"https://pith.science/api/pith-number/7RPBKFQUSDHBDSHDUSOOG3WUVH/graph.json","events_json":"https://pith.science/api/pith-number/7RPBKFQUSDHBDSHDUSOOG3WUVH/events.json","paper":"https://pith.science/paper/7RPBKFQU"},"agent_actions":{"view_html":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH","download_json":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH.json","view_paper":"https://pith.science/paper/7RPBKFQU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2103.13630&json=true","fetch_graph":"https://pith.science/api/pith-number/7RPBKFQUSDHBDSHDUSOOG3WUVH/graph.json","fetch_events":"https://pith.science/api/pith-number/7RPBKFQUSDHBDSHDUSOOG3WUVH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH/action/storage_attestation","attest_author":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH/action/author_attestation","sign_citation":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH/action/citation_signature","submit_replication":"https://pith.science/pith/7RPBKFQUSDHBDSHDUSOOG3WUVH/action/replication_record"}},"created_at":"2026-07-05T02:51:21.145369+00:00","updated_at":"2026-07-05T02:51:21.145369+00:00"}