{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:HUPMOIXAM6OH6ERQA2CFC4URRK","short_pith_number":"pith:HUPMOIXA","schema_version":"1.0","canonical_sha256":"3d1ec722e0679c7f123006845172918ab4c6895c1af0f04b9d27b66a535fa9b1","source":{"kind":"arxiv","id":"2310.19102","version":3},"attestation_state":"computed","paper":{"title":"Atom: Low-bit Quantization for Efficient and Accurate LLM Serving","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Arvind Krishnamurthy, Baris Kasikci, Chien-Yu Lin, Kan Zhu, Lequn Chen, Luis Ceze, Size Zheng, Tianqi Chen, Yilong Zhao, Zihao Ye","submitted_at":"2023-10-29T18:33:05Z","abstract_excerpt":"The growing demand for Large Language Models (LLMs) in applications such as content generation, intelligent chatbots, and sentiment analysis poses considerable challenges for LLM service providers. To efficiently use GPU resources and boost throughput, batching multiple requests has emerged as a popular paradigm; to further speed up batching, LLM quantization techniques reduce memory consumption and increase computing capacity. However, prevalent quantization schemes (e.g., 8-bit weight-activation quantization) cannot fully leverage the capabilities of modern GPUs, such as 4-bit integer operat"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.19102","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-10-29T18:33:05Z","cross_cats_sorted":[],"title_canon_sha256":"9ff3bdebd8f7c523afbd5dc43091fe4a3f3866d7780c14bedd425959ad47fec9","abstract_canon_sha256":"ecd69c2bae92946beb545b6a00d70389d4b95183be9c1a80669301c5b7968c4b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:08:18.920084Z","signature_b64":"IbbNmn+7boLbR5uXfOCWp2iM76QwUnrfyNC0+bxC2Wrj+QPjPomGcOdTwBXKkyH1gbXfxs7Y7zc4fB/6rRqBBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3d1ec722e0679c7f123006845172918ab4c6895c1af0f04b9d27b66a535fa9b1","last_reissued_at":"2026-07-05T08:08:18.919597Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:08:18.919597Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Atom: Low-bit Quantization for Efficient and Accurate LLM Serving","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Arvind Krishnamurthy, Baris Kasikci, Chien-Yu Lin, Kan Zhu, Lequn Chen, Luis Ceze, Size Zheng, Tianqi Chen, Yilong Zhao, Zihao Ye","submitted_at":"2023-10-29T18:33:05Z","abstract_excerpt":"The growing demand for Large Language Models (LLMs) in applications such as content generation, intelligent chatbots, and sentiment analysis poses considerable challenges for LLM service providers. To efficiently use GPU resources and boost throughput, batching multiple requests has emerged as a popular paradigm; to further speed up batching, LLM quantization techniques reduce memory consumption and increase computing capacity. However, prevalent quantization schemes (e.g., 8-bit weight-activation quantization) cannot fully leverage the capabilities of modern GPUs, such as 4-bit integer operat"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.19102","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.19102/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.19102","created_at":"2026-07-05T08:08:18.919658+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.19102v3","created_at":"2026-07-05T08:08:18.919658+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.19102","created_at":"2026-07-05T08:08:18.919658+00:00"},{"alias_kind":"pith_short_12","alias_value":"HUPMOIXAM6OH","created_at":"2026-07-05T08:08:18.919658+00:00"},{"alias_kind":"pith_short_16","alias_value":"HUPMOIXAM6OH6ERQ","created_at":"2026-07-05T08:08:18.919658+00:00"},{"alias_kind":"pith_short_8","alias_value":"HUPMOIXA","created_at":"2026-07-05T08:08:18.919658+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08032","citing_title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","ref_index":154,"is_internal_anchor":true},{"citing_arxiv_id":"2605.20315","citing_title":"Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01203","citing_title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2602.13595","citing_title":"The Quantization Trap: Breaking Linear Scaling Laws in Multi-Hop Reasoning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2405.16406","citing_title":"SpinQuant: LLM quantization with learned rotations","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2404.14294","citing_title":"A Survey on Efficient Inference for Large Language Models","ref_index":212,"is_internal_anchor":false},{"citing_arxiv_id":"2405.04434","citing_title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK","json":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK.json","graph_json":"https://pith.science/api/pith-number/HUPMOIXAM6OH6ERQA2CFC4URRK/graph.json","events_json":"https://pith.science/api/pith-number/HUPMOIXAM6OH6ERQA2CFC4URRK/events.json","paper":"https://pith.science/paper/HUPMOIXA"},"agent_actions":{"view_html":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK","download_json":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK.json","view_paper":"https://pith.science/paper/HUPMOIXA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.19102&json=true","fetch_graph":"https://pith.science/api/pith-number/HUPMOIXAM6OH6ERQA2CFC4URRK/graph.json","fetch_events":"https://pith.science/api/pith-number/HUPMOIXAM6OH6ERQA2CFC4URRK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK/action/storage_attestation","attest_author":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK/action/author_attestation","sign_citation":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK/action/citation_signature","submit_replication":"https://pith.science/pith/HUPMOIXAM6OH6ERQA2CFC4URRK/action/replication_record"}},"created_at":"2026-07-05T08:08:18.919658+00:00","updated_at":"2026-07-05T08:08:18.919658+00:00"}