{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:YAH7BKAUQFL7DHMXOOI5KK43V5","short_pith_number":"pith:YAH7BKAU","schema_version":"1.0","canonical_sha256":"c00ff0a8148157f19d977391d52b9baf5177ecbe66013f917cbaec9c1b10c9aa","source":{"kind":"arxiv","id":"2311.16442","version":4},"attestation_state":"computed","paper":{"title":"Fast and Efficient 2-bit LLM Inference on GPU: 2/4/16-bit in a Weight Matrix with Asynchronous Dequantization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Guohao Dai, Jiaming Xu, Jinhao Li, Jun Liu, Shan Huang, Shiyao Li, Yaoxiu Lian","submitted_at":"2023-11-28T02:44:59Z","abstract_excerpt":"Large language models (LLMs) have demonstrated impressive abilities in various domains while the inference cost is expensive. Many previous studies exploit quantization methods to reduce LLM inference cost by reducing latency and memory consumption. Applying 2-bit single-precision weight quantization brings >3% accuracy loss, so the state-of-the-art methods use mixed-precision methods for LLMs (e.g. Llama2-7b, etc.) to improve the accuracy. However, challenges still exist: (1) Uneven distribution in weight matrix. (2) Large speed degradation by adding sparse outliers. (3) Time-consuming dequan"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.16442","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2023-11-28T02:44:59Z","cross_cats_sorted":["cs.DC"],"title_canon_sha256":"6471540e0824836b2c74986ede1db10743a46ae0727ad163526f4493e8a796c1","abstract_canon_sha256":"c93fb676d37ee18ebfd742275aee85775721a754753407277f8e66ff9ddabd16"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:33:26.951023Z","signature_b64":"bugVB5gZprCWxkVnP5l8XEEUAHmsGHMLNLa6hcW+CY1amw0SlYxMwWg4Lvr3wJF5lHBeNb6SNkwEKYcRPyOoBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c00ff0a8148157f19d977391d52b9baf5177ecbe66013f917cbaec9c1b10c9aa","last_reissued_at":"2026-07-05T09:33:26.950490Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:33:26.950490Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Fast and Efficient 2-bit LLM Inference on GPU: 2/4/16-bit in a Weight Matrix with Asynchronous Dequantization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Guohao Dai, Jiaming Xu, Jinhao Li, Jun Liu, Shan Huang, Shiyao Li, Yaoxiu Lian","submitted_at":"2023-11-28T02:44:59Z","abstract_excerpt":"Large language models (LLMs) have demonstrated impressive abilities in various domains while the inference cost is expensive. Many previous studies exploit quantization methods to reduce LLM inference cost by reducing latency and memory consumption. Applying 2-bit single-precision weight quantization brings >3% accuracy loss, so the state-of-the-art methods use mixed-precision methods for LLMs (e.g. Llama2-7b, etc.) to improve the accuracy. However, challenges still exist: (1) Uneven distribution in weight matrix. (2) Large speed degradation by adding sparse outliers. (3) Time-consuming dequan"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.16442","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.16442/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.16442","created_at":"2026-07-05T09:33:26.950564+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.16442v4","created_at":"2026-07-05T09:33:26.950564+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.16442","created_at":"2026-07-05T09:33:26.950564+00:00"},{"alias_kind":"pith_short_12","alias_value":"YAH7BKAUQFL7","created_at":"2026-07-05T09:33:26.950564+00:00"},{"alias_kind":"pith_short_16","alias_value":"YAH7BKAUQFL7DHMX","created_at":"2026-07-05T09:33:26.950564+00:00"},{"alias_kind":"pith_short_8","alias_value":"YAH7BKAU","created_at":"2026-07-05T09:33:26.950564+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.02011","citing_title":"Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5","json":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5.json","graph_json":"https://pith.science/api/pith-number/YAH7BKAUQFL7DHMXOOI5KK43V5/graph.json","events_json":"https://pith.science/api/pith-number/YAH7BKAUQFL7DHMXOOI5KK43V5/events.json","paper":"https://pith.science/paper/YAH7BKAU"},"agent_actions":{"view_html":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5","download_json":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5.json","view_paper":"https://pith.science/paper/YAH7BKAU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.16442&json=true","fetch_graph":"https://pith.science/api/pith-number/YAH7BKAUQFL7DHMXOOI5KK43V5/graph.json","fetch_events":"https://pith.science/api/pith-number/YAH7BKAUQFL7DHMXOOI5KK43V5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5/action/storage_attestation","attest_author":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5/action/author_attestation","sign_citation":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5/action/citation_signature","submit_replication":"https://pith.science/pith/YAH7BKAUQFL7DHMXOOI5KK43V5/action/replication_record"}},"created_at":"2026-07-05T09:33:26.950564+00:00","updated_at":"2026-07-05T09:33:26.950564+00:00"}