{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:F3J2AOSJBANXTKUV6DWIAX3QWF","short_pith_number":"pith:F3J2AOSJ","schema_version":"1.0","canonical_sha256":"2ed3a03a49081b79aa95f0ec805f70b15c558f33dd1d32fa0af3b0a0ff6c1220","source":{"kind":"arxiv","id":"2507.16933","version":1},"attestation_state":"computed","paper":{"title":"SiLQ: Simple Large Language Model Quantization-Aware Training","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Deepika Bablani, Dharmendra S. Modha, Jeffrey L. McKinstry, Rathinakumar Appuswamy, Steven K. Esser","submitted_at":"2025-07-22T18:17:53Z","abstract_excerpt":"Large language models can be quantized to reduce inference time latency, model size, and energy consumption, thereby delivering a better user experience at lower cost. A challenge exists to deliver quantized models with minimal loss of accuracy in reasonable time, and in particular to do so without requiring mechanisms incompatible with specialized inference accelerators. Here, we demonstrate a simple, end-to-end quantization-aware training approach that, with an increase in total model training budget of less than 0.1%, outperforms the leading published quantization methods by large margins o"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.16933","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-07-22T18:17:53Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"f5231021b78ab71995410a177e8bf706c24124c31725c98e18884e46481271bd","abstract_canon_sha256":"093a038c15849034b666925aba3fad77c7212c101ea0a9dfab63cabd020bb637"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:41:58.550126Z","signature_b64":"CRoByLtfWzDcOKk33OpP3bxKIp17ndFf87a67DHyqNbwaP/kS+IVttMakIaXcUyEYNHX4I+Xtj+qaUP24ygxCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2ed3a03a49081b79aa95f0ec805f70b15c558f33dd1d32fa0af3b0a0ff6c1220","last_reissued_at":"2026-07-05T11:41:58.549628Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:41:58.549628Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SiLQ: Simple Large Language Model Quantization-Aware Training","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Deepika Bablani, Dharmendra S. Modha, Jeffrey L. McKinstry, Rathinakumar Appuswamy, Steven K. Esser","submitted_at":"2025-07-22T18:17:53Z","abstract_excerpt":"Large language models can be quantized to reduce inference time latency, model size, and energy consumption, thereby delivering a better user experience at lower cost. A challenge exists to deliver quantized models with minimal loss of accuracy in reasonable time, and in particular to do so without requiring mechanisms incompatible with specialized inference accelerators. Here, we demonstrate a simple, end-to-end quantization-aware training approach that, with an increase in total model training budget of less than 0.1%, outperforms the leading published quantization methods by large margins o"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.16933","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.16933/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.16933","created_at":"2026-07-05T11:41:58.549693+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.16933v1","created_at":"2026-07-05T11:41:58.549693+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.16933","created_at":"2026-07-05T11:41:58.549693+00:00"},{"alias_kind":"pith_short_12","alias_value":"F3J2AOSJBANX","created_at":"2026-07-05T11:41:58.549693+00:00"},{"alias_kind":"pith_short_16","alias_value":"F3J2AOSJBANXTKUV","created_at":"2026-07-05T11:41:58.549693+00:00"},{"alias_kind":"pith_short_8","alias_value":"F3J2AOSJ","created_at":"2026-07-05T11:41:58.549693+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.09425","citing_title":"AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF","json":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF.json","graph_json":"https://pith.science/api/pith-number/F3J2AOSJBANXTKUV6DWIAX3QWF/graph.json","events_json":"https://pith.science/api/pith-number/F3J2AOSJBANXTKUV6DWIAX3QWF/events.json","paper":"https://pith.science/paper/F3J2AOSJ"},"agent_actions":{"view_html":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF","download_json":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF.json","view_paper":"https://pith.science/paper/F3J2AOSJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.16933&json=true","fetch_graph":"https://pith.science/api/pith-number/F3J2AOSJBANXTKUV6DWIAX3QWF/graph.json","fetch_events":"https://pith.science/api/pith-number/F3J2AOSJBANXTKUV6DWIAX3QWF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF/action/storage_attestation","attest_author":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF/action/author_attestation","sign_citation":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF/action/citation_signature","submit_replication":"https://pith.science/pith/F3J2AOSJBANXTKUV6DWIAX3QWF/action/replication_record"}},"created_at":"2026-07-05T11:41:58.549693+00:00","updated_at":"2026-07-05T11:41:58.549693+00:00"}