{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ONCLVBIP56BBCO5NYBPWJOVAWV","short_pith_number":"pith:ONCLVBIP","schema_version":"1.0","canonical_sha256":"7344ba850fef82113badc05f64baa0b56a86d5e9d709ab4c6ca4899cf5399f7f","source":{"kind":"arxiv","id":"2506.04985","version":1},"attestation_state":"computed","paper":{"title":"FPTQuant: Function-Preserving Transforms for LLM Quantization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Boris van Breugel, Markus Nagel, Paul Whatmough, Yelysei Bondarenko","submitted_at":"2025-06-05T12:56:12Z","abstract_excerpt":"Large language models (LLMs) require substantial compute, and thus energy, at inference time. While quantizing weights and activations is effective at improving efficiency, naive quantization of LLMs can significantly degrade performance due to large magnitude outliers. This paper describes FPTQuant, which introduces four novel, lightweight, and expressive function-preserving transforms (FPTs) to facilitate quantization of transformers: (1) a mergeable pre-RoPE transform for queries and keys, (2) a mergeable transform for values, (3) a mergeable scaling transform within the MLP block, and (4) "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.04985","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-06-05T12:56:12Z","cross_cats_sorted":[],"title_canon_sha256":"63a21f07186ff21a037a7eb602eba75e9d39042c807a2754bb48a10453800532","abstract_canon_sha256":"511839949bc16ae893bc25ccf8a7ba84da33b5fdd50c97853335b4c1c499ef01"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:16:40.223721Z","signature_b64":"y+1JwWh7mdOdmItVot3OGlomUE6Gmp9233U+6Pb09nj/l36clTCXK02JyHrFPq6cbqhPrMwLJ71Pw3s4C7c9Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7344ba850fef82113badc05f64baa0b56a86d5e9d709ab4c6ca4899cf5399f7f","last_reissued_at":"2026-07-05T11:16:40.223172Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:16:40.223172Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FPTQuant: Function-Preserving Transforms for LLM Quantization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Boris van Breugel, Markus Nagel, Paul Whatmough, Yelysei Bondarenko","submitted_at":"2025-06-05T12:56:12Z","abstract_excerpt":"Large language models (LLMs) require substantial compute, and thus energy, at inference time. While quantizing weights and activations is effective at improving efficiency, naive quantization of LLMs can significantly degrade performance due to large magnitude outliers. This paper describes FPTQuant, which introduces four novel, lightweight, and expressive function-preserving transforms (FPTs) to facilitate quantization of transformers: (1) a mergeable pre-RoPE transform for queries and keys, (2) a mergeable transform for values, (3) a mergeable scaling transform within the MLP block, and (4) "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.04985","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.04985/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.04985","created_at":"2026-07-05T11:16:40.223232+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.04985v1","created_at":"2026-07-05T11:16:40.223232+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.04985","created_at":"2026-07-05T11:16:40.223232+00:00"},{"alias_kind":"pith_short_12","alias_value":"ONCLVBIP56BB","created_at":"2026-07-05T11:16:40.223232+00:00"},{"alias_kind":"pith_short_16","alias_value":"ONCLVBIP56BBCO5N","created_at":"2026-07-05T11:16:40.223232+00:00"},{"alias_kind":"pith_short_8","alias_value":"ONCLVBIP","created_at":"2026-07-05T11:16:40.223232+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2605.05699","citing_title":"When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon","ref_index":26,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV","json":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV.json","graph_json":"https://pith.science/api/pith-number/ONCLVBIP56BBCO5NYBPWJOVAWV/graph.json","events_json":"https://pith.science/api/pith-number/ONCLVBIP56BBCO5NYBPWJOVAWV/events.json","paper":"https://pith.science/paper/ONCLVBIP"},"agent_actions":{"view_html":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV","download_json":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV.json","view_paper":"https://pith.science/paper/ONCLVBIP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.04985&json=true","fetch_graph":"https://pith.science/api/pith-number/ONCLVBIP56BBCO5NYBPWJOVAWV/graph.json","fetch_events":"https://pith.science/api/pith-number/ONCLVBIP56BBCO5NYBPWJOVAWV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV/action/storage_attestation","attest_author":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV/action/author_attestation","sign_citation":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV/action/citation_signature","submit_replication":"https://pith.science/pith/ONCLVBIP56BBCO5NYBPWJOVAWV/action/replication_record"}},"created_at":"2026-07-05T11:16:40.223232+00:00","updated_at":"2026-07-05T11:16:40.223232+00:00"}