{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:LVJRIIB7ZTJJ7XBNDIKC3CKYEQ","short_pith_number":"pith:LVJRIIB7","schema_version":"1.0","canonical_sha256":"5d5314203fccd29fdc2d1a142d8958243caea58f786185d44b633d60590cedd5","source":{"kind":"arxiv","id":"2607.09999","version":1},"attestation_state":"computed","paper":{"title":"Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Jerry Wu, Mohan Vamsi Varadaraju Priya, Renuka Oladri","submitted_at":"2026-07-10T21:55:05Z","abstract_excerpt":"We show that post-training quantization can silently alter how large language models reason even when task accuracy is preserved. Using a six-category failure taxonomy validated by two independent human annotators (Cohen's $\\kappa$ = 0.906), we classify 30,000 chain-of-thought outputs from five instruction-tuned LLMs (3B--14B parameters) across three quantization precisions (FP32, FP16, NF4) and four reasoning benchmarks. We find that while accuracy is robust across precisions (maximum 3.1 pp drop), Hollow Convergence (correct answers reached through incomplete or unverifiable reasoning) shows"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.09999","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2026-07-10T21:55:05Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"54dc4658c5c4555a49b80c81a3431cea1aceaec7e8a8bd8328e7126442872d34","abstract_canon_sha256":"4a6cd571f4b1946a66fc620431b7b36e39df3601ab69f9e36874081917f2215b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-14T00:18:46.947709Z","signature_b64":"osJklhhAQsayAMc2053JLMCxR4UAljLq7U2q3lGWrplu8RLU2yP6rbpxnEyspY63fyAcpnB1XmZdm+CUUh0xDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5d5314203fccd29fdc2d1a142d8958243caea58f786185d44b633d60590cedd5","last_reissued_at":"2026-07-14T00:18:46.946880Z","signature_status":"signed_v1","first_computed_at":"2026-07-14T00:18:46.946880Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Jerry Wu, Mohan Vamsi Varadaraju Priya, Renuka Oladri","submitted_at":"2026-07-10T21:55:05Z","abstract_excerpt":"We show that post-training quantization can silently alter how large language models reason even when task accuracy is preserved. Using a six-category failure taxonomy validated by two independent human annotators (Cohen's $\\kappa$ = 0.906), we classify 30,000 chain-of-thought outputs from five instruction-tuned LLMs (3B--14B parameters) across three quantization precisions (FP32, FP16, NF4) and four reasoning benchmarks. We find that while accuracy is robust across precisions (maximum 3.1 pp drop), Hollow Convergence (correct answers reached through incomplete or unverifiable reasoning) shows"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.09999","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.09999/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.09999","created_at":"2026-07-14T00:18:46.947320+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.09999v1","created_at":"2026-07-14T00:18:46.947320+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.09999","created_at":"2026-07-14T00:18:46.947320+00:00"},{"alias_kind":"pith_short_12","alias_value":"LVJRIIB7ZTJJ","created_at":"2026-07-14T00:18:46.947320+00:00"},{"alias_kind":"pith_short_16","alias_value":"LVJRIIB7ZTJJ7XBN","created_at":"2026-07-14T00:18:46.947320+00:00"},{"alias_kind":"pith_short_8","alias_value":"LVJRIIB7","created_at":"2026-07-14T00:18:46.947320+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2608.02786","citing_title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","ref_index":14,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ","json":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ.json","graph_json":"https://pith.science/api/pith-number/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/graph.json","events_json":"https://pith.science/api/pith-number/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/events.json","paper":"https://pith.science/paper/LVJRIIB7"},"agent_actions":{"view_html":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ","download_json":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ.json","view_paper":"https://pith.science/paper/LVJRIIB7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.09999&json=true","fetch_graph":"https://pith.science/api/pith-number/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/graph.json","fetch_events":"https://pith.science/api/pith-number/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/action/storage_attestation","attest_author":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/action/author_attestation","sign_citation":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/action/citation_signature","submit_replication":"https://pith.science/pith/LVJRIIB7ZTJJ7XBNDIKC3CKYEQ/action/replication_record"}},"created_at":"2026-07-14T00:18:46.947320+00:00","updated_at":"2026-07-14T00:18:46.947320+00:00"}