{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:EYVQDWKLKUB55PENFIJAQGW3KV","short_pith_number":"pith:EYVQDWKL","schema_version":"1.0","canonical_sha256":"262b01d94b5503debc8d2a12081adb556cd9de52a6b46946ea2558d8a92fdd22","source":{"kind":"arxiv","id":"2607.08786","version":1},"attestation_state":"computed","paper":{"title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.AR"],"primary_cat":"cs.LG","authors_text":"Haoyu Wang, Jiaheng Zhang, Keshen Xiang, Tao Lu, Wenzhi Chen, Zonghui Wang","submitted_at":"2026-06-13T13:38:27Z","abstract_excerpt":"With the growing deployment of large language models (LLMs), LLM inference cost has become a key challenge. Pruning techniques that introduce sparsity into weight matrices can accelerate inference. However, maintaining model quality typically limits pruning to moderate unstructured sparsity (around 50\\%). At these sparsity levels, none of the existing GPU kernels for sparse matrix multiplication (SpMM) can outperform their dense counterparts. This paper proposes an efficient GPU inference method for LLMs with moderate sparsity. We propose a three-layer matrix storage format comprising: (i) a S"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.08786","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2026-06-13T13:38:27Z","cross_cats_sorted":["cs.AI","cs.AR"],"title_canon_sha256":"eadb0d235dd81c2ae61dc8bc2c8a0312cada5d4e4f384b1d5fc29c3394f5a624","abstract_canon_sha256":"8734128bf6ca3e0c2b7f9995f980630e6df49b3e84f80fce67973809ceef5062"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-13T00:17:16.670252Z","signature_b64":"QrLqEBHeIP3CrBonYONI+vlycm+t2llJQmvjojnrqUUEwI6PgyK4SUVvRyqitVl2BDEQxhXoUx8sNqV2rSL1Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"262b01d94b5503debc8d2a12081adb556cd9de52a6b46946ea2558d8a92fdd22","last_reissued_at":"2026-07-13T00:17:16.669276Z","signature_status":"signed_v1","first_computed_at":"2026-07-13T00:17:16.669276Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.AR"],"primary_cat":"cs.LG","authors_text":"Haoyu Wang, Jiaheng Zhang, Keshen Xiang, Tao Lu, Wenzhi Chen, Zonghui Wang","submitted_at":"2026-06-13T13:38:27Z","abstract_excerpt":"With the growing deployment of large language models (LLMs), LLM inference cost has become a key challenge. Pruning techniques that introduce sparsity into weight matrices can accelerate inference. However, maintaining model quality typically limits pruning to moderate unstructured sparsity (around 50\\%). At these sparsity levels, none of the existing GPU kernels for sparse matrix multiplication (SpMM) can outperform their dense counterparts. This paper proposes an efficient GPU inference method for LLMs with moderate sparsity. We propose a three-layer matrix storage format comprising: (i) a S"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.08786","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.08786/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.08786","created_at":"2026-07-13T00:17:16.669765+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.08786v1","created_at":"2026-07-13T00:17:16.669765+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.08786","created_at":"2026-07-13T00:17:16.669765+00:00"},{"alias_kind":"pith_short_12","alias_value":"EYVQDWKLKUB5","created_at":"2026-07-13T00:17:16.669765+00:00"},{"alias_kind":"pith_short_16","alias_value":"EYVQDWKLKUB55PEN","created_at":"2026-07-13T00:17:16.669765+00:00"},{"alias_kind":"pith_short_8","alias_value":"EYVQDWKL","created_at":"2026-07-13T00:17:16.669765+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV","json":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV.json","graph_json":"https://pith.science/api/pith-number/EYVQDWKLKUB55PENFIJAQGW3KV/graph.json","events_json":"https://pith.science/api/pith-number/EYVQDWKLKUB55PENFIJAQGW3KV/events.json","paper":"https://pith.science/paper/EYVQDWKL"},"agent_actions":{"view_html":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV","download_json":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV.json","view_paper":"https://pith.science/paper/EYVQDWKL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.08786&json=true","fetch_graph":"https://pith.science/api/pith-number/EYVQDWKLKUB55PENFIJAQGW3KV/graph.json","fetch_events":"https://pith.science/api/pith-number/EYVQDWKLKUB55PENFIJAQGW3KV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV/action/storage_attestation","attest_author":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV/action/author_attestation","sign_citation":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV/action/citation_signature","submit_replication":"https://pith.science/pith/EYVQDWKLKUB55PENFIJAQGW3KV/action/replication_record"}},"created_at":"2026-07-13T00:17:16.669765+00:00","updated_at":"2026-07-13T00:17:16.669765+00:00"}