{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:NS2EEQJXNUWHYJLTCIL6TKDIVM","short_pith_number":"pith:NS2EEQJX","schema_version":"1.0","canonical_sha256":"6cb44241376d2c7c25731217e9a868ab0d6c3cc7bed64946c8eb20ef6ae81389","source":{"kind":"arxiv","id":"2407.11681","version":1},"attestation_state":"computed","paper":{"title":"MINI-LLM: Memory-Efficient Structured Pruning for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Hongrong Cheng, Javen Qinfeng Shi, Miao Zhang","submitted_at":"2024-07-16T12:59:44Z","abstract_excerpt":"As Large Language Models (LLMs) grow dramatically in size, there is an increasing trend in compressing and speeding up these models. Previous studies have highlighted the usefulness of gradients for importance scoring in neural network compressing, especially in pruning medium-size networks. However, the substantial memory requirements involved in calculating gradients with backpropagation impede the utilization of gradients in guiding LLM pruning. As a result, most pruning strategies for LLMs rely on gradient-free criteria, such as weight magnitudes or a mix of magnitudes and activations. In "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.11681","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-07-16T12:59:44Z","cross_cats_sorted":[],"title_canon_sha256":"d46590d1af8958e8938f271f187b926586e4b5b3b8ee72a3125cf48f4cf7c781","abstract_canon_sha256":"de5d946276adc77b11c773dcdc04c97f7c638d57327b8e595c6b9e0df01e9b05"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:44:27.755017Z","signature_b64":"4YboA9+vxQmVfex/IE75v+ZuiP/VBvhgrzl0vcFmBMaITvPWxGOHGAtD87hRu4gkpdWqEsYoNQTcEJc6rsnCCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6cb44241376d2c7c25731217e9a868ab0d6c3cc7bed64946c8eb20ef6ae81389","last_reissued_at":"2026-07-05T08:44:27.754611Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:44:27.754611Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MINI-LLM: Memory-Efficient Structured Pruning for Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Hongrong Cheng, Javen Qinfeng Shi, Miao Zhang","submitted_at":"2024-07-16T12:59:44Z","abstract_excerpt":"As Large Language Models (LLMs) grow dramatically in size, there is an increasing trend in compressing and speeding up these models. Previous studies have highlighted the usefulness of gradients for importance scoring in neural network compressing, especially in pruning medium-size networks. However, the substantial memory requirements involved in calculating gradients with backpropagation impede the utilization of gradients in guiding LLM pruning. As a result, most pruning strategies for LLMs rely on gradient-free criteria, such as weight magnitudes or a mix of magnitudes and activations. In "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.11681","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.11681/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.11681","created_at":"2026-07-05T08:44:27.754667+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.11681v1","created_at":"2026-07-05T08:44:27.754667+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.11681","created_at":"2026-07-05T08:44:27.754667+00:00"},{"alias_kind":"pith_short_12","alias_value":"NS2EEQJXNUWH","created_at":"2026-07-05T08:44:27.754667+00:00"},{"alias_kind":"pith_short_16","alias_value":"NS2EEQJXNUWHYJLT","created_at":"2026-07-05T08:44:27.754667+00:00"},{"alias_kind":"pith_short_8","alias_value":"NS2EEQJX","created_at":"2026-07-05T08:44:27.754667+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.10445","citing_title":"SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19118","citing_title":"DP-FlogTinyLLM: Differentially private federated log anomaly detection using Tiny LLMs","ref_index":38,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM","json":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM.json","graph_json":"https://pith.science/api/pith-number/NS2EEQJXNUWHYJLTCIL6TKDIVM/graph.json","events_json":"https://pith.science/api/pith-number/NS2EEQJXNUWHYJLTCIL6TKDIVM/events.json","paper":"https://pith.science/paper/NS2EEQJX"},"agent_actions":{"view_html":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM","download_json":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM.json","view_paper":"https://pith.science/paper/NS2EEQJX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.11681&json=true","fetch_graph":"https://pith.science/api/pith-number/NS2EEQJXNUWHYJLTCIL6TKDIVM/graph.json","fetch_events":"https://pith.science/api/pith-number/NS2EEQJXNUWHYJLTCIL6TKDIVM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM/action/storage_attestation","attest_author":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM/action/author_attestation","sign_citation":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM/action/citation_signature","submit_replication":"https://pith.science/pith/NS2EEQJXNUWHYJLTCIL6TKDIVM/action/replication_record"}},"created_at":"2026-07-05T08:44:27.754667+00:00","updated_at":"2026-07-05T08:44:27.754667+00:00"}