{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:SYPGCTTZXWEUPMGRZ42IJPODYY","short_pith_number":"pith:SYPGCTTZ","schema_version":"1.0","canonical_sha256":"961e614e79bd8947b0d1cf3484bdc3c6079a3152bad4b5caf4588a226c8918f8","source":{"kind":"arxiv","id":"2410.18517","version":1},"attestation_state":"computed","paper":{"title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Dongjie Yang, Hai Zhao, Libo Qin, Qiguang Chen, Yifei Yang, Zhi Chen, Zouying Cao","submitted_at":"2024-10-24T08:06:41Z","abstract_excerpt":"The development of large language models (LLMs) has significantly expanded model sizes, resulting in substantial GPU memory requirements during inference. The key and value storage of the attention map in the KV (key-value) cache accounts for more than 80\\% of this memory consumption. Nowadays, most existing KV cache compression methods focus on intra-layer compression within a single Transformer layer but few works consider layer-wise compression. In this paper, we propose a plug-and-play method called \\textit{KVSharer}, which shares the KV cache between layers to achieve layer-wise compressi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.18517","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-10-24T08:06:41Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"ed53764df283a9d7833e3bb4f767d6f3bb9cb119c266564bcdded11ccc3b6253","abstract_canon_sha256":"0a04e21b442d9560b815f60a8c02c4d03ae9e37a396c13ea1feca09d808d2446"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:25:09.508799Z","signature_b64":"Ax1G/VtB7dPdFA2A70YfTy7W+Sbs2yuFEvelyGDH0LQo5knLE204mIruTamqMjgNpQa0+xrjebq34HehHUbuCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"961e614e79bd8947b0d1cf3484bdc3c6079a3152bad4b5caf4588a226c8918f8","last_reissued_at":"2026-07-05T09:25:09.508246Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:25:09.508246Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Dongjie Yang, Hai Zhao, Libo Qin, Qiguang Chen, Yifei Yang, Zhi Chen, Zouying Cao","submitted_at":"2024-10-24T08:06:41Z","abstract_excerpt":"The development of large language models (LLMs) has significantly expanded model sizes, resulting in substantial GPU memory requirements during inference. The key and value storage of the attention map in the KV (key-value) cache accounts for more than 80\\% of this memory consumption. Nowadays, most existing KV cache compression methods focus on intra-layer compression within a single Transformer layer but few works consider layer-wise compression. In this paper, we propose a plug-and-play method called \\textit{KVSharer}, which shares the KV cache between layers to achieve layer-wise compressi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.18517","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.18517/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.18517","created_at":"2026-07-05T09:25:09.508312+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.18517v1","created_at":"2026-07-05T09:25:09.508312+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.18517","created_at":"2026-07-05T09:25:09.508312+00:00"},{"alias_kind":"pith_short_12","alias_value":"SYPGCTTZXWEU","created_at":"2026-07-05T09:25:09.508312+00:00"},{"alias_kind":"pith_short_16","alias_value":"SYPGCTTZXWEUPMGR","created_at":"2026-07-05T09:25:09.508312+00:00"},{"alias_kind":"pith_short_8","alias_value":"SYPGCTTZ","created_at":"2026-07-05T09:25:09.508312+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2607.06519","citing_title":"FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference","ref_index":120,"is_internal_anchor":true},{"citing_arxiv_id":"2607.06523","citing_title":"DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression","ref_index":137,"is_internal_anchor":true},{"citing_arxiv_id":"2606.31093","citing_title":"Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15852","citing_title":"GHOST: Geometry-Hierarchical Online Streaming Token Eviction for Efficient 3D Reconstruction","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15852","citing_title":"GHOST: Geometry-Hierarchical Online Streaming Token Eviction for Efficient 3D Reconstruction","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08426","citing_title":"KV Cache Offloading for Context-Intensive Tasks","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08426","citing_title":"KV Cache Offloading for Context-Intensive Tasks","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12464","citing_title":"Search Your Block Floating Point Scales!","ref_index":165,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08426","citing_title":"KV Cache Offloading for Context-Intensive Tasks","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08426","citing_title":"KV Cache Offloading for Context-Intensive Tasks","ref_index":61,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY","json":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY.json","graph_json":"https://pith.science/api/pith-number/SYPGCTTZXWEUPMGRZ42IJPODYY/graph.json","events_json":"https://pith.science/api/pith-number/SYPGCTTZXWEUPMGRZ42IJPODYY/events.json","paper":"https://pith.science/paper/SYPGCTTZ"},"agent_actions":{"view_html":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY","download_json":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY.json","view_paper":"https://pith.science/paper/SYPGCTTZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.18517&json=true","fetch_graph":"https://pith.science/api/pith-number/SYPGCTTZXWEUPMGRZ42IJPODYY/graph.json","fetch_events":"https://pith.science/api/pith-number/SYPGCTTZXWEUPMGRZ42IJPODYY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY/action/storage_attestation","attest_author":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY/action/author_attestation","sign_citation":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY/action/citation_signature","submit_replication":"https://pith.science/pith/SYPGCTTZXWEUPMGRZ42IJPODYY/action/replication_record"}},"created_at":"2026-07-05T09:25:09.508312+00:00","updated_at":"2026-07-05T09:25:09.508312+00:00"}