{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:34SSKFYQV46R3LV7IAC3ZDFB6T","short_pith_number":"pith:34SSKFYQ","schema_version":"1.0","canonical_sha256":"df25251710af3d1daebf4005bc8ca1f4cea84c3c7a02a2427ec9d830dd813f55","source":{"kind":"arxiv","id":"2406.13035","version":3},"attestation_state":"computed","paper":{"title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chaofan Tao, Jing Xiong, Longyue Wang, Mi Zhang, Siqi Luo, Xinjian Wu, Xin Wang, Yi Xin, Yu Zhang, Zhihong Zhu, Zhongwei Wan","submitted_at":"2024-06-18T20:01:51Z","abstract_excerpt":"Generative inference in Large Language Models (LLMs) is impeded by the growing memory demands of Key-Value (KV) cache, especially for longer sequences. Traditional KV cache eviction strategies, which discard less critical KV pairs based on attention scores, often degrade generation quality, leading to issues such as context loss or hallucinations. In this work, we introduce Dynamic Discriminative Operations (D2O), a KV cache compression method that optimizes KV cache size dynamically and discriminatively at two levels without fine-tuning, while preserving essential context. At layer level, D2O"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.13035","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-06-18T20:01:51Z","cross_cats_sorted":[],"title_canon_sha256":"6ab9af56e9a04364ca66ffab12a0f286112b6747702e2b3bdee819077bb201de","abstract_canon_sha256":"d27bc0d629ba25629ebc9a9fde980b0f2019c59d67faaec5bf2a1c9e69ed6464"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:30:21.419034Z","signature_b64":"9gxF1zTiGBFofKdIHLM0tG9aIuJiKV/yADDVnomrFlvZuKZscHh3B7R1K6z71tNJ7Bwo6EH7CF3CEhPZ+N1/Cw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"df25251710af3d1daebf4005bc8ca1f4cea84c3c7a02a2427ec9d830dd813f55","last_reissued_at":"2026-07-05T10:30:21.418576Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:30:21.418576Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Chaofan Tao, Jing Xiong, Longyue Wang, Mi Zhang, Siqi Luo, Xinjian Wu, Xin Wang, Yi Xin, Yu Zhang, Zhihong Zhu, Zhongwei Wan","submitted_at":"2024-06-18T20:01:51Z","abstract_excerpt":"Generative inference in Large Language Models (LLMs) is impeded by the growing memory demands of Key-Value (KV) cache, especially for longer sequences. Traditional KV cache eviction strategies, which discard less critical KV pairs based on attention scores, often degrade generation quality, leading to issues such as context loss or hallucinations. In this work, we introduce Dynamic Discriminative Operations (D2O), a KV cache compression method that optimizes KV cache size dynamically and discriminatively at two levels without fine-tuning, while preserving essential context. At layer level, D2O"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.13035","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.13035/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.13035","created_at":"2026-07-05T10:30:21.418645+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.13035v3","created_at":"2026-07-05T10:30:21.418645+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.13035","created_at":"2026-07-05T10:30:21.418645+00:00"},{"alias_kind":"pith_short_12","alias_value":"34SSKFYQV46R","created_at":"2026-07-05T10:30:21.418645+00:00"},{"alias_kind":"pith_short_16","alias_value":"34SSKFYQV46R3LV7","created_at":"2026-07-05T10:30:21.418645+00:00"},{"alias_kind":"pith_short_8","alias_value":"34SSKFYQ","created_at":"2026-07-05T10:30:21.418645+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26875","citing_title":"Information-Aware KV Cache Compression for Long Reasoning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08302","citing_title":"HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03979","citing_title":"Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02553","citing_title":"LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22337","citing_title":"Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12260","citing_title":"PRISM: Pareto-Efficient Retrieval over Intent-Aware Structured Memory for Long-Horizon Agents","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23258","citing_title":"A Simple Plug-in for Improving Eviction-Based KV Cache Compression","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22337","citing_title":"Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20600","citing_title":"Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2603.20284","citing_title":"STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12260","citing_title":"PRISM: Pareto-Efficient Retrieval over Intent-Aware Structured Memory for Long-Horizon Agents","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26837","citing_title":"Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08840","citing_title":"ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07234","citing_title":"Reformulating KV Cache Eviction Problem for Long-Context LLM Inference","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2505.02922","citing_title":"RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference","ref_index":96,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T","json":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T.json","graph_json":"https://pith.science/api/pith-number/34SSKFYQV46R3LV7IAC3ZDFB6T/graph.json","events_json":"https://pith.science/api/pith-number/34SSKFYQV46R3LV7IAC3ZDFB6T/events.json","paper":"https://pith.science/paper/34SSKFYQ"},"agent_actions":{"view_html":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T","download_json":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T.json","view_paper":"https://pith.science/paper/34SSKFYQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.13035&json=true","fetch_graph":"https://pith.science/api/pith-number/34SSKFYQV46R3LV7IAC3ZDFB6T/graph.json","fetch_events":"https://pith.science/api/pith-number/34SSKFYQV46R3LV7IAC3ZDFB6T/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T/action/timestamp_anchor","attest_storage":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T/action/storage_attestation","attest_author":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T/action/author_attestation","sign_citation":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T/action/citation_signature","submit_replication":"https://pith.science/pith/34SSKFYQV46R3LV7IAC3ZDFB6T/action/replication_record"}},"created_at":"2026-07-05T10:30:21.418645+00:00","updated_at":"2026-07-05T10:30:21.418645+00:00"}