{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:S3DY2IS5CXJ5FPIFHO5QWGI7UU","short_pith_number":"pith:S3DY2IS5","schema_version":"1.0","canonical_sha256":"96c78d225d15d3d2bd053bbb0b191fa517f9fdffc65263a6c94c0a9c977199de","source":{"kind":"arxiv","id":"2403.12968","version":2},"attestation_state":"computed","paper":{"title":"LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Chin-Yew Lin, Dongmei Zhang, Huiqiang Jiang, H. Vicky Zhao, Jue Zhang, Lili Qiu, Menglin Xia, Qianhui Wu, Qingwei Lin, Victor R\\\"uhle, Xufang Luo, Yuqing Yang, Zhuoshi Pan","submitted_at":"2024-03-19T17:59:56Z","abstract_excerpt":"This paper focuses on task-agnostic prompt compression for better generalizability and efficiency. Considering the redundancy in natural language, existing approaches compress prompts by removing tokens or lexical units according to their information entropy obtained from a causal language model such as LLaMa-7B. The challenge is that information entropy may be a suboptimal compression metric: (i) it only leverages unidirectional context and may fail to capture all essential information needed for prompt compression; (ii) it is not aligned with the prompt compression objective.\n  To address th"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.12968","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-03-19T17:59:56Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"b0032cb2a14bdf1cb2966f064a9cf31cfd8c89e831620f531f7b9a8c383f7c45","abstract_canon_sha256":"48ad817ad77d430f7f92f27c5c11ae8b23257883974bdb8ade81ebe96a0061ca"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:54:08.812873Z","signature_b64":"Ri7Zibr/qeRMdkF/1frlQtENSk0ysDwVpVWebTshnJTHfJ44jMmsrX1ZQM8SjZP0RsOuzOhc3wfteQIH9LVACg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"96c78d225d15d3d2bd053bbb0b191fa517f9fdffc65263a6c94c0a9c977199de","last_reissued_at":"2026-07-05T08:54:08.812359Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:54:08.812359Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Chin-Yew Lin, Dongmei Zhang, Huiqiang Jiang, H. Vicky Zhao, Jue Zhang, Lili Qiu, Menglin Xia, Qianhui Wu, Qingwei Lin, Victor R\\\"uhle, Xufang Luo, Yuqing Yang, Zhuoshi Pan","submitted_at":"2024-03-19T17:59:56Z","abstract_excerpt":"This paper focuses on task-agnostic prompt compression for better generalizability and efficiency. Considering the redundancy in natural language, existing approaches compress prompts by removing tokens or lexical units according to their information entropy obtained from a causal language model such as LLaMa-7B. The challenge is that information entropy may be a suboptimal compression metric: (i) it only leverages unidirectional context and may fail to capture all essential information needed for prompt compression; (ii) it is not aligned with the prompt compression objective.\n  To address th"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.12968","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.12968/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.12968","created_at":"2026-07-05T08:54:08.812438+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.12968v2","created_at":"2026-07-05T08:54:08.812438+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.12968","created_at":"2026-07-05T08:54:08.812438+00:00"},{"alias_kind":"pith_short_12","alias_value":"S3DY2IS5CXJ5","created_at":"2026-07-05T08:54:08.812438+00:00"},{"alias_kind":"pith_short_16","alias_value":"S3DY2IS5CXJ5FPIF","created_at":"2026-07-05T08:54:08.812438+00:00"},{"alias_kind":"pith_short_8","alias_value":"S3DY2IS5","created_at":"2026-07-05T08:54:08.812438+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08032","citing_title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","ref_index":91,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01241","citing_title":"Mapping Text to Multiplex Graph: Prompt Compression as L\\'evy Walk-Guided Graph Pruning","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09585","citing_title":"Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28349","citing_title":"HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26165","citing_title":"Tool-Schema Compression Enables Agentic RAG Under Constrained Context Budgets","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2602.08324","citing_title":"Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2602.13933","citing_title":"HyMem: Hybrid Memory Architecture with Dynamic Retrieval Scheduling","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14156","citing_title":"Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11317","citing_title":"SOMA: Efficient Multi-turn LLM Serving via Small Language Model","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09611","citing_title":"Byte-Exact Deduplication in Retrieval-Augmented Generation: A Three-Regime Empirical Analysis Across Public Benchmarks","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13725","citing_title":"On the Effectiveness of Context Compression for Repository-Level Tasks: An Empirical Investigation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15153","citing_title":"Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14889","citing_title":"MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17512","citing_title":"ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17297","citing_title":"CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning","ref_index":3,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU","json":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU.json","graph_json":"https://pith.science/api/pith-number/S3DY2IS5CXJ5FPIFHO5QWGI7UU/graph.json","events_json":"https://pith.science/api/pith-number/S3DY2IS5CXJ5FPIFHO5QWGI7UU/events.json","paper":"https://pith.science/paper/S3DY2IS5"},"agent_actions":{"view_html":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU","download_json":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU.json","view_paper":"https://pith.science/paper/S3DY2IS5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.12968&json=true","fetch_graph":"https://pith.science/api/pith-number/S3DY2IS5CXJ5FPIFHO5QWGI7UU/graph.json","fetch_events":"https://pith.science/api/pith-number/S3DY2IS5CXJ5FPIFHO5QWGI7UU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU/action/storage_attestation","attest_author":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU/action/author_attestation","sign_citation":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU/action/citation_signature","submit_replication":"https://pith.science/pith/S3DY2IS5CXJ5FPIFHO5QWGI7UU/action/replication_record"}},"created_at":"2026-07-05T08:54:08.812438+00:00","updated_at":"2026-07-05T08:54:08.812438+00:00"}