{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:PJ5A4CQHTTLUMCXTY4WA3QCR2P","short_pith_number":"pith:PJ5A4CQH","schema_version":"1.0","canonical_sha256":"7a7a0e0a079cd7460af3c72c0dc051d3d255658730d59b4d173c9d7c112c80b7","source":{"kind":"arxiv","id":"2501.16214","version":1},"attestation_state":"computed","paper":{"title":"Provence: efficient and robust context pruning for retrieval-augmented generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR"],"primary_cat":"cs.CL","authors_text":"Nadezhda Chirkova, St\\'ephane Clinchant, Thibault Formal, Vassilina Nikoulina","submitted_at":"2025-01-27T17:06:56Z","abstract_excerpt":"Retrieval-augmented generation improves various aspects of large language models (LLMs) generation, but suffers from computational overhead caused by long contexts as well as the propagation of irrelevant retrieved information into generated responses. Context pruning deals with both aspects, by removing irrelevant parts of retrieved contexts before LLM generation. Existing context pruning approaches are however limited, and do not provide a universal model that would be both efficient and robust in a wide range of scenarios, e.g., when contexts contain a variable amount of relevant informatio"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.16214","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-01-27T17:06:56Z","cross_cats_sorted":["cs.IR"],"title_canon_sha256":"416096d44b69ae37b14765a68d48a34f599a0609188e1cf5ed06f116beb1cee1","abstract_canon_sha256":"102450dd3a361fd319a44ca4e6e0f17eb754494e5ec2cf51d2b083bddb920aa4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:07:29.832072Z","signature_b64":"eexh/8+G4RDPKsLBgE+ZSJW0JU5F/FHyrovAteeGqItTPu+Oqg3zHvXRESl11HCULSagg+jmibFNNPvNKRnSBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7a7a0e0a079cd7460af3c72c0dc051d3d255658730d59b4d173c9d7c112c80b7","last_reissued_at":"2026-07-05T10:07:29.831583Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:07:29.831583Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Provence: efficient and robust context pruning for retrieval-augmented generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.IR"],"primary_cat":"cs.CL","authors_text":"Nadezhda Chirkova, St\\'ephane Clinchant, Thibault Formal, Vassilina Nikoulina","submitted_at":"2025-01-27T17:06:56Z","abstract_excerpt":"Retrieval-augmented generation improves various aspects of large language models (LLMs) generation, but suffers from computational overhead caused by long contexts as well as the propagation of irrelevant retrieved information into generated responses. Context pruning deals with both aspects, by removing irrelevant parts of retrieved contexts before LLM generation. Existing context pruning approaches are however limited, and do not provide a universal model that would be both efficient and robust in a wide range of scenarios, e.g., when contexts contain a variable amount of relevant informatio"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.16214","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.16214/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.16214","created_at":"2026-07-05T10:07:29.831646+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.16214v1","created_at":"2026-07-05T10:07:29.831646+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.16214","created_at":"2026-07-05T10:07:29.831646+00:00"},{"alias_kind":"pith_short_12","alias_value":"PJ5A4CQHTTLU","created_at":"2026-07-05T10:07:29.831646+00:00"},{"alias_kind":"pith_short_16","alias_value":"PJ5A4CQHTTLUMCXT","created_at":"2026-07-05T10:07:29.831646+00:00"},{"alias_kind":"pith_short_8","alias_value":"PJ5A4CQH","created_at":"2026-07-05T10:07:29.831646+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08032","citing_title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","ref_index":23,"is_internal_anchor":true},{"citing_arxiv_id":"2606.06906","citing_title":"EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27494","citing_title":"Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01336","citing_title":"LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04979","citing_title":"Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P","json":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P.json","graph_json":"https://pith.science/api/pith-number/PJ5A4CQHTTLUMCXTY4WA3QCR2P/graph.json","events_json":"https://pith.science/api/pith-number/PJ5A4CQHTTLUMCXTY4WA3QCR2P/events.json","paper":"https://pith.science/paper/PJ5A4CQH"},"agent_actions":{"view_html":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P","download_json":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P.json","view_paper":"https://pith.science/paper/PJ5A4CQH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.16214&json=true","fetch_graph":"https://pith.science/api/pith-number/PJ5A4CQHTTLUMCXTY4WA3QCR2P/graph.json","fetch_events":"https://pith.science/api/pith-number/PJ5A4CQHTTLUMCXTY4WA3QCR2P/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P/action/storage_attestation","attest_author":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P/action/author_attestation","sign_citation":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P/action/citation_signature","submit_replication":"https://pith.science/pith/PJ5A4CQHTTLUMCXTY4WA3QCR2P/action/replication_record"}},"created_at":"2026-07-05T10:07:29.831646+00:00","updated_at":"2026-07-05T10:07:29.831646+00:00"}