{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:Z2EAMMLETGI5ZO2XXHIPQNJKFP","short_pith_number":"pith:Z2EAMMLE","schema_version":"1.0","canonical_sha256":"ce880631649991dcbb57b9d0f8352a2bdcb7a4fc9832d5aa2af39a5e755955f0","source":{"kind":"arxiv","id":"2412.04652","version":1},"attestation_state":"computed","paper":{"title":"Cross-Self KV Cache Pruning for Efficient Vision-Language Inference","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Chang Xu, Tao Huang, Xiaohuan Pei","submitted_at":"2024-12-05T22:47:17Z","abstract_excerpt":"KV cache pruning has emerged as a promising technique for reducing memory and computation costs in long-context auto-regressive generation. Existing methods for vision-language models (VLMs) typically rely on self-attention scores from large language models (LLMs) to identify and prune irrelevant tokens. However, these approaches overlook the inherent distributional discrepancies between modalities, often leading to inaccurate token importance estimation and the over-pruning of critical visual tokens. To address this, we propose decomposing attention scores into intra-modality attention (withi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.04652","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-05T22:47:17Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"3dc655bf4fb579f1d1779eafa7b1426dffcd1a694c479fc33db5667e2fcd9e0b","abstract_canon_sha256":"200d742cfda388f79657b6aa55921986239bf2fed39bbb3c39a0d183ad096dfc"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:45:21.410544Z","signature_b64":"Q2rcttz06XG4g0X4nORMl/8R7SHtHHpSK8yrRZFuXsmaMkTI3eEEmc7v5+jPiLqRL7IdGhQXvcWbpuiFzMFZDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ce880631649991dcbb57b9d0f8352a2bdcb7a4fc9832d5aa2af39a5e755955f0","last_reissued_at":"2026-07-05T09:45:21.410106Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:45:21.410106Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Cross-Self KV Cache Pruning for Efficient Vision-Language Inference","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Chang Xu, Tao Huang, Xiaohuan Pei","submitted_at":"2024-12-05T22:47:17Z","abstract_excerpt":"KV cache pruning has emerged as a promising technique for reducing memory and computation costs in long-context auto-regressive generation. Existing methods for vision-language models (VLMs) typically rely on self-attention scores from large language models (LLMs) to identify and prune irrelevant tokens. However, these approaches overlook the inherent distributional discrepancies between modalities, often leading to inaccurate token importance estimation and the over-pruning of critical visual tokens. To address this, we propose decomposing attention scores into intra-modality attention (withi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.04652","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.04652/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.04652","created_at":"2026-07-05T09:45:21.410172+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.04652v1","created_at":"2026-07-05T09:45:21.410172+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.04652","created_at":"2026-07-05T09:45:21.410172+00:00"},{"alias_kind":"pith_short_12","alias_value":"Z2EAMMLETGI5","created_at":"2026-07-05T09:45:21.410172+00:00"},{"alias_kind":"pith_short_16","alias_value":"Z2EAMMLETGI5ZO2X","created_at":"2026-07-05T09:45:21.410172+00:00"},{"alias_kind":"pith_short_8","alias_value":"Z2EAMMLE","created_at":"2026-07-05T09:45:21.410172+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.05232","citing_title":"Differentiable Efficient Operator Search","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13548","citing_title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16439","citing_title":"KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13548","citing_title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","ref_index":28,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP","json":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP.json","graph_json":"https://pith.science/api/pith-number/Z2EAMMLETGI5ZO2XXHIPQNJKFP/graph.json","events_json":"https://pith.science/api/pith-number/Z2EAMMLETGI5ZO2XXHIPQNJKFP/events.json","paper":"https://pith.science/paper/Z2EAMMLE"},"agent_actions":{"view_html":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP","download_json":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP.json","view_paper":"https://pith.science/paper/Z2EAMMLE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.04652&json=true","fetch_graph":"https://pith.science/api/pith-number/Z2EAMMLETGI5ZO2XXHIPQNJKFP/graph.json","fetch_events":"https://pith.science/api/pith-number/Z2EAMMLETGI5ZO2XXHIPQNJKFP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP/action/storage_attestation","attest_author":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP/action/author_attestation","sign_citation":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP/action/citation_signature","submit_replication":"https://pith.science/pith/Z2EAMMLETGI5ZO2XXHIPQNJKFP/action/replication_record"}},"created_at":"2026-07-05T09:45:21.410172+00:00","updated_at":"2026-07-05T09:45:21.410172+00:00"}