{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ILG36HOGVUTMHGF3AB4I2L44Y5","short_pith_number":"pith:ILG36HOG","schema_version":"1.0","canonical_sha256":"42cdbf1dc6ad26c398bb00788d2f9cc77eaf1c9a9fdebd7a4782a1053cd1bf52","source":{"kind":"arxiv","id":"2504.08966","version":1},"attestation_state":"computed","paper":{"title":"PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Aymen Shabou, Davide Buscaldi, Mohamed Dhouib, Sonia Vanier","submitted_at":"2025-04-11T20:45:00Z","abstract_excerpt":"Visual Language Models require substantial computational resources for inference due to the additional input tokens needed to represent visual information. However, these visual tokens often contain redundant and unimportant information, resulting in an unnecessarily high number of tokens. To address this, we introduce PACT, a method that reduces inference time and memory usage by pruning irrelevant tokens and merging visually redundant ones at an early layer of the language model. Our approach uses a novel importance metric to identify unimportant tokens without relying on attention scores, m"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.08966","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-04-11T20:45:00Z","cross_cats_sorted":[],"title_canon_sha256":"619c924947aef726e9a58149b7e7fb484b901e52e4cf708407dc94f7c03962d7","abstract_canon_sha256":"55e34a2b65731db6470e94099a580e4465f79c194ad6c333c2594647d05c53ff"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:48:02.359425Z","signature_b64":"HETfai3XqBB/3W+QN+LikhYMbOZH1lqI5d6eb/a+chR4zbk0o98h+Wak6VGJOYORzdF3LX4bKEXeMJQ5loN9DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"42cdbf1dc6ad26c398bb00788d2f9cc77eaf1c9a9fdebd7a4782a1053cd1bf52","last_reissued_at":"2026-07-05T10:48:02.358917Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:48:02.358917Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"PACT: Pruning and Clustering-Based Token Reduction for Faster Visual Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Aymen Shabou, Davide Buscaldi, Mohamed Dhouib, Sonia Vanier","submitted_at":"2025-04-11T20:45:00Z","abstract_excerpt":"Visual Language Models require substantial computational resources for inference due to the additional input tokens needed to represent visual information. However, these visual tokens often contain redundant and unimportant information, resulting in an unnecessarily high number of tokens. To address this, we introduce PACT, a method that reduces inference time and memory usage by pruning irrelevant tokens and merging visually redundant ones at an early layer of the language model. Our approach uses a novel importance metric to identify unimportant tokens without relying on attention scores, m"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.08966","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.08966/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.08966","created_at":"2026-07-05T10:48:02.358971+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.08966v1","created_at":"2026-07-05T10:48:02.358971+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.08966","created_at":"2026-07-05T10:48:02.358971+00:00"},{"alias_kind":"pith_short_12","alias_value":"ILG36HOGVUTM","created_at":"2026-07-05T10:48:02.358971+00:00"},{"alias_kind":"pith_short_16","alias_value":"ILG36HOGVUTMHGF3","created_at":"2026-07-05T10:48:02.358971+00:00"},{"alias_kind":"pith_short_8","alias_value":"ILG36HOG","created_at":"2026-07-05T10:48:02.358971+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2509.03872","citing_title":"Focus Through Motion: RGB-Event Collaborative Token Sparsification for Efficient Object Detection","ref_index":52,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5","json":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5.json","graph_json":"https://pith.science/api/pith-number/ILG36HOGVUTMHGF3AB4I2L44Y5/graph.json","events_json":"https://pith.science/api/pith-number/ILG36HOGVUTMHGF3AB4I2L44Y5/events.json","paper":"https://pith.science/paper/ILG36HOG"},"agent_actions":{"view_html":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5","download_json":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5.json","view_paper":"https://pith.science/paper/ILG36HOG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.08966&json=true","fetch_graph":"https://pith.science/api/pith-number/ILG36HOGVUTMHGF3AB4I2L44Y5/graph.json","fetch_events":"https://pith.science/api/pith-number/ILG36HOGVUTMHGF3AB4I2L44Y5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5/action/storage_attestation","attest_author":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5/action/author_attestation","sign_citation":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5/action/citation_signature","submit_replication":"https://pith.science/pith/ILG36HOGVUTMHGF3AB4I2L44Y5/action/replication_record"}},"created_at":"2026-07-05T10:48:02.358971+00:00","updated_at":"2026-07-05T10:48:02.358971+00:00"}