{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:L77RHSW2M3WSOVRBVDSLS5D6TF","short_pith_number":"pith:L77RHSW2","schema_version":"1.0","canonical_sha256":"5fff13cada66ed275621a8e4b9747e994ec5c27cf684020bf7185c8193814bca","source":{"kind":"arxiv","id":"2411.16720","version":2},"attestation_state":"computed","paper":{"title":"Importance-Based Token Merging for Efficient Image and Video Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dimitris Samaras, Haoyu Wu, Hieu Le, Jingyi Xu","submitted_at":"2024-11-23T02:01:49Z","abstract_excerpt":"Token merging can effectively accelerate various vision systems by processing groups of similar tokens only once and sharing the results across them. However, existing token grouping methods are often ad hoc and random, disregarding the actual content of the samples. We show that preserving high-information tokens during merging - those essential for semantic fidelity and structural details - significantly improves sample quality, producing finer details and more coherent, realistic generations. Despite being simple and intuitive, this approach remains underexplored.\n  To do so, we propose an "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.16720","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-11-23T02:01:49Z","cross_cats_sorted":[],"title_canon_sha256":"a84ee5680ae0fa28db8e0b1f036d2866d913bdfc9cd83d0cd137b2aa4aee5c71","abstract_canon_sha256":"814f2a1a33e8dd56cb7ccccd2769b99664fb19f0882b10dbe5e44c5fe9e06c45"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:53:49.490791Z","signature_b64":"fmRbkvQPCJHmEwW3+YnojI07VWQMHfY115/Xr1/tieScu4cJFihGJI4uyG0PcMVXggKZcwhGxIX0RCQ8AFDCDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5fff13cada66ed275621a8e4b9747e994ec5c27cf684020bf7185c8193814bca","last_reissued_at":"2026-07-05T10:53:49.490239Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:53:49.490239Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Importance-Based Token Merging for Efficient Image and Video Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dimitris Samaras, Haoyu Wu, Hieu Le, Jingyi Xu","submitted_at":"2024-11-23T02:01:49Z","abstract_excerpt":"Token merging can effectively accelerate various vision systems by processing groups of similar tokens only once and sharing the results across them. However, existing token grouping methods are often ad hoc and random, disregarding the actual content of the samples. We show that preserving high-information tokens during merging - those essential for semantic fidelity and structural details - significantly improves sample quality, producing finer details and more coherent, realistic generations. Despite being simple and intuitive, this approach remains underexplored.\n  To do so, we propose an "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.16720","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.16720/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.16720","created_at":"2026-07-05T10:53:49.490308+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.16720v2","created_at":"2026-07-05T10:53:49.490308+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.16720","created_at":"2026-07-05T10:53:49.490308+00:00"},{"alias_kind":"pith_short_12","alias_value":"L77RHSW2M3WS","created_at":"2026-07-05T10:53:49.490308+00:00"},{"alias_kind":"pith_short_16","alias_value":"L77RHSW2M3WSOVRB","created_at":"2026-07-05T10:53:49.490308+00:00"},{"alias_kind":"pith_short_8","alias_value":"L77RHSW2","created_at":"2026-07-05T10:53:49.490308+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2507.21420","citing_title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2603.06351","citing_title":"DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF","json":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF.json","graph_json":"https://pith.science/api/pith-number/L77RHSW2M3WSOVRBVDSLS5D6TF/graph.json","events_json":"https://pith.science/api/pith-number/L77RHSW2M3WSOVRBVDSLS5D6TF/events.json","paper":"https://pith.science/paper/L77RHSW2"},"agent_actions":{"view_html":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF","download_json":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF.json","view_paper":"https://pith.science/paper/L77RHSW2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.16720&json=true","fetch_graph":"https://pith.science/api/pith-number/L77RHSW2M3WSOVRBVDSLS5D6TF/graph.json","fetch_events":"https://pith.science/api/pith-number/L77RHSW2M3WSOVRBVDSLS5D6TF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF/action/storage_attestation","attest_author":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF/action/author_attestation","sign_citation":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF/action/citation_signature","submit_replication":"https://pith.science/pith/L77RHSW2M3WSOVRBVDSLS5D6TF/action/replication_record"}},"created_at":"2026-07-05T10:53:49.490308+00:00","updated_at":"2026-07-05T10:53:49.490308+00:00"}