{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:BBAOAYA4Q2WWG2YAAEW2C5EASO","short_pith_number":"pith:BBAOAYA4","schema_version":"1.0","canonical_sha256":"0840e0601c86ad636b00012da1748093a3f6c9480269e7ba7910e04288444669","source":{"kind":"arxiv","id":"2405.18616","version":1},"attestation_state":"computed","paper":{"title":"Wavelet-Based Image Tokenizer for Vision Transformers","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Radu Soricut, Zhenhai Zhu","submitted_at":"2024-05-28T21:45:46Z","abstract_excerpt":"Non-overlapping patch-wise convolution is the default image tokenizer for all state-of-the-art vision Transformer (ViT) models. Even though many ViT variants have been proposed to improve its efficiency and accuracy, little research on improving the image tokenizer itself has been reported in the literature. In this paper, we propose a new image tokenizer based on wavelet transformation. We show that ViT models with the new tokenizer achieve both higher training throughput and better top-1 precision for the ImageNet validation set. We present a theoretical analysis on why the proposed tokenize"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.18616","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-05-28T21:45:46Z","cross_cats_sorted":[],"title_canon_sha256":"ce9d58303e5a3c86ffe0313700142cf3745d77c8bf57ded298c605390482ec5c","abstract_canon_sha256":"64491089d51b4c44c8799dbee81bbccead60d0b61f02ff25bec32d924270b50e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:24:28.100839Z","signature_b64":"3/rgGSPysBktl6TcWuf4fkOq0FtHwk6WGtRP/2dbxjYsHfPW+9JopktY3BqZoCEnL0WORxicRCYc64Md1BciDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0840e0601c86ad636b00012da1748093a3f6c9480269e7ba7910e04288444669","last_reissued_at":"2026-07-05T08:24:28.100304Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:24:28.100304Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Wavelet-Based Image Tokenizer for Vision Transformers","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Radu Soricut, Zhenhai Zhu","submitted_at":"2024-05-28T21:45:46Z","abstract_excerpt":"Non-overlapping patch-wise convolution is the default image tokenizer for all state-of-the-art vision Transformer (ViT) models. Even though many ViT variants have been proposed to improve its efficiency and accuracy, little research on improving the image tokenizer itself has been reported in the literature. In this paper, we propose a new image tokenizer based on wavelet transformation. We show that ViT models with the new tokenizer achieve both higher training throughput and better top-1 precision for the ImageNet validation set. We present a theoretical analysis on why the proposed tokenize"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.18616","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.18616/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.18616","created_at":"2026-07-05T08:24:28.100378+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.18616v1","created_at":"2026-07-05T08:24:28.100378+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.18616","created_at":"2026-07-05T08:24:28.100378+00:00"},{"alias_kind":"pith_short_12","alias_value":"BBAOAYA4Q2WW","created_at":"2026-07-05T08:24:28.100378+00:00"},{"alias_kind":"pith_short_16","alias_value":"BBAOAYA4Q2WWG2YA","created_at":"2026-07-05T08:24:28.100378+00:00"},{"alias_kind":"pith_short_8","alias_value":"BBAOAYA4","created_at":"2026-07-05T08:24:28.100378+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.02631","citing_title":"Wavelet as Tokenizer: Preliminary Results on a Shared Wavelet Token Schema for Natural Signals","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25949","citing_title":"Small Models, Strong Priors: Architectural Inductive Bias for Parameter-Efficient Neural PDE Solvers","ref_index":51,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO","json":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO.json","graph_json":"https://pith.science/api/pith-number/BBAOAYA4Q2WWG2YAAEW2C5EASO/graph.json","events_json":"https://pith.science/api/pith-number/BBAOAYA4Q2WWG2YAAEW2C5EASO/events.json","paper":"https://pith.science/paper/BBAOAYA4"},"agent_actions":{"view_html":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO","download_json":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO.json","view_paper":"https://pith.science/paper/BBAOAYA4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.18616&json=true","fetch_graph":"https://pith.science/api/pith-number/BBAOAYA4Q2WWG2YAAEW2C5EASO/graph.json","fetch_events":"https://pith.science/api/pith-number/BBAOAYA4Q2WWG2YAAEW2C5EASO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO/action/storage_attestation","attest_author":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO/action/author_attestation","sign_citation":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO/action/citation_signature","submit_replication":"https://pith.science/pith/BBAOAYA4Q2WWG2YAAEW2C5EASO/action/replication_record"}},"created_at":"2026-07-05T08:24:28.100378+00:00","updated_at":"2026-07-05T08:24:28.100378+00:00"}