{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:24K3T3ZRNEKLMQRRUTG4EHTPAK","short_pith_number":"pith:24K3T3ZR","schema_version":"1.0","canonical_sha256":"d715b9ef316914b64231a4cdc21e6f02aef1ba0a5016a6bee7b4066bacaeb87a","source":{"kind":"arxiv","id":"2507.07997","version":2},"attestation_state":"computed","paper":{"title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jiaxin Guo, Mingkai Jia, Ping Tan, Qian Zhang, Wei Yin, Xiaotao Hu, Xiao-Xiao Long, Xiaoyang Guo","submitted_at":"2025-07-10T17:59:54Z","abstract_excerpt":"Vector Quantized Variational Autoencoders (VQ-VAEs) are fundamental models that compress continuous visual data into discrete tokens. Existing methods have tried to improve the quantization strategy for better reconstruction quality, however, there still exists a large gap between VQ-VAEs and VAEs. To narrow this gap, we propose MGVQ, a novel method to augment the representation capability of discrete codebooks, facilitating easier optimization for codebooks and minimizing information loss, thereby enhancing reconstruction quality. Specifically, we propose to retain the latent dimension to pre"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.07997","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-07-10T17:59:54Z","cross_cats_sorted":[],"title_canon_sha256":"b254fcf128b82416262647e756fda5e95204d7c168c7806a870ab662d648e0fc","abstract_canon_sha256":"cd19724cc701d14b81c57fb3b88c922b5de6240e074d88664ae01be673f55edb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:36:35.285796Z","signature_b64":"DkME5CX03SdVl6QgXDXO2hPJ2ibQNTbYF+xkTIEPfLOVzOotu1+s+SM0oXdPyVaSovUGkFqiOxEEzjM0QvIWAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d715b9ef316914b64231a4cdc21e6f02aef1ba0a5016a6bee7b4066bacaeb87a","last_reissued_at":"2026-07-05T11:36:35.285278Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:36:35.285278Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jiaxin Guo, Mingkai Jia, Ping Tan, Qian Zhang, Wei Yin, Xiaotao Hu, Xiao-Xiao Long, Xiaoyang Guo","submitted_at":"2025-07-10T17:59:54Z","abstract_excerpt":"Vector Quantized Variational Autoencoders (VQ-VAEs) are fundamental models that compress continuous visual data into discrete tokens. Existing methods have tried to improve the quantization strategy for better reconstruction quality, however, there still exists a large gap between VQ-VAEs and VAEs. To narrow this gap, we propose MGVQ, a novel method to augment the representation capability of discrete codebooks, facilitating easier optimization for codebooks and minimizing information loss, thereby enhancing reconstruction quality. Specifically, we propose to retain the latent dimension to pre"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.07997","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.07997/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.07997","created_at":"2026-07-05T11:36:35.285341+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.07997v2","created_at":"2026-07-05T11:36:35.285341+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.07997","created_at":"2026-07-05T11:36:35.285341+00:00"},{"alias_kind":"pith_short_12","alias_value":"24K3T3ZRNEKL","created_at":"2026-07-05T11:36:35.285341+00:00"},{"alias_kind":"pith_short_16","alias_value":"24K3T3ZRNEKLMQRR","created_at":"2026-07-05T11:36:35.285341+00:00"},{"alias_kind":"pith_short_8","alias_value":"24K3T3ZR","created_at":"2026-07-05T11:36:35.285341+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.00371","citing_title":"MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18115","citing_title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","ref_index":40,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK","json":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK.json","graph_json":"https://pith.science/api/pith-number/24K3T3ZRNEKLMQRRUTG4EHTPAK/graph.json","events_json":"https://pith.science/api/pith-number/24K3T3ZRNEKLMQRRUTG4EHTPAK/events.json","paper":"https://pith.science/paper/24K3T3ZR"},"agent_actions":{"view_html":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK","download_json":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK.json","view_paper":"https://pith.science/paper/24K3T3ZR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.07997&json=true","fetch_graph":"https://pith.science/api/pith-number/24K3T3ZRNEKLMQRRUTG4EHTPAK/graph.json","fetch_events":"https://pith.science/api/pith-number/24K3T3ZRNEKLMQRRUTG4EHTPAK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK/action/storage_attestation","attest_author":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK/action/author_attestation","sign_citation":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK/action/citation_signature","submit_replication":"https://pith.science/pith/24K3T3ZRNEKLMQRRUTG4EHTPAK/action/replication_record"}},"created_at":"2026-07-05T11:36:35.285341+00:00","updated_at":"2026-07-05T11:36:35.285341+00:00"}