{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:GUXIJ24UUQMM7LIF2SZVISDKRC","short_pith_number":"pith:GUXIJ24U","schema_version":"1.0","canonical_sha256":"352e84eb94a418cfad05d4b354486a889788cf242c716bed1f4f6f314334e6d0","source":{"kind":"arxiv","id":"2411.17762","version":4},"attestation_state":"computed","paper":{"title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chang Liu, Chen Du, Ping Song, Rongchang Xie","submitted_at":"2024-11-26T03:33:52Z","abstract_excerpt":"We introduce MUSE-VL, a Unified Vision-Language Model through Semantic discrete Encoding for multimodal understanding and generation. Recently, the research community has begun exploring unified models for visual generation and understanding. However, existing vision tokenizers (e.g., VQGAN) only consider low-level information, which makes it difficult to align with language tokens. This results in high training complexity and necessitates a large amount of training data to achieve optimal performance. Additionally, their performance is still far from dedicated understanding models. This paper"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.17762","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-11-26T03:33:52Z","cross_cats_sorted":[],"title_canon_sha256":"55359d1538c498f6f77d28ea3108901a769896d4fa29a7df454d787fb6dbd4ea","abstract_canon_sha256":"c56883c2e5c91aeb751a4f8867cc7c242bddc0edaa22683cac82be3ff8014dd7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:43:58.912084Z","signature_b64":"bCYK8MmA/GfSQoN6Vm9kjGK8UM93l8xqHlFYCm2tw3ODdOFxmml1xt5TzDx7t8aN/i2aHaABofKO1IK65lzsBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"352e84eb94a418cfad05d4b354486a889788cf242c716bed1f4f6f314334e6d0","last_reissued_at":"2026-07-05T11:43:58.911602Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:43:58.911602Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chang Liu, Chen Du, Ping Song, Rongchang Xie","submitted_at":"2024-11-26T03:33:52Z","abstract_excerpt":"We introduce MUSE-VL, a Unified Vision-Language Model through Semantic discrete Encoding for multimodal understanding and generation. Recently, the research community has begun exploring unified models for visual generation and understanding. However, existing vision tokenizers (e.g., VQGAN) only consider low-level information, which makes it difficult to align with language tokens. This results in high training complexity and necessitates a large amount of training data to achieve optimal performance. Additionally, their performance is still far from dedicated understanding models. This paper"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.17762","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.17762/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.17762","created_at":"2026-07-05T11:43:58.911664+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.17762v4","created_at":"2026-07-05T11:43:58.911664+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.17762","created_at":"2026-07-05T11:43:58.911664+00:00"},{"alias_kind":"pith_short_12","alias_value":"GUXIJ24UUQMM","created_at":"2026-07-05T11:43:58.911664+00:00"},{"alias_kind":"pith_short_16","alias_value":"GUXIJ24UUQMM7LIF","created_at":"2026-07-05T11:43:58.911664+00:00"},{"alias_kind":"pith_short_8","alias_value":"GUXIJ24U","created_at":"2026-07-05T11:43:58.911664+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2503.14324","citing_title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2505.17726","citing_title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01554","citing_title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2506.15564","citing_title":"Show-o2: Improved Native Unified Multimodal Models","ref_index":129,"is_internal_anchor":false},{"citing_arxiv_id":"2505.14683","citing_title":"Emerging Properties in Unified Multimodal Pretraining","ref_index":91,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC","json":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC.json","graph_json":"https://pith.science/api/pith-number/GUXIJ24UUQMM7LIF2SZVISDKRC/graph.json","events_json":"https://pith.science/api/pith-number/GUXIJ24UUQMM7LIF2SZVISDKRC/events.json","paper":"https://pith.science/paper/GUXIJ24U"},"agent_actions":{"view_html":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC","download_json":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC.json","view_paper":"https://pith.science/paper/GUXIJ24U","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.17762&json=true","fetch_graph":"https://pith.science/api/pith-number/GUXIJ24UUQMM7LIF2SZVISDKRC/graph.json","fetch_events":"https://pith.science/api/pith-number/GUXIJ24UUQMM7LIF2SZVISDKRC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC/action/storage_attestation","attest_author":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC/action/author_attestation","sign_citation":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC/action/citation_signature","submit_replication":"https://pith.science/pith/GUXIJ24UUQMM7LIF2SZVISDKRC/action/replication_record"}},"created_at":"2026-07-05T11:43:58.911664+00:00","updated_at":"2026-07-05T11:43:58.911664+00:00"}