{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:5ZIQXABMIEUFPK7VEBYVGESNK5","short_pith_number":"pith:5ZIQXABM","schema_version":"1.0","canonical_sha256":"ee510b802c412857abf5207153124d575bb3cd6a902826f8ca71e4d473fdbb5e","source":{"kind":"arxiv","id":"2505.23661","version":3},"attestation_state":"computed","paper":{"title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chen Change Loy, Qingyi Tao, Qinyue Li, Sheng Jin, Size Wu, Wei Li, Zerui Gong, Zhonghua Wu","submitted_at":"2025-05-29T17:09:44Z","abstract_excerpt":"In this report, we present OpenUni, a simple, lightweight, and fully open-source baseline for unifying multimodal understanding and generation. Inspired by prevailing practices in unified model learning, we adopt an efficient training strategy that minimizes the training complexity and overhead by bridging the off-the-shelf multimodal large language models (LLMs) and diffusion models through a set of learnable queries and a light-weight transformer-based connector. With a minimalist choice of architecture, we demonstrate that OpenUni can: 1) generate high-quality and instruction-aligned images"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.23661","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-05-29T17:09:44Z","cross_cats_sorted":[],"title_canon_sha256":"1d5b8f707fa35334af98deddd4cf826edc1809fa8fa6bb18ea3bec6eada053c6","abstract_canon_sha256":"f8e0f5bbe1bd0c4609085505613def86b1414364ad77ded1fd247d6a8e092d54"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:14:08.453015Z","signature_b64":"Idk9sj1IGCJA4ZM5YgDy0TDmmr6YCGjBGWskg2i25V07gtSOPSDSEamxD6QBzw4QbFG50+fTdQEdjkXIRVPUDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ee510b802c412857abf5207153124d575bb3cd6a902826f8ca71e4d473fdbb5e","last_reissued_at":"2026-07-05T11:14:08.452543Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:14:08.452543Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chen Change Loy, Qingyi Tao, Qinyue Li, Sheng Jin, Size Wu, Wei Li, Zerui Gong, Zhonghua Wu","submitted_at":"2025-05-29T17:09:44Z","abstract_excerpt":"In this report, we present OpenUni, a simple, lightweight, and fully open-source baseline for unifying multimodal understanding and generation. Inspired by prevailing practices in unified model learning, we adopt an efficient training strategy that minimizes the training complexity and overhead by bridging the off-the-shelf multimodal large language models (LLMs) and diffusion models through a set of learnable queries and a light-weight transformer-based connector. With a minimalist choice of architecture, we demonstrate that OpenUni can: 1) generate high-quality and instruction-aligned images"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.23661","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.23661/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.23661","created_at":"2026-07-05T11:14:08.452600+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.23661v3","created_at":"2026-07-05T11:14:08.452600+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.23661","created_at":"2026-07-05T11:14:08.452600+00:00"},{"alias_kind":"pith_short_12","alias_value":"5ZIQXABMIEUF","created_at":"2026-07-05T11:14:08.452600+00:00"},{"alias_kind":"pith_short_16","alias_value":"5ZIQXABMIEUFPK7V","created_at":"2026-07-05T11:14:08.452600+00:00"},{"alias_kind":"pith_short_8","alias_value":"5ZIQXABM","created_at":"2026-07-05T11:14:08.452600+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":19,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24849","citing_title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23041","citing_title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23041","citing_title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13289","citing_title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18714","citing_title":"Semantic Generative Tuning for Unified Multimodal Models","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10784","citing_title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24763","citing_title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17766","citing_title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18714","citing_title":"Semantic Generative Tuning for Unified Multimodal Models","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2509.01986","citing_title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01554","citing_title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2503.07265","citing_title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11400","citing_title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24763","citing_title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05781","citing_title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05646","citing_title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","ref_index":146,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19954","citing_title":"Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10784","citing_title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18168","citing_title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","ref_index":70,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5","json":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5.json","graph_json":"https://pith.science/api/pith-number/5ZIQXABMIEUFPK7VEBYVGESNK5/graph.json","events_json":"https://pith.science/api/pith-number/5ZIQXABMIEUFPK7VEBYVGESNK5/events.json","paper":"https://pith.science/paper/5ZIQXABM"},"agent_actions":{"view_html":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5","download_json":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5.json","view_paper":"https://pith.science/paper/5ZIQXABM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.23661&json=true","fetch_graph":"https://pith.science/api/pith-number/5ZIQXABMIEUFPK7VEBYVGESNK5/graph.json","fetch_events":"https://pith.science/api/pith-number/5ZIQXABMIEUFPK7VEBYVGESNK5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5/action/storage_attestation","attest_author":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5/action/author_attestation","sign_citation":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5/action/citation_signature","submit_replication":"https://pith.science/pith/5ZIQXABMIEUFPK7VEBYVGESNK5/action/replication_record"}},"created_at":"2026-07-05T11:14:08.452600+00:00","updated_at":"2026-07-05T11:14:08.452600+00:00"}