{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:3CZKOB7FCOH2QNHMHJ2SQFBLB7","short_pith_number":"pith:3CZKOB7F","schema_version":"1.0","canonical_sha256":"d8b2a707e5138fa834ec3a7528142b0fe38e935f1872b798c4127ee5345575ab","source":{"kind":"arxiv","id":"2503.21758","version":1},"attestation_state":"computed","paper":{"title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bin Fu, Bo Zhang, Chang Xu, Conghui He, Dongyang Liu, Erwann Millon, Hongsheng Li, Jiakang Yuan, Le Zhuo, Manyuan Zhang, Peng Gao, Qi Qin, Ruoyi Du, Victor Perez, Wenhai Wang, Will Beddow, Xiangyang Zhu, Xiaohong Liu, Xinyue Li, Yiting Lu, Yi Xin, Yu Qiao, Zhen Li","submitted_at":"2025-03-27T17:57:07Z","abstract_excerpt":"We introduce Lumina-Image 2.0, an advanced text-to-image generation framework that achieves significant progress compared to previous work, Lumina-Next. Lumina-Image 2.0 is built upon two key principles: (1) Unification - it adopts a unified architecture (Unified Next-DiT) that treats text and image tokens as a joint sequence, enabling natural cross-modal interactions and allowing seamless task expansion. Besides, since high-quality captioners can provide semantically well-aligned text-image training pairs, we introduce a unified captioning system, Unified Captioner (UniCap), specifically desi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.21758","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-03-27T17:57:07Z","cross_cats_sorted":[],"title_canon_sha256":"648a8f3fe34898c51d15f07043978947fc6b9d72aae50535c01bbeaab6e4141e","abstract_canon_sha256":"28269a554c8b3848463564df2a147857e15fe773b55ec8e91592e13fa091f1cd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:40:30.201453Z","signature_b64":"D1S9sWI0WinZy8R209J9iZ5yxfgTUvCUeqzDksYcIpZ/8bugIs/h3NzdJoZWG9v9pbTvQVqKNs5T4AnZ7OPiCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d8b2a707e5138fa834ec3a7528142b0fe38e935f1872b798c4127ee5345575ab","last_reissued_at":"2026-07-05T10:40:30.200969Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:40:30.200969Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bin Fu, Bo Zhang, Chang Xu, Conghui He, Dongyang Liu, Erwann Millon, Hongsheng Li, Jiakang Yuan, Le Zhuo, Manyuan Zhang, Peng Gao, Qi Qin, Ruoyi Du, Victor Perez, Wenhai Wang, Will Beddow, Xiangyang Zhu, Xiaohong Liu, Xinyue Li, Yiting Lu, Yi Xin, Yu Qiao, Zhen Li","submitted_at":"2025-03-27T17:57:07Z","abstract_excerpt":"We introduce Lumina-Image 2.0, an advanced text-to-image generation framework that achieves significant progress compared to previous work, Lumina-Next. Lumina-Image 2.0 is built upon two key principles: (1) Unification - it adopts a unified architecture (Unified Next-DiT) that treats text and image tokens as a joint sequence, enabling natural cross-modal interactions and allowing seamless task expansion. Besides, since high-quality captioners can provide semantically well-aligned text-image training pairs, we introduce a unified captioning system, Unified Captioner (UniCap), specifically desi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.21758","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.21758/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.21758","created_at":"2026-07-05T10:40:30.201022+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.21758v1","created_at":"2026-07-05T10:40:30.201022+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.21758","created_at":"2026-07-05T10:40:30.201022+00:00"},{"alias_kind":"pith_short_12","alias_value":"3CZKOB7FCOH2","created_at":"2026-07-05T10:40:30.201022+00:00"},{"alias_kind":"pith_short_16","alias_value":"3CZKOB7FCOH2QNHM","created_at":"2026-07-05T10:40:30.201022+00:00"},{"alias_kind":"pith_short_8","alias_value":"3CZKOB7F","created_at":"2026-07-05T10:40:30.201022+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":17,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17030","citing_title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","ref_index":265,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11188","citing_title":"ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30124","citing_title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30248","citing_title":"GenClaw: Code-Driven Agentic Image Generation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21605","citing_title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21605","citing_title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2506.00433","citing_title":"Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2506.18871","citing_title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2512.07584","citing_title":"LongCat-Image Technical Report","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10127","citing_title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10127","citing_title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04653","citing_title":"Threshold-Guided Optimization for Visual Generative Models","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2511.22699","citing_title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12322","citing_title":"Self-Adversarial One Step Generation via Condition Shifting","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13030","citing_title":"Generative Refinement Networks for Visual Synthesis","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2508.02324","citing_title":"Qwen-Image Technical Report","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18168","citing_title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","ref_index":65,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7","json":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7.json","graph_json":"https://pith.science/api/pith-number/3CZKOB7FCOH2QNHMHJ2SQFBLB7/graph.json","events_json":"https://pith.science/api/pith-number/3CZKOB7FCOH2QNHMHJ2SQFBLB7/events.json","paper":"https://pith.science/paper/3CZKOB7F"},"agent_actions":{"view_html":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7","download_json":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7.json","view_paper":"https://pith.science/paper/3CZKOB7F","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.21758&json=true","fetch_graph":"https://pith.science/api/pith-number/3CZKOB7FCOH2QNHMHJ2SQFBLB7/graph.json","fetch_events":"https://pith.science/api/pith-number/3CZKOB7FCOH2QNHMHJ2SQFBLB7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7/action/storage_attestation","attest_author":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7/action/author_attestation","sign_citation":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7/action/citation_signature","submit_replication":"https://pith.science/pith/3CZKOB7FCOH2QNHMHJ2SQFBLB7/action/replication_record"}},"created_at":"2026-07-05T10:40:30.201022+00:00","updated_at":"2026-07-05T10:40:30.201022+00:00"}