{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:FWUGH6CHHDHARF2ESMWC2RXKD3","short_pith_number":"pith:FWUGH6CH","schema_version":"1.0","canonical_sha256":"2da863f84738ce089744932c2d46ea1ef45b772cb3fda77ef1549b86ff1e6d5c","source":{"kind":"arxiv","id":"2408.02657","version":3},"attestation_state":"computed","paper":{"title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dongyang Liu, Hongsheng Li, Le Zhuo, Peng Gao, Qi Qin, Shitian Zhao, Weifeng Lin, Xinyue Li, Yi Xin, Yu Qiao","submitted_at":"2024-08-05T17:46:53Z","abstract_excerpt":"We present Lumina-mGPT, a family of multimodal autoregressive models capable of various vision and language tasks, particularly excelling in generating flexible photorealistic images from text descriptions. By initializing from multimodal Generative PreTraining (mGPT), we demonstrate that decoder-only Autoregressive (AR) model can achieve image generation performance comparable to modern diffusion models with high efficiency through Flexible Progressive Supervised Fine-tuning (FP-SFT). Equipped with our proposed Unambiguous image Representation (UniRep), Lumina-mGPT can flexibly generate high-"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.02657","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-08-05T17:46:53Z","cross_cats_sorted":[],"title_canon_sha256":"5f8e838e12f752436a1554d61ae530be687b34f3eef794d6740f7f0710481fca","abstract_canon_sha256":"adc158b6455d27ad87423648c9506f5a0d52d424a16a466b72b206d421e7e774"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:53:38.833682Z","signature_b64":"o1sdVvhozv+/xz8OIs6roYlDVlUkJYr4bmoOH19TVt4jl8Fb2+pI7N4TfCtHnwsHrBi+V1dib/TYfzF9R9dXDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2da863f84738ce089744932c2d46ea1ef45b772cb3fda77ef1549b86ff1e6d5c","last_reissued_at":"2026-07-05T10:53:38.833162Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:53:38.833162Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dongyang Liu, Hongsheng Li, Le Zhuo, Peng Gao, Qi Qin, Shitian Zhao, Weifeng Lin, Xinyue Li, Yi Xin, Yu Qiao","submitted_at":"2024-08-05T17:46:53Z","abstract_excerpt":"We present Lumina-mGPT, a family of multimodal autoregressive models capable of various vision and language tasks, particularly excelling in generating flexible photorealistic images from text descriptions. By initializing from multimodal Generative PreTraining (mGPT), we demonstrate that decoder-only Autoregressive (AR) model can achieve image generation performance comparable to modern diffusion models with high efficiency through Flexible Progressive Supervised Fine-tuning (FP-SFT). Equipped with our proposed Unambiguous image Representation (UniRep), Lumina-mGPT can flexibly generate high-"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.02657","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.02657/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.02657","created_at":"2026-07-05T10:53:38.833220+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.02657v3","created_at":"2026-07-05T10:53:38.833220+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.02657","created_at":"2026-07-05T10:53:38.833220+00:00"},{"alias_kind":"pith_short_12","alias_value":"FWUGH6CHHDHA","created_at":"2026-07-05T10:53:38.833220+00:00"},{"alias_kind":"pith_short_16","alias_value":"FWUGH6CHHDHARF2E","created_at":"2026-07-05T10:53:38.833220+00:00"},{"alias_kind":"pith_short_8","alias_value":"FWUGH6CH","created_at":"2026-07-05T10:53:38.833220+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20543","citing_title":"SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06078","citing_title":"Knowledge Distillation for Visual Autoregressive Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05703","citing_title":"Parallel Jacobi Decoding for Fast Autoregressive Image Generation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01858","citing_title":"Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14891","citing_title":"Hierarchical Image Tokenization for Multi-Scale Image Super Resolution","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00310","citing_title":"Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2505.23606","citing_title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2506.16796","citing_title":"RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2510.24211","citing_title":"Speculative Coupled Decoding for Training-Free Lossless Acceleration of Autoregressive Visual Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2511.13587","citing_title":"VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2512.19433","citing_title":"dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2505.17685","citing_title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2603.28049","citing_title":"Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09430","citing_title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10564","citing_title":"DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving","ref_index":125,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09430","citing_title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24459","citing_title":"TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06481","citing_title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06966","citing_title":"MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07230","citing_title":"CASCADE: Context-Aware Relaxation for Speculative Image Decoding","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18572","citing_title":"Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3","json":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3.json","graph_json":"https://pith.science/api/pith-number/FWUGH6CHHDHARF2ESMWC2RXKD3/graph.json","events_json":"https://pith.science/api/pith-number/FWUGH6CHHDHARF2ESMWC2RXKD3/events.json","paper":"https://pith.science/paper/FWUGH6CH"},"agent_actions":{"view_html":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3","download_json":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3.json","view_paper":"https://pith.science/paper/FWUGH6CH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.02657&json=true","fetch_graph":"https://pith.science/api/pith-number/FWUGH6CHHDHARF2ESMWC2RXKD3/graph.json","fetch_events":"https://pith.science/api/pith-number/FWUGH6CHHDHARF2ESMWC2RXKD3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3/action/storage_attestation","attest_author":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3/action/author_attestation","sign_citation":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3/action/citation_signature","submit_replication":"https://pith.science/pith/FWUGH6CHHDHARF2ESMWC2RXKD3/action/replication_record"}},"created_at":"2026-07-05T10:53:38.833220+00:00","updated_at":"2026-07-05T10:53:38.833220+00:00"}