{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:BMGHFCH7GKUOIOC4BH3N5OXFR3","short_pith_number":"pith:BMGHFCH7","schema_version":"1.0","canonical_sha256":"0b0c7288ff32a8e4385c09f6debae58ee7619841c7e7335a11dd5a8dd2aba624","source":{"kind":"arxiv","id":"2507.22058","version":1},"attestation_state":"computed","paper":{"title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chen Li, Di Wang, Han Hu, Jie Jiang, Linus, Qinglin Lu, Shuyang Gu, Xiaosong Zhang, Yeyao Ma, Yibing Wang, Yongming Rao, Zhao Zhong, Zigang Geng","submitted_at":"2025-07-29T17:59:04Z","abstract_excerpt":"Numerous efforts have been made to extend the ``next token prediction'' paradigm to visual contents, aiming to create a unified approach for both image generation and understanding. Nevertheless, attempts to generate images through autoregressive modeling with discrete tokens have been plagued by issues such as low visual fidelity, distorted outputs, and failure to adhere to complex instructions when rendering intricate details. These shortcomings are likely attributed to cumulative errors during autoregressive inference or information loss incurred during the discretization process. Probably "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.22058","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-07-29T17:59:04Z","cross_cats_sorted":[],"title_canon_sha256":"b1b36df6ed9f9c62c6761115726429412e0379eb18933eb91084c28903d59d70","abstract_canon_sha256":"765fa8a47e0c1a93689c0a2665dd22e14c69e45da9b48db7874a41992d97d793"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:45:12.387732Z","signature_b64":"/NogEYpn8fubdAfV2N21qpJ8OZ1wHrpvAqzFxm+HG4GNmTtgM1yMS9p5wlvulOaGagpGADd8+Yhiq5M1d/XsAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0b0c7288ff32a8e4385c09f6debae58ee7619841c7e7335a11dd5a8dd2aba624","last_reissued_at":"2026-07-05T11:45:12.387089Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:45:12.387089Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chen Li, Di Wang, Han Hu, Jie Jiang, Linus, Qinglin Lu, Shuyang Gu, Xiaosong Zhang, Yeyao Ma, Yibing Wang, Yongming Rao, Zhao Zhong, Zigang Geng","submitted_at":"2025-07-29T17:59:04Z","abstract_excerpt":"Numerous efforts have been made to extend the ``next token prediction'' paradigm to visual contents, aiming to create a unified approach for both image generation and understanding. Nevertheless, attempts to generate images through autoregressive modeling with discrete tokens have been plagued by issues such as low visual fidelity, distorted outputs, and failure to adhere to complex instructions when rendering intricate details. These shortcomings are likely attributed to cumulative errors during autoregressive inference or information loss incurred during the discretization process. Probably "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.22058","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.22058/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.22058","created_at":"2026-07-05T11:45:12.387196+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.22058v1","created_at":"2026-07-05T11:45:12.387196+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.22058","created_at":"2026-07-05T11:45:12.387196+00:00"},{"alias_kind":"pith_short_12","alias_value":"BMGHFCH7GKUO","created_at":"2026-07-05T11:45:12.387196+00:00"},{"alias_kind":"pith_short_16","alias_value":"BMGHFCH7GKUOIOC4","created_at":"2026-07-05T11:45:12.387196+00:00"},{"alias_kind":"pith_short_8","alias_value":"BMGHFCH7","created_at":"2026-07-05T11:45:12.387196+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":33,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27376","citing_title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27089","citing_title":"TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26984","citing_title":"Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18249","citing_title":"Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13289","citing_title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","ref_index":209,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12575","citing_title":"High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04457","citing_title":"Imagine Before You Draw: Visual Prompt Engineering for Image Generation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28266","citing_title":"RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.32039","citing_title":"GEAR: Guided End-to-End AutoRegression for Image Synthesis","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31326","citing_title":"Bridging Video Understanding and Generation in a Unified Framework","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18172","citing_title":"Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25347","citing_title":"ERNIE-Image Technical Report","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30248","citing_title":"GenClaw: Code-Driven Agentic Image Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23903","citing_title":"Geo-Align: Video Generation Alignment via Metric Geometry Reward","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21573","citing_title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04128","citing_title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21090","citing_title":"TextSculptor: Training and Benchmarking Scene Text Editing","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24763","citing_title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18172","citing_title":"Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16842","citing_title":"Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2510.26583","citing_title":"Emu3.5: Native Multimodal Models are World Learners","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11061","citing_title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09430","citing_title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12500","citing_title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08163","citing_title":"MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing","ref_index":78,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3","json":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3.json","graph_json":"https://pith.science/api/pith-number/BMGHFCH7GKUOIOC4BH3N5OXFR3/graph.json","events_json":"https://pith.science/api/pith-number/BMGHFCH7GKUOIOC4BH3N5OXFR3/events.json","paper":"https://pith.science/paper/BMGHFCH7"},"agent_actions":{"view_html":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3","download_json":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3.json","view_paper":"https://pith.science/paper/BMGHFCH7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.22058&json=true","fetch_graph":"https://pith.science/api/pith-number/BMGHFCH7GKUOIOC4BH3N5OXFR3/graph.json","fetch_events":"https://pith.science/api/pith-number/BMGHFCH7GKUOIOC4BH3N5OXFR3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3/action/storage_attestation","attest_author":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3/action/author_attestation","sign_citation":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3/action/citation_signature","submit_replication":"https://pith.science/pith/BMGHFCH7GKUOIOC4BH3N5OXFR3/action/replication_record"}},"created_at":"2026-07-05T11:45:12.387196+00:00","updated_at":"2026-07-05T11:45:12.387196+00:00"}