{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ZCHU6OKDBKKYXR3BYR3TQUDZKK","short_pith_number":"pith:ZCHU6OKD","schema_version":"1.0","canonical_sha256":"c88f4f39430a958bc761c47738507952bac31a311ba9dc694e9fe623003c49d9","source":{"kind":"arxiv","id":"2411.07975","version":2},"attestation_state":"computed","paper":{"title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Chengyue Wu, Chong Ruan, Haowei Zhang, Jiaying Liu, Liang Zhao, Wen Liu, Xiaokang Chen, Xingchao Liu, Xingkai Yu, Yisong Wang, Yiyang Ma, Zhenda Xie, Zhiyu Wu, Zizheng Pan","submitted_at":"2024-11-12T17:55:10Z","abstract_excerpt":"We present JanusFlow, a powerful framework that unifies image understanding and generation in a single model. JanusFlow introduces a minimalist architecture that integrates autoregressive language models with rectified flow, a state-of-the-art method in generative modeling. Our key finding demonstrates that rectified flow can be straightforwardly trained within the large language model framework, eliminating the need for complex architectural modifications. To further improve the performance of our unified model, we adopt two key strategies: (i) decoupling the understanding and generation enco"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.07975","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-11-12T17:55:10Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"76364918c8fb07faa251e3fc378f76f2139bcbbfb5ca990f2ff3f5672ab2ebff","abstract_canon_sha256":"0260137613a3425ad2ab8df9c1a384300cecc2d0693eb4a8bb6959c9e0506061"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:37:36.987995Z","signature_b64":"eJgLsxWnQjBQSk43MLCxhEapj8xCKI6rZ8aPNyk+4WfNJ8hpbMGkU2hpLwiaeSpFA2Omrh38KgONDRicVHUpDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c88f4f39430a958bc761c47738507952bac31a311ba9dc694e9fe623003c49d9","last_reissued_at":"2026-07-05T10:37:36.987215Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:37:36.987215Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Chengyue Wu, Chong Ruan, Haowei Zhang, Jiaying Liu, Liang Zhao, Wen Liu, Xiaokang Chen, Xingchao Liu, Xingkai Yu, Yisong Wang, Yiyang Ma, Zhenda Xie, Zhiyu Wu, Zizheng Pan","submitted_at":"2024-11-12T17:55:10Z","abstract_excerpt":"We present JanusFlow, a powerful framework that unifies image understanding and generation in a single model. JanusFlow introduces a minimalist architecture that integrates autoregressive language models with rectified flow, a state-of-the-art method in generative modeling. Our key finding demonstrates that rectified flow can be straightforwardly trained within the large language model framework, eliminating the need for complex architectural modifications. To further improve the performance of our unified model, we adopt two key strategies: (i) decoupling the understanding and generation enco"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.07975","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.07975/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.07975","created_at":"2026-07-05T10:37:36.987322+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.07975v2","created_at":"2026-07-05T10:37:36.987322+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.07975","created_at":"2026-07-05T10:37:36.987322+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZCHU6OKDBKKY","created_at":"2026-07-05T10:37:36.987322+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZCHU6OKDBKKYXR3B","created_at":"2026-07-05T10:37:36.987322+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZCHU6OKD","created_at":"2026-07-05T10:37:36.987322+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":22,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22873","citing_title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","ref_index":229,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04264","citing_title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22873","citing_title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","ref_index":228,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28696","citing_title":"COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30054","citing_title":"Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21798","citing_title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2505.23606","citing_title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2510.21122","citing_title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2505.05472","citing_title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2505.16933","citing_title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2503.19325","citing_title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2503.07265","citing_title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12112","citing_title":"When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10564","citing_title":"DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving","ref_index":123,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25636","citing_title":"Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2505.07818","citing_title":"DanceGRPO: Unleashing GRPO on Visual Generation","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24625","citing_title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2505.05470","citing_title":"Flow-GRPO: Training Flow Matching Models via Online RL","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2511.22699","citing_title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2412.10302","citing_title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04746","citing_title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2505.14683","citing_title":"Emerging Properties in Unified Multimodal Pretraining","ref_index":50,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK","json":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK.json","graph_json":"https://pith.science/api/pith-number/ZCHU6OKDBKKYXR3BYR3TQUDZKK/graph.json","events_json":"https://pith.science/api/pith-number/ZCHU6OKDBKKYXR3BYR3TQUDZKK/events.json","paper":"https://pith.science/paper/ZCHU6OKD"},"agent_actions":{"view_html":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK","download_json":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK.json","view_paper":"https://pith.science/paper/ZCHU6OKD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.07975&json=true","fetch_graph":"https://pith.science/api/pith-number/ZCHU6OKDBKKYXR3BYR3TQUDZKK/graph.json","fetch_events":"https://pith.science/api/pith-number/ZCHU6OKDBKKYXR3BYR3TQUDZKK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK/action/storage_attestation","attest_author":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK/action/author_attestation","sign_citation":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK/action/citation_signature","submit_replication":"https://pith.science/pith/ZCHU6OKDBKKYXR3BYR3TQUDZKK/action/replication_record"}},"created_at":"2026-07-05T10:37:36.987322+00:00","updated_at":"2026-07-05T10:37:36.987322+00:00"}