Pith. sign in

Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation

4 Pith papers cite this work. Polarity classification is still indexing.

4 Pith papers citing it

citation-role summary

baseline 1

citation-polarity summary

fields

cs.CV 4

years

2026 2 2025 2

roles

baseline 1

polarities

baseline 1

representative citing papers

Nucleus-Image: Sparse MoE for Image Generation

cs.CV · 2026-04-14 · unverdicted · novelty 6.0

A 17B-parameter sparse MoE diffusion transformer activates 2B parameters per pass and reaches competitive quality on image generation benchmarks without post-training.

Kling-Omni Technical Report

cs.CV · 2025-12-18 · unverdicted · novelty 6.0

Kling-Omni is a unified multimodal generative system that produces cinematic videos from diverse inputs by integrating generation, editing, and intelligent reasoning in a single end-to-end model.

HunyuanImage 3.0 Technical Report

cs.CV · 2025-09-28 · conditional · novelty 6.0

HunyuanImage 3.0 is an open 80B-parameter multimodal autoregressive image generator that reportedly matches leading closed models on in-house benchmarks.

citing papers explorer

Showing 4 of 4 citing papers.

  • Nucleus-Image: Sparse MoE for Image Generation cs.CV · 2026-04-14 · unverdicted · none · ref 47

    A 17B-parameter sparse MoE diffusion transformer activates 2B parameters per pass and reaches competitive quality on image generation benchmarks without post-training.

  • Kling-Omni Technical Report cs.CV · 2025-12-18 · unverdicted · none · ref 18

    Kling-Omni is a unified multimodal generative system that produces cinematic videos from diverse inputs by integrating generation, editing, and intelligent reasoning in a single end-to-end model.

  • HunyuanImage 3.0 Technical Report cs.CV · 2025-09-28 · conditional · none · ref 23

    HunyuanImage 3.0 is an open 80B-parameter multimodal autoregressive image generator that reportedly matches leading closed models on in-house benchmarks.

  • Steering Visual Generation in Unified Multimodal Models with Understanding Supervision cs.CV · 2026-05-07 · unverdicted · none · ref 34

    Using understanding tasks as direct supervision during post-training improves image generation and editing in unified multimodal models.