Fine-grained prompt decomposition, self-judgment, and localized refinement plus step-level GRPO improve compositional text-to-image generation with unified MLLMs.
The procedure begins by summarizing P into Psummary to extract the core visual constraints
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation
Fine-grained prompt decomposition, self-judgment, and localized refinement plus step-level GRPO improve compositional text-to-image generation with unified MLLMs.