A training-free multi-agent scene parser plus hierarchical region-aware diffusion improves complex text-to-image generation on T2I-CompBench over several Stable Diffusion baselines.
Mastering text-to-image dif- fusion: Recaptioning, planning, and generating with multi- modal llms
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation
A training-free multi-agent scene parser plus hierarchical region-aware diffusion improves complex text-to-image generation on T2I-CompBench over several Stable Diffusion baselines.