CoTIR fine-tunes a pre-trained image editing model using a differentiable CoT-style objective inspired by Lagrangian optimization to enable single-pass universal image restoration, supported by a new 5.2M-sample benchmark showing improved perceptual quality.
Lumina-omnilv: A unified multimodal framework for general low-level vision
3 Pith papers cite this work. Polarity classification is still indexing.
citation-role summary
citation-polarity summary
fields
cs.CV 3verdicts
UNVERDICTED 3roles
background 1polarities
background 1representative citing papers
Task-aware localization via attention cues and feature centroids from source/target streams in IIE models improves non-edit consistency while preserving instruction following.
Step1X-Edit integrates a multimodal LLM with a diffusion decoder, trained on a custom high-quality dataset, to deliver image editing performance that surpasses open-source baselines and approaches proprietary models on the new GEdit-Bench.
citing papers explorer
-
Universal Image Restoration via Internalized Chain-of-Thought Reasoning
CoTIR fine-tunes a pre-trained image editing model using a differentiable CoT-style objective inspired by Lagrangian optimization to enable single-pass universal image restoration, supported by a new 5.2M-sample benchmark showing improved perceptual quality.
-
Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing
Task-aware localization via attention cues and feature centroids from source/target streams in IIE models improves non-edit consistency while preserving instruction following.
-
Step1X-Edit: A Practical Framework for General Image Editing
Step1X-Edit integrates a multimodal LLM with a diffusion decoder, trained on a custom high-quality dataset, to deliver image editing performance that surpasses open-source baselines and approaches proprietary models on the new GEdit-Bench.