In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
2025/04/29 by Zechuan Zhang, Xie Ji, Zhang, Zechuan +7 · 66 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Image Enhancement Techniques #Multimodal Machine Learning Applications
paper · pdf · doi:10.48550/arxiv.2504.20690
openalex publication_date 2025/04/29 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Instruction-based image editing enables precise modifications via natural language prompts, but existing methods face a precision-efficiency tradeoff: fine-tuning demands massive datasets (>10M) and computational resources, while training-free approaches suffer from weak instruction comprehension. We address this by proposing ICEdit, which leverages the inherent comprehension and generation abilities of large-scale Diffusion Transformers (DiTs) through three key innovations: (1) An in-context editing paradigm without architectural modifications; (2) Minimal parameter-efficient fine-tuning for quality improvement; (3) Early Filter Inference-Time Scaling, which uses VLMs to select high-quality noise samples for efficiency. Experiments show that ICEdit achieves state-of-the-art editing performance with only 0.1% of the training data and 1% trainable parameters compared to previous methods. Our approach establishes a new paradigm for balancing precision and efficiency in instructional image editing. Codes and demos can be found in https://river-zhang.github.io/ICEdit-gh-pages/.
Cited by
- MIRA: Multimodal Iterative Reasoning Agent for Image Editing
- LongCat-Image Technical Report
- ThinkGen: Generalized Thinking for Visual Generation
- InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
- VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
- Region-Constraint In-Context Generation for Instructional Video Editing
- Mitty: Diffusion-based Human-to-Robot Video Generation
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
- STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
- Exploring MLLM-Diffusion Information Transfer with MetaCanvas
- OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
- MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition
- Unified Video Editing with Temporal Reasoner
- EditThinker: Unlocking Iterative Reasoning for Any Image Editor
- I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
- In-Context Sync-LoRA for Portrait Video Editing
- InEx: Hallucination Mitigation via Introspection and Cross-Modal Multi-Agent Collaboration
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- IC-World: In-Context Generation for Shared World Modeling
- WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
- ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
- CameraMaster: Unified Camera Semantic-Parameter Control for Photography Retouching
- iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
- HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
- Low-Resolution Editing is All You Need for High-Resolution Editing
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
- SplitFlux: Learning to Decouple Content and Style from a Single Image
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- StyleQoRA: Quality-Aware Low-Rank Adaptation for Few-Shot Multi-Style Editing
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- Emu3.5: Native Multimodal Models are World Learners
- Instruction-based image editing: a survey on data, models, evaluation, and applications
- Group Relative Attention Guidance for Image Editing
- LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- BLIP3o-NEXT: Next Frontier of Native Image Generation
- GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
- ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation
- Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
- TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency
- MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
- Does FLUX Already Know How to Perform Physically Plausible Image Composition?
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
- Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder
- Reconstruction Alignment Improves Unified Multimodal Models
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- SpotEdit: Evaluating Visually-Guided Image Editing Methods
- Visual Autoregressive Modeling for Instruction-Guided Image Editing
- TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
- Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
- X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
- SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
- Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
- Inference-time Scaling for Diffusion-based Audio Super-resolution
- Qwen-Image Technical Report
- UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
Related