MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing
2023/04/17 by Mingdeng Cao, Xintao Wang, Cao, Mingdeng +9 · 184 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
paper · pdf · doi:10.48550/arxiv.2304.08465
openalex publication_date 2023/04/17 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Despite the success in large-scale text-to-image generation and text-conditioned image editing, existing methods still struggle to produce consistent generation and editing results. For example, generation approaches usually fail to synthesize multiple images of the same objects/characters but with different views or poses. Meanwhile, existing editing methods either fail to achieve effective complex non-rigid editing while maintaining the overall textures and identity, or require time-consuming fine-tuning to capture the image-specific appearance. In this paper, we develop MasaCtrl, a tuning-free method to achieve consistent image generation and complex non-rigid image editing simultaneously. Specifically, MasaCtrl converts existing self-attention in diffusion models into mutual self-attention, so that it can query correlated local contents and textures from source images for consistency. To further alleviate the query confusion between foreground and background, we propose a mask-guided mutual self-attention strategy, where the mask can be easily extracted from the cross-attention maps. Extensive experiments show that the proposed MasaCtrl can produce impressive results in both consistent image generation and complex non-rigid real image editing.
Cited by
- ProEdit: Inversion-based Editing From Prompts Done Right
- Text-Conditioned Background Generation for Editable Multi-Layer Documents
- MatE: Material Extraction from Single-Image via Geometric Prior
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- DeContext as Defense: Safe Image Editing in Diffusion Transformers
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs
- CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
- OmniPSD: Layered PSD Generation with Diffusion Transformer
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- LumiX: Structured and Coherent Text-to-Intrinsic Generation
- PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
- Match-and-Fuse: Consistent Generation from Unstructured Image Sets
- POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
- A Training-Free Approach for Multi-ID Customization via Attention Adjustment and Spatial Control
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- Low-Resolution Editing is All You Need for High-Resolution Editing
- LATTICE: Democratize High-Fidelity 3D Generation at Scale
- Zero-Shot Video Deraining with Video Diffusion Models
- IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment
- MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization
- NaTex: Seamless Texture Generation as Latent Color Diffusion
- Free-Form Scene Editor: Enabling Multi-Round Object Manipulation like in a 3D Engine
- FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing
- Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
- LayerEdit: Disentangled Multi-Object Editing via Conflict-Aware Multi-Layer Learning
- V-Shuffle: Zero-Shot Style Transfer via Value Shuffle
- Text to Sketch Generation with Multi-Styles
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- Instruction-based image editing: a survey on data, models, evaluation, and applications
- OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
- Neural USD: An object-centric framework for iterative editing and control
- Self-Attention Decomposition For Training Free Diffusion Editing
- EditInfinity: Image Editing with Binary-Quantized Generative Models
- ConsistEdit: Highly Consistent and Precise Training-free Visual Editing
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Learning an Image Editing Model without Image Editing Pairs
- Only-Style: Stylistic Consistency in Image Generation without Content Leakage
- FreeViS: Training-free Video Stylization with Inconsistent References
- InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
- Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- Teleportraits: Training-Free People Insertion into Any Scene
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing
- FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Inpaint4Drag: Repurposing Inpainting Models for Drag-Based Image Editing via Bidirectional Warping
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Q-Align: Alleviating Attention Leakage in Zero-Shot Appearance Transfer via Query-Query Alignment
- Color Bind: Exploring Color Perception in Text-to-Image Models
- Articulate3D: Zero-Shot Text-Driven 3D Object Posing
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- SPG: Style-Prompting Guidance for Style-Specific Content Creation
- CoreEditor: Correspondence-constrained Diffusion for Consistent 3D Editing
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- TweezeEdit: Consistent and Efficient Image Editing with Path Regularization
- Stable Diffusion Models are Secretly Good at Visual In-Context Learning
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- Cut2Next: Generating Next Shot via In-Context Tuning
- Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control
- X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
- DreamVE: Unified Instruction-based Image and Video Editing
- PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- X-Actor: Emotional and Expressive Long-Range Portrait Acting from Audio
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention
- StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization
- Training-free Geometric Image Editing on Diffusion Models
- X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
- FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers
- BokehDiff: Neural Lens Blur with One-Step Diffusion
- Moodifier: MLLM-Enhanced Emotion-Driven Image Editing
- Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models
- HarmonPaint: Harmonized Training-Free Diffusion Inpainting
- Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling
- Stable Score Distillation
- FlowDrag: 3D-aware Drag-based Image Editing with Mesh-guided Deformation Vector Flow Fields
- Stable-Hair v2: Real-World Hair Transfer via Multiple-View Diffusion Model
- Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing
- Flux-Sculptor: Text-Driven Rich-Attribute Portrait Editing through Decomposed Spatial Flow Control
- RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
- FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion Model
- ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation
- Imagine for Me: Creative Conceptual Blending of Real Images and Text via Blended Attention
- STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing
- Improving Diffusion-Based Image Editing Faithfulness via Guidance and Scheduling
- The Aging Multiverse: Generating Condition-Aware Facial Aging Tree via Training-Free Diffusion
- EditP23: 3D Editing via Propagation of Image Prompts to Multi-View
- ShowFlow: From Robust Single Concept to Condition-Free Multi-Concept Generation
- CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing
- DragNeXt: Rethinking Drag-Based Image Editing
- PairEdit: Learning Semantic Variations for Exemplar-based Image Editing
- DreamLight: Towards Harmonious and Consistent Image Relighting
- AttentionDrag: Exploiting Latent Correlation Knowledge in Pre-trained Diffusion Models for Image Editing
- TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation
- Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models
- Controllable Coupled Image Generation via Diffusion Models
- ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models
- FADE: Frequency-Aware Diffusion Model Factorization for Video Editing
- MARBLE: Material Recomposition and Blending in CLIP-Space
- Follow-Your-Creation: Empowering 4D Creation through Video Inpainting
- SeedEdit 3.0: Fast and High-Quality Generative Image Editing
- Multi-turn Consistent Image Editing
- DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing
- ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions
- RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers
- DNAEdit: Direct Noise Alignment for Text-Guided Rectified Flow Editing
- Interactive Video Generation via Domain Adaptation
- Cora: Correspondence-aware image editing using few step diffusion
- LayerPeeler: Autoregressive Peeling for Layer-wise Image Vectorization
- SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
- FastFace: Tuning Identity Preservation in Distilled Diffusion via Guidance and Attention
- Structure Disruption: Subverting Malicious Diffusion-Based Inpainting via Self-Attention Query Perturbation
- Training-free Stylized Text-to-Image Generation with Fast Inference
- Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
- Rethinking Direct Preference Optimization in Diffusion Models
- Localizing Knowledge in Diffusion Transformers
- GSRAIN: Physically Calibrated High-/Low-Frequency Rainfall Synthesis for 3D Gaussian Driving Scenes
- Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
- Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
- Leveraging the Powerful Attention of a Pre-trained Diffusion Model for Exemplar-based Image Colorization
- MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing
- DragLoRA: Online Optimization of LoRA Adapters for Drag-based Image Editing in Diffusion Model
- PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance Alignment
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- X-Edit: Detecting and Localizing Edits in Images Altered by Text-Guided Diffusion Models
- Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
- FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
- Towards Scalable Human-aligned Benchmark for Text-guided Image Editing
- InstructAttribute: Fine-grained Object Attributes editing with Instruction
- Follow the Mean: Reference-Guided Flow Matching
- In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
- REED-VAE: RE-Encode Decode Training for Iterative Image Editing with Diffusion Models
- DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
- Structure-Preserving Zero-Shot Image Editing via Stage-Wise Latent Injection in Diffusion Models
- FaceCraft4D: Animated 3D Facial Avatar Generation from a Single Image
- "I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts
- PRISM: A Unified Framework for Photorealistic Reconstruction and Intrinsic Scene Modeling
- Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image Editing
- Image Editing with Diffusion Models: A Survey
- DiTaiListener: Controllable High Fidelity Listener Video Generation with Diffusion
- UniEdit-Flow: Unleashing Inversion and Editing in the Era of Flow Models
- SPIE: Semantic and Structural Post-Training of Image Editing Diffusion Models with AI feedback
- Understanding Attention Mechanism in Video Diffusion Models
- Anchor Token Matching: Implicit Structure Locking for Training-free AR Image Editing
- CoProSketch: Controllable and Progressive Sketch Generation with Diffusion Model
- Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model
- Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
Related