Prompt-to-Prompt Image Editing with Cross Attention Control
2022/08/02 by Amir Hertz, Hertz, Amir, Ron Mokady +11 · 1 voice · 271 citations
Computer Science · Engineering · #Advanced Materials and Mechanics #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Interactive and Immersive Displays #Machine Learning (cs.LG) #Modular Robots and Swarm Intelligence #cs.CL #cs.CV #cs.GR #cs.LG
paper · pdf · doi:10.48550/arxiv.2208.01626
openalex publication_date 2022/08/02 · arxiv published 2022/08/02 · arxiv updated 2022/08/02 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Recent large-scale text-driven synthesis models have attracted much attention thanks to their remarkable capabilities of generating highly diverse images that follow given text prompts. Such text-based synthesis methods are particularly appealing to humans who are used to verbally describe their intent. Therefore, it is only natural to extend the text-driven image synthesis to text-driven image editing. Editing is challenging for these generative models, since an innate property of an editing technique is to preserve most of the original image, while in the text-based models, even a small modification of the text prompt often leads to a completely different outcome. State-of-the-art methods mitigate this by requiring the users to provide a spatial mask to localize the edit, hence, ignoring the original structure and content within the masked region. In this paper, we pursue an intuitive prompt-to-prompt editing framework, where the edits are controlled by text only. To this end, we analyze a text-conditioned model in depth and observe that the cross-attention layers are the key to controlling the relation between the spatial layout of the image to each word in the prompt. With this observation, we present several applications which monitor the image synthesis by editing the textual prompt only. This includes localized editing by replacing a word, global editing by adding a specification, and even delicately controlling the extent to which a word is reflected in the image. We present our results over diverse images and prompts, demonstrating high-quality synthesis and fidelity to the edited prompts.
Cited by
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- MIRA: Multimodal Iterative Reasoning Agent for Image Editing
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
- Multi Agents Semantic Emotion Aligned Music to Image Generation with Music Derived Captions
- Reverse Personalization
- Guided Path Sampling: Steering Diffusion Models Back on Track with Principled Path Guidance
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- Characterizing Motion Encoding in Video Diffusion Timesteps
- ProEdit: Inversion-based Editing From Prompts Done Right
- ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition
- ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline
- Text-Conditioned Background Generation for Editable Multi-Layer Documents
- FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting
- FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
- Generalization of Diffusion Models Arises with a Balanced Representation Space
- SE360: Semantic Edit in 360^∘ Panoramas via Hierarchical Data Construction
- Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- Region-Constraint In-Context Generation for Instructional Video Editing
- InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
- LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- RoomEditor++: A Parameter-Sharing Diffusion Architecture for High-Fidelity Furniture Synthesis
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- DeContext as Defense: Safe Image Editing in Diffusion Transformers
- IC-Effect: Precise and Efficient Video Effects Editing via In-Context Learning
- Unveiling the Attribute Misbinding Threat in Identity-Preserving Models
- Towards Transferable Defense Against Malicious Image Edits
- Dual Attention Guided Defense Against Malicious Edits
- SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs
- DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
- RecTok: Reconstruction Distillation along Rectified Flow
- CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- SCAdapter: Content-Style Disentanglement for Diffusion Style Transfer
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
- CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop
- CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models
- OmniPSD: Layered PSD Generation with Diffusion Transformer
- Food Image Generation on Multi-Noun Categories
- CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- Training-free Clothing Region of Interest Self-correction for Virtual Try-On
- EditThinker: Unlocking Iterative Reasoning for Any Image Editor
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- GaussianBlender: Instant Stylization of 3D Gaussians with Disentangled Latent Spaces
- Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
- CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models
- In-Context Sync-LoRA for Portrait Video Editing
- UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- FlowEO: Generative Unsupervised Domain Adaptation for Earth Observation
- AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
- TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
- DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy
- Match-and-Fuse: Consistent Generation from Unstructured Image Sets
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- 3D-Consistent Multi-View Editing by Correspondence Guidance
- POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
- InstanceV: Instance-Level Video Generation
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Infinite-Story: A Training-Free Consistent Text-to-Image Generation
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- Low-Resolution Editing is All You Need for High-Resolution Editing
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Zero-Shot Video Deraining with Video Diffusion Models
- TRANSPORTER: Transferring Visual Semantics from VLM Manifolds
- FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement
- Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
- Multi-speaker Attention Alignment for Multimodal Social Interaction
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
- UniSER: A Foundation Model for Unified Soft Effects Removal
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- Example-Based Feature Painting on Textures
- FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Perturb a Model, Not an Image: Towards Robust Privacy Protection via Anti-Personalized Diffusion Models
- Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
- LayerEdit: Disentangled Multi-Object Editing via Conflict-Aware Multi-Layer Learning
- CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- CPO: Condition Preference Optimization for Controllable Image Generation
- MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- OSMGen: Highly Controllable Satellite Image Synthesis using OpenStreetMap Data
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
- SplitFlow: Flow Decomposition for Inversion-Free Text-to-Image Editing
- Instruction-based image editing: a survey on data, models, evaluation, and applications
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch Generation
- LGCC: Enhancing Flow Matching Based Text-Guided Image Editing with Local Gaussian Coupling and Context Consistency
- EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift
- DiffusionX: Efficient Edge-Cloud Collaborative Image Generation with Multi-Round Prompt Evolution
- OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
- Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
- Neural USD: An object-centric framework for iterative editing and control
- VALA: Learning Latent Anchors for Training-Free and Temporally Consistent
- FAME: Fairness-aware Attention-modulated Video Editing
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
- EchoDistill: Bidirectional Concept Distillation for One-Step Diffusion Personalization
- EditInfinity: Image Editing with Binary-Quantized Generative Models
- Target-aware Image Editing via Cycle-consistent Constraints
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- Chimera: Compositional Image Generation using Part-based Concepting
- Region in Context: Text-condition Image editing with Human-like semantic reasoning
- Personalized Image Filter: Mastering Your Photographic Style
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- Learning an Image Editing Model without Image Editing Pairs
- WithAnyone: Towards Controllable and ID Consistent Image Generation
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- Consistent text-to-image generation via scene de-contextualization
- Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation
- NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
- Salient Concept-Aware Generative Data Augmentation
- Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
- What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
- DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
- ReMix: Towards a Unified View of Consistent Character Generation and Editing
- FreeViS: Training-free Video Stylization with Inconsistent References
- Few-shot multi-token DreamBooth with LoRa for style-consistent character generation
- Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
- X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
- TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- DreamOmni2: Multimodal Instruction-based Editing and Generation
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- AgeBooth: Controllable Facial Aging and Rejuvenation via Diffusion Models
- FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation
- ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement
- C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- TempoControl: Temporal Attention Guidance for Text-to-Video Models
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator
- Prompt-to-Prompt: Text-Based Image Editing Via Cross-Attention Mechanisms -- The Research of Hyperparameters and Novel Mechanisms to Enhance Existing Frameworks
- Fine-Tuning Diffusion Models via Intermediate Distribution Shaping
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- GaussEdit: Adaptive 3D Scene Editing with Text and Image Prompts
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- CO3: Contrasting Concepts Compose Better
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- Dragging with Geometry: From Pixels to Geometry-Guided Image Editing
- Interpret, prune and distill Donut : towards lightweight VLMs for VQA on document
- Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency
- UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark
- Semantic Editing with Coupled Stochastic Differential Equations
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling
- ReLumix: Extending Image Relighting to Video via Video Diffusion Models
- Griffin: Generative Reference and Layout Guided Image Composition
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- RefAM: Attention Magnets for Zero-Shot Referral Segmentation
- FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing
- SemanticControl: A Training-Free Approach for Handling Loosely Aligned Visual Conditions in ControlNet
- Taming Flow-based I2V Models for Creative Video Editing
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- ReviewScore: Misinformed Peer Review Detection with Large Language Models
- Guiding Audio Editing with Audio Language Model
- FreeInsert: Personalized Object Insertion with Geometric and Style Control
- Latent Activation Editing: Inference-Time Refinement of Learned Policies for Safer Multirobot Navigation
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- Prompt-Guided Dual Latent Steering for Inversion Problems
- Towards Application Aligned Synthetic Surgical Image Synthesis
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Stencil: Subject-Driven Generation with Context Guidance
- Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
- RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
- Controllable-Continuous Color Editing in Diffusion Model via Color Mapping
- EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing
- Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- Robust Concept Erasure in Diffusion Models: A Theoretical Perspective on Security and Robustness
- MusicScaffold: Bridging Machine Efficiency and Human Growth in Adolescent Creative Education through Generative AI
- Align 3D Representation and Text Embedding for 3D Content Personalization
- Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
- Feature Space Analysis by Guided Diffusion Model
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training
- Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- A Data-Centric Approach to Pedestrian Attribute Recognition: Synthetic Augmentation via Prompt-driven Diffusion Models
- PromptFlare: Prompt-Generalized Defense via Cross-Attention Decoy in Diffusion-Based Inpainting
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Delta Rectified Flow Sampling for Text-to-Image Editing
- PractiLight: Practical Light Control Using Foundational Diffusion Models
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- The Name-Free Gap: Policy-Aware Stylistic Control in Music Generation
- 3D-LATTE: Latent Space 3D Editing from Textual Instructions
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Audio-Guided Visual Editing with Complex Multi-Modal Prompts
- Q-Align: Alleviating Attention Leakage in Zero-Shot Appearance Transfer via Query-Query Alignment
- Color Bind: Exploring Color Perception in Text-to-Image Models
- Articulate3D: Zero-Shot Text-Driven 3D Object Posing
- Visual Autoregressive Modeling for Instruction-Guided Image Editing
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- AnchorSync: Global Consistency Optimization for Long Video Editing
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- SPG: Style-Prompting Guidance for Style-Specific Content Creation
- Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
- CoreEditor: Correspondence-constrained Diffusion for Consistent 3D Editing
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- TweezeEdit: Consistent and Efficient Image Editing with Path Regularization
- Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- TARA: Token-Aware LoRA for Composable Personalization in Diffusion Models
- MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization
- Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control
- X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- DreamVE: Unified Instruction-based Image and Video Editing
- A Study of the Framework and Real-World Applications of Language Embedding for 3D Scene Understanding
- VideoGuard: Protecting Video Content from Unauthorized Editing
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
- UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- The Promise of RL for Autoregressive Image Editing
- ECGTwin: Personalized ECG Generation Using Controllable Diffusion Model
- Training-free Geometric Image Editing on Diffusion Models
- APT: Improving Diffusion Models for High Resolution Image Generation with Adaptive Path Tracing
Discussions
Related