SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
2021/08/02 by Chenlin Meng, Meng, Chenlin, Yutong He +11 · 1 voice · 226 citations
Computer Science · Biochemistry, Genetics and Molecular Biology · #Generative Adversarial Networks and Image Synthesis #Computer Graphics and Visualization Techniques #Cell Image Analysis Techniques
paper · pdf · doi:10.48550/arxiv.2108.01073
Abstract
Guided image synthesis enables everyday users to create and edit photo-realistic images with minimum effort. The key challenge is balancing faithfulness to the user input (e.g., hand-drawn colored strokes) and realism of the synthesized image. Existing GAN-based methods attempt to achieve such balance using either conditional GANs or GAN inversions, which are challenging and often require additional training data or loss functions for individual applications. To address these issues, we introduce a new image synthesis and editing method, Stochastic Differential Editing (SDEdit), based on a diffusion model generative prior, which synthesizes realistic images by iteratively denoising through a stochastic differential equation (SDE). Given an input image with user guide of any type, SDEdit first adds noise to the input, then subsequently denoises the resulting image through the SDE prior to increase its realism. SDEdit does not require task-specific training or inversions and can naturally achieve the balance between realism and faithfulness. SDEdit significantly outperforms state-of-the-art GAN-based methods by up to 98.09% on realism and 91.72% on overall satisfaction scores, according to a human perception study, on multiple tasks, including stroke-based image synthesis and editing as well as image compositing.
Cited by
- Diffusion-guided optimization for full waveform inversion
- Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction
- Importance-Aware OBS Pruning for Diffusion Models
- Image Editing Models are Numerical Solvers
- ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation
- Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
- FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration
- Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection
- Differentiable Cardiac Electrophysiology Simulations for Dynamical State and Parameter Estimation
- A Step Forward Towards Trustworthy Risk-Aware Facial Retrieval (RA-FR)
- High-resolution efficient image generation from WiFi CSI using a pretrained latent diffusion model
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- MIRA: Multimodal Iterative Reasoning Agent for Image Editing
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
- Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape
- Score-Based Stabilization for Time-Dependent Problems
- ProEdit: Inversion-based Editing From Prompts Done Right
- A Diagnostic Gap Framework for Evaluating Reconstruction Fidelity in Weakly Supervised Mammography
- Text-based Tactile Graphics Generation for the Visually Impaired
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment
- Dexterous World Models
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- SFBD-OMNI: Bridge models for lossy measurement restoration with limited clean samples
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
- Towards Transferable Defense Against Malicious Image Edits
- Dual Attention Guided Defense Against Malicious Edits
- Quality-Driven and Diversity-Aware Sample Expansion for Robust Marine Obstacle Segmentation
- Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models
- Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
- Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior
- CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models
- MotionEdit: Benchmarking and Learning Motion-Centric Image Editing
- Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
- EgoX: Egocentric Video Generation from a Single Exocentric Video
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Unified Video Editing with Temporal Reasoner
- AdLift: Lifting Adversarial Perturbations to Safeguard 3D Gaussian Splatting Assets Against Instruction-Driven Editing
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- Training-free Clothing Region of Interest Self-correction for Virtual Try-On
- EditThinker: Unlocking Iterative Reasoning for Any Image Editor
- Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models
- UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
- DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature Alignment
- BlurDM: A Blur Diffusion Model for Image Deblurring
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- GaussianBlender: Instant Stylization of 3D Gaussians with Disentangled Latent Spaces
- ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation
- Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- Controllable 3D Object Generation with Single Image Prompt
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- DAISI: Data Assimilation with Inverse Sampling using Stochastic Interpolants
- POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models
- DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline
- Semantic-Aware Caching for Efficient Image Generation in Edge Computing
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring
- DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
- ObjectAlign: Neuro-Symbolic Object Consistency Verification and Correction
- Zero-Shot Video Deraining with Video Diffusion Models
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- SPAGS: Sparse-View Articulated Object Reconstruction from Single State via Planar Gaussian Splatting
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- Equivariant Sampling for Improving Diffusion Model-based Image Restoration
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- PADM: A Physics-aware Diffusion Model for Attenuation Correction
- AvatarTex: High-Fidelity Facial Texture Reconstruction from Single-Image Stylized Avatars
- Test-Time Iterative Error Correction for Efficient Diffusion Models
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
- MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- OSMGen: Highly Controllable Satellite Image Synthesis using OpenStreetMap Data
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
- FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- Instruction-based image editing: a survey on data, models, evaluation, and applications
- RadEdit: Stress-Testing Biomedical Vision Models via Diffusion Image Editing
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- Diffusion Models in Vision: A Survey
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch Generation
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- Compositional Image Synthesis with Inference-Time Scaling
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- WorldGrow: Generating Infinite 3D World
- Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
- Enhancing Video Inpainting with Aligned Frame Interval Guidance
- Bridging the gap to real-world language-grounded visual concept learning
- LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal
- EditInfinity: Image Editing with Binary-Quantized Generative Models
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- Guiding diffusion models to reconstruct flow fields from sparse data
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- Personalized Image Filter: Mastering Your Photographic Style
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- Latent Diffusion Model without Variational Autoencoder
- ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Learning an Image Editing Model without Image Editing Pairs
- Nonparametric Data Attribution for Diffusion Models
- Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation
- NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
- Salient Concept-Aware Generative Data Augmentation
- Adaptive Visual Conditioning for Semantic Consistency in Diffusion-Based Story Continuation
- NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models
- T(R,O) Grasp: Efficient Graph Diffusion of Robot-Object Spatial Transformation for Cross-Embodiment Dexterous Grasping
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- Zero-shot Face Editing via ID-Attribute Decoupled Inversion
- DreamMakeup: Face Makeup Customization using Latent Diffusion Models
- FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- ReMix: Towards a Unified View of Consistent Character Generation and Editing
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
- SkipSR: Faster Super Resolution with Token Skipping
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- Towards Better Optimization For Listwise Preference in Diffusion Models
- Three Forms of Stochastic Injection for Improved Distribution-to-Distribution Generative Modeling
- Conditional Denoising Diffusion Model-Based Robust MR Image Reconstruction from Highly Undersampled Data
- Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion
- C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- Prompt-to-Prompt: Text-Based Image Editing Via Cross-Attention Mechanisms -- The Research of Hyperparameters and Novel Mechanisms to Enhance Existing Frameworks
- Generating Human Motion Videos using a Cascaded Text-to-Video Framework
- Contrastive-SDE: Guiding Stochastic Differential Equations with Contrastive Learning for Unpaired Image-to-Image Translation
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- GaussEdit: Adaptive 3D Scene Editing with Text and Image Prompts
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- CharGen: Fast and Fluent Portrait Modification
- Semantic Editing with Coupled Stochastic Differential Equations
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- Explanation-Driven Counterfactual Testing for Faithfulness in Vision-Language Model Explanations
- ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Taming Flow-based I2V Models for Creative Video Editing
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- ReviewScore: Misinformed Peer Review Detection with Large Language Models
- Does FLUX Already Know How to Perform Physically Plausible Image Composition?
- Latent Activation Editing: Inference-Time Refinement of Learned Policies for Safer Multirobot Navigation
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
- ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion
- Virtual Consistency for Audio Editing
- Similarity-Guided Diffusion for Long-Gap Music Inpainting
- Image Tokenizer Needs Post-Training
- IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
- Styleclone: Face Stylization with Diffusion Based Data Augmentation
- LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- InJecteD: Analyzing Trajectories and Drift Dynamics in Denoising Diffusion Probabilistic Models for 2D Point Cloud Generation
- Painting the market: generative diffusion models for financial limit order book simulation and forecasting
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- SEEDS: Exponential SDE Solvers for Fast High-Quality Sampling from Diffusion Models
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- MedShift: Implicit Conditional Transport for X-Ray Domain Adaptation
- First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge
- Dress&Dance: Dress up and Dance as You Like It - Technical Preview
- Audio-Guided Visual Editing with Complex Multi-Modal Prompts
- Discrete-Guided Diffusion for Scalable and Safe Multi-Robot Motion Planning
- Articulate3D: Zero-Shot Text-Driven 3D Object Posing
- MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
- InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing
- OmniTry: Virtual Try-On Anything without Masks
- Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping
- StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
- AtomDiffuser: Time-Aware Degradation Modeling for Drift and Beam Damage in STEM Imaging
- MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
- UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- The Promise of RL for Autoregressive Image Editing
- LeakyCLIP: Extracting Training Data from CLIP
- TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- APT: Improving Diffusion Models for High Resolution Image Generation with Adaptive Path Tracing
- GuidPaint: Class-Guided Image Inpainting with Diffusion Models
- Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training
- GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
- Local Prompt Adaptation for Style-Consistent Multi-Object Generation in Diffusion Models
- BokehDiff: Neural Lens Blur with One-Step Diffusion
- Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving
- Stable Diffusion [wikipedia]
Discussions
Related