SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
2021/08/02 by Chenlin Meng, Meng, Chenlin, Yutong He +11 · 1 voice · 407 citations
Biochemistry, Genetics and Molecular Biology · Computer Science · Mathematics · #Algorithm #Applied mathematics #Artificial intelligence #Cell Image Analysis Techniques #Compositing #Computer Graphics and Visualization Techniques #Computer science #Computer vision #Generative Adversarial Networks and Image Synthesis #Image (mathematics) #Image editing #Mathematical optimization #Mathematics #Noise reduction #Realism #Stochastic differential equation #Theoretical computer science #cs.AI #cs.CV
paper · pdf · doi:10.48550/arxiv.2108.01073
published in arXiv (Cornell University) (Cornell University) · https://sde-image-editing.github.io/
openalex publication_date 2021/08/02 · arxiv created 2022/01/05 · arxiv updated 2022/01/06 · openalex created_date 2022/07/25 · openalex updated_date 2026/07/28
Abstract
Guided image synthesis enables everyday users to create and edit photo-realistic images with minimum effort. The key challenge is balancing faithfulness to the user input (e.g., hand-drawn colored strokes) and realism of the synthesized image. Existing GAN-based methods attempt to achieve such balance using either conditional GANs or GAN inversions, which are challenging and often require additional training data or loss functions for individual applications. To address these issues, we introduce a new image synthesis and editing method, Stochastic Differential Editing (SDEdit), based on a diffusion model generative prior, which synthesizes realistic images by iteratively denoising through a stochastic differential equation (SDE). Given an input image with user guide of any type, SDEdit first adds noise to the input, then subsequently denoises the resulting image through the SDE prior to increase its realism. SDEdit does not require task-specific training or inversions and can naturally achieve the balance between realism and faithfulness. SDEdit significantly outperforms state-of-the-art GAN-based methods by up to 98.09% on realism and 91.72% on overall satisfaction scores, according to a human perception study, on multiple tasks, including stroke-based image synthesis and editing as well as image compositing.
Cited by
- Diffusion-guided optimization for full waveform inversion
- Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction
- Importance-Aware OBS Pruning for Diffusion Models
- Image Editing Models are Numerical Solvers
- ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation
- Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency
- FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration
- Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection
- Differentiable Cardiac Electrophysiology Simulations for Dynamical State and Parameter Estimation
- A Step Forward Towards Trustworthy Risk-Aware Facial Retrieval (RA-FR)
- High-resolution efficient image generation from WiFi CSI using a pretrained latent diffusion model
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- MIRA: Multimodal Iterative Reasoning Agent for Image Editing
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
- Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape
- Score-Based Stabilization for Time-Dependent Problems
- ProEdit: Inversion-based Editing From Prompts Done Right
- A Diagnostic Gap Framework for Evaluating Reconstruction Fidelity in Weakly Supervised Mammography
- Text-based Tactile Graphics Generation for the Visually Impaired
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment
- Dexterous World Models
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- SFBD-OMNI: Bridge models for lossy measurement restoration with limited clean samples
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
- Towards Transferable Defense Against Malicious Image Edits
- Dual Attention Guided Defense Against Malicious Edits
- Quality-Driven and Diversity-Aware Sample Expansion for Robust Marine Obstacle Segmentation
- Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models
- Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
- Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior
- CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models
- MotionEdit: Benchmarking and Learning Motion-Centric Image Editing
- Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
- EgoX: Egocentric Video Generation from a Single Exocentric Video
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- VideoCoF: Unified Video Editing with Temporal Reasoner
- AdLift: Lifting Adversarial Perturbations to Safeguard 3D Gaussian Splatting Assets Against Instruction-Driven Editing
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- Training-free Clothing Region of Interest Self-correction for Virtual Try-On
- EditThinker: Unlocking Iterative Reasoning for Any Image Editor
- Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models
- UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
- DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature Alignment
- BlurDM: A Blur Diffusion Model for Image Deblurring
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- GaussianBlender: Instant Stylization of 3D Gaussians with Disentangled Latent Spaces
- ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation
- Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- Controllable 3D Object Generation with Single Image Prompt
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- DAISI: Data Assimilation with Inverse Sampling using Stochastic Interpolants
- POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models
- DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline
- Semantic-Aware Caching for Efficient Image Generation in Edge Computing
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring
- DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
- ObjectAlign: Neuro-Symbolic Object Consistency Verification and Correction
- Zero-Shot Video Deraining with Video Diffusion Models
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- SPAGS: Sparse-View Articulated Object Reconstruction from Single State via Planar Gaussian Splatting
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- Equivariant Sampling for Improving Diffusion Model-based Image Restoration
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- PADM: A Physics-aware Diffusion Model for Attenuation Correction
- AvatarTex: High-Fidelity Facial Texture Reconstruction from Single-Image Stylized Avatars
- Test-Time Iterative Error Correction for Efficient Diffusion Models
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
- MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- OSMGen: Highly Controllable Satellite Image Synthesis using OpenStreetMap Data
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
- FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- Instruction-based image editing: a survey on data, models, evaluation, and applications
- RadEdit: Stress-Testing Biomedical Vision Models via Diffusion Image Editing
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- Diffusion Models in Vision: A Survey
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch Generation
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- Compositional Image Synthesis with Inference-Time Scaling
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- WorldGrow: Generating Infinite 3D World
- Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
- Enhancing Video Inpainting with Aligned Frame Interval Guidance
- Bridging the gap to real-world language-grounded visual concept learning
- LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal
- EditInfinity: Image Editing with Binary-Quantized Generative Models
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- Guiding diffusion models to reconstruct flow fields from sparse data
- Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis
- Personalized Image Filter: Mastering Your Photographic Style
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- Latent Diffusion Model without Variational Autoencoder
- ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Learning an Image Editing Model without Image Editing Pairs
- Nonparametric Data Attribution for Diffusion Models
- Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation
- NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
- Salient Concept-Aware Generative Data Augmentation
- Adaptive Visual Conditioning for Semantic Consistency in Diffusion-Based Story Continuation
- NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models
- T(R,O) Grasp: Efficient Graph Diffusion of Robot-Object Spatial Transformation for Cross-Embodiment Dexterous Grasping
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- Zero-shot Face Editing via ID-Attribute Decoupled Inversion
- DreamMakeup: Face Makeup Customization using Latent Diffusion Models
- FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- ReMix: Towards a Unified View of Consistent Character Generation and Editing
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
- SkipSR: Faster Super Resolution with Token Skipping
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- Towards Better Optimization For Listwise Preference in Diffusion Models
- Three Forms of Stochastic Injection for Improved Distribution-to-Distribution Generative Modeling
- Conditional Denoising Diffusion Model-Based Robust MR Image Reconstruction from Highly Undersampled Data
- Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion
- C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- Prompt-to-Prompt: Text-Based Image Editing Via Cross-Attention Mechanisms -- The Research of Hyperparameters and Novel Mechanisms to Enhance Existing Frameworks
- Generating Human Motion Videos using a Cascaded Text-to-Video Framework
- Contrastive-SDE: Guiding Stochastic Differential Equations with Contrastive Learning for Unpaired Image-to-Image Translation
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- GaussEdit: Adaptive 3D Scene Editing with Text and Image Prompts
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- CharGen: Fast and Fluent Portrait Modification
- Semantic Editing with Coupled Stochastic Differential Equations
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- Explanation-Driven Counterfactual Testing for Faithfulness in Vision-Language Model Explanations
- ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Taming Flow-based I2V Models for Creative Video Editing
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- ReviewScore: Misinformed Peer Review Detection with Large Language Models
- Does FLUX Already Know How to Perform Physically Plausible Image Composition?
- Latent Activation Editing: Inference-Time Refinement of Learned Policies for Safer Multirobot Navigation
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
- ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion
- Virtual Consistency for Audio Editing
- Similarity-Guided Diffusion for Long-Gap Music Inpainting
- Image Tokenizer Needs Post-Training
- IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
- Styleclone: Face Stylization with Diffusion Based Data Augmentation
- LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- InJecteD: Analyzing Trajectories and Drift Dynamics in Denoising Diffusion Probabilistic Models for 2D Point Cloud Generation
- Painting the market: generative diffusion models for financial limit order book simulation and forecasting
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- SEEDS: Exponential SDE Solvers for Fast High-Quality Sampling from Diffusion Models
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- MedShift: Implicit Conditional Transport for X-Ray Domain Adaptation
- First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge
- Dress&Dance: Dress up and Dance as You Like It - Technical Preview
- Audio-Guided Visual Editing with Complex Multi-Modal Prompts
- Discrete-Guided Diffusion for Scalable and Safe Multi-Robot Motion Planning
- Articulate3D: Zero-Shot Text-Driven 3D Object Posing
- MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
- InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing
- OmniTry: Virtual Try-On Anything without Masks
- Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping
- StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
- AtomDiffuser: Time-Aware Degradation Modeling for Drift and Beam Damage in STEM Imaging
- MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
- UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- The Promise of RL for Autoregressive Image Editing
- LeakyCLIP: Extracting Training Data from CLIP
- TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- APT: Improving Diffusion Models for High Resolution Image Generation with Adaptive Path Tracing
- GuidPaint: Class-Guided Image Inpainting with Diffusion Models
- Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training
- GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
- CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers
- Local Prompt Adaptation for Style-Consistent Multi-Object Generation in Diffusion Models
- BokehDiff: Neural Lens Blur with One-Step Diffusion
- StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation
- Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving
- Qwen-Image-Flash: Beyond Objective Design
- Moodifier: MLLM-Enhanced Emotion-Driven Image Editing
- Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models
- CNS-Bench: Benchmarking Image Classifier Robustness Under Continuous Nuisance Shifts
- Efficient Burst Super-Resolution with One-step Diffusion
- An h-space Based Adversarial Attack for Protection Against Few-shot Personalization
- Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis
- RODS: Robust Optimization Inspired Diffusion Sampling for Detecting and Reducing Hallucination in Generative Models
- DLSF: Dual-Layer Synergistic Fusion for High-Fidelity Image Syn-thesis
- Do Concept Replacement Techniques Really Erase Unacceptable Concepts?
- MFGDiffusion: Mask-Guided Smoke Synthesis for Enhanced Forest Fire Detection
- Product of Experts for Visual Generation
- Minimizing the Pretraining Gap: Domain-aligned Text-Based Person Retrieval
- Dimensions of Vulnerability in Visual Working Memory: An AI-Driven Approach to Perceptual Comparison
- From Wardrobe to Canvas: Wardrobe Polyptych LoRA for Part-level Controllable Human Image Generation
- prNet: Data-Driven Phase Retrieval via Stochastic Refinement
- Divergence Minimization Preference Optimization for Diffusion Model Alignment
- ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation
- LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
- Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing
- Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
- S2Edit: Text-Guided Image Editing with Precise Semantic and Spatial Control
- Neural-Driven Image Editing
- DiffEdit: Diffusion-based semantic image editing with mask guidance
- SecureT2I: No More Unauthorized Manipulation on AI Generated Images from Prompts
- StreamDiT: Real-Time Streaming Text-to-Video Generation
- FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting
- RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
- PosDiffAE: Position-aware Diffusion Auto-encoder For High-Resolution Brain Tissue Classification Incorporating Artifact Restoration
- Understanding Trade offs When Conditioning Synthetic Data
- FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion Model
- TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking
- ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation
- DiffusionLight-Turbo: Accelerated Light Probes for Free via Single-Pass Chrome Ball Inpainting
- Guided Unconditional and Conditional Generative Models for Super-Resolution and Inference of Quasi-Geostrophic Turbulence
- Subjective Camera 1.0: Bridging Human Cognition and Visual Reconstruction through Sequence-Aware Sketch-Guided Diffusion
- CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation
- PixelBoost: Leveraging Brownian Motion for Realistic-Image Super-Resolution
- Score-based Diffusion Model for Unpaired Virtual Histology Staining
- Diffusion Counterfactual Generation with Semantic Abduction
- Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy
- Unfolding Generative Flows with Koopman Operators: Fast and Interpretable Sampling
- 3D-Telepathy: Reconstructing 3D Objects from EEG Signals
- DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing
- DemoDiffusion: One-Shot Human Imitation using pre-trained Diffusion Policy
- Towards Efficient Exemplar Based Image Editing with Multimodal VLMs
- Robust Robotic Exploration and Mapping Using Generative Occupancy Map Synthesis
- SoK: Can Synthetic Images Replace Real Data? A Survey of Utility and Privacy of Synthetic Image Generation
- SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution
- SceneCrafter: Controllable Multi-View Driving Scene Editing
- Style Transfer: A Decade Survey
- R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation
- RDPO: Real Data Preference Optimization for Physics Consistency Video Generation
- VisualChef: Generating Visual Aids in Cooking via Mask Inpainting
- CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing
- AI's Blind Spots: Geographic Knowledge and Diversity Deficit in Generated Urban Scenario
- Fast Training-free Perceptual Image Compression
- PairEdit: Learning Semantic Variations for Exemplar-based Image Editing
- Difference Inversion: Interpolate and Isolate the Difference with Token Consistency for Image Analogy Generation
- ImmerseGen: Agent-Guided Immersive World Generation with Alpha-Textured Proxies
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- VideoPDE: Unified Generative PDE Solving via Video Inpainting Diffusion Models
- Face Aging via Diffusion-based Editing
- Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts
- Fusion of multi-source precipitation records via coordinate-based generative model
- Abstract Sound Fusion with Unconditional Inversion Models
- TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation
- Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
- Antithetic Noise in Diffusion Models
- FontAdapter: Instant Font Adaptation in Visual Text Generation
- FADE: Frequency-Aware Diffusion Model Factorization for Video Editing
- Follow-Your-Creation: Empowering 4D Creation through Video Inpainting
- FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing
- Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
- Supporting renewable energy planning and operation with data-driven high-resolution ensemble weather forecast
- SSIMBaD: Sigma Scaling with SSIM-Guided Balanced Diffusion for AnimeFace Colorization
- Is Perturbation-Based Image Protection Disruptive to Image Editing?
- Negative-Guided Subject Fidelity Optimization for Zero-Shot Subject-Driven Generation
- DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
- RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
- LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
- Native-Resolution Image Synthesis
- Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
- DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing
- ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions
- One-Step Diffusion-based Real-World Image Super-Resolution with Visual Perception Distillation
- RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers
- IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
- Minimal Impact ControlNet: Advancing Multi-ControlNet Integration
- ADEPT: Adaptive Diffusion Environment for Policy Transfer Sim-to-Real
- DiffuseSlide: Training-Free High Frame Rate Video Generation Diffusion
- Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection
- Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models
- Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis
- On Designing Diffusion Autoencoders for Efficient Generation and Representation Learning
- AdaHuman: Animatable Detailed 3D Human Generation with Compositional Multiview Diffusion
- RealDrive: Retrieval-Augmented Driving with Diffusion Models
- ComposeAnything: Composite Object Priors for Text-to-Image Generation
- STORK: Faster Diffusion And Flow Matching Sampling By Resolving Both Stiffness And Structure-Dependence
- LayerPeeler: Autoregressive Peeling for Layer-wise Image Vectorization
- Optimization-Free Diffusion Model -- A Perturbation Theory Approach
- Precise Object and Effect Removal with Adaptive Target-Aware Attention
- SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
- CoDA: Coordinated Diffusion Noise Optimization for Whole-Body Manipulation of Articulated Objects
- Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning
- WeatherEdit: Controllable Weather Editing with 4D Gaussian Field
- MUSAR: Exploring Multi-Subject Customization from Single-Subject Dataset via Attention Routing
- Affective Image Editing: Shaping Emotional Factors via Text Descriptions
- OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
- WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions
- Generative Data Augmentation for Object Point Cloud Segmentation
- SeaLion: Semantic Part-Aware Latent Point Diffusion Models for 3D Generation
- Creatively Upscaling Images with Global-Regional Priors
- FlashBack: Consistency Model-Accelerated Shared Autonomy
- Training-Free Efficient Video Generation via Dynamic Token Carving
- Forward-only Diffusion Probabilistic Models
- Erased or Dormant? Rethinking Concept Erasure Through Reversibility
- CDST: Color Disentangled Style Transfer for Universal Style Reference Customization
- PolyMicros: Bootstrapping a Foundation Model for Polycrystalline Material Structure
- My Face Is Mine, Not Yours: Facial Protection Against Diffusion Model Face Swapping
- Anti-Inpainting: A Proactive Defense Approach against Malicious Diffusion-based Inpainters under Unknown Conditions
- DragLoRA: Online Optimization of LoRA Adapters for Drag-based Image Editing in Diffusion Model
- SGD-Mix: Enhancing Domain-Specific Image Classification with Label-Preserving Data Augmentation
- Self-NPO: Data-Free Diffusion Model Enhancement via Truncated Diffusion Fine-Tuning
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport
- Unpaired Downscaling of Fluid Flows with Diffusion Bridges
- Image-Space Rule Discovery
- NeuSEditor: From Multi-View Images to Text-Guided Neural Surface Edits
- One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework
- Don't Forget your Inverse DDIM for Image Editing
- Few-Shot Anomaly-Driven Generation for Anomaly Classification and Segmentation
- Improving Data Fidelity via Diffusion Model-based Correction and Super-Resolution
- Improving Physical Object State Representation in Text-to-Image Generative Systems
- Distilling Two-Timed Flow Models by Separately Matching Initial and Terminal Velocities
- Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews
- Towards Scalable Human-aligned Benchmark for Text-guided Image Editing
- Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks
- Feynman Kac Reweighted Schrödinger Bridge Matching for Surface-Based Tau PET Harmonization
- Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge
- PixelSmile: Toward Fine-Grained Facial Expression Editing
- In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
- Creating Your Editable 3D Photorealistic Avatar with Tetrahedron-constrained Gaussian Splatting
- Robot Motion Planning using One-Step Diffusion with Noise-Optimized Approximate Motions
- DanceOPD: On-Policy Generative Field Distillation
- RewardFlow: Generate Images by Optimizing What You Reward
- Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
- REED-VAE: RE-Encode Decode Training for Iterative Image Editing with Diffusion Models
- DiffMI: Breaking Face Recognition Privacy via Diffusion-Driven Training-Free Model Inversion
- Spectral Collapse in Diffusion Inversion
- DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
- RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing
- FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis
- We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback
- TRACE: Textual Relevance Augmentation and Contextual Encoding for Multimodal Hate Detection
- Text-to-Image Alignment in Denoising-Based Models through Step Selection
- Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection
- DreamO: A Unified Framework for Image Customization
- PRISM: Probabilistic Representation for Integrated Shape Modeling and Generation
- Structure-Preserving Zero-Shot Image Editing via Stage-Wise Latent Injection in Diffusion Models
- FaceCraft4D: Animated 3D Facial Avatar Generation from a Single Image
- Beyond One-Hot Labels: Semantic Mixing for Model Calibration
- Image Editing with Diffusion Models: A Survey
- ARAP-GS: Drag-driven As-Rigid-As-Possible 3D Gaussian Splatting Editing with Diffusion Prior
- SemDiff: Generating Natural Unrestricted Adversarial Examples via Semantic Attributes Optimization in Diffusion Models
- Embedding Hidden Adversarial Capabilities in Pre-Trained Diffusion Models
- RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos
- Autoregressive Distillation of Diffusion Transformers
- IlluSign: Illustrating Sign Language Videos by Leveraging the Attention Mechanism
- Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
- Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model
- VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
- POEM: Precise Object-level Editing via MLLM control
- PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
- Diffusion-based Models for Unpaired Super-resolution in Fluid Dynamics
- Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
- Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
- How I Warped Your Noise: a Temporally-Correlated Noise Prior for Diffusion Models
- RoSMM: A Robust and Secure Multi-Modal Watermarking Framework for Diffusion Models
- Stable Diffusion [wikipedia]
Discussions
Related