Classifier-Free Diffusion Guidance
2022/07/26 by Jonathan Ho, Tim Salimans, Ho, Jonathan +1 · 798 citations
Physics and Astronomy · Computer Science · #Model Reduction and Neural Networks #Generative Adversarial Networks and Image Synthesis
paper · pdf · doi:10.48550/arxiv.2207.12598
Abstract
Classifier guidance is a recently introduced method to trade off mode coverage and sample fidelity in conditional diffusion models post training, in the same spirit as low temperature sampling or truncation in other types of generative models. Classifier guidance combines the score estimate of a diffusion model with the gradient of an image classifier and thereby requires training an image classifier separate from the diffusion model. It also raises the question of whether guidance can be performed without a classifier. We show that guidance can be indeed performed by a pure generative model without such a classifier: in what we call classifier-free guidance, we jointly train a conditional and an unconditional diffusion model, and we combine the resulting conditional and unconditional score estimates to attain a trade-off between sample quality and diversity similar to that obtained using classifier guidance.
Cited by
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- Accelerated Multi-Modal Motion Planning Using Context-Conditioned Diffusion Models
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
- Distribution Matching Variational AutoEncoder
- Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control
- Memorization in 3D Shape Generation: An Empirical Study
- Anomaly Detection by Effectively Leveraging Synthetic Images
- Reverse Personalization
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- Long-Range Distillation: Distilling 10,000 Years of Simulated Climate into Long Timestep AI Weather Models
- Visual Autoregressive Modelling for Monocular Depth Estimation
- Energy-Guided Flow Matching Enables Few-Step Conformer Generation and Ground-State Identification
- ViDS: Video Diffusion Shader using 3D Face Tracking
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- Joint Flow Matching for Generator-Consistent Classification
- BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion
- Generative Modeling by Value-Driven Transport
- To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion
- Learning Sampling Parameters for Diffusion Models
- MobileWan: Closing the Quality Gap for Mobile Video Diffusion
- Normalizing Trajectory Models
- UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
- Catalyst Diffusion Transformer: Generative Inverse Design of Heterogeneous Catalysts
- CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion
- Wrong Design Intent Is Worse Than None: A Derangement-Control Diagnosis of Header Conditioning in CAD Program Completion
- Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors
- NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
- G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees
- Fast Navigation Through Occluded Spaces via Language-Conditioned Map Prediction
- ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
- STLDM: Spatio-Temporal Latent Diffusion Model for Precipitation Nowcasting
- FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
- MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
- How I Met Your Bias: Investigating Bias Amplification in Diffusion Models
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
- Learning to Refocus with Video Diffusion Models
- Generating the Past, Present and Future from a Motion-Blurred Image
- Over++: Generative Video Compositing for Layer Interaction Effects
- Efficient Personalization of Generative Models via Optimal Experimental Design
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- Decoupled Generative Modeling for Human-Object Interaction Synthesis
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- Is Your Conditional Diffusion Model Actually Denoising?
- Generating Risky Samples with Conformity Constraints via Diffusion Models
- Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
- Loom: Diffusion-Transformer for Interleaved Generation
- CrystalFormer-CSP: Thinking Fast and Slow for Crystal Structure Prediction
- MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
- InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- MatLat: Material Latent Space for PBR Texture Generation
- Disentangled representations via score-based variational autoencoders
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- InfoDCL: Informative Noise Enhanced Diffusion Based Contrastive Learning
- FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
- EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation
- Learning High-Quality Initial Noise for Single-View Synthesis with Diffusion Models
- Large Video Planner Enables Generalizable Robot Control
- Stylized Synthetic Augmentation further improves Corruption Robustness
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- BLANKET: Anonymizing Faces in Infant Video Recordings
- DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations
- Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting
- HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens
- EMFusion: Uncertainty-Aware Conditional Diffusion Model for Multivariate Narrow-band Exposure Forecasting
- Spherical Leech Quantization for Visual Tokenization and Generation
- V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- Quality-Driven and Diversity-Aware Sample Expansion for Robust Marine Obstacle Segmentation
- Feedforward 3D Editing via Text-Steerable Image-to-3D
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- What Happens Next? Next Scene Prediction with a Unified Video Model
- Pattern-Guided Diffusion Models
- MineTheGap: Automatic Mining of Biases in Text-to-Image Models
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
- Exploring the Design Space of Transition Matching
- MolGuidance: Advanced Guidance Strategies for Conditional Molecular Generation with Flow Matching
- Animus3D: Text-driven 3D Animation via Motion Score Distillation
- Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- Referring Change Detection in Remote Sensing Imagery
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Flowception: Temporally Expansive Flow Matching for Video Generation
- PersonaLive! Expressive Portrait Image Animation for Live Streaming
- Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation
- AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path
- AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Bidirectional Normalizing Flow: From Data to Noise and Back
- DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance
- Multi-dimensional Preference Alignment by Conditioning Reward Itself
- DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance
- Membership and Dataset Inference Attacks on Large Audio Generative Models
- FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
- Food Image Generation on Multi-Noun Categories
- Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
- Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- Training-free Clothing Region of Interest Self-correction for Virtual Try-On
- ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points
- JoPano: Unified Panorama Generation via Joint Modeling
- UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- Scaling Zero-Shot Reference-to-Video Generation
- A Comparative Study on Synthetic Facial Data Generation Techniques for Face Recognition
- SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
- Bring Your Dreams to Life: Continual Text-to-Video Customization
- Generative design of stabilizing controllers with diffusion models: the Youla approach
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- LaFiTe: A Generative Latent Field for 3D Native Texturing
- M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
- DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
- Data-regularized Reinforcement Learning for Diffusion Models at Scale
- Inference-time Stochastic Refinement of GRU-Normalizing Flow for Real-time Video Motion Transfer
- CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
- SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows
- Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
- Towards Irreversible Machine Unlearning for Diffusion Models
- EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
- Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
- Unlocking hidden biomolecular conformational landscapes in diffusion models at inference time
- MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra
- TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution
- Iterative Tilting for Diffusion Fine-Tuning
- Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
- Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
- Generative Video Motion Editing with 3D Point Tracks
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- GRASP: Guided Residual Adapters with Sample-wise Partitioning
- Diffusion Model in Latent Space for Medical Image Segmentation Task
- DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling
- LAP: Fast LAtent Diffusion Planner for Autonomous Driving
- Digital Surfactant
- Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models
- AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
- GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence
- Fast Multi-view Consistent 3D Editing with Video Priors
- Masked Diffusion for Generative Recommendation
- Guiding Visual Autoregressive Models through Spectrum Weakening
- CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
- Overcoming the Curvature Bottleneck in MeanFlow
- InstanceV: Instance-Level Video Generation
- CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Generative models for crystalline materials
- Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
- Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration
- Adversarial Flow Models
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- The Collapse of Patches
- Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models
- IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- MeanFlow Transformers with Representation Autoencoders
- Infinite-Story: A Training-Free Consistent Text-to-Image Generation
- 3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion
- Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
- BRIC: Bridging Kinematic Plans and Physical Control at Test Time
- PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images
- SONIC: Spectral Optimization of Noise for Inpainting with Consistency
- ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
- Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
- Terminal Velocity Matching
- Flow Map Distillation Without Data
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- EnfoPath: Energy-Informed Analysis of Generative Trajectories in Flow Matching
- A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- DiP: Taming Diffusion Models in Pixel Space
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
- LATTICE: Democratize High-Fidelity 3D Generation at Scale
- When and What to Recommend: Joint Modeling of Timing and Content for Active Sequential Recommendation
- Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation
- Masked Diffusion Models are Secretly Learned-Order Autoregressive Models
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
- GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- CoD: A Diffusion Foundation Model for Image Compression
- Zero-Shot Video Deraining with Video Diffusion Models
- SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
- TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- Score-Regularized Joint Sampling with Importance Weights for Flow Matching
- Spanning Tree Autoregressive Visual Generation
- Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation
- Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
- TFCDiff: Robust ECG Denoising via Time-Frequency Complementary Diffusion
- Decoupling Complexity from Scale in Latent Diffusion Model
- NaTex: Seamless Texture Generation as Latent Color Diffusion
- PairHuman: A High-Fidelity Photographic Dataset for Customized Dual-Person Generation
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- CFG-EC: Error Correction Classifier-Free Guidance
- Coffee: Controllable Diffusion Fine-tuning
- MRIQT: Physics-Aware Diffusion Model for Image Quality Transfer in Neonatal Ultra-Low-Field MRI
- CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model
- Example-Based Feature Painting on Textures
- Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI Reconstruction via ROI Encoder and visuAl Mapping
- Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image
- Model Inversion Attack Against Deep Hashing
- GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- SP-Guard: Selective Prompt-adaptive Guidance for Safe Text-to-Image Generation
- Controllable protein design through Feynman-Kac steering
- Expanding the Content-Style Frontier: a Balanced Subspace Blending Approach for Content-Style LoRA Fusion
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
- HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition
- Top2Ground: A Height-Aware Dual Conditioning Diffusion Model for Robust Aerial-to-Ground View Generation
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- SYNAPSE: Synergizing an Adapter and Finetuning for High-Fidelity EEG Synthesis from a CLIP-Aligned Encoder
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?
- Conditional Diffusion as Latent Constraints for Controllable Symbolic Music Generation
- Guiding Generative Models to Uncover Diverse and Novel Crystals via Reinforcement Learning
- A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models
- MALeR: Improving Compositional Fidelity in Layout-Guided Generation
- Neodragon: Mobile Video Generation using Diffusion Transformer
- Joint Design of Protein Surface and Structure Using a Diffusion Bridge Model
- Enhancing Diffusion Model Guidance through Calibration and Regularization
- SAD-Flower: Flow Matching for Safe, Admissible, and Dynamically Consistent Planning
- Reasoning on Time-Series for Financial Technical Analysis
- Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidance
- CPO: Condition Preference Optimization for Controllable Image Generation
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
- MoSa: Motion Generation with Scalable Autoregressive Modeling
- Text to Sketch Generation with Multi-Styles
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- Prompt-Based Safety Guidance Is Ineffective for Unlearned Text-to-Image Diffusion Models
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- SyMuPe: Affective and Controllable Symbolic Music Performance
- UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
- Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models
- A Conditional Diffusion Model for Building Energy Modeling Workflows
- A New Perspective on Precision and Recall for Generative Models
- Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
- Effective Test-Time Scaling of Discrete Diffusion through Iterative Refinement
- XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges
- Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
- Occlusion-Aware Diffusion Model for Pedestrian Intention Prediction
- Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities
- Enhancing Frequency Forgery Clues for Diffusion-Generated Image Detection
- Diffusion Models at the Drug Discovery Frontier: A Review on Generating Small Molecules versus Therapeutic Peptides
- SEE4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting
- Dynamic VLM-Guided Negative Prompting for Diffusion Models
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- RegionE: Adaptive Region-Aware Generation for Efficient Image Editing
- Echo-Conditioned Denoising Diffusion Probabilistic Models for Multi-Target Tracking in RF Sensing
- Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models
- ROGR: Relightable 3D Objects using Generative Relighting
- A Priori Sampling of Transition States with Guided Diffusion
- How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer
- High-Resolution Image Synthesis with Latent Diffusion Models
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation
- Surflo: Consistent 3D Surface Flow Model with Global State
- HRM-Text: Efficient Pretraining Beyond Scaling
- AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
- Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
- Diffusion Models in Vision: A Survey
- Differentiable Normative Guidance for Nash Bargaining Solution Recovery
- Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
- Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
- Generative Modeling via Drifting
- Distance Marching for Generative Modeling
- Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch Generation
- 'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
- LRT-Diffusion: Calibrated Risk-Aware Guidance for Diffusion Policies
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- Generative View Stitching
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Group Relative Attention Guidance for Image Editing
- Time-Embedded Algorithm Unrolling for Computational MRI
- UtilGen: Utility-Centric Generative Data Augmentation with Dual-Level Task Adaptation
- GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
- MC-SJD : Maximal Coupling Speculative Jacobi Decoding for Autoregressive Visual Generation Acceleration
- Compositional Image Synthesis with Inference-Time Scaling
- Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
- Neural USD: An object-centric framework for iterative editing and control
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- TRELLISWorld: Training-Free World Generation from Object Generators
- Model-free filtering in high dimensions via projection and score-based diffusions
- A Novel Framework for Multi-Modal Protein Representation Learning
- Autoregressive Styled Text Image Generation, but Make it Reliable
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- Simple Denoising Diffusion Language Models
- Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner
- Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- Optimize Any Topology: A Foundation Model for Shape- and Resolution-Free Structural Topology Optimization
- DDTR: Diffusion Denoising Trace Recovery
- ACG: Action Coherence Guidance for Flow-based VLA models
- Efficient Utility-Preserving Machine Unlearning with Implicit Gradient Surgery
- Mitigating Coordinate Prediction Bias from Positional Encoding Failures
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing
- StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks
- Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
- BADiff: Bandwidth Adaptive Diffusion Model
- Compositional Monte Carlo Tree Diffusion for Extendable Planning
- Improved Training Technique for Shortcut Models
- Noise is All You Need: Solving Linear Inverse Problems by Noise Combination Sampling with Diffusion Models
- QSilk: Micrograin Stabilization and Adaptive Quantile Clipping for Detail-Friendly Latent Diffusion
- Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- A Contact-Driven Framework for Manipulating in the Blind
- AlphaFlow: Understanding and Improving MeanFlow Models
- Seed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assets
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- A Cross-Environment and Cross-Embodiment Path Planning Framework via a Conditional Diffusion Model
- Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
- Latent-Augmented Discrete Diffusion Models
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- L2P: Unlocking Latent Potential for Pixel Generation
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
- In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models
- HumanCM: One Step Human Motion Prediction
- H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Spatial Computing Communications for Multi-User Virtual Reality in Distributed Mobile Edge Computing Network
- Salient Concept-Aware Generative Data Augmentation
- TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
- CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
- VIST3A: Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- Ultra High-Resolution Image Inpainting with Patch-Based Content Consistency Adapter
- Counting Hallucinations in Diffusion Models
- End-to-End Multi-Modal Diffusion Mamba
- Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
- T(R,O) Grasp: Efficient Graph Diffusion of Robot-Object Spatial Transformation for Cross-Embodiment Dexterous Grasping
- LayerSync: Self-aligning Intermediate Layers
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Scene Coordinate Reconstruction Priors
- Controlling Intent Expressiveness in Robot Motion with Diffusion Models
- A Gradient Guided Diffusion Framework for Chance Constrained Programming
- Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
- Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
- Diffusion Transformers with Representation Autoencoders
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation
- MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars
- UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- Pre to Post-Treatment Glioblastoma MRI Prediction using a Latent Diffusion Model
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
- DiffStyleTS: Diffusion Model for Style Transfer in Time Series
- Zero-shot Face Editing via ID-Attribute Decoupled Inversion
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- Discrete State Diffusion Models: A Sample Complexity Perspective
- Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- VLM-Guided Adaptive Negative Prompting for Creative Generation
- SoundReactor: Frame-level Online Video-to-Audio Generation
- Knowledge-Decoupled Functionally Invariant Path with Synthetic Personal Data for Personalized ASR
- Hierarchical Bayesian Flow Networks for Molecular Graph Generation
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Calibrating Generative Models
- Asymmetric Flow Models
- How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
- Enhancing Diffusion Policy with Classifier-Free Guidance for Temporal Robotic Tasks
- Domain Knowledge Infused Conditional Generative Models for Accelerating Drug Discovery
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- RadioFlow: Efficient Radio Map Construction Framework with Flow Matching
- Conditional Flow Matching for Bayesian Posterior Inference
- UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction
- X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering
- SummDiff: Generative Modeling of Video Summarization with Diffusion
- Counterfactual Identifiability via Dynamic Optimal Transport
- SViM3D: Stable Video Material Diffusion for Single Image 3D Generation
- IntMeanFlow: Few-step Speech Generation with Integral Velocity Distillation
- FlowLensing: Simulating Gravitational Lensing with Flow Matching
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
- Rectified-CFG++ for Flow Based Models
- Attribution-by-design: Ensuring Inference-Time Provenance in Generative Music Systems
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers
- WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
- Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report
- Diffusing Trajectory Optimization Problems for Recovery During Multi-Finger Manipulation
- No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual Prompts
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers
- Heptapod: Language Modeling on Visual Signals
- scPPDM: A Diffusion Model for Single-Cell Drug-Response Prediction
- Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
- Limited-Angle Tomography Reconstruction via Projector Guided 3D Diffusion
- Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation
- Local MAP Sampling for Diffusion Models
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion
- ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement
- SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator
- TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
- Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- Pulp Motion: Framing-aware multimodal camera and human motion generation
- Mitigating Diffusion Model Hallucinations with Dynamic Guidance
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation
- Bridging Text and Video Generation: A Survey
- UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- Learning Robust Diffusion Models from Imprecise Supervision
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models
- Constrained Diffusion for Protein Design with Hard Structural Constraints
- SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model
- UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching
- Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
- Learn to Guide Your Diffusion Model
- Diffusion Alignment as Variational Expectation-Maximization
- Selective Underfitting in Diffusion Models
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- MOLM: Mixture of LoRA Markers
- Video Object Segmentation-Aware Audio Generation
- Contrastive Diffusion Guidance for Spatial Inverse Problems
- 3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation
- IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
- EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Fading to Grow: Growing Preference Ratios via Preference Fading Discrete Diffusion for Recommendation
- VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing
- CO3: Contrasting Concepts Compose Better
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- ART-VITON: Measurement-Guided Latent Diffusion for Artifact-Free Virtual Try-On
- LieHMR: Autoregressive Human Mesh Recovery with SO(3) Diffusion
- How Diffusion Models Memorize
- Swift: An Autoregressive Consistency Model for Efficient Weather Forecasting
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- MoReFlow: Motion Retargeting Learning through Unsupervised Flow Matching
- Flow Matching with Semidiscrete Couplings
- One-shot Conditional Sampling: MMD meets Nearest Neighbors
- Guided Diffusion for the Discovery of New Superconductors
- Score Distillation of Flow Matching Models
- Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
- SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution
- When Scores Learn Geometry: Rate Separations under the Manifold Hypothesis
- ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation
- Assessing the risk of future Dunkelflaute events for Germany using generative deep learning
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- SAIP: A Plug-and-Play Scale-adaptive Module in Diffusion-based Inverse Problems
- CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers
- NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis
- Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
- SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions
- FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation
- MAD: Manifold Attracted Diffusion
- TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- I need husband: AI beauty standards, fascism and the proliferation of bot driven content
- Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
- SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
- UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- MoReact: Generating Reactive Motion from Textual Descriptions
- GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning
- HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
- AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
- DA-MMP: Learning Coordinated and Accurate Throwing with Dynamics-Aware Motion Manifold Primitives
- CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement
- BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
- Generative Modeling of Shape-Dependent Self-Contact Human Poses
- Landing with the Score: Riemannian Optimization through Denoising
- CREPE: Controlling Diffusion with Replica Exchange
- Stochastic Interpolants via Conditional Dependent Coupling
- Sensitivity Analysis for Diffusion Models
- Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
- Rethinking Inter-LoRA Orthogonality in Adapter Merging: Insights from Orthogonal Monte Carlo Dropout
- Scale-Wise VAR is Secretly Discrete Diffusion
- Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance
- JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation
- Decoding quantum low density parity check codes with diffusion
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- DHAGrasp: Synthesizing Affordance-Aware Dual-Hand Grasps with Text Instructions
- Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
- Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models
- Universal Multi-Domain Translation via Diffusion Routers
- Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning
- FlowDrive: moderated flow matching with data balancing for trajectory planning
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- Memory Self-Regeneration: Uncovering Hidden Knowledge in Unlearned Models
- DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models
- Guiding Audio Editing with Audio Language Model
- No Alignment Needed for Generation: Learning Linearly Separable Representations in Diffusion Models
- Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
- DistillKac: Few-Step Image Generation via Damped Wave Equations
- DyME: Dynamic Multi-Concept Erasure in Diffusion Models with Bi-Level Orthogonal LoRA Adaptation
- SPREAD: Sampling-based Pareto front Refinement via Efficient Adaptive Diffusion
- Prompt-aware classifier free guidance for diffusion models
- AIBA: Attention-based Instrument Band Alignment for Text-to-Audio Diffusion
- Causal Time Series Generation via Diffusion Models
- Actor-Critic without Actor
- SAGE:State-Aware Guided End-to-End Policy for Multi-Stage Sequential Tasks via Hidden Markov Decision Process
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
- Selective Classifier-free Guidance for Zero-shot Text-to-speech
- MMG: Mutual Information Estimation via the MMSE Gap in Diffusion
- PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
- RFMSR: Residual Flow Matching for Image Super-Resolution
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- ELF: Embedded Language Flows
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- Training Flow Matching Models with Reliable Labels via Self-Purification
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- StereoFoley: Object-Aware Stereo Audio Generation from Video
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
- ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
- Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling
- DiffQ: Unified Parameter Initialization for Variational Quantum Algorithms via Diffusion Models
- OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
- Ambiguous Medical Image Segmentation Using Diffusion Schrödinger Bridge
- MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances
- Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
- HOGraspFlow: Exploring Vision-based Generative Grasp Synthesis with Hand-Object Priors and Taxonomy Awareness
- Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
- A Mutil-conditional Diffusion Transformer for Versatile Seismic Wave Generation
- DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
- Animalbooth: multimodal feature enhancement for animal subject personalization
- Enhancing Reference-based Sketch Colorization via Separating Reference Representations
- A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
- DoubleGen: Debiased Generative Modeling of Counterfactuals
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Blind-Spot Guided Diffusion for Self-supervised Real-World Denoising
- Sampling String Vacua Using Generative Models
- Dynamic Classifier-Free Diffusion Guidance via Online Feedback
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- DiffusionNFT: Online Diffusion Reinforcement with Forward Process
- ROOT: Rethinking Offline Optimization as Distributional Translation via Probabilistic Bridge
- Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
- The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- Kuramoto Orientation Diffusion Models
- Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
- WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance
- Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
- MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis
- Radiology Report Conditional 3D CT Generation with Multi Encoder Latent diffusion Model
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
- <i>De novo</i> Design of All-atom Biomolecular Interactions with RFdiffusion3
- Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior
- Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures
- AnyAccomp: Generalizable Accompaniment Generation via Quantized Melodic Bottleneck
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- Inverse Design of Amorphous Materials with Targeted Properties
- DiCache: Let Diffusion Model Determine Its Own Cache
- SpeechOp: Inference-Time Task Composition for Generative Speech Processing
- Behavior Foundation Model for Humanoid Robots
- Cross-Distribution Diffusion Priors-Driven Iterative Reconstruction for Sparse-View CT
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- Optimization for Massive 3D-RIS Deployment: A Generative Diffusion Model-Based Approach
- DRAG: Data Reconstruction Attack using Guided Diffusion
- A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models
- Inference-stage Adaptation-projection Strategy Adapts Diffusion Policy to Cross-manipulators Scenarios
- PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models
- Dual Orthogonal Guidance for Robust Diffusion-based Handwritten Text Generation
- Mechanistic Learning with Guided Diffusion Models to Predict Spatio-Temporal Brain Tumor Growth
- Composable Score-based Graph Diffusion Model for Multi-Conditional Molecular Generation
- Integrating Anatomical Priors into a Causal Diffusion Model
- Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling
- Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
- Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
- ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
- Feature Space Analysis by Guided Diffusion Model
- Universal Few-Shot Spatial Control for Diffusion Models
- Reconstruction Alignment Improves Unified Multimodal Models
- Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
- BIR-Adapter: A Low-Complexity Diffusion Model Adapter for Blind Image Restoration
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models
- Interleaving Reasoning for Better Text-to-Image Generation
- Continuous Audio Language Models
- Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction
- Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- Imagining Alternatives: Towards High-Resolution 3D Counterfactual Medical Image Generation via Language Guidance
- SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
- SemSteDiff: Generative Diffusion Model-based Coverless Semantic Steganography Communication
- Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
- Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner
- DCDB: Dynamic Conditional Dual Diffusion Bridge for Ill-posed Multi-Tasks
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- TeRA: Rethinking Text-guided Realistic 3D Avatar Generation
- VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
- Fidelity-preserving enhancement of ptychography with foundational text-to-image models
- Head-Related Transfer Function Individualization Using Anthropometric Features and Spatially Independent Latent Representation
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- Latent Space Single-Pixel Imaging Under Low-Sampling Conditions
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
- Neural Scene Designer: Self-Styled Semantic Image Manipulation
- Delta Rectified Flow Sampling for Text-to-Image Editing
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
- Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation
- NoiseCutMix: A Novel Data Augmentation Approach by Mixing Estimated Noise in Diffusion Models
- Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online
- Tree-Guided Diffusion Planner
- FLORA: Efficient Synthetic Data Generation for Object Detection in Low-Data Regimes via finetuning Flux LoRA
- EEGDM: Learning EEG Representation with Latent Diffusion Model
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Probability Density from Latent Diffusion Models for Out-of-Distribution Detection
- FastFit: Accelerating Multi-Reference Virtual Try-On via Cacheable Diffusion Models
- Towards 6G Intelligence: The Role of Generative AI in Future Wireless Networks
- MicroLad: 2D-to-3D Microstructure Reconstruction and Generation via Latent Diffusion and Score Distillation
- VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- Scaling Group Inference for Diverse and High-Quality Generation
- Source-Guided Flow Matching
- On the notion of missingness for path attribution explainability methods in medical settings: Guiding the selection of medically meaningful baselines
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- MoVieDrive: Multi-Modal Multi-View Urban Scene Video Generation
- FOCUS: Frequency-Optimized Conditioning of DiffUSion Models for mitigating catastrophic forgetting during Test-Time Adaptation
- Inference Time Debiasing Concepts in Diffusion Models
- Learning to See Through Flare
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- 4DNeX: Feed-Forward 4D Generative Modeling Made Easy
- EgoTwin: Dreaming Body and View in First Person
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- Generic Event Boundary Detection via Denoising Diffusion
- SPG: Style-Prompting Guidance for Style-Specific Content Creation
- LoRAtorio: An intrinsic approach to LoRA Skill Composition
- Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
- Probing the Representational Power of Sparse Autoencoders in Vision Models
- Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Increasing the Utility of Synthetic Images through Chamfer Guidance
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- Stable Diffusion Models are Secretly Good at Visual In-Context Learning
- Prototype-Guided Diffusion: Visual Conditioning without External Memory
- EEGDM: EEG Representation Learning via Generative Diffusion Model
- Non-asymptotic convergence bound of conditional diffusion models
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
- Semantic-Aware Reconstruction Error for Detecting AI-Generated Images
- ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
- Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
- Transient Noise Removal via Diffusion-based Speech Inpainting
- SafeFix: Targeted Model Repair via Controlled Image Generation
- DiffVolume: Diffusion Models for Volume Generation in Limit Order Books
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip
- CObL: Toward Zero-Shot Ordinal Layering without User Prompting
- Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
- LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- When and how can inexact generative models still sample from the data manifold?
- Comparison Reveals Commonality: Customized Image Generation through Contrastive Inversion
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
- Multimodal learning with next-token prediction for large multimodal models
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models
- Live Music Models
- One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion
- Turbulent Injection assisted by Diffusion Models for Scale Resolving Simulations
- Intention Enhanced Diffusion Model for Multimodal Pedestrian Trajectory Prediction
- OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
- Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
- SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
- RAAG: Ratio Aware Adaptive Guidance
- GL-LCM: Global-Local Latent Consistency Models for Fast High-Resolution Bone Suppression in Chest X-Ray Images
- Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
- Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems
- Diffusion Models with Adaptive Negative Sampling Without External Resources
- Inference-time Scaling for Diffusion-based Audio Super-resolution
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
- Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention
- Scoring ISAC: Benchmarking Integrated Sensing and Communications via Score-Based Generative Modeling
- Versatile Transition Generation with Image-to-Video Diffusion
- DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
- Diffusion Models for Future Networks and Communications: A Comprehensive Survey
- Semantically-Guided Inference for Conditional Diffusion Models: Enhancing Covariate Consistency in Time Series Forecasting
- Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation
- UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
- A Reward-Directed Diffusion Framework for Generative Design Optimization
- On-Device Diffusion Transformer Policy for Efficient Robot Manipulation
- Wukong Framework for Not Safe For Work Detection in Text-to-Image systems
- Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
- SDMatte: Grafting Diffusion Models for Interactive Matting
- IN2OUT: Fine-Tuning Video Inpainting Model for Video Outpainting Using Hierarchical Discriminator
- DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
- Steering Guidance for Personalized Text-to-Image Diffusion Models
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- Training-free Geometric Image Editing on Diffusion Models
- PixNerd: Pixel Neural Field Diffusion
- BS-1-to-N: Diffusion-Based Environment-Aware Cross-BS Channel Knowledge Map Generation for Cell-Free Networks
- X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- ShortFT: Diffusion Model Alignment via Shortcut-based Fine-Tuning
- Aleatoric Uncertainty Medical Image Segmentation Estimation via Flow Matching
- ZIUM: Zero-Shot Intent-Aware Adversarial Attack on Unlearned Models
- GuidPaint: Class-Guided Image Inpainting with Diffusion Models
- Flow Matching Policy Gradients
- DmC: Nearest Neighbor Guidance Diffusion Model for Offline Cross-domain Reinforcement Learning
- JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync
- Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
- LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs
Related