Diffusion Models Beat GANs on Image Synthesis
2021/05/11 by Prafulla Dhariwal, Alex Nichol, Dhariwal, Prafulla +1 · 1 voice · 1033 citations
Biochemistry, Genetics and Molecular Biology · Computer Science · Physics and Astronomy · #Cell Image Analysis Techniques #Generative Adversarial Networks and Image Synthesis #Model Reduction and Neural Networks #cs.AI #cs.CV #cs.LG #stat.ML
paper · pdf · doi:10.48550/arxiv.2105.05233
openalex publication_date 2021/05/11 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
We show that diffusion models can achieve image sample quality superior to the current state-of-the-art generative models. We achieve this on unconditional image synthesis by finding a better architecture through a series of ablations. For conditional image synthesis, we further improve sample quality with classifier guidance: a simple, compute-efficient method for trading off diversity for fidelity using gradients from a classifier. We achieve an FID of 2.97 on ImageNet 128×128, 4.59 on ImageNet 256×256, and 7.72 on ImageNet 512×512, and we match BigGAN-deep even with as few as 25 forward passes per sample, all while maintaining better coverage of the distribution. Finally, we find that classifier guidance combines well with upsampling diffusion models, further improving FID to 3.94 on ImageNet 256×256 and 3.85 on ImageNet 512×512. We release our code at https://github.com/openai/guided-diffusion
Citations
Cited by
- Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook
- Transformer-based Diffusion models for Hydrological Time Series Probabilistic Imputation and Forecasting
- Twins: Learn to Predict Unified Representations with Focal Loss
- Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction
- SurvDiff: A Diffusion Model for Generating Synthetic Data in Survival Analysis
- GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation
- Forensics Adapter: Unleashing CLIP for Generalizable Face Forgery Detection
- Spectral Prior for Reducing Exposure Bias in Diffusion Models
- SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation
- Lyapunov Guidance: A Unified Framework for Stabilizing Generative Flows
- PILD: Physics-Informed Learning via Diffusion
- Conditioning Residuals for Diffusion Models via Representation Feedback
- SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation
- Flexible generation of daily Earth system model projections across radiative forcing scenarios
- Analytic Distribution of Classifier-Free Guidance for Schedule Design
- ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program
- Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction
- Importance-Aware OBS Pruning for Diffusion Models
- SynSur: An end-to-end generative pipeline for synthetic industrial surface defect generation and detection
- Pixel-Space Diffusion Transformers
- Integration Matters: Rollout-Based Training for Constrained Diffusion Models
- On the Separability of Information in Diffusion Models
- CLOAK: Contrastive Guidance for Latent Diffusion-Based Data Obfuscation
- EmoSpace: Immersive Affective Image Generation Guided by Fine-Grained Emotion Prototypes
- DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation
- Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling
- Fundamental Recovery Bounds for SPAD Signals under Stationary Flux
- One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization
- Decafs: Disentangled Conditional adversarial Flows
- GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors
- Seeing Before Generating: Object Perception Enhances Single-View 3D Reconstruction
- ROMS-IMLE: A Minimalist Approach to Competitive Single-Step Generative Modelling
- Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
- Provable diffusion-based posterior sampling for linear inverse problems via DDIM
- LEGO: LoRA-Enabled Generator-Oriented Framework for Synthetic Image Detection
- SGN: A Similarity-based Generative Network for Data Generation under Distribution Shift
- A machine-learned probability distribution in the phase space of turbulent channel flow for synthetic turbulence and flow reconstruction
- Signed Rectified Flow: Negativity-Controlled Generation
- DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration
- DiFA: Inference-Time Forward-Process Alignment for Diffusion Models
- DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer
- Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents
- Three-Body Scattering for Generative Modeling
- History-Aware Transformation of ReID Features for Multiple Object Tracking
- REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion
- DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution
- DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes
- TVGL-CFM:Generating and Forecasting Time-Varying Trajectories of Dynamic Networks with Conditional Flow Matching
- WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
- Dichotomous Diffusion Policy Optimization
- Toward a mechanistic understanding of inference in visual cortex and diffusion models
- Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance
- Compositional Diffusion with Guided Search for Long-Horizon Planning
- Spatial Transport of Integration Error in Generative ODEs
- Knowledge-Centric Agents for Workflow Generation in ComfyUI
- From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
- NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
- Scaling Behavior Foundation Model for Humanoid Robots
- Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition
- Introspective Attention Modulation for Safe Text-to-Image Generation
- Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing
- From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime
- Efficient and Training-Free Single-Image Diffusion Models
- AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning
- FMPose3D: monocular 3D pose estimation via flow matching
- Remapping and navigation of an embedding space via error minimization: a fundamental organizational principle of cognition in natural and artificial systems
- Image Diffusion Models Exhibit Emergent Temporal Propagation in Videos
- Taming diffusion transformers for high-fidelity MRI super-resolution
- MIRO: MultI-Reward cOnditioned pretraining improves T2I quality and efficiency
- FakeParts: a New Family of AI-Generated DeepFakes
- The Information Dynamics of Generative Diffusion
- A Survey on Diffusion Language Models
- Entropic Time Schedulers for Generative Diffusion Models
- Large Language Diffusion Models
- Characterizing higher-order representations through generative diffusion models explains human decoded neurofeedback performance
- How far can we go with ImageNet for Text-to-Image generation?
- Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation
- Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation
- FOD-Diff: 3D Multi-Channel Patch Diffusion Model for Fiber Orientation Distribution
- Simultaneous Approximation of the Score Function and Its Derivatives by Deep Neural Networks
- Memorization in 3D Shape Generation: An Empirical Study
- D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
- Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- ReDiF: Reinforced Distillation for Few Step Diffusion
- Energy-Guided Flow Matching Enables Few-Step Conformer Generation and Ground-State Identification
- Reverse-Time Diffusion Processes for Discrete Time Linear and Nonlinear Systems with non-Gaussian Noise
- Joint Flow Matching for Generator-Consistent Classification
- Generative Modeling by Value-Driven Transport
- Statistics of natural scenes shape contextual modulation in the visual cortex
- OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models
- ConnectomeDiffuser: Generative AI Enables Brain Network Construction from Diffusion Tensor Imaging
- Advancing Marine Bioacoustics with Deep Generative Models: A Hybrid Augmentation Strategy for Southern Resident Killer Whale Detection
- PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
- Diffusion-Guided Search via Exponential Tilting (DiffTilt): An Application to Falsification of Safety-Critical Systems
- PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation
- Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging
- FMOPF: Latent Flow Matching with Constraint-Aware Interaction Priors for AC Optimal Power Flow
- AI-generated Images Challenge Visual Trust in High-risk Scenarios
- T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition
- G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- TRE: Training-Free Hallucination Detection for Diffusion Language Models
- FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation
- Concept-based Visual Counterfactual Explanations with Diffusion Models
- Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- UPMRI: Unsupervised Parallel MRI Reconstruction via Projected Conditional Flow Matching
- Physics-informed Diffusion Models for Multi-scale Prediction of Reference Signal Received Power in Wireless Networks
- FUSE: Unifying Spectral and Semantic Cues for Robust AI-Generated Image Detection
- Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
- ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
- STLDM: Spatio-Temporal Latent Diffusion Model for Precipitation Nowcasting
- FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting
- Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model
- Enhancing diffusion models with Gaussianization preprocessing
- Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification
- How I Met Your Bias: Investigating Bias Amplification in Diffusion Models
- IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
- SkinGenBench: Generative Model and Preprocessing Effects for Synthetic Dermoscopic Augmentation in Melanoma Diagnosis
- Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models
- VA-π: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
- Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior
- Efficient Personalization of Generative Models via Optimal Experimental Design
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- Is Your Conditional Diffusion Model Actually Denoising?
- Generating Risky Samples with Conformity Constraints via Diffusion Models
- Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
- Is There a Better Source Distribution than Gaussian? Exploring Source Distributions for Image Flow Matching
- Detection of AI Generated Images Using Combined Uncertainty Measures and Particle Swarm Optimised Rejection Mechanism
- Efficient Zero-Shot Inpainting with Decoupled Diffusion Guidance
- Grad: Guided Relation Diffusion Generation for Graph Augmentation in Graph Fraud Detection
- DESSERT: Diffusion-based Event-driven Single-frame Synthesis via Residual Training
- Diffusion Forcing for Multi-Agent Interaction Sequence Modeling
- InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
- Beyond Semantic Features: Pixel-level Mapping for Generalized AI-Generated Image Detection
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- Disentangled representations via score-based variational autoencoders
- Interpretable Similarity of Synthetic Image Utility
- SFTok: Bridging the Performance Gap in Discrete Tokenizers
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- FrameDiffuser: G-Buffer-Conditioned Diffusion for Neural Forward Frame Rendering
- InfoDCL: Informative Noise Enhanced Diffusion Based Contrastive Learning
- GMODiff: One-Step Gain Map Refinement with Diffusion Priors for HDR Reconstruction
- Stylized Synthetic Augmentation further improves Corruption Robustness
- CoPHo: Classifier-guided Conditional Topology Generation with Persistent Homology
- Spherical Leech Quantization for Visual Tokenization and Generation
- Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
- Dual Attention Guided Defense Against Malicious Edits
- V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
- 4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation
- Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation
- Smudged Fingerprints: A Systematic Evaluation of the Robustness of AI Image Fingerprints
- Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- An intercomparison of generative machine learning methods for downscaling precipitation at fine spatial scales
- AI-Augmented Pollen Recognition in Optical and Holographic Microscopy for Veterinary Imaging
- Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes
- Image Diffusion Preview with Consistency Solver
- CausalCLIP: Causally-Informed Feature Disentanglement and Filtering for Generalizable Detection of Generated Images
- RecTok: Reconstruction Distillation along Rectified Flow
- KlingAvatar 2.0 Technical Report
- Pattern-Guided Diffusion Models
- Robust Motion Generation using Part-level Reliable Data from Videos
- On Approaches to Building Surrogate ODE Models for Diffusion Bridges
- MolGuidance: Advanced Guidance Strategies for Conditional Molecular Generation with Flow Matching
- Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- SPDMark: Selective Parameter Displacement for Robust Video Watermarking
- Flowception: Temporally Expansive Flow Matching for Video Generation
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Bidirectional Normalizing Flow: From Data to Noise and Back
- GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian Splatting
- Generative Modeling from Black-box Corruptions via Self-Consistent Stochastic Interpolants
- What matters for Representation Alignment: Global Information or Spatial Structure?
- Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
- StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to-End Diffusion in a Canonical Space
- Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality
- Color encoding in Latent Space of Stable Diffusion Models
- VABench: A Comprehensive Benchmark for Audio-Video Generation
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- Astra: General Interactive World Model with Autoregressive Denoising
- Refining Visual Artifacts in Diffusion Models via Explainable AI-based Flaw Activation Maps
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- Inferring Compositional 4D Scenes without Ever Seeing One
- Perturbation-based Inference for Extreme Value Index
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank
- One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
- DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- Optimization-Guided Diffusion for Interactive Scene Generation
- JoPano: Unified Panorama Generation via Joint Modeling
- Rectifying Latent Space for Generative Single-Image Reflection Removal
- TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search
- UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- Latent Nonlinear Denoising Score Matching for Enhanced Learning of Structured Distributions
- Selective Masking based Self-Supervised Learning for Image Semantic Segmentation
- Rethinking Training Dynamics in Scale-wise Autoregressive Generation
- An Efficient Test-Time Scaling Approach for Image Generation
- Consist-Retinex: One-Step Noise-Emphasized Consistency Training Accelerates High-Quality Retinex Enhancement
- Self-Supervised AI-Generated Image Detection: A Camera Metadata Perspective
- General and Domain-Specific Zero-shot Detection of Generated Images via Conditional Likelihood
- BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- Generative design of stabilizing controllers with diffusion models: the Youla approach
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- Multi Task Denoiser Training for Solving Linear Inverse Problems
- YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance
- One-Step Generative Channel Estimation via Average Velocity Field
- GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis
- UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
- Data-regularized Reinforcement Learning for Diffusion Models at Scale
- Inference-time Stochastic Refinement of GRU-Normalizing Flow for Real-time Video Motion Transfer
- CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
- SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows
- Towards Irreversible Machine Unlearning for Diffusion Models
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
- Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features
- Step-by-step Layered Design Generation
- Unlocking hidden biomolecular conformational landscapes in diffusion models at inference time
- CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models
- SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control
- Glance: Accelerating Diffusion Models with 1 Sample
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- Co-speech Gesture Video Generation via Motion-Based Graph Retrieval
- OmniPerson: Unified Identity-Preserving Pedestrian Generation
- Iterative Tilting for Diffusion Fine-Tuning
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- Dual Randomized Smoothing: Beyond Global Noise Variance
- GRASP: Guided Residual Adapters with Sample-wise Partitioning
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
- Syndrome-Flow Consistency Model Achieves One-step Denoising Error Correction Codes
- Diffusion Model in Latent Space for Medical Image Segmentation Task
- DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling
- TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model
- Digital Surfactant
- ART-ASyn: Anatomy-aware Realistic Texture-based Anomaly Synthesis Framework for Chest X-Rays
- Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
- UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations
- PhysGen: Physically Grounded 3D Shape Generation for Industrial Design
- SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learning
- REVEAL: Reasoning-enhanced Forensic Evidence Analysis for Explainable AI-generated Image Detection
- Masked Diffusion for Generative Recommendation
- DM3T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
- Overcoming the Curvature Bottleneck in MeanFlow
- TARFVAE: Efficient One-Step Generative Time Series Forecasting via TARFLOW based VAE
- Markovian Scale Prediction: A New Era of Visual Autoregressive Generation
- CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance
- MammoRGB: Dual-View Mammogram Synthesis Using Denoising Diffusion Probabilistic Models
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Adversarial Flow Models
- Rethinking Cross-Generator Image Forgery Detection through DINOv3
- A Model and Data Dual-driven Approach for Multitargets Detection under Mainlobe Jamming
- Semantic-Aware Caching for Efficient Image Generation in Edge Computing
- Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment
- GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
- The Collapse of Patches
- Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models
- The Age-specific Alzheimer 's Disease Prediction with Characteristic Constraints in Nonuniform Time Span
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- MeanFlow Transformers with Representation Autoencoders
- Generating Separated Singing Vocals Using a Diffusion Model Conditioned on Music Mixtures
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation
- Deep Parameter Interpolation for Scalar Conditioning
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Efficient and Fast Generative-Based Singing Voice Separation using a Latent Diffusion Model
- PixelDiT: Pixel Diffusion Transformers for Image Generation
- Diffusion for Fusion: Designing Stellarators with Generative AI
- Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations
- Advancing Image Classification with Discrete Diffusion Classification Modeling
- Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
- Restora-Flow: Mask-Guided Image Restoration with Flow Matching
- PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- Terminal Velocity Matching
- Solving Diffusion Inverse Problems with Restart Posterior Sampling
- Flow Map Distillation Without Data
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
- When Semantics Regulate: Rethinking Patch Shuffle and Internal Bias for Generated Image Detection with CLIP
- Understanding, Accelerating, and Improving MeanFlow Training
- FVAR: Visual Autoregressive Modeling via Next Focus Prediction
- DiP: Taming Diffusion Models in Pixel Space
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- When and What to Recommend: Joint Modeling of Timing and Content for Active Sequential Recommendation
- ObjectAlign: Neuro-Symbolic Object Consistency Verification and Correction
- Masked Diffusion Models are Secretly Learned-Order Autoregressive Models
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
- Demystifying Diffusion Objectives: Reweighted Losses are Better Variational Bounds
- Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
- Beyond Binary Classification: A Semi-supervised Approach to Generalized AI-generated Image Detection
- Uncertainty Quantification in HSI Reconstruction using Physics-Aware Diffusion Priors and Optics-Encoded Measurements
- Jacobian-Aware Posterior Sampling for Inverse Problems
- TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading
- Early Lung Cancer Diagnosis from Virtual Follow-up LDCT Generation via Correlational Autoencoder and Latent Flow Matching
- IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment
- GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models
- MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization
- Generative Model Predictive Control in Manufacturing Processes: A Review
- T2I-Based Physical-World Appearance Attack against Traffic Sign Recognition Systems in Autonomous Driving
- Radar2Shape: 3D Shape Reconstruction from High-Frequency Radar using Multiresolution Signed Distance Functions
- FLUID: Training-Free Face De-identification via Latent Identity Substitution
- Spanning Tree Autoregressive Visual Generation
- DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing
- Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment
- Boosting Predictive Performance on Tabular Data through Data Augmentation with Latent-Space Flow-Based Diffusion
- Supervised Contrastive Learning for Few-Shot AI-Generated Image Detection and Attribution
- Denoising weak lensing mass maps with diffusion model and generative adversarial network
- Towards Overcoming Data Scarcity in Nuclear Energy: A Study on Critical Heat Flux with Physics-consistent Conditional Diffusion Model
- How Noise Benefits AI-generated Image Detection
- Automatic Uncertainty-Aware Synthetic Data Bootstrapping for Historical Map Segmentation
- cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold
- Generative design and validation of therapeutic peptides for glioblastoma based on a potential target ATP5A
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- GloTok: Global Perspective Tokenizer for Image Reconstruction and Generation
- Full-Atom Peptide Design via Riemannian-Euclidean Bayesian Flow Networks
- CFG-EC: Error Correction Classifier-Free Guidance
- Coffee: Controllable Diffusion Fine-tuning
- Reconstructing the Aerosol State from Partial Observations with Generative Modeling
- Training-free Detection of AI-generated images via Cropping Robustness
- Training-Free Multi-View Extension of IC-Light for Textual Position-Aware Scene Relighting
- Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views
- HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
- DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection
- Stabilizing Self-Consuming Diffusion Models with Latent Space Filtering
- Example-Based Feature Painting on Textures
- SecDiff: Diffusion-Aided Secure Deep Joint Source-Channel Coding Against Adversarial Attacks
- Which Way from B to A: The role of embedding geometry in image interpolation for Stable Diffusion
- Diffusion Model Based Signal Recovery Under 1-Bit Quantization
- MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
- HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- Lacking Data? No worries! How synthetic images can alleviate image scarcity in wildlife surveys: a case study with muskox (Ovibos moschatus)
- Chemistry-Enhanced Diffusion-Based Framework for Small-to-Large Molecular Conformation Generation
- FedSDA: Federated Stain Distribution Alignment for Non-IID Histopathological Image Classification
- Improved Masked Image Generation with Knowledge-Augmented Token Representations
- Null-Space Diffusion Distillation Unlocks Speed, Fidelity and Realism in Lensless Imaging
- GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
- NP-LoRA: Null Space Projection Unifies Subject and Style in LoRA Fusion
- Autonomous Vehicle Path Planning by Searching With Differentiable Simulation
- GrounDiff: Diffusion-Based Ground Surface Generation from Digital Surface Models
- DK-Root: A Joint Data-and-Knowledge-Driven Framework for Root Cause Analysis of QoE Degradations in Mobile Networks
- Equivariant Sampling for Improving Diffusion Model-based Image Restoration
- PRISM: Diversifying Dataset Distillation by Decoupling Architectural Priors
- Enhanced Privacy Leakage from Noise-Perturbed Gradients via Gradient-Guided Conditional Diffusion Models
- WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images
- HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition
- Top2Ground: A Height-Aware Dual Conditioning Diffusion Model for Robust Aerial-to-Ground View Generation
- StableMorph: High-Quality Face Morph Generation with Stable Diffusion
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- Detecting Generated Images by Fitting Natural Image Distributions
- Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- Forecasting implied volatility surface with generative diffusion models
- Laplacian Score Sharpening for Mitigating Hallucination in Diffusion Models
- Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System
- Steering LLMs toward Korean Local Speech: Iterative Refinement Framework for Faithful Dialect Translation
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance
- RelightMaster: Precise Video Relighting with Multi-plane Light Images
- AD-DAE: Unsupervised Modeling of Longitudinal Alzheimer's Disease Progression with Diffusion Auto-Encoder
- MALeR: Improving Compositional Fidelity in Layout-Guided Generation
- Enhancing Diffusion Model Guidance through Calibration and Regularization
- SAD-Flower: Flow Matching for Safe, Admissible, and Dynamically Consistent Planning
- Reasoning on Time-Series for Financial Technical Analysis
- Rethinking Metrics and Diffusion Architecture for 3D Point Cloud Generation
- Integrating Score-Based Diffusion Models with Machine Learning-Enhanced Localization for Advanced Data Assimilation in Geological Carbon Storage
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- CPO: Condition Preference Optimization for Controllable Image Generation
- Efficient probabilistic surrogate modeling techniques for partially-observed large-scale dynamical systems
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- Generative deep learning for foundational video translation in ultrasound
- Finetuning-Free Personalization of Text to Image Generation via Hypernetworks
- Scaling Multi-Agent Environment Co-Design with Diffusion Models
- Conditional Diffusion Model-Enabled Scenario-Specific Neural Receivers for Superimposed Pilot Schemes
- A Conditional Diffusion Model for Building Energy Modeling Workflows
- AI-Generated Image Detection: An Empirical Study and Future Research Directions
- Generalizable super-resolution turbulence reconstruction from minimal training data
- Wavelet-Optimized Motion Artifact Correction in 3D MRI Using Pre-trained 2D Score Priors
- DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping
- Diffusion Models are Robust Pretrainers
- NSYNC: Negative Synthetic Image Generation for Contrastive Training to Improve Stylized Text-To-Image Translation
- Quantum-Enhanced Generative Models for Rare Event Prediction
- Towards One-step Causal Video Generation via Adversarial Self-Distillation
- XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges
- Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
- Deep Generative Models for Enhanced Vitreous OCT Imaging
- Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
- EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
- Occlusion-Aware Diffusion Model for Pedestrian Intention Prediction
- Leveraging Hierarchical Image-Text Misalignment for Universal Fake Image Detection
- Who Made This? Fake Detection and Source Attribution with Diffusion Features
- OSMGen: Highly Controllable Satellite Image Synthesis using OpenStreetMap Data
- Enhancing Frequency Forgery Clues for Diffusion-Generated Image Detection
- Diffusion Models at the Drug Discovery Frontier: A Review on Generating Small Molecules versus Therapeutic Peptides
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- A Step Toward World Models: A Survey on Robotic Manipulation
- BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
- Diffusion LLMs are Natural Adversaries for any LLM
- BI-DCGAN: A Theoretically Grounded Bayesian Framework for Efficient and Diverse GANs
- ResMatching: Noise-Resilient Computational Super-Resolution via Guided Conditional Flow Matching
- Distributional Multi-objective Black-box Optimization for Diffusion-model Inference-time Multi-Target Generation
- Sketch2PoseNet: Efficient and Generalized Sketch to 3D Human Pose Prediction
- FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
- AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency
- Neural Stochastic Flows: Solver-Free Modelling and Inference for SDE Solutions
- Hawk: Leveraging Spatial Context for Faster Autoregressive Text-to-Image Generation
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- Model Inversion Attacks Meet Cryptographic Fuzzy Extractors
- Off-policy Reinforcement Learning with Model-based Exploration Augmentation
- Echo-Conditioned Denoising Diffusion Probabilistic Models for Multi-Target Tracking in RF Sensing
- Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models
- Flow Map Learning via Nongradient Vector Flow
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- UMI-on-Air: Embodiment-Aware Guidance for Embodiment-Agnostic Visuomotor Policies
- PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
- RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization
- Multi-scale Autoregressive Models are Laplacian, Discrete, and Latent Diffusion Models in Disguise
- TGCM: Topic-Guided Consistency Modeling for One-Step Disentanglement of Interleaved APT Technique Sequences
- BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation
- Surflo: Consistent 3D Surface Flow Model with Global State
- Differentiable Normative Guidance for Nash Bargaining Solution Recovery
- Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
- Generative Modeling via Drifting
- Meta Flow Maps enable scalable reward alignment
- Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
- DeepShield: Fortifying Deepfake Video Detection with Local and Global Forgery Analysis
- Balanced conic rectified flow
- Target-Guided Bayesian Flow Networks for Quantitatively Constrained CAD Generation
- EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift
- LRT-Diffusion: Calibrated Risk-Aware Guidance for Diffusion Policies
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- A Dual-Branch CNN for Robust Detection of AI-Generated Facial Forgeries
- Time-Embedded Algorithm Unrolling for Computational MRI
- UtilGen: Utility-Centric Generative Data Augmentation with Dual-Level Task Adaptation
- See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
- OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Score-based constrained generative modeling via Langevin diffusions with boundary conditions
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- FARMER: Flow AutoRegressive Transformer over Pixels
- Model-free filtering in high dimensions via projection and score-based diffusions
- A Novel Framework for Multi-Modal Protein Representation Learning
- Introducing physics-informed generative models for targeting structural novelty in the exploration of chemical space
- Nested AutoRegressive Models
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- ManiDP: Manipulability-Aware Diffusion Policy for Posture-Dependent Bimanual Manipulation
- Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner
- Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models
- A Free Probabilistic Framework for Denoising Diffusion Models: Entropy, Transport, and Reverse Processes
- Optimize Any Topology: A Foundation Model for Shape- and Resolution-Free Structural Topology Optimization
- LO-SDA: Latent Optimization for Score-based Atmospheric Data Assimilation
- DDTR: Diffusion Denoising Trace Recovery
- An End-to-End Generative Diffusion Model for Heavy-Ion Collisions
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- ACG: Action Coherence Guidance for Flow-based VLA models
- Expert Validation of Synthetic Cervical Spine Radiographs Generated with a Denoising Diffusion Probabilistic Model
- Discovering Latent Graphs with GFlowNets for Diverse Conditional Image Generation
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- MAGIC-Flow: Multiscale Adaptive Conditional Flows for Generation and Interpretable Classification
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
- BADiff: Bandwidth Adaptive Diffusion Model
- Compositional Monte Carlo Tree Diffusion for Extendable Planning
- Improved Training Technique for Shortcut Models
- Noise is All You Need: Solving Linear Inverse Problems by Noise Combination Sampling with Diffusion Models
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Amortized Active Generation of Pareto Sets
- Gaussian Mixture Flow Matching with Domain Alignment for Multi-Domain Sequential Recommendation
- Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- Downsizing Diffusion Models for Cardinality Estimation
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics
- AlphaFlow: Understanding and Improving MeanFlow Models
- Diffusion Autoencoders with Perceivers for Long, Irregular and Multimodal Astronomical Sequences
- Predicting before Reconstruction: A generative prior framework for MRI acceleration
- Curvilinear Structure-preserving Unpaired Cross-domain Medical Image Translation
- Guiding diffusion models to reconstruct flow fields from sparse data
- Learning and Simulating Building Evacuation Patterns for Enhanced Safety Design Using Generative Models
- CBDiff:Conditional Bernoulli Diffusion Models for Image Forgery Localization
- LAND: Lung and Nodule Diffusion for 3D Chest CT Synthesis with Anatomical Guidance
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- DiffPace: Diffusion-based Plug-and-play Augmented Channel Estimation in mmWave and Terahertz Ultra-Massive MIMO Systems
- VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
- HyperDiffusionFields (HyDiF): Diffusion-Guided Hypernetworks for Learning Implicit Molecular Neural Fields
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- L2P: Unlocking Latent Potential for Pixel Generation
- Diffusion Models as Dataset Distillation Priors
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- Adaptive Discretization for Consistency Models
- GuideFlow3D: Optimization-Guided Rectified Flow For Appearance Transfer
- Deep generative priors for 3D brain analysis
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Attention Is All You Need for KV Cache in Diffusion LLMs
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- FraQAT: Quantization Aware Training with Fractional bits
- Inpainting the Red Planet: Diffusion Models for the Reconstruction of Martian Environments in Virtual Reality
- SteeringTTA: Guiding Diffusion Trajectories for Robust Test-Time-Adaptation
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Inference-Time Search using Side Information for Diffusion-based Image Reconstruction
- PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis
- LOTA: Bit-Planes Guided AI-Generated Image Detection
- Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
- Counting Hallucinations in Diffusion Models
- End-to-End Multi-Modal Diffusion Mamba
- DiffLoc: Diffusion Model-Based High-Precision Positioning for 6G Networks
- Adaptive Visual Conditioning for Semantic Consistency in Diffusion-Based Story Continuation
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- LayerSync: Self-aligning Intermediate Layers
- Learning Human Motion with Temporally Conditional Mamba
- Unconditional Human Motion and Shape Generation via Balanced Score-Based Diffusion
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Scene Coordinate Reconstruction Priors
- A Gradient Guided Diffusion Framework for Chance Constrained Programming
- BIGFix: Bidirectional Image Generation with Token Fixing
- DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation
- Self-Supervised Selective-Guided Diffusion Model for Old-Photo Face Restoration
- Diffusion models for polarimetric reconstruction of circumstellar environments
- Diffusion Transformers with Representation Autoencoders
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- Hierarchical Koopman Diffusion: Fast Generation with Interpretable Diffusion Trajectory
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- Pre to Post-Treatment Glioblastoma MRI Prediction using a Latent Diffusion Model
- Don't Walk the Line: Boundary Guidance for Filtered Generation
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
- Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
- Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
- Joint Discriminative-Generative Modeling via Dual Adversarial Training
- DiffStyleTS: Diffusion Model for Style Transfer in Time Series
- Coherent Load Profile Synthesis with Conditional Diffusion for LV Distribution Network Scenario Generation
- NeuroSwift: A Lightweight Cross-Subject Framework for fMRI Visual Reconstruction of Complex Scenes
- WaveletDiff: Multilevel Wavelet Diffusion For Time Series Generation
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
- Controllable Graph Generation with Diffusion Models via Inference-Time Tree Search Guidance
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Waves of Imagination: Unconditional Spectrogram Generation using Diffusion Architectures
- Calibrating Generative Models
- Asymmetric Flow Models
- How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
- Domain Knowledge Infused Conditional Generative Models for Accelerating Drug Discovery
- Few-shot multi-token DreamBooth with LoRa for style-consistent character generation
- MSDM: Generating Task-Specific Pathology Images with a Multimodal Conditioned Diffusion Model for Cell and Nuclei Segmentation
- Lesion-Aware Post-Training of Latent Diffusion Models for Synthesizing Diffusion MRI from CT Perfusion
- Physically Valid Biomolecular Interaction Modeling with Gauss-Seidel Projection
- Augmenting generative models with biomedical knowledge graphs improves targeted drug discovery
- Hyperspectral data augmentation with transformer-based diffusion models
- Counterfactual Identifiability via Dynamic Optimal Transport
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- GeoGen: A Two-stage Coarse-to-Fine Framework for Fine-grained Synthetic Location-based Social Network Trajectory Generation
- Rectified-CFG++ for Flow Based Models
- Towards Real-World Deepfake Detection: A Diverse In-the-wild Dataset of Forgery Faces
- Provably Robust Adaptation for Language-Empowered Foundation Models
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- Bridging the Physics-Data Gap with FNO-Guided Conditional Flow Matching: Designing Inductive Bias through Hierarchical Physical Constraints
- Who Said Neural Networks Aren't Linear?
- Coupled Data and Measurement Space Dynamics for Enhanced Diffusion Posterior Sampling
- EigenScore: OOD Detection using Covariance in Diffusion Models
- The Digital Mirror: Gender Bias and Occupational Stereotypes in AI-Generated Images
- MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
- A Diffusion Model for Regular Time Series Generation from Irregular Data with Completion and Masking
- Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
- Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
- Control-Augmented Autoregressive Diffusion for Data Assimilation
- Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model
- Controllable Stylistic Text Generation with Train-Time Attribute-Regularized Diffusion
- Local MAP Sampling for Diffusion Models
- SpotDiff: Spotting and Disentangling Interference in Feature Space for Subject-Preserving Image Generation
- Carré du champ flow matching: better quality-generalisation tradeoff in generative models
- \bfD3QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
- The Safety Challenge of World Models for Embodied AI Agents: A Review
- ESS-Flow: Training-free guidance of flow-based models as inference in source space
- Redefining Generalization in Visual Domains: A Two-Axis Framework for Fake Image Detection with FusionDetect
- Teleportraits: Training-Free People Insertion into Any Scene
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- Traj-Transformer: Diffusion Models with Transformer for GPS Trajectory Generation
- Teamwork: Collaborative Diffusion with Low-rank Coordination and Adaptation
- Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis
- Policy Gradient Guidance Enables Test Time Control
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
- ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion
- Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
- SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator
- TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
- MACS: Measurement-Aware Consistency Sampling for Inverse Problems
- Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- Pulp Motion: Framing-aware multimodal camera and human motion generation
- Mitigating Diffusion Model Hallucinations with Dynamic Guidance
- Bridging Text and Video Generation: A Survey
- Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion
- FoilDiff: A Hybrid Transformer Backbone for Diffusion-based Modelling of 2D Airfoil Flow Fields
- GenAR: Next-Scale Autoregressive Generation for Spatial Gene Expression Prediction
- GDiffuSE: Diffusion-based speech enhancement with noise model guidance
- MASC: Boosting Autoregressive Image Generation with a Manifold-Aligned Semantic Clustering
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Evolutionary Computation as Natural Generative AI
- Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- A Novel Cloud-Based Diffusion-Guided Hybrid Model for High-Accuracy Accident Detection in Intelligent Transportation Systems
- Memory Forcing: Spatio-Temporal Memory for Consistent Scene Generation on Minecraft
- AortaDiff: A Unified Multitask Diffusion Framework For Contrast-Free AAA Imaging
- HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
- Learning Robust Diffusion Models from Imprecise Supervision
- Dale meets Langevin: A Multiplicative Denoising Diffusion Model
- Synthetic EEG Generation using Diffusion Models for Motor Imagery Tasks
- Longitudinal Flow Matching for Trajectory Modeling
- Purrception: Variational Flow Matching for Vector-Quantized Image Generation
- Constrained Diffusion for Protein Design with Hard Structural Constraints
- In-Situ Tweedie Discrete Diffusion Models
- SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
- UCD: Unconditional Discriminator Promotes Nash Equilibrium in GANs
- GRITS: A Spillage-Aware Guided Diffusion Policy for Robot Food Scooping Tasks
- Vicinity-Guided Discriminative Latent Diffusion for Privacy-Preserving Domain Adaptation
- Generative AI for subgrid turbulence in large-eddy simulations
- Learn to Guide Your Diffusion Model
- Diffusion Alignment as Variational Expectation-Maximization
- Selective Underfitting in Diffusion Models
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- MOLM: Mixture of LoRA Markers
- HilbertA: Hilbert Attention for Image Generation with Diffusion Models
- Contrastive Diffusion Guidance for Spatial Inverse Problems
- Data-to-Energy Stochastic Dynamics
- EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- 3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- RL-Guided Data Selection for Language Model Finetuning
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- How Diffusion Models Memorize
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- Score-based Membership Inference on Diffusion Models
- Path Diffuser: Diffusion Model for Data-Driven Traffic Simulator
- Assessing the risk of future Dunkelflaute events for Germany using generative deep learning
- UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark
- Unsupervised Single-Channel Speech Separation with a Diffusion Prior under Speaker-Embedding Guidance
- Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
- Anatomy-DT: A Cross-Diffusion Digital Twin for Anatomical Evolution
- SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions
- Simulating Post-Neoadjuvant Chemotherapy Breast Cancer MRI via Diffusion Model with Prompt Tuning
- Watermarking Diffusion Language Models
- MAD: Manifold Attracted Diffusion
- Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
- Scalable GANs with Transformers
- OAT-FM: Optimal Acceleration Transport for Improved Flow Matching
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- VFSI: Validity First Spatial Intelligence for Constraint-Guided Traffic Diffusion
- EWC-Guided Diffusion Replay for Exemplar-Free Continual Learning in Medical Imaging
- Adversarial Diffusion for Robust Reinforcement Learning
- DiffPCN: Latent Diffusion Model Based on Multi-view Depth Images for Point Cloud Completion
- Diff-3DCap: Shape Captioning with Diffusion Models
- StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer
- CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement
- Griffin: Generative Reference and Layout Guided Image Composition
- HunyuanImage 3.0 Technical Report
- Electric Currents for Discrete Data Generation
- Landing with the Score: Riemannian Optimization through Denoising
- CREPE: Controlling Diffusion with Replica Exchange
- Sparse2Dense: A Keypoint-driven Generative Framework for Human Video Compression and Vertex Prediction
- Stochastic Interpolants via Conditional Dependent Coupling
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
- Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance
- JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation
- Bézier Meets Diffusion: Robust Generation Across Domains for Medical Image Segmentation
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- Guidance Watermarking for Diffusion Models
- Factor-Based Conditional Diffusion Model for Portfolio Optimization
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Comparative Analysis of GAN and Diffusion for MRI-to-CT translation
- Universal Multi-Domain Translation via Diffusion Routers
- FlowDrive: moderated flow matching with data balancing for trajectory planning
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models
- No Alignment Needed for Generation: Learning Linearly Separable Representations in Diffusion Models
- Consistency Models as Plug-and-Play Priors for Inverse Problems
- SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models
- DAGDiff: Guiding Dual-Arm Grasp Diffusion to Stable and Collision-Free Grasps
- SPREAD: Sampling-based Pareto front Refinement via Efficient Adaptive Diffusion
- FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
- SimDiff: Simulator-constrained Diffusion Model for Physically Plausible Motion Generation
- Actor-Critic without Actor
- FreeInsert: Personalized Object Insertion with Geometric and Style Control
- CusEnhancer: A Zero-Shot Scene and Controllability Enhancement Method for Photo Customization via ResInversion
- Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
- ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
- SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding
- From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
- Selective Classifier-free Guidance for Zero-shot Text-to-speech
- InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
- PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
- FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference
- RL2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
- 4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
- Diffusion-Based Data Augmentation for Medical Image Segmentation
- UniSino: Physics-Driven Foundational Model for Universal CT Sinogram Standardization
- CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
- Training Flow Matching Models with Reliable Labels via Self-Purification
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- DS-Diffusion: Data Style-Guided Diffusion Model for Time-Series Generation
- Towards Application Aligned Synthetic Surgical Image Synthesis
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- Optimizing Inference in Transformer-Based Models: A Multi-Method Benchmark
- ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
- Conditioning in Generative Quantum Denoising Diffusion Models
- Measurement Score-Based MRI Reconstruction with Automatic Coil Sensitivity Estimation
- Exploring Machine Learning Models for Physical Dose Calculation in Carbon Ion Therapy Using Heterogeneous Imaging Data -- A Proof of Concept Study
- Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling
- DiffQ: Unified Parameter Initialization for Variational Quantum Algorithms via Diffusion Models
- Semantic and Visual Crop-Guided Diffusion Models for Heterogeneous Tissue Synthesis in Histopathology
- Audio Super-Resolution with Latent Bridge Models
- Equilibrium flow: From Snapshots to Dynamics
- Ambiguous Medical Image Segmentation Using Diffusion Schrödinger Bridge
- HOGraspFlow: Exploring Vision-based Generative Grasp Synthesis with Hand-Object Priors and Taxonomy Awareness
- A Mutil-conditional Diffusion Transformer for Versatile Seismic Wave Generation
- Enhancing Reference-based Sketch Colorization via Separating Reference Representations
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Guided Sequence-Structure Generative Modeling for Iterative Antibody Optimization
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
- Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
- Layout Stroke Imitation: A Layout Guided Handwriting Stroke Generation for Style Imitation with Diffusion Model
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- TrueMoE: Dual-Routing Mixture of Discriminative Experts for Synthetic Image Detection
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition
- Kuramoto Orientation Diffusion Models
- Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- Variational Shape Inference for Grasp Diffusion on SE(3)
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
- [Re] Improving Interpretation Faithfulness for Vision Transformers
- Data Augmentation via Latent Diffusion Models for Detecting Smell-Related Objects in Historical Artworks
- Generative AI Meets Wireless Sensing: Towards Wireless Foundation Model
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- GenExam: A Multidisciplinary Text-to-Image Exam
- Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures
- MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- DiCache: Let Diffusion Model Determine Its Own Cache
- BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching
- Semantic Diffusion Posterior Sampling for Cardiac Ultrasound Dehazing
- Cross-Distribution Diffusion Priors-Driven Iterative Reconstruction for Sparse-View CT
- BiasMap: Leveraging Cross-Attentions to Discover and Mitigate Hidden Social Biases in Text-to-Image Generation
- End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection
- Generation diffusion degradation: Simple and efficient design for blind super-resolution
- Conditional Image Generation with Score-Based Diffusion Models
- Image Tokenizer Needs Post-Training
- HoloGarment: 360° Novel View Synthesis of In-the-Wild Garments
- DRAG: Data Reconstruction Attack using Guided Diffusion
- IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
- DinoAtten3D: Slice-Level Attention Aggregation of DinoV2 for 3D Brain MRI Anomaly Classification
- Beyond Sliders: Mastering the Art of Diffusion-based Image Manipulation
- PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models
- A Novel Local Focusing Mechanism for Deepfake Detection Generalization
- Robustifying Diffusion-Denoised Smoothing Against Covariate Shift
- ToMA: Token Merge with Attention for Diffusion Models
- InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis
- HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching
- Flow Straight and Fast in Hilbert Space: Functional Rectified Flow
- Immunizing Images from Text to Image Editing via Adversarial Cross-Attention
- Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
- OnlineHOI: Towards Online Human-Object Interaction Generation and Perception
- RPD-Diff: Region-Adaptive Physics-Guided Diffusion Model for Visibility Enhancement under Dense and Non-Uniform Haze
- Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
- Automated Tuning for Diffusion Inverse Problem Solvers without Generative Prior Retraining
- Sig-DEG for Distillation: Making Diffusion Models Faster and Lighter
- Mechanistic Learning with Guided Diffusion Models to Predict Spatio-Temporal Brain Tumor Growth
- Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
- Composable Score-based Graph Diffusion Model for Multi-Conditional Molecular Generation
- Plug-and-play Diffusion Models for Image Compressive Sensing with Data Consistency Projection
- Structural Energy-Guided Sampling for View-Consistent Text-to-3D
- InterAct: Advancing Large-Scale Versatile 3D Human-Object Interaction Generation
- Integrating Anatomical Priors into a Causal Diffusion Model
- Joint Model-based Model-free Diffusion for Planning with Constraints
- ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
- DiffPlace: A Conditional Diffusion Framework for Simultaneous VLSI Placement Beyond Sequential Paradigms
- Feature Space Analysis by Guided Diffusion Model
- Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier Integrity
- BIR-Adapter: A Low-Complexity Diffusion Model Adapter for Blind Image Restoration
- TIDE: Achieving Balanced Subject-Driven Image Generation via Target-Instructed Diffusion Enhancement
- Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
- A Scalable Attention-Based Approach for Image-to-3D Texture Mapping
- AURAD: Anatomy-Pathology Unified Radiology Synthesis with Progressive Representations
- Constraints-Guided Diffusion Reasoner for Neuro-Symbolic Learning
- Transition Models: Rethinking the Generative Learning Objective
- Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- DUDE: Diffusion-Based Unsupervised Cross-Domain Image Retrieval
- MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation
- SEEDS: Exponential SDE Solvers for Fast High-Quality Sampling from Diffusion Models
- Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
- Human Motion Video Generation: A Survey
- Fitting Image Diffusion Models on Video Datasets
- DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
- DCDB: Dynamic Conditional Dual Diffusion Bridge for Ill-posed Multi-Tasks
- Scale-Adaptive Generative Flows for Multiscale Scientific Data
- InfraDiffusion: zero-shot depth map restoration with diffusion models and prompted segmentation from sparse infrastructure point clouds
- Generative AI for Crystal Structures: A Review
- Category-Aware 3D Object Composition with Disentangled Texture and Shape Multi-view Diffusion
- Enhancing Zero-Shot Pedestrian Attribute Recognition with Synthetic Data Generation: A Comparative Study with Image-To-Image Diffusion Models
- Conditional-t3VAE: Equitable Latent Space Allocation for Fair Generation
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
- PromptFlare: Prompt-Generalized Defense via Cross-Attention Decoy in Diffusion-Based Inpainting
- OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models
- VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Data-Dependent Smoothing for Protein Discovery with Walk-Jump Sampling
- DroneSR: Rethinking Few-shot Thermal Image Super-Resolution from Drone-based Perspective
- On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
- Acoustic Interference Suppression in Ultrasound images for Real-Time HIFU Monitoring Using an Image-Based Latent Diffusion Model
- Prior-Guided Flow Matching for Target-Aware Molecule Design with Learnable Atom Number
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- Lipschitz-Guided Design of Interpolation Schedules in Generative Models
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- PractiLight: Practical Light Control Using Foundational Diffusion Models
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs
- Tabular Diffusion Counterfactual Explanations
- Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
- Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation
- Double-Constraint Diffusion Model with Nuclear Regularization for Ultra-low-dose PET Reconstruction
- Beyond Negative Transfer: Disentangled Preference-Guided Diffusion for Cross-Domain Sequential Recommendation
- Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
- Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online
- Tree-Guided Diffusion Planner
- ECHO: Ego-Centric modeling of Human-Object interactions
- Controllable 3D Molecular Generation for Structure-Based Drug Design Through Bayesian Flow Networks and Gradient Integration
- Generative AI for Industrial Contour Detection: A Language-Guided Vision System
- Weighted Support Points from Random Measures: An Interpretable Alternative for Generative Modeling
- WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration
- FW-GAN: Frequency-Driven Handwriting Synthesis with Wave-Modulated MLP Generator
- Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
- EEGDM: Learning EEG Representation with Latent Diffusion Model
- CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
- Zero-Shot Text-Guided Object Generation with Dream Fields
- Evaluating Compositional Generalisation in VLMs and Diffusion Models
- GS: Generative Segmentation via Label Diffusion
- Quantum latent distributions in deep generative models
- Guiding Noisy Label Conditional Diffusion Models with Score-based Discriminator Correction
- Towards 6G Intelligence: The Role of Generative AI in Future Wireless Networks
- MicroLad: 2D-to-3D Microstructure Reconstruction and Generation via Latent Diffusion and Score Distillation
- MRExtrap: Longitudinal Aging of Brain MRIs using Linear Modeling in Latent Space
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- STDiff: A State Transition Diffusion Framework for Time Series Imputation in Industrial Systems
- Generative AI in Map-Making: A Technical Exploration and Its Implications for Cartographers
- BRAIN: Bias-Mitigation Continual Learning Approach to Vision-Brain Understanding
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
- Scaling Group Inference for Diverse and High-Quality Generation
- Pixie: Fast and Generalizable Supervised Learning of 3D Physics from Pixels
- TAIGen: Training-Free Adversarial Image Generation via Diffusion Models
- Squeezed Diffusion Models
- Source-Guided Flow Matching
- Cross-Modality Controlled Molecule Generation with Diffusion Language Model
- Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
- FOCUS: Frequency-Optimized Conditioning of DiffUSion Models for mitigating catastrophic forgetting during Test-Time Adaptation
- Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states
- SBGD: Improving Graph Diffusion Generative Model via Stochastic Block Diffusion
- AnchorSync: Global Consistency Optimization for Long Video Editing
- Learning to See Through Flare
- Improving Deep Learning for Accelerated MRI With Data Filtering
- Eliminating Rasterization: Direct Vector Floor Plan Generation with DiffPlanner
- DiffIER: Optimizing Diffusion Models with Iterative Error Reduction
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- Denoising diffusion models for inverse design of inflatable structures with programmable deformations
- Next Visual Granularity Generation
- Self-Guided Action Diffusion
- Generic Event Boundary Detection via Denoising Diffusion
- SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress
- SPG: Style-Prompting Guidance for Style-Specific Content Creation
- Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
- TimeMachine: Fine-Grained Facial Age Editing with Identity Preservation
- Semi-supervised Image Dehazing via Expectation-Maximization and Bidirectional Brownian Bridge Diffusion Models
- Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension
- Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
- Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
- Object Fidelity Diffusion for Remote Sensing Image Generation
- Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Geospatial Diffusion for Land Cover Imperviousness Change Forecasting
- Increasing the Utility of Synthetic Images through Chamfer Guidance
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- EgoMusic-driven Human Dance Motion Estimation with Skeleton Mamba
- Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
- DiffTopo: Solver in the Loop for Inverse Topography via Condition Diffusion Generation
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
- Integrating Reinforcement Learning with Visual Generative Models: Foundations and Advances
- BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
- Prototype-Guided Diffusion: Visual Conditioning without External Memory
- Enhancing Diffusion Face Generation with Contrastive Embeddings and SegFormer Guidance
- Non-asymptotic convergence bound of conditional diffusion models
- MInDI-3D: Iterative Deep Learning in 3D for Sparse-view Cone Beam Computed Tomography
- Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Learning Spatial Decay for Vision Transformers
- Leveraging Failed Samples: A Few-Shot and Training-Free Framework for Generalized Deepfake Detection
- Personalized Face Super-Resolution with Identity Decoupling and Fitting
- Semantic-Aware Reconstruction Error for Detecting AI-Generated Images
- Lung-DDPM+: Efficient Thoracic CT Image Synthesis using Diffusion Probabilistic Model
- Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
- Transient Noise Removal via Diffusion-based Speech Inpainting
- Measurement-Based Quantum Diffusion Models
- Unlocking the Potential of Diffusion Priors in Blind Face Restoration
- Learning User Preferences for Image Generation Model
- CD-TVD: Contrastive Diffusion for 3D Super-Resolution with Scarce High-Resolution Time-Varying Data
- Score Augmentation for Diffusion Models
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- Neural Bridge Processes
- Perceptual Evaluation of GANs and Diffusion Models for Generating X-rays
- SketchAnimator: Animate Sketch via Motion Customization of Text-to-Video Diffusion Models
- HaDM-ST: Histology-Assisted Differential Modeling for Spatial Transcriptomics Generation
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- ActivityDiff: A diffusion model with Positive and Negative Activity Guidance for De Novo Drug Design
- ADPro: a Test-time Adaptive Diffusion Policy via Manifold-constrained Denoising and Task-aware Initialization for Robotic Manipulation
- Meta-Learning for Speeding Up Large Model Inference in Decentralized Environments
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
- Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution
- DreamVE: Unified Instruction-based Image and Video Editing
- DiffCap: Diffusion-based Real-time Human Motion Capture using Sparse IMUs and a Monocular Camera
- WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
- Keep It Real: Challenges in Attacking Compression-Based Adversarial Purification
- ArbiViewGen: Controllable Arbitrary Viewpoint Camera Data Generation for Autonomous Driving via Stable Diffusion Models
- MetaDiT: Enabling Fine-grained Constraints in High-degree-of Freedom Metasurface Design
- Align-for-Fusion: Harmonizing Triple Preferences via Dual-oriented Diffusion for Cross-domain Sequential Recommendation
- FLUX-Makeup: High-Fidelity, Identity-Consistent, and Robust Makeup Transfer via Diffusion Transformer
- Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models
- Multi-Marginal Stochastic Flow Matching for High-Dimensional Snapshot Data at Irregular Time Points
- Turbulent Injection assisted by Diffusion Models for Scale Resolving Simulations
- DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification
- DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models
- Conditional Latent Diffusion Models for Zero-Shot Instance Segmentation
- DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models
- Anti-Tamper Protection for Unauthorized Individual Image Generation
- OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
- Likelihood Matching for Diffusion Models
- CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation
- EditGarment: An Instruction-Based Garment Editing Dataset Constructed with Automated MLLM Synthesis and Semantic-Aware Evaluation
- RAAG: Ratio Aware Adaptive Guidance
- GL-LCM: Global-Local Latent Consistency Models for Fast High-Resolution Bone Suppression in Chest X-Ray Images
- Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation
- Zero Shot Domain Adaptive Semantic Segmentation by Synthetic Data Generation and Progressive Adaptation
- Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
- Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems
- Injecting Measurement Information Yields a Fast and Noise-Robust Diffusion-Based Inverse Problem Solver
- Scoring ISAC: Benchmarking Integrated Sensing and Communications via Score-Based Generative Modeling
- MiraGe: Multimodal Discriminative Representation Learning for Generalizable AI-Generated Image Detection
- Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning
- Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning
- Semantically-Guided Inference for Conditional Diffusion Models: Enhancing Covariate Consistency in Time Series Forecasting
- Censored Sampling for Topology Design: Guiding Diffusion with Human Preferences
- Enhancing Diffusion-based Dataset Distillation via Adversary-Guided Curriculum Sampling
- NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection
- Dataset Condensation with Color Compensation
- ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
- A Reward-Directed Diffusion Framework for Generative Design Optimization
- Flow Matching for Probabilistic Learning of Dynamical Systems from Missing or Noisy Data
- Evading Data Provenance in Deep Neural Networks
- Unraveling Hidden Representations: A Multi-Modal Layer Analysis for Better Synthetic Content Forensics
- GECO: Geometrically Consistent Embedding with Lightspeed Inference
- DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose Prior
- DBLP: Noise Bridge Consistency Distillation For Efficient And Reliable Adversarial Purification
- Occlusion-robust Stylization for Drawing-based 3D Animation
- Jet Image Generation in High Energy Physics Using Diffusion Models
- CIF: A Constrained Inversion Framework for Reliable Message Extraction in Diffusion-Based Generative Steganography
- Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- One-Step Flow Policy Mirror Descent
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
- UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
- PixNerd: Pixel Neural Field Diffusion
- Adversarial-Guided Diffusion for Multimodal LLM Attacks
- BS-1-to-N: Diffusion-Based Environment-Aware Cross-BS Channel Knowledge Map Generation for Cell-Free Networks
- Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath Prediction
- DISTIL: Data-Free Inversion of Suspicious Trojan Inputs via Latent Diffusion
- ShortFT: Diffusion Model Alignment via Shortcut-based Fine-Tuning
- AI art [wikipedia]
- Diffusion model [wikipedia]
- Trajectory optimization [wikipedia]
Discussions
Related