Classifier-Free Diffusion Guidance
2022/07/26 by Jonathan Ho, Tim Salimans, Ho, Jonathan +1 · 1 voice · 1,391 citations
Computer Science · Physics and Astronomy · #Artificial intelligence #Classifier (UML) #Computer science #Generative Adversarial Networks and Image Synthesis #Generative grammar #Machine learning #Margin classifier #Model Reduction and Neural Networks #Pattern recognition (psychology) #Quadratic classifier #cs.AI #cs.LG
paper · pdf · doi:10.48550/arxiv.2207.12598
published in arXiv (Cornell University) (Cornell University) · A short version of this paper appeared in the NeurIPS 2021 Workshop on Deep Generative Models and Downstream Applications: https://openreview.net/pdf?id=qw8AKxfYbI
arxiv created 2022/07/26 · openalex publication_date 2022/07/26 · arxiv published 2022/07/26 · arxiv updated 2022/07/27 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Classifier guidance is a recently introduced method to trade off mode coverage and sample fidelity in conditional diffusion models post training, in the same spirit as low temperature sampling or truncation in other types of generative models. Classifier guidance combines the score estimate of a diffusion model with the gradient of an image classifier and thereby requires training an image classifier separate from the diffusion model. It also raises the question of whether guidance can be performed without a classifier. We show that guidance can be indeed performed by a pure generative model without such a classifier: in what we call classifier-free guidance, we jointly train a conditional and an unconditional diffusion model, and we combine the resulting conditional and unconditional score estimates to attain a trade-off between sample quality and diversity similar to that obtained using classifier guidance.
Cited by
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
- Accelerated Multi-Modal Motion Planning Using Context-Conditioned Diffusion Models
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
- Distribution Matching Variational AutoEncoder
- Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control
- Memorization in 3D Shape Generation: An Empirical Study
- Anomaly Detection by Effectively Leveraging Synthetic Images
- Reverse Personalization
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- Long-Range Distillation: Distilling 10,000 Years of Simulated Climate into Long Timestep AI Weather Models
- Visual Autoregressive Modelling for Monocular Depth Estimation
- Energy-Guided Flow Matching Enables Few-Step Conformer Generation and Ground-State Identification
- ViDS: Video Diffusion Shader using 3D Face Tracking
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- Joint Flow Matching for Generator-Consistent Classification
- BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion
- Generative Modeling by Value-Driven Transport
- To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion
- Learning Sampling Parameters for Diffusion Models
- MobileWan: Closing the Quality Gap for Mobile Video Diffusion
- Normalizing Trajectory Models
- UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
- Catalyst Diffusion Transformer: Generative Inverse Design of Heterogeneous Catalysts
- CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion
- Wrong Design Intent Can Be Worse Than None: A Derangement-Control Diagnosis of Header Conditioning in CAD Program Completion
- Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors
- NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
- G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees
- Fast Navigation Through Occluded Spaces via Language-Conditioned Map Prediction
- ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
- STLDM: Spatio-Temporal Latent Diffusion Model for Precipitation Nowcasting
- FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
- MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
- How I Met Your Bias: Investigating Bias Amplification in Diffusion Models
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
- Learning to Refocus with Video Diffusion Models
- Generating the Past, Present and Future from a Motion-Blurred Image
- Over++: Generative Video Compositing for Layer Interaction Effects
- Efficient Personalization of Generative Models via Optimal Experimental Design
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- Decoupled Generative Modeling for Human-Object Interaction Synthesis
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- Is Your Conditional Diffusion Model Actually Denoising?
- Generating Risky Samples with Conformity Constraints via Diffusion Models
- Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
- Loom: Diffusion-Transformer for Interleaved Generation
- CrystalFormer-CSP: Thinking Fast and Slow for Crystal Structure Prediction
- MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
- InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- MatLat: Material Latent Space for PBR Texture Generation
- Disentangled representations via score-based variational autoencoders
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- InfoDCL: Informative Noise Enhanced Diffusion Based Contrastive Learning
- FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
- EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation
- Learning High-Quality Initial Noise for Single-View Synthesis with Diffusion Models
- Large Video Planner Enables Generalizable Robot Control
- Stylized Synthetic Augmentation further improves Corruption Robustness
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- BLANKET: Anonymizing Faces in Infant Video Recordings
- DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations
- Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting
- HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens
- EMFusion: Uncertainty-Aware Conditional Diffusion Model for Multivariate Narrow-band Exposure Forecasting
- Spherical Leech Quantization for Visual Tokenization and Generation
- V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
- RSTR: Reducing SpatioTemporal Redundancy in Diffusion Transformers
- Quality-Driven and Diversity-Aware Sample Expansion for Robust Marine Obstacle Segmentation
- Feedforward 3D Editing via Text-Steerable Image-to-3D
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- What Happens Next? Next Scene Prediction with a Unified Video Model
- Pattern-Guided Diffusion Models
- MineTheGap: Automatic Mining of Biases in Text-to-Image Models
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
- Exploring the Design Space of Transition Matching
- MolGuidance: Advanced Guidance Strategies for Conditional Molecular Generation with Flow Matching
- Animus3D: Text-driven 3D Animation via Motion Score Distillation
- Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- Referring Change Detection in Remote Sensing Imagery
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Flowception: Temporally Expansive Flow Matching for Video Generation
- PersonaLive! Expressive Portrait Image Animation for Live Streaming
- Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation
- AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path
- AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Bidirectional Normalizing Flow: From Data to Noise and Back
- DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance
- Multi-dimensional Preference Alignment by Conditioning Reward Itself
- DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance
- Membership and Dataset Inference Attacks on Large Audio Generative Models
- FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
- Food Image Generation on Multi-Noun Categories
- Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- Early Estimation of Language to Latent Alignment in Diffusion Models
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
- Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- Training-free Clothing Region of Interest Self-correction for Virtual Try-On
- ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points
- JoPano: Unified Panorama Generation via Joint Modeling
- UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- Scaling Zero-Shot Reference-to-Video Generation
- A Comparative Study on Synthetic Facial Data Generation Techniques for Face Recognition
- SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
- Bring Your Dreams to Life: Continual Text-to-Video Customization
- Generative design of stabilizing controllers with diffusion models: the Youla approach
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- LaFiTe: A Generative Latent Field for 3D Native Texturing
- M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
- DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
- Data-regularized Reinforcement Learning for Diffusion Models at Scale
- Inference-time Stochastic Refinement of GRU-Normalizing Flow for Real-time Video Motion Transfer
- CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
- SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows
- Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
- Towards Irreversible Machine Unlearning for Diffusion Models
- EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
- Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
- Unlocking hidden biomolecular conformational landscapes in diffusion models at inference time
- MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra
- TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution
- Iterative Tilting for Diffusion Fine-Tuning
- Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
- Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
- Generative Video Motion Editing with 3D Point Tracks
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- GRASP: Guided Residual Adapters with Sample-wise Partitioning
- Diffusion Model in Latent Space for Medical Image Segmentation Task
- DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling
- LAP: Fast LAtent Diffusion Planner for Autonomous Driving
- Digital Surfactant
- Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models
- AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
- GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence
- Fast Multi-view Consistent 3D Editing with Video Priors
- Masked Diffusion for Generative Recommendation
- Guiding Visual Autoregressive Models through Spectrum Weakening
- CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
- Overcoming the Curvature Bottleneck in MeanFlow
- InstanceV: Instance-Level Video Generation
- CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Generative models for crystalline materials
- Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
- Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration
- Adversarial Flow Models
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- The Collapse of Patches
- Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models
- IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- MeanFlow Transformers with Representation Autoencoders
- Infinite-Story: A Training-Free Consistent Text-to-Image Generation
- 3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion
- Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
- BRIC: Bridging Kinematic Plans and Physical Control at Test Time
- PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images
- SONIC: Spectral Optimization of Noise for Inpainting with Consistency
- ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
- Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
- Terminal Velocity Matching
- Flow Map Distillation Without Data
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- EnfoPath: Energy-Informed Analysis of Generative Trajectories in Flow Matching
- A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- DiP: Taming Diffusion Models in Pixel Space
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
- LATTICE: Democratize High-Fidelity 3D Generation at Scale
- When and What to Recommend: Joint Modeling of Timing and Content for Active Sequential Recommendation
- Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation
- Masked Diffusion Models are Secretly Learned-Order Autoregressive Models
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
- GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- CoD: A Diffusion Foundation Model for Image Compression
- Zero-Shot Video Deraining with Video Diffusion Models
- SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
- TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- Score-Regularized Joint Sampling with Importance Weights for Flow Matching
- Spanning Tree Autoregressive Visual Generation
- Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation
- Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
- TFCDiff: Robust ECG Denoising via Time-Frequency Complementary Diffusion
- Decoupling Complexity from Scale in Latent Diffusion Model
- NaTex: Seamless Texture Generation as Latent Color Diffusion
- PairHuman: A High-Fidelity Photographic Dataset for Customized Dual-Person Generation
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- CFG-EC: Error Correction Classifier-Free Guidance
- Coffee: Controllable Diffusion Fine-tuning
- MRIQT: Physics-Aware Diffusion Model for Image Quality Transfer in Neonatal Ultra-Low-Field MRI
- CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model
- Example-Based Feature Painting on Textures
- Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI Reconstruction via ROI Encoder and visuAl Mapping
- Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image
- Model Inversion Attack Against Deep Hashing
- GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- SP-Guard: Selective Prompt-adaptive Guidance for Safe Text-to-Image Generation
- Controllable protein design through Feynman-Kac steering
- Expanding the Content-Style Frontier: a Balanced Subspace Blending Approach for Content-Style LoRA Fusion
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
- HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition
- Top2Ground: A Height-Aware Dual Conditioning Diffusion Model for Robust Aerial-to-Ground View Generation
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- SYNAPSE: Synergizing an Adapter and Finetuning for High-Fidelity EEG Synthesis from a CLIP-Aligned Encoder
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?
- Conditional Diffusion as Latent Constraints for Controllable Symbolic Music Generation
- Guiding Generative Models to Uncover Diverse and Novel Crystals via Reinforcement Learning
- A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models
- MALeR: Improving Compositional Fidelity in Layout-Guided Generation
- Neodragon: Mobile Video Generation using Diffusion Transformer
- Joint Design of Protein Surface and Structure Using a Diffusion Bridge Model
- Enhancing Diffusion Model Guidance through Calibration and Regularization
- SAD-Flower: Flow Matching for Safe, Admissible, and Dynamically Consistent Planning
- Reasoning on Time-Series for Financial Technical Analysis
- Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidance
- CPO: Condition Preference Optimization for Controllable Image Generation
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
- MoSa: Motion Generation with Scalable Autoregressive Modeling
- Text to Sketch Generation with Multi-Styles
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- Prompt-Based Safety Guidance Is Ineffective for Unlearned Text-to-Image Diffusion Models
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- SyMuPe: Affective and Controllable Symbolic Music Performance
- UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
- Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models
- Conditional Distribution Estimation of Building Characteristics with Diffusion Models for Urban Energy Modeling
- A New Perspective on Precision and Recall for Generative Models
- Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
- Effective Test-Time Scaling of Discrete Diffusion through Iterative Refinement
- XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges
- Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
- Occlusion-Aware Diffusion Model for Pedestrian Intention Prediction
- Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities
- Enhancing Frequency Forgery Clues for Diffusion-Generated Image Detection
- Diffusion Models at the Drug Discovery Frontier: A Review on Generating Small Molecules versus Therapeutic Peptides
- SEE4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting
- Dynamic VLM-Guided Negative Prompting for Diffusion Models
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- RegionE: Adaptive Region-Aware Generation for Efficient Image Editing
- Echo-Conditioned Denoising Diffusion Probabilistic Models for Multi-Target Tracking in RF Sensing
- Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models
- ROGR: Relightable 3D Objects using Generative Relighting
- A Priori Sampling of Transition States with Guided Diffusion
- Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
- How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer
- High-Resolution Image Synthesis with Latent Diffusion Models
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation
- Surflo: Consistent 3D Surface Flow Model with Global State
- HRM-Text: Efficient Pretraining Beyond Scaling
- AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
- Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
- Diffusion Models in Vision: A Survey
- Normatively guided graph diffusion for efficient and rational utility generation in bilateral bargaining
- Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
- Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
- Generative Modeling via Drifting
- Distance Marching for Generative Modeling
- Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch Generation
- 'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
- LRT-Diffusion: Calibrated Risk-Aware Guidance for Diffusion Policies
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- Generative View Stitching
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Group Relative Attention Guidance for Image Editing
- Time-Embedded Algorithm Unrolling for Computational MRI
- UtilGen: Utility-Centric Generative Data Augmentation with Dual-Level Task Adaptation
- GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
- MC-SJD : Maximal Coupling Speculative Jacobi Decoding for Autoregressive Visual Generation Acceleration
- Compositional Image Synthesis with Inference-Time Scaling
- Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
- Neural USD: An object-centric framework for iterative editing and control
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- TRELLISWorld: Training-Free World Generation from Object Generators
- Model-free filtering in high dimensions via projection and score-based diffusions
- A Novel Framework for Multi-Modal Protein Representation Learning
- Autoregressive Styled Text Image Generation, but Make it Reliable
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- Simple Denoising Diffusion Language Models
- Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner
- Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- Optimize Any Topology: A Foundation Model for Shape- and Resolution-Free Structural Topology Optimization
- DDTR: Diffusion Denoising Trace Recovery
- ACG: Action Coherence Guidance for Flow-based VLA models
- Efficient Utility-Preserving Machine Unlearning with Implicit Gradient Surgery
- Mitigating Coordinate Prediction Bias from Positional Encoding Failures
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing
- StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks
- Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
- BADiff: Bandwidth Adaptive Diffusion Model
- Compositional Monte Carlo Tree Diffusion for Extendable Planning
- Improved Training Technique for Shortcut Models
- Noise is All You Need: Solving Linear Inverse Problems by Noise Combination Sampling with Diffusion Models
- QSilk: Micrograin Stabilization and Adaptive Quantile Clipping for Detail-Friendly Latent Diffusion
- Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- A Contact-Driven Framework for Manipulating in the Blind
- AlphaFlow: Understanding and Improving MeanFlow Models
- Seed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assets
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- A Cross-Environment and Cross-Embodiment Path Planning Framework via a Conditional Diffusion Model
- Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback
- Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis
- VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
- Latent-Augmented Discrete Diffusion Models
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- L2P: Unlocking Latent Potential for Pixel Generation
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
- In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models
- HumanCM: One Step Human Motion Prediction
- H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Spatial Computing Communications for Multi-User Virtual Reality in Distributed Mobile Edge Computing Network
- Salient Concept-Aware Generative Data Augmentation
- TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
- CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
- Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- Ultra High-Resolution Image Inpainting with Patch-Based Content Consistency Adapter
- Counting Hallucinations in Diffusion Models
- End-to-End Multi-Modal Diffusion Mamba
- Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
- T(R,O) Grasp: Efficient Graph Diffusion of Robot-Object Spatial Transformation for Cross-Embodiment Dexterous Grasping
- LayerSync: Self-aligning Intermediate Layers
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Scene Coordinate Reconstruction Priors
- Controlling Intent Expressiveness in Robot Motion with Diffusion Models
- A Gradient Guided Diffusion Framework for Chance Constrained Programming
- Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
- Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
- Diffusion Transformers with Representation Autoencoders
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation
- MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars
- UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- Pre to Post-Treatment Glioblastoma MRI Prediction using a Latent Diffusion Model
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
- DiffStyleTS: Diffusion Model for Style Transfer in Time Series
- Zero-shot Face Editing via ID-Attribute Decoupled Inversion
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- Discrete State Diffusion Models: A Sample Complexity Perspective
- Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- VLM-Guided Adaptive Negative Prompting for Creative Generation
- SoundReactor: Frame-level Online Video-to-Audio Generation
- Knowledge-Decoupled Functionally Invariant Path with Synthetic Personal Data for Personalized ASR
- Hierarchical Bayesian Flow Networks for Molecular Graph Generation
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Calibrating Generative Models
- Asymmetric Flow Models
- How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
- Enhancing Diffusion Policy with Classifier-Free Guidance for Temporal Robotic Tasks
- Domain Knowledge Infused Conditional Generative Models for Accelerating Drug Discovery
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- RadioFlow: Efficient Radio Map Construction Framework with Flow Matching
- Conditional Flow Matching for Bayesian Posterior Inference
- UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction
- X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering
- SummDiff: Generative Modeling of Video Summarization with Diffusion
- Counterfactual Identifiability via Dynamic Optimal Transport
- SViM3D: Stable Video Material Diffusion for Single Image 3D Generation
- IntMeanFlow: Few-step Speech Generation with Integral Velocity Distillation
- FlowLensing: Simulating Gravitational Lensing with Flow Matching
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
- Rectified-CFG++ for Flow Based Models
- Attribution-by-design: Ensuring Inference-Time Provenance in Generative Music Systems
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers
- WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
- Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report
- Diffusing Trajectory Optimization Problems for Recovery During Multi-Finger Manipulation
- No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual Prompts
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers
- Heptapod: Language Modeling on Visual Signals
- scPPDM: A Diffusion Model for Single-Cell Drug-Response Prediction
- Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
- Limited-Angle Tomography Reconstruction via Projector Guided 3D Diffusion
- Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation
- Local MAP Sampling for Diffusion Models
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion
- ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement
- SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator
- TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling
- Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- Pulp Motion: Framing-aware multimodal camera and human motion generation
- Mitigating Diffusion Model Hallucinations with Dynamic Guidance
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation
- Bridging Text and Video Generation: A Survey
- UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- Learning Robust Diffusion Models from Imprecise Supervision
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models
- Constrained Diffusion for Protein Design with Hard Structural Constraints
- SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model
- UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching
- Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
- Learn to Guide Your Diffusion Model
- Diffusion Alignment as Variational Expectation-Maximization
- Selective Underfitting in Diffusion Models
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- MOLM: Mixture of LoRA Markers
- Video Object Segmentation-Aware Audio Generation
- Contrastive Diffusion Guidance for Spatial Inverse Problems
- 3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation
- IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
- EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Fading to Grow: Growing Preference Ratios via Preference Fading Discrete Diffusion for Recommendation
- VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing
- CO3: Contrasting Concepts Compose Better
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- ART-VITON: Measurement-Guided Latent Diffusion for Artifact-Free Virtual Try-On
- LieHMR: Autoregressive Human Mesh Recovery with SO(3) Diffusion
- How Diffusion Models Memorize
- Swift: An Autoregressive Consistency Model for Efficient Weather Forecasting
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- MoReFlow: Motion Retargeting Learning through Unsupervised Flow Matching
- Flow Matching with Semidiscrete Couplings
- One-shot Conditional Sampling: MMD meets Nearest Neighbors
- Guided Diffusion for the Discovery of New Superconductors
- Score Distillation of Flow Matching Models
- Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
- SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution
- When Scores Learn Geometry: Rate Separations under the Manifold Hypothesis
- ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation
- Assessing the risk of future Dunkelflaute events for Germany using generative deep learning
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- SAIP: A Plug-and-Play Scale-adaptive Module in Diffusion-based Inverse Problems
- CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers
- NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis
- Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
- SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions
- FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation
- MAD: Manifold Attracted Diffusion
- TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- I need husband: AI beauty standards, fascism and the proliferation of bot driven content
- Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
- SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
- UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- MoReact: Generating Reactive Motion from Textual Descriptions
- GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning
- HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
- AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
- DA-MMP: Learning Coordinated and Accurate Throwing with Dynamics-Aware Motion Manifold Primitives
- CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement
- BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
- Generative Modeling of Shape-Dependent Self-Contact Human Poses
- Landing with the Score: Riemannian Optimization through Denoising
- CREPE: Controlling Diffusion with Replica Exchange
- Stochastic Interpolants via Conditional Dependent Coupling
- Sensitivity Analysis for Diffusion Models
- Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
- Rethinking Inter-LoRA Orthogonality in Adapter Merging: Insights from Orthogonal Monte Carlo Dropout
- Scale-Wise VAR is Secretly Discrete Diffusion
- Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance
- JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation
- Decoding quantum low density parity check codes with diffusion
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- DHAGrasp: Synthesizing Affordance-Aware Dual-Hand Grasps with Text Instructions
- Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
- Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models
- Universal Multi-Domain Translation via Diffusion Routers
- Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning
- FlowDrive: moderated flow matching with data balancing for trajectory planning
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- Memory Self-Regeneration: Uncovering Hidden Knowledge in Unlearned Models
- DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models
- Guiding Audio Editing with Audio Language Model
- No Alignment Needed for Generation: Learning Linearly Separable Representations in Diffusion Models
- Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
- DistillKac: Few-Step Image Generation via Damped Wave Equations
- DyME: Dynamic Multi-Concept Erasure in Diffusion Models with Bi-Level Orthogonal LoRA Adaptation
- SPREAD: Sampling-based Pareto front Refinement via Efficient Adaptive Diffusion
- Prompt-aware classifier free guidance for diffusion models
- AIBA: Attention-based Instrument Band Alignment for Text-to-Audio Diffusion
- Causal Time Series Generation via Diffusion Models
- Actor-Critic without Actor
- SAGE:State-Aware Guided End-to-End Policy for Multi-Stage Sequential Tasks via Hidden Markov Decision Process
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition
- Selective Classifier-free Guidance for Zero-shot Text-to-speech
- MMG: Mutual Information Estimation via the MMSE Gap in Diffusion
- PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
- RFMSR: Residual Flow Matching for Image Super-Resolution
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- ELF: Embedded Language Flows
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- Training Flow Matching Models with Reliable Labels via Self-Purification
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- StereoFoley: Object-Aware Stereo Audio Generation from Video
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
- ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
- Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling
- DiffQ: Unified Parameter Initialization for Variational Quantum Algorithms via Diffusion Models
- OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
- Ambiguous Medical Image Segmentation Using Diffusion Schrödinger Bridge
- MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances
- Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
- HOGraspFlow: Exploring Vision-based Generative Grasp Synthesis with Hand-Object Priors and Taxonomy Awareness
- Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
- A Mutil-conditional Diffusion Transformer for Versatile Seismic Wave Generation
- DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
- Animalbooth: multimodal feature enhancement for animal subject personalization
- Enhancing Reference-based Sketch Colorization via Separating Reference Representations
- A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
- DoubleGen: Debiased Generative Modeling of Counterfactuals
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Blind-Spot Guided Diffusion for Self-supervised Real-World Denoising
- Sampling String Vacua Using Generative Models
- Dynamic Classifier-Free Diffusion Guidance via Online Feedback
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- DiffusionNFT: Online Diffusion Reinforcement with Forward Process
- ROOT: Rethinking Offline Optimization as Distributional Translation via Probabilistic Bridge
- Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
- The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- Kuramoto Orientation Diffusion Models
- Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
- WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance
- Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
- MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis
- Radiology Report Conditional 3D CT Generation with Multi Encoder Latent diffusion Model
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
- De novo Design of All-atom Biomolecular Interactions with RFdiffusion3
- Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior
- Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures
- AnyAccomp: Generalizable Accompaniment Generation via Quantized Melodic Bottleneck
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- Inverse Design of Amorphous Materials with Targeted Properties
- DiCache: Let Diffusion Model Determine Its Own Cache
- SpeechOp: Inference-Time Task Composition for Generative Speech Processing
- Behavior Foundation Model for Humanoid Robots
- Cross-Distribution Diffusion Priors-Driven Iterative Reconstruction for Sparse-View CT
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- Optimization for Massive 3D-RIS Deployment: A Generative Diffusion Model-Based Approach
- DRAG: Data Reconstruction Attack using Guided Diffusion
- A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models
- Inference-stage Adaptation-projection Strategy Adapts Diffusion Policy to Cross-manipulators Scenarios
- PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models
- Dual Orthogonal Guidance for Robust Diffusion-based Handwritten Text Generation
- Mechanistic Learning with Guided Diffusion Models to Predict Spatio-Temporal Brain Tumor Growth
- Composable Score-based Graph Diffusion Model for Multi-Conditional Molecular Generation
- Integrating Anatomical Priors into a Causal Diffusion Model
- Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling
- Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
- Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
- ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
- Feature Space Analysis by Guided Diffusion Model
- Universal Few-Shot Spatial Control for Diffusion Models
- Reconstruction Alignment Improves Unified Multimodal Models
- Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
- BIR-Adapter: A Low-Complexity Diffusion Model Adapter for Blind Image Restoration
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models
- Interleaving Reasoning for Better Text-to-Image Generation
- Continuous Audio Language Models
- Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction
- Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- Imagining Alternatives: Towards High-Resolution 3D Counterfactual Medical Image Generation via Language Guidance
- SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
- SemSteDiff: Generative Diffusion Model-based Coverless Semantic Steganography Communication
- ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models Improves Recognition
- Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
- Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner
- DCDB: Dynamic Conditional Dual Diffusion Bridge for Ill-posed Multi-Tasks
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing
- TeRA: Rethinking Text-guided Realistic 3D Avatar Generation
- VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
- Fidelity-preserving enhancement of ptychography with foundational text-to-image models
- Head-Related Transfer Function Individualization Using Anthropometric Features and Spatially Independent Latent Representation
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- Latent Space Single-Pixel Imaging Under Low-Sampling Conditions
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
- Neural Scene Designer: Self-Styled Semantic Image Manipulation
- Delta Rectified Flow Sampling for Text-to-Image Editing
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
- Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation
- NoiseCutMix: A Novel Data Augmentation Approach by Mixing Estimated Noise in Diffusion Models
- Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online
- Tree-Guided Diffusion Planner
- FLORA: Efficient Synthetic Data Generation for Object Detection in Low-Data Regimes via finetuning Flux LoRA
- EEGDM: Learning EEG Representation with Latent Diffusion Model
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Probability Density from Latent Diffusion Models for Out-of-Distribution Detection
- FastFit: Accelerating Multi-Reference Virtual Try-On via Cacheable Diffusion Models
- Towards 6G Intelligence: The Role of Generative AI in Future Wireless Networks
- MicroLad: 2D-to-3D Microstructure Reconstruction and Generation via Latent Diffusion and Score Distillation
- VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- Scaling Group Inference for Diverse and High-Quality Generation
- Source-Guided Flow Matching
- On the notion of missingness for path attribution explainability methods in medical settings: Guiding the selection of medically meaningful baselines
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
- FOCUS: Frequency-Optimized Conditioning of DiffUSion Models for mitigating catastrophic forgetting during Test-Time Adaptation
- Inference Time Debiasing Concepts in Diffusion Models
- Learning to See Through Flare
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- 4DNeX: Feed-Forward 4D Generative Modeling Made Easy
- EgoTwin: Dreaming Body and View in First Person
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- Generic Event Boundary Detection via Denoising Diffusion
- SPG: Style-Prompting Guidance for Style-Specific Content Creation
- LoRAtorio: An intrinsic approach to LoRA Skill Composition
- Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
- Probing the Representational Power of Sparse Autoencoders in Vision Models
- Can Synthetic Images Conquer Forgetting? Beyond Unexplored Doubts in Few-Shot Class-Incremental Learning
- Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Increasing the Utility of Synthetic Images through Chamfer Guidance
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- Stable Diffusion Models are Secretly Good at Visual In-Context Learning
- Prototype-Guided Diffusion: Visual Conditioning without External Memory
- EEGDM: EEG Representation Learning via Generative Diffusion Model
- Non-asymptotic convergence bound of conditional diffusion models
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
- Semantic-Aware Reconstruction Error for Detecting AI-Generated Images
- ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
- Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
- Vision Generalist Model: A Survey
- Transient Noise Removal via Diffusion-based Speech Inpainting
- SafeFix: Targeted Model Repair via Controlled Image Generation
- DiffVolume: Diffusion Models for Volume Generation in Limit Order Books
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip
- CObL: Toward Zero-Shot Ordinal Layering without User Prompting
- Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
- LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- When and how can inexact generative models still sample from the data manifold?
- Comparison Reveals Commonality: Customized Image Generation through Contrastive Inversion
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
- Multimodal learning with next-token prediction for large multimodal models
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- ReSim: Reliable World Simulation for Autonomous Driving
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models
- Live Music Models
- One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion
- Turbulent Injection assisted by Diffusion Models for Scale Resolving Simulations
- Intention Enhanced Diffusion Model for Multimodal Pedestrian Trajectory Prediction
- OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
- Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
- SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
- RAAG: Ratio Aware Adaptive Guidance
- GL-LCM: Global-Local Latent Consistency Models for Fast High-Resolution Bone Suppression in Chest X-Ray Images
- Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
- Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems
- Diffusion Models with Adaptive Negative Sampling Without External Resources
- Inference-time Scaling for Diffusion-based Audio Super-resolution
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
- Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention
- Scoring ISAC: Benchmarking Integrated Sensing and Communications via Score-Based Generative Modeling
- Versatile Transition Generation with Image-to-Video Diffusion
- DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
- Diffusion Models for Future Networks and Communications: A Comprehensive Survey
- Semantically-Guided Inference for Conditional Diffusion Models: Enhancing Covariate Consistency in Time Series Forecasting
- Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation
- UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
- A Reward-Directed Diffusion Framework for Generative Design Optimization
- On-Device Diffusion Transformer Policy for Efficient Robot Manipulation
- Wukong Framework for Not Safe For Work Detection in Text-to-Image systems
- Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
- SDMatte: Grafting Diffusion Models for Interactive Matting
- IN2OUT: Fine-Tuning Video Inpainting Model for Video Outpainting Using Hierarchical Discriminator
- DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
- Steering Guidance for Personalized Text-to-Image Diffusion Models
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- Imbalance in Balance: Online Concept Balancing in Generation Models
- Training-free Geometric Image Editing on Diffusion Models
- PixNerd: Pixel Neural Field Diffusion
- BS-1-to-N: Diffusion-Based Environment-Aware Cross-BS Channel Knowledge Map Generation for Cell-Free Networks
- DiffuMeta: Algebraic Language Models for Inverse Design of Metamaterials via Diffusion Transformers
- X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
- A Practical Investigation of Spatially-Controlled Image Generation with Transformers
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- ShortFT: Diffusion Model Alignment via Shortcut-based Fine-Tuning
- Aleatoric Uncertainty Medical Image Segmentation Estimation via Flow Matching
- ZIUM: Zero-Shot Intent-Aware Adversarial Attack on Unlearned Models
- GuidPaint: Class-Guided Image Inpainting with Diffusion Models
- Flow Matching Policy Gradients
- DmC: Nearest Neighbor Guidance Diffusion Model for Offline Cross-domain Reinforcement Learning
- JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync
- IM-Chat: A Multi-agent LLM Framework Integrating Tool-Calling and Diffusion Modeling for Knowledge Transfer in Injection Molding Industry
- Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
- LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs
- ReDi: Rectified Discrete Flow
- Enhancing Materials Discovery with Valence Constrained Design in Generative Modeling
- TransFlow: Motion Knowledge Transfer from Video Diffusion Models to Video Salient Object Detection
- Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis
- Diffusion models for multivariate subsurface generation and efficient probabilistic inversion
- Atomistic Generative Diffusion for Materials Modeling
- TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
- A Comprehensive Review of Diffusion Models in Smart Agriculture: Progress, Applications, and Challenges
- Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
- Paired Image Generation with Diffusion-Guided Diffusion Models
- R2MoE: Redundancy-Removal Mixture of Experts for Lifelong Concept Learning
- Qwen-Image-2.0 Technical Report
- One-step Latent-free Image Generation with Pixel Mean Flows
- Diffusion Models for Time Series Forecasting: A Survey
- Adding Conditional Control to Text-to-Image Diffusion Models
- DreamScene: 3D Gaussian-based End-to-end Text-to-3D Scene Generation
- DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
- PARTE: Part-Guided Texturing for 3D Human Reconstruction from a Single Image
- Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention
- SADA: Stability-guided Adaptive Diffusion Acceleration
- Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
- SplitMeanFlow: Interval Splitting Consistency in Few-Step Generative Modeling
- HarmonPaint: Harmonized Training-Free Diffusion Inpainting
- Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling
- Generative Diffusion Models for Wireless Networks: Fundamental, Architecture, and State-of-the-Art
- AutoPartGen: Autogressive 3D Part Generation and Discovery
- DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
- Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
- FADE: Adversarial Concept Erasure in Flow Models
- Multi-Component VAE with Gaussian Markov Random Field
- SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models
- Room Impulse Response Generation Conditioned on Acoustic Parameters
- Canonical Latent Representations in Conditional Diffusion Models
- Style Composition within Distinct LoRA modules for Traditional Art
- Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models
- DLSF: Dual-Layer Synergistic Fusion for High-Fidelity Image Syn-thesis
- Deep Generative Methods and Tire Architecture Design
- Token Perturbation Guidance for Diffusion Models
- A Simple Analysis of Discretization Error in Diffusion Models
- Bias Analysis in Unconditional Image Generative Models
- Diffuse and Disperse: Image Generation with Representation Regularization
- Human-Guided Shade Artifact Suppression in CBCT-to-MDCT Translation via Schrödinger Bridge with Conditional Diffusion
- AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air
- ZClassifier: Temperature Tuning and Manifold Approximation via KL Divergence on Logit Space
- Visually grounded emotion regulation via diffusion models and user-driven reappraisal
- Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
- Consistency Trajectory Planning: High-Quality and Efficient Trajectory Optimization for Offline Model-Based Reinforcement Learning
- Real-Time Adaptive Motion Planning via Point Cloud-Guided, Energy-Based Diffusion and Potential Fields
- ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching
- Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models
- Stable Score Distillation
- Interactive Drawing Guidance for Anime Illustrations with Diffusion Model
- Learning Diffusion Models with Flexible Representation Guidance
- Theory-Informed Improvements to Classifier-Free Guidance for Discrete Diffusion Models
- When and Where do Data Poisons Attack Textual Inversion?
- EnCoBo: Energy-Guided Concept Bottlenecks for Interpretable Generation
- Contrastive Conditional-Unconditional Alignment for Long-tailed Diffusion Model
- EscherNet++: Simultaneous Amodal Completion and Scalable View Synthesis through Masked Fine-Tuning and Enhanced Feed-Forward 3D Reconstruction
- Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
- Evaluating Attribute Confusion in Fashion Text-to-Image Generation
- Democratizing High-Fidelity Co-Speech Gesture Video Generation
- Improving scDiffusion with Sparsity-Biased Classifier-Free Guidance
- Concept-TRAK: Understanding how diffusion models learn concepts through concept-level attribution
- Interactive Generative Motion Editing via Scheduled Inpainting
- FairDiffuseVQVAE: Sampling-Time Fairness in Tabular Diffusion via Conditional Refinement of Vector-Quantized Latents
- MOST: Motion Diffusion Model for Rare Text via Temporal Clip Banzhaf Interaction
- Prompt-Free Conditional Diffusion for Multi-object Image Augmentation
- NeoBabel: A Multilingual Open Tower for Visual Generation
- Bridging Sequential Deep Operator Network and Video Diffusion: Residual Refinement of Spatio-Temporal PDE Solutions
- ScoreAdv: Score-based Targeted Generation of Natural Adversarial Examples via Diffusion Models
- LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
- DreamGrasp: Zero-Shot 3D Multi-Object Reconstruction from Partial-View Images for Robotic Manipulation
- Brownian Bridge Diffusion for Sequential Recommendation
- ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion
- Generative Panoramic Image Stitching
- Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions
- SegmentDreamer: Towards High-fidelity Text-to-3D Synthesis with Segmented Consistency Trajectory Distillation
- Object-centric Denoising Diffusion Models for Physical Reasoning
- Meshy T2: Fast Native Mesh Generation with Flow Matching
- Discrete Diffusion Trajectory Alignment via Stepwise Decomposition
- Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors
- Cloud Diffusion Part 1: Theory and Motivation
- Context Tuning for In-Context Optimization
- DiffEdit: Diffusion-based semantic image editing with mask guidance
- Zero-Shot Cyclic Peptide Design via Composable Geometric Constraints
- Evaluating Adversarial Protections for Diffusion Personalization: A Comprehensive Study
- FACM: Flow-Anchored Consistency Models
- LACONIC: A 3D Layout Adapter for Controllable Image Creation
- FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting
- RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
- APT: Adaptive Personalized Training for Diffusion Models with Limited Data
- Hita: Holistic Tokenizer for Autoregressive Image Generation
- Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers
- Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation
- Understanding Trade offs When Conditioning Synthetic Data
- MAGIC: Few-Shot Mask-Guided Anomaly Inpainting with Prompt Perturbation, Spatially Adaptive Guidance, and Context Awareness
- LATTE: Latent Trajectory Embedding for Diffusion-Generated Image Detection
- Progressive Checkerboards for Autoregressive Multiscale Image Generation
- Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams
- Resolving Turbulent Magnetohydrodynamics: A Hybrid Operator-Diffusion Framework
- Frontiers of Generative AI for Network Optimization: Theories, Limits, and Visions
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
- Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
- Expert-Data Alignment Governs Generation Quality in Decentralized Diffusion Models
- Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation
- Guided Unconditional and Conditional Generative Models for Super-Resolution and Inference of Quasi-Geostrophic Turbulence
- Diffusion Classifier Guidance for Non-robust Classifiers
- Posterior Inference in Latent Space for Scalable Constrained Black-box Optimization
- Edit Flows: Flow Matching with Edit Operations
- MAMBO: High-Resolution Generative Approach for Mammography Images
- MotionGPT3: Human Motion as a Second Modality
- StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
- Blending Concepts with Text-to-Image Diffusion Models
- SG-LDM: Semantic-Guided LiDAR Generation via Latent-Aligned Diffusion
- A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation
- Contrastive Learning with Diffusion Features for Weakly Supervised Medical Image Segmentation
- A Unified Framework for Stealthy Adversarial Generation via Latent Optimization and Transferability Enhancement
- Pyramidal Patchification Flow for Visual Generation
- FA-Seg: A Fast and Accurate Diffusion-Based Method for Open-Vocabulary Segmentation
- Flexibility-Conditioned Protein Structure Design with Flow Matching
- STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing
- Multimodal Atmospheric Super-Resolution With Deep Generative Models
- EgoM2P: Egocentric Multimodal Multitask Pretraining
- Diffusion Counterfactual Generation with Semantic Abduction
- Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
- Improving Diffusion-Based Image Editing Faithfulness via Guidance and Scheduling
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
- FreeDNA: Endowing Domain Adaptation of Diffusion-Based Dense Prediction with Training-Free Domain Noise Alignment
- Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
- Inverse Design of Diffractive Metasurfaces Using Diffusion Models
- Diffusion Tree Sampling: Scalable inference-time alignment of diffusion models
- HiWave: Training-Free High-Resolution Image Generation via Wavelet-Based Diffusion Sampling
- Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation
- Ctrl-Z Sampling: Diffusion Sampling with Controlled Random Zigzag Explorations
- Unraveling the Potential of Diffusion Models in Small Molecule Generation
- Improving Progressive Generation with Decomposable Flow Matching
- Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
- Controllable diffusion-based generation for multi-channel biological data
- Style Transfer: A Decade Survey
- Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router
- When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators
- PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes
- Guidance in the Frequency Domain Enables High-Fidelity Sampling at Low CFG Scales
- Noise Consistency Training: A Native Approach for One-Step Generator in Learning Additional Controls
- From Virtual Games to Real-World Play
- Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset
- MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners
- CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing
- Generative Diffusion Receivers: Achieving Pilot-Efficient MIMO-OFDM Communications
- Instability in Diffusion ODEs: An Explanation for Inaccurate Image Reconstruction
- Exact Conditional Score-Guided Generative Modeling for Amortized Inference in Uncertainty Quantification
- Inverse-and-Edit: Effective and Fast Image Editing by Cycle Consistency Models
- Two Sonification Methods for the MindCube
- ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
- EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations
- GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models
- BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
- Beyond Blur: A Fluid Perspective on Generative Diffusion Models
- Fast and Stable Diffusion Planning through Variational Adaptive Weighting
- How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
- Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective
- Generating Directed Graphs with Dual Attention and Asymmetric Encoding
- Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
- Minimizing Structural Vibrations via Guided Flow Matching Design Optimization
- UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting
- When Model Knowledge meets Diffusion Model: Diffusion-assisted Data-free Image Synthesis with Alignment of Domain and Class
- Provable Maximum Entropy Manifold Exploration via Diffusion Models
- Acoustic Waveform Inversion with Image-to-Image Schrödinger Bridges
- Difference Inversion: Interpolate and Isolate the Difference with Token Consistency for Image Analogy Generation
- Causally Steered Diffusion for Automated Video Counterfactual Generation
- DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- FRIDU: Functional Map Refinement with Guided Image Diffusion
- Align Your Flow: Scaling Continuous-Time Flow Map Distillation
- Steering LLM Thinking with Budget Guidance
- Vid-CamEdit: Video Camera Trajectory Editing with Generative Rendering from Estimated Geometry
- AttentionDrag: Exploiting Latent Correlation Knowledge in Pre-trained Diffusion Models for Image Editing
- ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching
- WildCAT3D: Appearance-Aware Multi-View Diffusion in the Wild
- Fake it till You Make it: Reward Modeling as Discriminative Prediction
- DynaGuide: Steering Diffusion Polices with Active Dynamic Guidance
- DualFast: Dual-Speedup Framework for Fast Sampling of Diffusion Models
- VideoPDE: Unified Generative PDE Solving via Video Inpainting Diffusion Models
- Dive3D: Diverse Distillation-based Text-to-3D Generation via Score Implicit Matching
- LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer
- Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts
- Constrained Diffusers for Safe Planning and Control
- Wireless Channel Identification via Conditional Diffusion Model
- SAIL: Faster-than-Demonstration Execution of Imitation Learning Policies
- Audio synthesizer inversion in symmetric parameter spaces with approximately equivariant flow matching
- Hi-VAE: Efficient Video Autoencoding with Global and Detailed Motion
- LiLAC: A Lightweight Latent ControlNet for Musical Audio Generation
- Measurement-Aligned Sampling for Inverse Problem
- ViSAGe: Video-to-Spatial Audio Generation
- Conditional Denoising Diffusion for ISAC Enhanced Channel Estimation in Cell-Free 6G
- Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models
- Execution Guided Line-by-Line Code Generation
- ReconMOST: Multi-Layer Sea Temperature Reconstruction with Observations-Guided Diffusion
- Measuring Semantic Information Production in Generative Diffusion Models
- What Exactly Does Guidance Do in Masked Discrete Diffusion Models
- Geometric Regularity in Deterministic Sampling of Diffusion-based Generative Models
- SPARKE: Scalable Prompt-Aware Diversity and Novelty Guidance in Diffusion Models via RKE Score
- Graph Diffusion that can Insert and Delete
- STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
- Learning to Weight Parameters for Training Data Attribution
- RNE: plug-and-play diffusion inference-time control and energy-based training
- BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning
- Feedback Guidance of Diffusion Models
- Learning Design-Score Manifold to Guide Diffusion Models for Offline Optimization
- UniRes: Universal Image Restoration for Complex Degradations
- Contrastive Flow Matching
- MARBLE: Material Recomposition and Blending in CLIP-Space
- Aligning Latent Spaces with Flow Priors
- PixCell: A generative foundation model for digital histopathology images
- Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model
- Progressive Tempering Sampler with Diffusion
- SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training
- Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
- Person-In-Situ: Scene-Consistent Human Image Insertion with Occlusion-Aware Pose Control
- Steerable Scene Generation with Post Training and Inference-Time Search
- Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
- Efficient Flow Matching using Latent Variables
- CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
- Personalized MR-Informed Diffusion Models for 3D PET Image Reconstruction
- How Far Are We from Generating Missing Modalities with Foundation Models?
- Sounding that Object: Interactive Object-Aware Image to Audio Generation
- HuGeDiff: 3D Human Generation via Diffusion with Gaussian Splatting
- Solving Inverse Problems via Diffusion-Based Priors: An Approximation-Free Ensemble Sampling Approach
- Algorithm- and Data-Dependent Generalization Bounds for Diffusion Models
- Negative-Guided Subject Fidelity Optimization for Zero-Shot Subject-Driven Generation
- DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
- Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
- The Unreasonable Effectiveness of Discrete-Time Gaussian Process Mixtures for Robot Policy Learning
- RADE: Learning Risk-Adjustable Driving Environment via Multi-Agent Conditional Diffusion
- Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
- Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
- FlexPainter: Flexible and Multi-View Consistent Texture Generation
- InterMamba: Efficient Human-Human Interaction Generation with Adaptive Spatio-Temporal Mamba
- IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
- TaxaDiffusion: Progressively Trained Diffusion Model for Fine-Grained Species Generation
- Synthesis of discrete-continuous quantum circuits with multimodal diffusion models
- Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation
- NoiseAR: AutoRegressing Initial Noise Prior for Diffusion Models
- Synthetic Data Augmentation using Pre-trained Diffusion Models for Long-tailed Food Image Classification
- Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment
- Latent Stochastic Interpolants
- ADEPT: Adaptive Diffusion Environment for Policy Transfer Sim-to-Real
- Efficiency without Compromise: CLIP-aided Text-to-Image GANs with Increased Diversity
- FourierFlow: Frequency-aware Flow Matching for Generative Turbulence Modeling
- SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
- Neuro-Symbolic Generative Diffusion Models for Physically Grounded, Robust, and Safe Generation
- CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
- FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video Generation
- Real-Time Person Image Synthesis Using a Flow Matching Model
- Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation
- Your Demands Deserve More Bits: Referring Semantic Image Compression at Ultra-low Bitrate
- IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
- Text-to-CT Generation via 3D Latent Diffusion Model with Contrastive Vision-Language Pretraining
- Parallel Rescaling: Rebalancing Consistency Guidance for Personalized Diffusion Models
- Mamba-Diffusion Model with Learnable Wavelet for Controllable Symbolic Music Generation
- DLM-One: Diffusion Language Models for One-Step Sequence Generation
- STORK: Faster Diffusion And Flow Matching Sampling By Resolving Both Stiffness And Structure-Dependence
- Not All Parameters Matter: Masking Diffusion Models for Enhancing Generation Ability
- MiniMax-Remover: Taming Bad Noise Helps Video Object Removal
- TRAP: Targeted Redirecting of Agentic Preferences
- D-AR: Diffusion via Autoregressive Models
- ZeroSep: Separate Anything in Audio with Zero Training
- Inference-time Scaling of Diffusion Models through Classical Search
- CryoCCD: Conditional Cycle-consistent Diffusion with Biophysical Modeling for Cryo-EM Synthesis
- Video Editing for Audio-Visual Dubbing
- TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance
- Diffusion-Based Generative Models for 3D Occupancy Prediction in Autonomous Driving
- Principal Context-aware Diffusion Guided Data Augmentation for Fault Localization
- Efficiently Access Diffusion Fisher: Within the Outer Product Span Space
- Normalizing Flows are Capable Models for Continuous Control
- Generating Fit Check Videos with a Handheld Camera
- DarkDiff: Advancing Low-Light Raw Enhancement by Retasking Diffusion Models for Camera ISP
- MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction
- Diffusion Guidance Is a Controllable Policy Improvement Operator
- Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering
- OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
- EquiReg: Equivariance Regularized Diffusion for Inverse Problems
- ClimSat – A diffusion autoencoder model for climate-conditional satellite image editing
- UniMoGen: Universal Motion Generation
- Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion Processes
- What Makes for Text to 360-degree Panorama Generation with Stable Diffusion?
- AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
- ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation
- Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design
- Kernel-Smoothed Scores for Denoising Diffusion: A Bias-Variance Study
- EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
- Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
- Efficient Controllable Diffusion via Optimal Classifier Guidance
- PropMolFlow: Property-Guided Molecule Generation with Geometry-Complete Flow Matching
- Exploring Timeline Control for Facial Motion Generation
- OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
- CoDA: Coordinated Diffusion Noise Optimization for Whole-Body Manipulation of Articulated Objects
- SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
- Geometry-Editable and Appearance-Preserving Object Compositon
- Leveraging Diffusion Models for Parameterized Quantum Circuit Generation
- ALTER: All-in-One Layer Pruning and Temporal Expert Routing for Efficient Diffusion Generation
- Designing Cyclic Peptides via Harmonic SDE with Atom-Bond Modeling
- Frame In-N-Out: Unbounded Controllable Image-to-Video Generation
- Conditional Diffusion Models with Classifier-Free Gibbs-like Guidance
- Policy Optimized Text-to-Image Pipeline Design
- Empowering Vector Graphics with Consistently Arbitrary Viewing and View-dependent Visibility
- Multi-Embodiment Robotic Retargeting via Guided Diffusion Model
- Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models
- NatADiff: Adversarial Boundary Guidance for Natural Adversarial Diffusion
- OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
- No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
- ReDDiT: Rehashing Noise for Discrete Visual Generation
- Understanding Generalization in Diffusion Distillation via Probability Flow Distance
- Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
- HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance
- Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift
- Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
- Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
- Adaptive Classifier-Free Guidance via Dynamic Low-Confidence Masking
- Underwater Diffusion Attention Network with Contrastive Language-Image Joint Learning for Underwater Image Enhancement
- HF-VTON: High-Fidelity Virtual Try-On via Consistent Geometric and Semantic Alignment
- Absolute Coordinates Make Motion Generation Easy
- Harnessing the Power of Training-Free Techniques in Text-to-2D Generation for Text-to-3D Generation via Score Distillation Sampling
- Graph Guided Diffusion: Unified Guidance for Conditional Graph Generation
- SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
- Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
- Jodi: Unification of Visual Generation and Understanding via Joint Modeling
- OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
- Adaptive Diffusion Guidance via Stochastic Optimal Control
- Plug-and-Play Context Feature Reuse for Efficient Masked Generation
- GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation
- MGD3: Mode-Guided Dataset Distillation using Diffusion Models
- Smoothie: Smoothing Diffusion on Token Embeddings for Text Generation
- How to build a consistency model: Learning flow maps via self-distillation
- Test-Time Scaling of Diffusion Models via Noise Trajectory Search
- DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
- Localizing Knowledge in Diffusion Transformers
- DVD-Quant: Data-free Video Diffusion Transformers Quantization
- Diffusion Self-Weighted Guidance for Offline Reinforcement Learning
- Improved Sample Complexity For Diffusion Model Training Without Empirical Risk Minimizer Access
- Towards more transferable adversarial attack in black-box manner
- What Do You Need for Compositional Generalization in Diffusion Planning?
- Strictly Constrained Generative Modeling via Split Augmented Langevin Sampling
- A Unified and Fast-Sampling Diffusion Bridge Framework via Stochastic Optimal Control
- Diffusion Classifiers Understand Compositionality, but Conditions Apply
- Why Diffusion Models Don't Memorize: The Role of Implicit Dynamical Regularization in Training
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- A Minimalist Method for Fine-tuning Text-to-Image Diffusion Models
- T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models
- REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training
- Learning Flexible Forward Trajectories for Masked Molecular Diffusion
- Forward-only Diffusion Probabilistic Models
- Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models
- Conditional Panoramic Image Generation via Masked Autoregressive Modeling
- Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
- Erased or Dormant? Rethinking Concept Erasure Through Reversibility
- SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
- Source Separation by Flow Matching
- Materials Generation in the Era of Artificial Intelligence: A Comprehensive Survey
- FPQVAR: Floating Point Quantization for Visual Autoregressive Model with FPGA Hardware Co-design
- CDST: Color Disentangled Style Transfer for Universal Style Reference Customization
- URLs Help, Topics Guide: Understanding Metadata Utility in LLM Training
- Leveraging the Powerful Attention of a Pre-trained Diffusion Model for Exemplar-based Image Colorization
- FaceCrafter: Identity-Conditional Diffusion with Disentangled Control over Facial Pose, Expression, and Emotion
- Angle Domain Guidance: Latent Diffusion Requires Rotation Rather Than Extrapolation
- Cascaded Diffusion Models for Neural Motion Planning
- Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
- SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
- Comprehensive Evaluation and Analysis for NSFW Concept Erasure in Text-to-Image Diffusion Models
- My Face Is Mine, Not Yours: Facial Protection Against Diffusion Model Face Swapping
- CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization
- Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
- Emerging Properties in Unified Multimodal Pretraining
- UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
- Vid2World: Crafting Video Diffusion Models to Interactive World Models
- Adaptive Inference-Time Scaling via Cyclic Diffusion Search
- Challenges and Limitations of Generative AI in Synthesizing Wearable Sensor Data
- Learning to Integrate Diffusion ODEs by Averaging the Derivatives
- Instructing Text-to-Image Diffusion Models via Classifier-Guided Semantic Optimization
- Improving Compositional Generation with Diffusion Models Using Lift Scores
- Minimum-Excess-Work Guidance
- Policy Contrastive Decoding for Robotic Foundation Models
- Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
- Accelerate TarFlow Sampling with GS-Jacobi Iteration
- UniHM: Universal Human Motion Generation with Object Interactions in Indoor Scenes
- Diffusion Models with Double Guidance: Generate with aggregated datasets
- Constraint-Aware Diffusion Guidance for Robotics: Real-Time Obstacle Avoidance for Autonomous Racing
- Few-Step Diffusion via Score identity Distillation
- Mean Flows for One-step Generative Modeling
- MVAR: Visual Autoregressive Modeling with Scale and Spatial Markovian Conditioning
- Modular Diffusion Policy Training: Decoupling and Recombining Guidance and Diffusion for Offline RL
- Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
- Video-GPT via Next Clip Diffusion
- Guiding Diffusion with Deep Geometric Moments: Balancing Fidelity and Variation
- VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
- Black-box Adversaries from Latent Space: Unnoticeable Attacks on Human Pose and Shape Estimation
- SpatialCrafter: Unleashing the Imagination of Video Diffusion Models for Scene Reconstruction from Limited Observations
- Diffmv: A Unified Diffusion Framework for Healthcare Predictions with Random Missing Views and View Laziness
- FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge
- UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- Recent Advances in Diffusion Models for Hyperspectral Image Processing and Analysis: A Review
- Unpaired Downscaling of Fluid Flows with Diffusion Bridges
- FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation
- Prior-Guided Diffusion Planning for Offline Reinforcement Learning
- NeuSEditor: From Multi-View Images to Text-Guided Neural Surface Edits
- Content Generation Models in Computational Pathology: A Comprehensive Survey on Methods, Applications, and Challenges
- Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching
- QVGen: Pushing the Limit of Quantized Video Generative Models
- One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework
- Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models
- MTVCrafter: 4D Motion Tokenization for Open-World Human Image Animation
- From Air to Wear: Personalized 3D Digital Fashion with AR/VR Immersive 3D Sketching
- Parallel Scaling Law for Language Models
- Multi-Token Prediction Needs Registers
- MuScriptor: An Open Model for Multi-Instrument Music Transcription
- Don't Forget your Inverse DDIM for Image Editing
- Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving
- Heterogeneous Decentralized Diffusion Models
- Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance
- ConDiSim: Conditional Diffusion Models for Simulation Based Inference
- Plug-and-Play Guidance for Discrete Diffusion Models via Gradient-Informed Logit Correction
- Distilling Drifting Transformers with Representation Autoencoders
- FLUXSynID: A Framework for Identity-Controlled Synthetic Face Generation with Document and Live Images
- MixBridge: Heterogeneous Image-to-Image Backdoor Attack through Mixture of Schrödinger Bridges
- DiffCrysGen: A Score-Based Diffusion Model for Design of Diverse Inorganic Crystalline Materials
- DanceGRPO: Unleashing GRPO on Visual Generation
- Towards SFW sampling for diffusion models via external conditioning
- Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
- Unsupervised Learning for Class Distribution Mismatch
- Topology Guidance: Controlling the Outputs of Generative Models via Vector Field Topology
- ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
- HDGlyph: A Hierarchical Disentangled Glyph-Based Framework for Long-Tail Text Rendering in Diffusion Models
- GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding
- StableMotion: One-Step Motion Estimation with Diffusion Prior
- Noise-Consistent Siamese-Diffusion for Medical Image Synthesis and Segmentation
- DiffLocks: Generating 3D Hair from a Single Image using Diffusion Models
- Prompt to Polyp: Medical Text-Conditioned Image Synthesis with Diffusion Models
- SVAD: From Single Image to 3D Avatar via Synthetic Data Generation with Video Diffusion and Data Augmentation
- Cross-Problem Solving for Network Optimization: Is Problem-Aware Learning the Key?
- ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation
- Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
- Provably Safe Generative Sampling with Constricting Barrier Functions
- Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
- A Survey on Generative Diffusion Models
- Rethinking Score Distilling Sampling for 3D Editing and Generation
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- Provable Efficiency of Guidance in Diffusion Models for General Data Distribution
- Fast Flow-based Visuomotor Policies via Conditional Optimal Transport Couplings
- BitDance: Scaling Autoregressive Generative Models with Binary Tokens
- It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models
- A Framework for Generating Semantically Ambiguous Images to Probe Human and Machine Perception
- A chemical language model for reticular materials design
- dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model
- Spectral Diffusion for Protein Dynamics
- CytoSyn: a Foundation Diffusion Model for Histopathology -- Tech Report
- SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
- On the Generalization in Topology Optimization via Sensitivity-Conditioned Bernoulli Flow Matching
- KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution
- JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
- dots.tts Technical Report
- MIBURI: Towards Expressive Interactive Gesture Synthesis
- Generative diffusion model surrogates for mechanistic agent-based biological models
- Q-Tag: watermarking quantum circuit generative models
- InstructAttribute: Fine-grained Object Attributes editing with Instruction
- Causal Motion Diffusion Models for Autoregressive Motion Generation
- SOM-VQ: Topology-Aware Tokenization for Interactive Generative Models
- Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge
- End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer
- Beyond Language Modeling: An Exploration of Multimodal Pretraining
- World Action Models are Zero-shot Policies
- Image Generation with a Sphere Encoder
- Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention into Convolutions
- Follow the Mean: Reference-Guided Flow Matching
- Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation
- TD3B: Transition-Directed Discrete Diffusion for Allosteric Binder Generation
- MP2D: Constrained Monte Carlo Tree-Guided Diffusion for Multi-Objective Protein Sequence Design
- AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
- Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models
- GarmentX: Autoregressive Parametric Representations for High-Fidelity 3D Garment Generation
- PixelHacker: Image Inpainting with Structural and Semantic Consistency
- Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
- SoccerDiffusion: Toward Learning End-to-End Humanoid Robot Soccer from Gameplay Recordings
- Towards Flow-Matching-based TTS without Classifier-Free Guidance
- Erased but Not Forgotten: How Backdoors Compromise Concept Erasure
- Multimodal Conditioned Diffusive Time Series Forecasting
- DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
- DanceOPD: On-Policy Generative Field Distillation
- Conditional Monte Carlo Tree Diffusion for Designing Cell-Type-Specific and Biologically Faithful Regulatory DNA
- Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design
- Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
- EarthMapper: Visual Autoregressive Models for Controllable Bidirectional Satellite-Map Translation
- Enhancing Privacy-Utility Trade-offs to Mitigate Memorization in Diffusion Models
- Continuous Adversarial Flow Models
- MapPFN: Learning Causal Perturbation Maps in Context
- What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering
- Secure Intellicise Wireless Network: Agentic AI for Coverless Semantic Steganography Communication
- DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers
- RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing
- When Oracle Conditioning Misleads Deployment: Conditioning-Availability Bias in Echocardiographic Segmentation
- DiffImaginE: Imagine to Verify Entity Types with Diffusio
- LiDPM: Rethinking Point Diffusion for Lidar Scene Completion
- Towards Real-world Environment-aware Zero-shot Text-to-speech Synthesis via Disentangled Audio Infilling
- 3DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion Models
- Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models
- Text-to-Image Alignment in Denoising-Based Models through Step Selection
- Fast Autoregressive Models for Continuous Latent Generation
- TarDiff: Target-Oriented Diffusion Guidance for Synthetic Electronic Health Record Time Series Generation
- Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution
- CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention
- Intrinsic-Hybrid Latent Diffusion Models for Generative Modeling on Unknown Manifolds
- OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films
- Best-of-N TTS Evaluation is Confounded by ASR Family Alignment
- MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- RiboSphere: Learning Unified and Efficient Representations of RNA Structures
- PRISM: Probabilistic Representation for Integrated Shape Modeling and Generation
- Satellite to GroundScape -- Large-scale Consistent Ground View Generation from Satellite Views
- DualOptim: Enhancing Efficacy and Stability in Machine Unlearning with Dual Optimizers
- Boosting Generative Image Modeling via Joint Image-Feature Synthesis
- Structure-Preserving Zero-Shot Image Editing via Stage-Wise Latent Injection in Diffusion Models
- StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D Gaussians
- Bringing Diversity from Diffusion Models to Semantic-Guided Face Asset Generation
- RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
- Solving New Tasks by Adapting Internet Video Knowledge
- Entropy Rectifying Guidance for Diffusion and Flow Models
- Beyond One-Hot Labels: Semantic Mixing for Model Calibration
- Supervising 3D Talking Head Avatars with Analysis-by-Audio-Synthesis
- IMAGGarment: Fine-Grained Garment Generation for Controllable Fashion Design
- Set You Straight: Auto-Steering Denoising Trajectories to Sidestep Unwanted Concepts
- TTRD3: Texture Transfer Residual Denoising Dual Diffusion Model for Remote Sensing Image Super-Resolution
- SPIE: Semantic and Structural Post-Training of Image Editing Diffusion Models with AI feedback
- DMM: Building a Versatile Image Generation Model via Distillation-Based Model Merging
- Diffusion Generative Recommendation with Continuous Tokens
- Diffusion Based Robust LiDAR Place Recognition
- Generalized Visual Relation Detection with Diffusion Models
- Understanding Attention Mechanism in Video Diffusion Models
- Ordered Diffusion for 3D Human Registration
- Rethinking Automatic Music Mixing as Sequential Stem Blending
- iARCS: Iterative Agentic RL for Controllable 3D Scene Generation
- Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects
- EchoEdit: Stabilizing Inversion-Free Audio Editing via Optimal Transport Geometry
- Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
- Domain-Gated Latent Diffusion: Generative Inverse Design of HMX-Class Energetic Materials with First-Principles Validation
- IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbation
- DeepWheel: Generating a 3D Synthetic Wheel Dataset for Design and Performance Evaluation
- Autoregressive Distillation of Diffusion Transformers
- ADT: Tuning Diffusion Models with Adversarial Supervision
- Taming Consistency Distillation for Accelerated Human Image Animation
- IlluSign: Illustrating Sign Language Videos by Leveraging the Attention Mechanism
- VideoPanda: Video Panoramic Diffusion with Multi-view Attention
- SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
- SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
- SpinMeRound: Consistent Multi-View Identity Generation Using Diffusion Models
- REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion Transformers
- Efficient Task-specific Conditional Diffusion Policies: Shortcut Model Acceleration and SO(3) Optimization
- Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
- Enhanced Semantic Extraction and Guidance for UGC Image Super Resolution
- I Want It That Way! Specifying Nuanced Camera Motions in Video Editing
- Scalable Motion In-betweening via Diffusion and Physics-Based Character Adaptation
- DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
- SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification
- D2iT: Dynamic Diffusion Transformer for Accurate Image Generation
- Diffusion Models for Robotic Manipulation: A Survey
- TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation
- LookingGlass: Generative Anamorphoses via Laplacian Pyramid Warping
- Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model
- PixelFlow: Pixel-Space Generative Models with Flow
- DiverseFlow: Sample-Efficient Diverse Mode Coverage in Flows
- Revisiting Likelihood-Based Out-of-Distribution Detection by Modeling Representations
- FlexIP: Dynamic Control of Preservation and Personality for Customized Image Generation
- ColorizeDiffusion v2: Enhancing Reference-based Sketch Colorization Through Separating Utilities
- EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation
- Probability Density Geodesics in Image Diffusion Latent Space
- Parasite: A Steganography-based Backdoor Attack Framework for Diffusion Models
- TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
- Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model
- HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
- Electronic Structure Guided Inverse Design Using Generative Models
- Studying Image Diffusion Features for Zero-Shot Video Object Segmentation
- Gaussian Mixture Flow Matching Models
- One-Minute Video Generation with Test-Time Training
Discussions
Related