Score-Based Generative Modeling through Stochastic Differential Equations
2020/11/26 by Song, Yang, Sohl-Dickstein, Jascha, Kingma, Diederik P. +3 · 1 voice · 1241 citations
#FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
paper · doi:10.48550/arxiv.2011.13456
Abstract
Creating noise from data is easy; creating data from noise is generative modeling. We present a stochastic differential equation (SDE) that smoothly transforms a complex data distribution to a known prior distribution by slowly injecting noise, and a corresponding reverse-time SDE that transforms the prior distribution back into the data distribution by slowly removing the noise. Crucially, the reverse-time SDE depends only on the time-dependent gradient field (\aka, score) of the perturbed data distribution. By leveraging advances in score-based generative modeling, we can accurately estimate these scores with neural networks, and use numerical SDE solvers to generate samples. We show that this framework encapsulates previous approaches in score-based generative modeling and diffusion probabilistic modeling, allowing for new sampling procedures and new modeling capabilities. In particular, we introduce a predictor-corrector framework to correct errors in the evolution of the discretized reverse-time SDE. We also derive an equivalent neural ODE that samples from the same distribution as the SDE, but additionally enables exact likelihood computation, and improved sampling efficiency. In addition, we provide a new way to solve inverse problems with score-based models, as demonstrated with experiments on class-conditional generation, image inpainting, and colorization. Combined with multiple architectural improvements, we achieve record-breaking performance for unconditional image generation on CIFAR-10 with an Inception score of 9.89 and FID of 2.20, a competitive likelihood of 2.99 bits/dim, and demonstrate high fidelity generation of 1024 x 1024 images for the first time from a score-based generative model.
Cited by
- UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
- Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization
- Image Inpainting via Stochastic Dynamics
- Simultaneous Approximation of the Score Function and Its Derivatives by Deep Neural Networks
- LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation
- Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators
- Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
- SURE Guided Posterior Sampling: Trajectory Correction for Diffusion-Based Inverse Problems
- JADAI: Jointly Amortizing Adaptive Design and Bayesian Inference
- Geometric decomposition of information flow for overdamped Langevin systems and optimal transport in subsystems
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- Long-Range Distillation: Distilling 10,000 Years of Simulated Climate into Long Timestep AI Weather Models
- ReDiF: Reinforced Distillation for Few Step Diffusion
- Parallel Diffusion Solver via Residual Dirichlet Policy Optimization
- A Generative Reconstruction of Low-ℓ CMB B-Mode Signal using Reverse Diffusion in Deep Learning
- Energy-Guided Flow Matching Enables Few-Step Conformer Generation and Ground-State Identification
- Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
- Sampling with Shielded Langevin Monte Carlo Using Navigation Potentials
- Reverse-Time Diffusion Processes for Discrete Time Linear and Nonlinear Systems with non-Gaussian Noise
- Joint Flow Matching for Generator-Consistent Classification
- Generative Modeling by Value-Driven Transport
- Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling
- Learning Sampling Parameters for Diffusion Models
- Restoration Flow Matching-Based Channel Refinement and Equalization Correction for MIMO Semantic Communications
- Normalizing Trajectory Models
- Logit-Coordinate Generative Models for Mixed Continuous-Categorical Tabular Data
- Escaping the Euclidean Void: Manifold-Informed Flow Matching for Sequential Recommendation
- Wireless Intelligence Needs a Cerebellum: Score-Based Foundation Models Toward Real-Time Physical-Layer Inference
- Joint Activity Detection and Channel Estimation for Massive Connectivity: Where Message Passing Meets Score-Based Generative Priors
- Diffusion-Guided Search via Exponential Tilting (DiffTilt): An Application to Falsification of Safety-Critical Systems
- TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation
- All in One: Generative Modeling as Mean-Field Game Design
- A Dacorogna-Moser construction of transport maps on ℝd with application to geodesics on the space of couplings
- From Score Learning to Discretized Sampling: An End-to-End Generalization Analysis of Diffusion Models
- Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations
- Score-Based Stabilization for Time-Dependent Problems
- ScaleResfusion: Residual Rectified Flow based on Residual Vector Field
- Lantern: Conflict-Aware Gradient Blending for Physics-Guided Diffusion Models in Calorimeter Simulation
- Low-Latency Generative Semantic Communication via Channel-Realization Flow Matching
- Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models
- AI-generated Images Challenge Visual Trust in High-risk Scenarios
- Diffusion models for SU(2) lattice gauge theory in two dimensions
- Generalized Fine-Tuning of Diffusion Models via Stochastic Control and FBSDEs
- Differencing the Diffusion Trajectory toward Uncertain Components for Time Series Forecasting
- Autoregressive One-Step Generative Modeling for Dynamical System Forecasting
- Concept-based Visual Counterfactual Explanations with Diffusion Models
- Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- Diffusion Posterior Sampling for Super-Resolution under Gaussian Measurement Noise
- Tilt Matching for Scalable Sampling and Fine-Tuning
- SDUM: A Scalable Deep Unrolled Model for Universal MRI Reconstruction
- UPMRI: Unsupervised Parallel MRI Reconstruction via Projected Conditional Flow Matching
- Residual Prior Diffusion: A Probabilistic Framework Integrating Coarse Latent Priors with Diffusion Models
- RefineBridge: Generative Bridge Models Improve Financial Forecasting by Foundation Models
- FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting
- Enhancing diffusion models with Gaussianization preprocessing
- DiEC: Diffusion Embedded Clustering
- Generalization of Diffusion Models Arises with a Balanced Representation Space
- PhononBench:A Large-Scale Phonon-Based Benchmark for Dynamical Stability in Crystal Generation
- HGAN-SDEs: Learning Neural Stochastic Differential Equations with Hermite-Guided Adversarial Training
- How I Met Your Bias: Investigating Bias Amplification in Diffusion Models
- Generative Spectrum Cartography: Unified Reconstruction and Active Sensing via Diffusion Models
- PairFlow: Closed-Form Source-Target Coupling for Few-Step Generation in Discrete Flow Models
- Control Variate Score Matching for Diffusion Models
- Spectral Diffusion for Sampling on \rm SU(N)
- Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior
- Variational Autoregressive Networks Applied to ϕ4 Field Theory Systems
- Real-Time Streamable Generative Speech Restoration with Flow Matching
- Efficient Personalization of Generative Models via Optimal Experimental Design
- The Ensemble Schrödinger Bridge filter for Nonlinear Data Assimilation
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- Adaptive Probability Flow Residual Minimization for High-Dimensional Fokker-Planck Equations
- Generative Modeling through Koopman Spectral Analysis: An Operator-Theoretic Perspective
- SD2AIL: Adversarial Imitation Learning from Synthetic Demonstrations via Diffusion Models
- Is Your Conditional Diffusion Model Actually Denoising?
- AsyncDiff: Asynchronous Timestep Conditioning for Enhanced Text-to-Image Diffusion Inference
- Preserving Spectral Structure and Statistics in Diffusion Models
- Plasticine: A Traceable Diffusion Model for Medical Image Translation
- Out-of-Distribution Detection in Molecular Complexes via Diffusion Models for Irregular Graphs
- Is There a Better Source Distribution than Gaussian? Exploring Source Distributions for Image Flow Matching
- Local Patches Meet Global Context: Scalable 3D Diffusion Priors for Computed Tomography Reconstruction
- Efficient Zero-Shot Inpainting with Decoupled Diffusion Guidance
- MatE: Material Extraction from Single-Image via Geometric Prior
- Generative modeling of conditional probability distributions on the level-sets of collective variables
- Beyond Semantic Features: Pixel-level Mapping for Generalized AI-Generated Image Detection
- 3One2: One-step Regression Plus One-step Diffusion for One-hot Modulation in Dual-path Video Snapshot Compressive Imaging
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- A Systems-Theoretic View on the Convergence of Algorithms under Disturbances
- SFBD-OMNI: Bridge models for lossy measurement restoration with limited clean samples
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks
- EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
- Accelerating High-Throughput Catalyst Screening by Direct Generation of Equilibrium Adsorption Structures
- Softly Constrained Denoisers for Diffusion Models Applied to Partial Differential Equations
- HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens
- Spectral Representation-based Reinforcement Learning
- ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision
- WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
- Score-Based Turbo Message Passing for Plug-and-Play Compressive Imaging
- Towards Transferable Defense Against Malicious Image Edits
- Dual Attention Guided Defense Against Malicious Edits
- 4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation
- Random-Bridges as Stochastic Transports for Generative Models
- Smudged Fingerprints: A Systematic Evaluation of the Robustness of AI Image Fingerprints
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- Generative Monte Carlo Sampling for Constant-Cost Particle Transport
- DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
- World Models Can Leverage Human Videos for Dexterous Manipulation
- Image Diffusion Preview with Consistency Solver
- Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- BézierFlow: Learning Bézier Stochastic Interpolant Schedulers for Few-Step Generation
- Multi-Robot Motion Planning from Vision and Language using Heat-Inspired Diffusion
- On the continuity of flows
- Exploring the Design Space of Transition Matching
- Diffusion Model-Based Posterior Sampling in Full Waveform Inversion
- Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment
- On Approaches to Building Surrogate ODE Models for Diffusion Bridges
- Integrating Fourier Neural Operator with Diffusion Model for Autoregressive Predictions of Three-dimensional Turbulence
- PIS: A Generalized Physical Inversion Solver for Arbitrary Sparse Observations via Set Conditioned Flow Matching
- Iterative Sampling Methods for Sinkhorn Distributionally Robust Optimization
- Generative Spatiotemporal Data Augmentation
- Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- Resolution-Independent Neural Operators for Multi-Rate Sparse-View CT
- HydroDiffusion: Diffusion-Based Probabilistic Streamflow Forecasting with a State Space Backbone
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Flowception: Temporally Expansive Flow Matching for Video Generation
- Emergence of Nonequilibrium Latent Cycles in Unsupervised Generative Modeling
- PersonaLive! Expressive Portrait Image Animation for Live Streaming
- Back to the Baseline: Examining Baseline Effects on Explainability Metrics
- SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
- AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path
- Generative Modeling from Black-box Corruptions via Self-Consistent Stochastic Interpolants
- UNAAGI: Atom-Level Diffusion for Generating Non-Canonical Amino Acid Substitutions
- Diffusion differentiable resampling
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation
- Multi-dimensional Preference Alignment by Conditioning Reward Itself
- Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
- Inverse problems with diffusion models: MAP estimation via mode-seeking loss
- FALCON: Few-step Accurate Likelihoods for Continuous Flows
- Guided Transfer Learning for Discrete Diffusion Models
- Splatent: Splatting Diffusion Latents for Novel View Synthesis
- Diffusion Posterior Sampler for Hyperspectral Unmixing with Spectral Variability Modeling
- Transport Novelty Distance: A Distributional Metric for Evaluating Material Generative Models
- DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping
- Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- Fast operator learning for mapping correlations
- Distributional Shrinkage II: Higher-Order Scores Encode Brenier Map
- AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
- A Diffusion-Based Framework for High-Resolution Precipitation Forecasting over CONUS
- Refining Visual Artifacts in Diffusion Models via Explainable AI-based Flaw Activation Maps
- Explainable Learning Based Regularization of Inverse Problems
- Gradient-Informed Monte Carlo Fine-Tuning of Diffusion Models for Low-Thrust Trajectory Design
- CFO: Learning Continuous-Time PDE Dynamics via Flow-Matched Neural Operators
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- Dflow-SUR: Enhancing Generative Aerodynamic Inverse Design using Differentiation Throughout Flow Matching
- CARD: Correlation Aware Restoration with Diffusion
- One-Step Diffusion Samplers via Self-Distillation and Deterministic Flow
- Diffusion Model Regularized Implicit Neural Representation for CT Metal Artifact Reduction
- Worst-case generation via minimax optimization in Wasserstein space
- TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank
- Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
- One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
- Training-Free Vector Quantization via Gaussian VAEs
- MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer
- Physics-Guided Diffusion Priors for Multi-Slice Reconstruction in Scientific Imaging
- Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
- Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
- Materium: An Autoregressive Approach for Material Generation
- Equivariant Diffusion for Crystal Structure Prediction
- FOAM: Blocked State Folding for Memory-Efficient LLM Training
- Adaptive Path Integral Diffusion: AdaPID
- Optimal and Diffusion Transports in Machine Learning
- Latent Nonlinear Denoising Score Matching for Enhanced Learning of Structured Distributions
- Pathway to O(√(d)) Complexity bound under Wasserstein metric of flow-based models
- PMA-Diffusion: A Physics-guided Mask-Aware Diffusion Framework for TSE from Sparse Observations
- EditThinker: Unlocking Iterative Reasoning for Any Image Editor
- NEAT: Neighborhood-Guided, Efficient, Autoregressive Set Transformer for 3D Molecular Generation
- Fast and Robust Diffusion Posterior Sampling for MR Image Reconstruction Using the Preconditioned Unadjusted Langevin Algorithm
- Consist-Retinex: One-Step Noise-Emphasized Consistency Training Accelerates High-Quality Retinex Enhancement
- InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem
- Self-Supervised AI-Generated Image Detection: A Camera Metadata Perspective
- Generative Stochastic Optimal Transport: Guided Harmonic Path-Integral Diffusion
- OMTRA: A Multi-Task Generative Model for Structure-Based Drug Design
- Generative design of stabilizing controllers with diffusion models: the Youla approach
- Convergence Dynamics of Over-Parameterized Score Matching for a Single Gaussian
- ICM-SR: Image-Conditioned Manifold Regularization for Image Super-Resolution
- OmniScaleSR: Unleashing Scale-Controlled Diffusion Prior for Faithful and Realistic Arbitrary-Scale Image Super-Resolution
- Complementary Characterization of Agent-Based Models via Computational Mechanics and Diffusion Models
- LeMat-GenBench: A Unified Evaluation Framework for Crystal Generative Models
- Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
- One-Step Generative Channel Estimation via Average Velocity Field
- UniTS: Unified Time Series Generative Model for Remote Sensing
- STeP-Diff: Spatio-Temporal Physics-Informed Diffusion Models for Mobile Fine-Grained Pollution Forecasting
- Data-regularized Reinforcement Learning for Diffusion Models at Scale
- CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
- Minuet: A Diffusion Autoencoder for Compact Semantic Compression of Multi-Band Galaxy Images
- Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- On the Design of One-step Diffusion via Shortcutting Flow Paths
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features
- SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
- Highly Efficient Test-Time Scaling for T2I Diffusion Models with Text Embedding Perturbation
- Dimension-free error estimate for diffusion model and optimal scheduling
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra
- SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control
- Glance: Accelerating Diffusion Models with 1 Sample
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- Diffusion-Prior Split Gibbs Sampling for Synthetic Aperture Radar Imaging under Incomplete Measurements
- Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- A Discrete Neural Operator with Adaptive Sampling for Surrogate Modeling of Parametric Transient Darcy Flows in Porous Media
- Iterative Tilting for Diffusion Fine-Tuning
- Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
- Unrolled Networks are Conditional Probability Flows in MRI Reconstruction
- Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- A Variational Manifold Embedding Framework for Nonlinear Dimensionality Reduction
- Reconstructing Multi-Scale Physical Fields from Extremely Sparse Measurements with an Autoencoder-Diffusion Cascade
- Deep Unsupervised Anomaly Detection in Brain Imaging: Large-Scale Benchmarking and Bias Analysis
- FlowEO: Generative Unsupervised Domain Adaptation for Earth Observation
- ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling
- Syndrome-Flow Consistency Model Achieves One-step Denoising Error Correction Codes
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- Generative Modeling with Continuous Flows: Sample Complexity of Flow Matching
- Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
- DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling
- Forecasting in Offline Reinforcement Learning for Non-stationary Environments
- Adaptive-lambda Subtracted Importance Sampled Scores in Machine Unlearning for DDPMs and VAEs
- Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards
- LAP: Fast LAtent Diffusion Planner for Autonomous Driving
- DAISI: Data Assimilation with Inverse Sampling using Stochastic Interpolants
- Digital Surfactant
- SplatFont3D: Structure-Aware Text-to-3D Artistic Font Generation with Part-Level Style Control
- POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models
- UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations
- ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts
- DisMo: Disentangled Motion Representations for Open-World Motion Transfer
- Vision Bridge Transformer at Scale
- Guiding Visual Autoregressive Models through Spectrum Weakening
- Overcoming the Curvature Bottleneck in MeanFlow
- A Trainable Centrality Framework for Modern Data
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Test-time scaling of diffusions with flow maps
- Generative models for crystalline materials
- CaFlow: Enhancing Long-Term Action Quality Assessment with Causal Counterfactual Flow
- Adversarial Flow Models
- A Model and Data Dual-driven Approach for Multitargets Detection under Mainlobe Jamming
- GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
- Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- MeanFlow Transformers with Representation Autoencoders
- TSGM: Regular and Irregular Time-series Generation using Score-based Generative Models
- LaGen: Towards Autoregressive LiDAR Scene Generation
- Conditional Generative Modeling of Stochastic LTI Systems: A Behavioral Approach
- MFM-point: Multi-scale Flow Matching for Point Cloud Generation
- Deep Parameter Interpolation for Scalar Conditioning
- Crowdsourcing the Frontier: Advancing Hybrid Physics-ML Climate Simulation via a 50,000 Kaggle Competition
- HMARK: Radioactive Multi-Bit Semantic-Latent Watermarking for Diffusion Models
- From Diffusion to One-Step Generation: A Comparative Study of Flow-Based Models with Application to Image Inpainting
- Dynamic Test-Time Compute Scaling in Control Policy: Difficulty-Aware Stochastic Interpolant Policy
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
- Learning to Generate Human-Human-Object Interactions from Textual Descriptions
- Block Cascading: Training Free Acceleration of Block-Causal Video Models
- Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
- Restora-Flow: Mask-Guided Image Restoration with Flow Matching
- UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
- Low-Resolution Editing is All You Need for High-Resolution Editing
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- Terminal Velocity Matching
- Solving Diffusion Inverse Problems with Restart Posterior Sampling
- Flow Map Distillation Without Data
- Predicting partially observable dynamical systems via diffusion models with a multiscale inference scheme
- Efficiency vs. Fidelity: A Comparative Analysis of Diffusion Probabilistic Models and Flow Matching on Low-Resource Hardware
- Talagrand's convolution conjecture up to loglog via perturbed reverse heat
- ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
- EnfoPath: Energy-Informed Analysis of Generative Trajectories in Flow Matching
- Understanding, Accelerating, and Improving MeanFlow Training
- Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation
- View-Consistent Diffusion Representations for 3D-Consistent Video Generation
- FineXtrol: Controllable Motion Generation via Fine-Grained Text
- One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
- FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
- DiP: Taming Diffusion Models in Pixel Space
- Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
- Demystifying Diffusion Objectives: Reweighted Losses are Better Variational Bounds
- Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
- Zero-Shot Video Deraining with Video Diffusion Models
- Uncertainty Quantification in HSI Reconstruction using Physics-Aware Diffusion Priors and Optics-Encoded Measurements
- Jacobian-Aware Posterior Sampling for Inverse Problems
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
- Point-to-Point: Sparse Motion Guidance for Controllable Video Editing
- Versatile Recompression-Aware Perceptual Image Super-Resolution
- FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning
- Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion
- Generative Model Predictive Control in Manufacturing Processes: A Review
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- Score-Regularized Joint Sampling with Importance Weights for Flow Matching
- Diffusion Models are Molecular Dynamics Simulators
- EvDiff: High Quality Video with an Event Camera
- DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing
- Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation
- Warm Diffusion: Recipe for Blur-Noise Mixture Diffusion Models
- MRI Super-Resolution with Deep Learning: A Comprehensive Survey
- Time dependent loss reweighting for flow matching and diffusion models is theoretically justified
- Saving Foundation Flow-Matching Priors for Inverse Problems
- LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving
- FreqFlow: Long-term forecasting using lightweight flow matching
- Exact Stochastic Differential Equations for Quantum Reverse Diffusion
- cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold
- Theoretical Closed-loop Stability Bounds for Dynamical System Coupled with Diffusion Policies
- Generative design and validation of therapeutic peptides for glioblastoma based on a potential target ATP5A
- Particle Monte Carlo methods for Lattice Field Theory
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- Efficient Score Pre-computation for Diffusion Models via Cross-Matrix Krylov Projection
- BokehFlow: Depth-Free Controllable Bokeh Rendering via Flow Matching
- Unified all-atom molecule generation with neural fields
- Full-Atom Peptide Design via Riemannian-Euclidean Bayesian Flow Networks
- MiAD: Mirage Atom Diffusion for De Novo Crystal Generation
- Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
- Iterative Diffusion-Refined Neural Attenuation Fields for Multi-Source Stationary CT Reconstruction: NAF Meets Diffusion Model
- AI-driven Generation of MALDI-TOF MS for Microbial Characterization
- InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
- CFG-EC: Error Correction Classifier-Free Guidance
- FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration
- Scientific Data Compression and Super-Resolution Sampling
- Generalized Denoising Diffusion Codebook Models (gDDCM): Tokenizing images using a pre-trained diffusion model
- Conditional Diffusion Model for Multi-Agent Dynamic Task Decomposition
- Distribution Matching Distillation Meets Reinforcement Learning
- Functional Mean Flow in Hilbert Space
- An unsupervised posterior sampling framework for multi-purpose seismic data recovery
- Example-Based Feature Painting on Textures
- SecDiff: Diffusion-Aided Secure Deep Joint Source-Channel Coding Against Adversarial Attacks
- CaloClouds3: Ultra-Fast Geometry-Independent Highly-Granular Calorimeter Simulation
- PID-controlled Langevin Dynamics for Faster Sampling of Generative Models
- Which Way from B to A: The role of embedding geometry in image interpolation for Stable Diffusion
- Diffusion Model Based Signal Recovery Under 1-Bit Quantization
- Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
- MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
- On the Dimension-Free Approximation of Deep Neural Networks for Symmetric Korobov Functions
- HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models
- Chemistry-Enhanced Diffusion-Based Framework for Small-to-Large Molecular Conformation Generation
- Continuous-time Discrete-space Diffusion Model for Recommendation
- VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation
- MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy
- Arcee: Differentiable Recurrent State Chain for Generative Vision Modeling with Mamba SSMs
- Fast Data Attribution for Text-to-Image Models
- Distributional Shrinkage I: Universal Denoiser Beyond Tweedie's Formula
- Optimizing Input of Denoising Score Matching is Biased Towards Higher Score Norm
- Equivariant Sampling for Improving Diffusion Model-based Image Restoration
- Simulator and Experience Enhanced Diffusion Model for Comprehensive ECG Generation
- Enhanced Privacy Leakage from Noise-Perturbed Gradients via Gradient-Guided Conditional Diffusion Models
- Controllable protein design through Feynman-Kac steering
- Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling
- Regularized Schrödinger Bridge: Alleviating Distortion and Exposure Bias in Solving Inverse Problems
- Generative Pricing of Basket Options via Signature-Conditioned Mixture Density Networks
- Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
- Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
- SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment
- Diffusion-Based Solver for CNF Placement on the Cloud-Continuum
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- Top2Ground: A Height-Aware Dual Conditioning Diffusion Model for Robust Aerial-to-Ground View Generation
- Automatic Music Mixing using a Generative Model of Effect Embeddings
- Parallel Sampling via Autospeculation
- VEDA: 3D Molecular Generation via Variance-Exploding Diffusion with Annealing
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- Rectified Noise: A Generative Model Using Positive-incentive Noise
- Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- FlowTIE: Flow-based Transport of Intensity Equation for Phase Gradient Estimation from 4D-STEM Data
- Forecasting implied volatility surface with generative diffusion models
- Inference-Time Scaling of Diffusion Models for Infrared Data Generation
- Laplacian Score Sharpening for Mitigating Hallucination in Diffusion Models
- BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
- GFix: Perceptually Enhanced Gaussian Splatting Video Compression
- Ambiguity-aware Truncated Flow Matching for Ambiguous Medical Image Segmentation
- Integrating Reweighted Least Squares with Plug-and-Play Diffusion Priors for Noisy Image Restoration
- Image Restoration via Primal Dual Hybrid Gradient and Flow Generative Model
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance
- Turbo-DDCM: Fast and Flexible Zero-Shot Diffusion-Based Image Compression
- Test-Time Iterative Error Correction for Efficient Diffusion Models
- Functional Adjoint Sampler: Scalable Sampling on Infinite Dimensional Spaces
- Latent Refinement via Flow Matching for Training-free Linear Inverse Problem Solving
- Neodragon: Mobile Video Generation using Diffusion Transformer
- Physics-Informed Design of Input Convex Neural Networks for Consistency Optimal Transport Flow Matching
- Joint Design of Protein Surface and Structure Using a Diffusion Bridge Model
- A PDE Perspective on Generative Diffusion Models
- DiScoFormer: Plug-In Density and Score Estimation with Transformers
- Enhancing Diffusion Model Guidance through Calibration and Regularization
- SAD-Flower: Flow Matching for Safe, Admissible, and Dynamically Consistent Planning
- Integrating Score-Based Diffusion Models with Machine Learning-Enhanced Localization for Advanced Data Assimilation in Geological Carbon Storage
- The Causal Round Trip: Generating Authentic Counterfactuals by Eliminating Information Loss
- Multi-agent Coordination via Flow Matching
- KLASS: KL-Guided Fast Inference in Masked Diffusion Models
- SigmaDock: Untwisting Molecular Docking With Fragment-Based SE(3) Diffusion
- Sublinear iterations can suffice even for DDPMs
- Blind Strong Gravitational Lensing Inversion: Joint Inference of Source and Lens Mass with Score-Based Models
- CPO: Condition Preference Optimization for Controllable Image Generation
- MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
- Diffusion Models Bridge Deep Learning and Physics in ENSO Forecasting
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
- Text to Sketch Generation with Multi-Styles
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- Conditional Score Learning for Quickest Change Detection in Markov Transition Kernels
- PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection
- Integrating Score-Based Generative Modeling and Neural ODEs for Accurate Representation of Multiscale Chaotic Dynamics
- Learning Paths for Dynamic Measure Transport: A Control Perspective
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- Unified Long Video Inpainting and Outpainting via Overlapping High-Order Co-Denoising
- Finetuning-Free Personalization of Text to Image Generation via Hypernetworks
- FP-AbDiff: Improving Score-based Antibody Design by Capturing Nonequilibrium Dynamics through the Underlying Fokker-Planck Equation
- Scaling Multi-Agent Environment Co-Design with Diffusion Models
- An Interdisciplinary and Cross-Task Review on Missing Data Imputation
- Conditional Diffusion Model-Enabled Scenario-Specific Neural Receivers for Superimposed Pilot Schemes
- Discrete Bayesian Sample Inference for Graph Generation
- Stability of the Kim--Milman flow map
- Generative Hints
- Wasserstein Convergence of Critically Damped Langevin Diffusions
- IllumFlow: Illumination-Adaptive Low-Light Enhancement via Conditional Rectified Flow and Retinex Decomposition
- Wavelet-Optimized Motion Artifact Correction in 3D MRI Using Pre-trained 2D Score Priors
- Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
- Effective Test-Time Scaling of Discrete Diffusion through Iterative Refinement
- Diffusion Models are Robust Pretrainers
- Energy Loss Functions for Physical Systems
- Fractional Diffusion Bridge Models
- Towards One-step Causal Video Generation via Adversarial Self-Distillation
- XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges
- RefVTON: person-to-person Try on with Additional Unpaired Visual Reference
- Dynamic Population Distribution Aware Human Trajectory Generation with Diffusion Model
- TA-LSDiff:Topology-Aware Diffusion Guided by a Level Set Energy for Pancreas Segmentation
- Privacy-Aware Time Series Synthesis via Public Knowledge Distillation
- Learning an Efficient Optimizer via Hybrid-Policy Sub-Trajectory Balance
- Sensitivity Analysis for Climate Science with Generative Flow Models
- Generative Modeling Enables Molecular Structure Retrieval from Coulomb Explosion Imaging
- Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals
- H2-Cache: A Novel Hierarchical Dual-Stage Cache for High-Performance Acceleration of Generative Diffusion Models
- Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V
- BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
- Blind MIMO Semantic Communication via Parallel Variational Diffusion: A Completely Pilot-Free Approach
- Masked Diffusion Captioning for Visual Feature Learning
- Generative sampling with physics-informed kernels
- Hybrid Consistency Policy: Decoupling Multi-Modal Diversity and Real-Time Efficiency in Robotic Manipulation
- Likely Interpolants of Generative Models
- LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
- Group-Equivariant Diffusion Models for Lattice Field Theory
- A Review of AI-Driven Approaches for Nanoscale Heat Conduction and Radiation
- Bias-Corrected Data Synthesis for Imbalanced Learning
- FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
- SplitFlow: Flow Decomposition for Inversion-Free Text-to-Image Editing
- π_
RL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models - VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
- Neural Stochastic Flows: Solver-Free Modelling and Inference for SDE Solutions
- Physics-Guided Conditional Diffusion Networks for Microwave Image Reconstruction
- Off-policy Reinforcement Learning with Model-based Exploration Augmentation
- Can Deep Generative Models Reproduce Non-Stationary Gaussian Random Fields?
- Mimicking diffusion processes with differential equations
- A Priori Sampling of Transition States with Guided Diffusion
- From Deterministic to Generative Deep Learning for Urban Air Quality Reconstruction from Sparse Observations
- How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models
- Flow Map Learning via Nongradient Vector Flow
- Existence-Field Diffusion Model for Spatial Point Processes with Variable Cardinality
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- Denoising growth complexity: Data geometry and certified schedules for diffusion sampling
- TridentServe: A Stage-level Serving System for Diffusion Pipelines
- PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
- RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization
- Flow Matching for Measure Transport and Feedback Stabilization of Control-Affine Systems
- D2 Actor Critic: Diffusion Actor Meets Distributional Critic
- Breaking the Curse with BAND: Nonparametric Distribution Estimation in High Dimensions
- Learning Backward Transport for Source Localization
- The Score Hamiltonian: Mapping Diffusion Models to Adiabatic Transport
- Surflo: Consistent 3D Surface Flow Model with Global State
- High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation
- Physics-informed generative AI for semiconductor manufacturing: Enforcing hard physical constraints in generative models by construction
- From Noise to Order: Learning to Rank via Denoising Diffusion
- Generative Modeling via Drifting
- Distance Marching for Generative Modeling
- Meta Flow Maps enable scalable reward alignment
- Sparse Transformer Architectures via Regularized Wasserstein Proximal Operator with L1 Prior
- LGCC: Enhancing Flow Matching Based Text-Guided Image Editing with Local Gaussian Coupling and Context Consistency
- Balanced conic rectified flow
- EnzyControl: Adding Functional and Substrate-Specific Control for Enzyme Backbone Generation
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
- Generative View Stitching
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Time-Embedded Algorithm Unrolling for Computational MRI
- Synergizing chemical and AI communities for advancing laboratories of the future
- ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
- Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
- Information-Theoretic Discrete Diffusion
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Score-based constrained generative modeling via Langevin diffusions with boundary conditions
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- Simulation-free Structure Learning for Stochastic Dynamics
- RareFlow: Physics-Aware Flow-Matching for Cross-Sensor Super-Resolution of Rare-Earth Features
- Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
- Mixed Precision Training of Neural ODEs
- Model-free filtering in high dimensions via projection and score-based diffusions
- Introducing physics-informed generative models for targeting structural novelty in the exploration of chemical space
- Residual Diffusion Bridge Model for Image Restoration
- Simple Denoising Diffusion Language Models
- Machine-Learning-Guided Insights into Solid-Electrolyte Interphase Conductivity: Are Amorphous Lithium Fluorophosphates the Key?
- Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner
- On the Anisotropy of Score-Based Generative Models
- Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
- Clustering by Denoising: Latent plug-and-play diffusion for single-cell data
- A Free Probabilistic Framework for Denoising Diffusion Models: Entropy, Transport, and Reverse Processes
- Optimize Any Topology: A Foundation Model for Shape- and Resolution-Free Structural Topology Optimization
- Conjugate Relation Modeling for Few-Shot Knowledge Graph Completion
- LO-SDA: Latent Optimization for Score-based Atmospheric Data Assimilation
- An End-to-End Generative Diffusion Model for Heavy-Ion Collisions
- CANDI: Hybrid Discrete-Continuous Diffusion Models
- Diffusion-Driven Two-Stage Active Learning for Low-Budget Semantic Segmentation
- ACG: Action Coherence Guidance for Flow-based VLA models
- LongCat-Video Technical Report
- FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing
- LiteDiff
- Generalised Flow Maps for Few-Step Generative Modelling on Riemannian Manifolds
- Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
- Self-diffusion for Solving Inverse Problems
- LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal
- BADiff: Bandwidth Adaptive Diffusion Model
- SCORENF: Score-based Normalizing Flows for Sampling Unnormalized distributions
- Improved Training Technique for Shortcut Models
- Noise is All You Need: Solving Linear Inverse Problems by Noise Combination Sampling with Diffusion Models
- On the flow matching interpretability
- Near Optimality of Discrete-Time Approximations for Controlled McKean-Vlasov Diffusions and Interacting Particle Systems
- Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
- Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
- Generative Point Tracking with Flow Matching
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- Downsizing Diffusion Models for Cardinality Estimation
- Exponential Convergence Guarantees for Iterative Markovian Fitting
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- Information Gradient for Nonlinear Gaussian Channel with Applications to Task-Oriented Communication
- Poisson Flow Consistency Training
- IEnSF: Iterative Ensemble Score Filter for Reducing Error in Posterior Score Estimation in Nonlinear Data Assimilation
- Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics
- Compositional Generation for Long-Horizon Coupled PDEs
- DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
- AlphaFlow: Understanding and Improving MeanFlow Models
- Guiding diffusion models to reconstruct flow fields from sparse data
- A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
- Beyond sparse denoising in frames: minimax estimation with a scattering transform
- Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning
- UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
- Diffusion Buffer for Online Generative Speech Enhancement
- Quantum Reversibility Meets Classical Reverse Diffusion
- From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation
- Learning Boltzmann Generators via Constrained Mass Transport
- GeoDiff: Geometry-Guided Diffusion for Metric Depth Estimation
- Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference
- DP2O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution
- Towards Robust Zero-Shot Reinforcement Learning
- Gradient Variance Reveals Failure Modes in Flow-Based Generative Models
- Demystifying Transition Matching: When and Why It Can Beat Flow Matching
- Inference-Time Compute Scaling For Flow Matching
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
- L2P: Unlocking Latent Potential for Pixel Generation
- Diffusion Models as Dataset Distillation Priors
- Beyond Binary Out-of-Distribution Detection: Characterizing Distributional Shifts with Multi-Statistic Diffusion Trajectories
- Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
- Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
- Soft-Masked Diffusion Language Models
- Adaptive Discretization for Consistency Models
- In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models
- Matricial Free Energy as a Gaussianizing Regularizer: Enhancing Autoencoders for Gaussian Code Generation
- KineDiff3D: Kinematic-Aware Diffusion for Category-Level Articulated Object Shape Reconstruction and Generation
- Continuous Q-Score Matching: Diffusion Guided Reinforcement Learning for Continuous-Time Control
- Towards Real-Time Generative Speech Restoration with Flow-Matching
- One-step Diffusion Models with Bregman Density Ratio Matching
- HumanCM: One Step Human Motion Prediction
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- FLOWR.root: A flow matching based foundation model for joint multi-purpose structure-aware 3D ligand generation and affinity prediction
- Latent Diffusion Model without Variational Autoencoder
- Deep generative priors for 3D brain analysis
- Operator Flow Matching for Timeseries Forecasting
- Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models
- AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
- RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
- Exploring Cross-Modal Flows for Few-Shot Learning
- Restoring Noisy Demonstration for Imitation Learning With Diffusion Models
- Unsupervised Deep Generative Models for Anomaly Detection in Neuroimaging: A Systematic Scoping Review
- Inference-Time Search using Side Information for Diffusion-based Image Reconstruction
- Nonparametric Data Attribution for Diffusion Models
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- Briding Diffusion Posterior Sampling and Monte Carlo methods: a survey
- TENDE: Transfer Entropy Neural Diffusion Estimation
- DiffOPF: Diffusion Solver for Optimal Power Flow
- NAPPure: Adversarial Purification for Robust Image Classification under Non-Additive Perturbations
- PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
- CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
- VIST3A: Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- GO-Diff: Data-free and amortized global structure optimization
- Counting Hallucinations in Diffusion Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- Federated Conditional Conformal Prediction via Generative Models
- Generating healthy counterfactuals with denoising diffusion bridge models
- SCOPED: Score-Curvature Out-of-distribution Proximity Evaluator for Diffusion
- A Connection Between Score Matching and Local Intrinsic Dimension
- What If : Understanding Motion Through Sparse Interactions
- DiffEM: Learning from Corrupted Data with Diffusion Models via Expectation Maximization
- Moment-based Posterior Sampling for Multi-reference Alignment
- Adapting Noise to Data: Generative Flows from 1D Processes
- Unconditional Human Motion and Shape Generation via Balanced Score-Based Diffusion
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- Scene Coordinate Reconstruction Priors
- Learning Latent Energy-Based Models via Interacting Particle Langevin Dynamics
- A Gradient Guided Diffusion Framework for Chance Constrained Programming
- DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation
- Probabilistic Super-Resolution for Urban Micrometeorology via a Schrödinger Bridge
- Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
- Time-Correlated Video Bridge Matching
- Diffusion models for polarimetric reconstruction of circumstellar environments
- Diffusion Transformers with Representation Autoencoders
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- Hierarchical Koopman Diffusion: Fast Generation with Interpretable Diffusion Trajectory
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- Reinforced sequential Monte Carlo for amortised sampling
- Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
- Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization
- Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
- An Eulerian Perspective on Straight-Line Sampling
- Offline Reinforcement Learning with Generative Trajectory Policies
- Unlocking the Potential of Diffusion Language Models through Template Infilling
- DiffStyleTS: Diffusion Model for Style Transfer in Time Series
- Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
- Schrödinger bridge for generative AI: Soft-constrained formulation and convergence analysis
- Normalization-equivariant Diffusion Models: Learning Posterior Samplers From Noisy And Partial Measurements
- Discrete State Diffusion Models: A Sample Complexity Perspective
- Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- SoundReactor: Frame-level Online Video-to-Audio Generation
- Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
- Sketch Animation: State-of-the-art Report
- CauchyNet: Compact and Data-Efficient Learning using Holomorphic Activation Functions
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Local-Global Context-Aware and Structure-Preserving Image Super-Resolution
- Calibrating Generative Models
- Mathematical Modeling and Convergence Analysis of Deep Neural Networks with Dense Layer Connectivities in Deep Learning
- Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
- Flow-Matching Guided Deep Unfolding for Hyperspectral Image Reconstruction
- DreamX-World 1.0: A General-Purpose Interactive World Model
- Asymmetric Flow Models
- Combined Representation and Generation with Diffusive State Predictive Information Bottleneck
- TC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion Control
- SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- Failure Prediction at Runtime for Generative Robot Policies
- MCMC: Bridging Rendering, Optimization and Generative AI
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- Efficient Autoregressive Inference for Transformer Probabilistic Models
- Score-Based Density Estimation from Pairwise Comparisons
- Conditional Flow Matching for Bayesian Posterior Inference
- Physically Valid Biomolecular Interaction Modeling with Gauss-Seidel Projection
- Permutation-Invariant Spectral Learning via Dyson Diffusion
- SummDiff: Generative Modeling of Video Summarization with Diffusion
- Expressive Value Learning for Scalable Offline Reinforcement Learning
- Beyond Real Data: Synthetic Data through the Lens of Regularization
- FlowLensing: Simulating Gravitational Lensing with Flow Matching
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- Deep Neural Networks Inspired by Differential Equations
- Value Flows
- Rectified-CFG++ for Flow Based Models
- Universality and kernel-adaptive training for classically trained, quantum-deployed generative models
- InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
- Wavefunction Flows: Efficient Quantum Simulation of Continuous Flow Models
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
- RePainter: Empowering E-commerce Object Removal via Spatial-matting Reinforcement Learning
- Ergodicity and error estimate of laws for a random splitting Langevin Monte Carlo
- Optimal Stopping in Latent Diffusion Models
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- Bridging the Physics-Data Gap with FNO-Guided Conditional Flow Matching: Designing Inductive Bias through Hierarchical Physical Constraints
- Who Said Neural Networks Aren't Linear?
- LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
- Coupled Data and Measurement Space Dynamics for Enhanced Diffusion Posterior Sampling
- Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
- Approximate Gaussian Mapping for Generative Image Steganography
- EigenScore: OOD Detection using Covariance in Diffusion Models
- Diffusing Trajectory Optimization Problems for Recovery During Multi-Finger Manipulation
- NPN: Non-Linear Projections of the Null-Space for Imaging Inverse Problems
- MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
- A Diffusion Model for Regular Time Series Generation from Irregular Data with Completion and Masking
- Rethinking Nonlinearity: Trainable Gaussian Mixture Modules for Modern Neural Architectures
- Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
- Towards Better Optimization For Listwise Preference in Diffusion Models
- scPPDM: A Diffusion Model for Single-Cell Drug-Response Prediction
- Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
- Conditional Denoising Diffusion Model-Based Robust MR Image Reconstruction from Highly Undersampled Data
- Thermodynamic Performance Limits for Score-Based Diffusion Models
- \bfD3QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
- ESS-Flow: Training-free guidance of flow-based models as inference in source space
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies
- PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- Teamwork: Collaborative Diffusion with Low-rank Coordination and Adaptation
- Mutual Information Estimation via Score-to-Fisher Bridge for Nonlinear Gaussian Noise Channels
- Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis
- A Data-Driven Prism: Multi-View Source Separation with Diffusion Model Priors
- VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
- SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
- Policy Gradient Guidance Enables Test Time Control
- Learning a distance measure from the information-estimation geometry of data
- FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation
- Diffusion2: Turning 3D Environments into Radio Frequency Heatmaps
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Flow-Matching Based Refiner for Molecular Conformer Generation
- ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
- ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion
- Diffusion Transformers for Imputation: Statistical Efficiency and Uncertainty Quantification
- TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
- MACS: Measurement-Aware Consistency Sampling for Inverse Problems
- RareGraph-Synth: Knowledge-Guided Diffusion Models for Generating Privacy-Preserving Synthetic Patient Trajectories in Ultra-Rare Diseases
- Perspectives on Stochastic Localization
- Mitigating Diffusion Model Hallucinations with Dynamic Guidance
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation
- UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
- Score-based generative emulation of impact-relevant Earth system model outputs
- Diffusion-Assisted Distillation for Self-Supervised Graph Representation Learning with MLPs
- GDiffuSE: Diffusion-based speech enhancement with noise model guidance
- Self Speculative Decoding for Diffusion Large Language Models
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Unlearning in Diffusion models under Data Constraints: A Variational Inference Approach
- Drax: Speech Recognition with Discrete Flow Matching
- Diffusion2: Dual Diffusion Model with Uncertainty-Aware Adaptive Noise for Momentary Trajectory Prediction
- Proximal Diffusion Neural Sampler
- Contrastive-SDE: Guiding Stochastic Differential Equations with Contrastive Learning for Unpaired Image-to-Image Translation
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Evolutionary Computation as Natural Generative AI
- Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- A Novel Cloud-Based Diffusion-Guided Hybrid Model for High-Accuracy Accident Detection in Intelligent Transportation Systems
- Learning Robust Diffusion Models from Imprecise Supervision
- ContextFlow: Context-Aware Flow Matching For Trajectory Inference From Spatial Omics Data
- Dale meets Langevin: A Multiplicative Denoising Diffusion Model
- Diffusion-Based, Data-Assimilation-Enabled Super-Resolution of Hub-height Winds
- Fine-Tuning Diffusion Models via Intermediate Distribution Shaping
- Synthetic EEG Generation using Diffusion Models for Motor Imagery Tasks
- Longitudinal Flow Matching for Trajectory Modeling
- Purrception: Variational Flow Matching for Vector-Quantized Image Generation
- LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration
- Combining complex Langevin dynamics with score-based and energy-based diffusion models
- Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models
- Constrained Diffusion for Protein Design with Hard Structural Constraints
- NS-Pep: De novo Peptide Design with Non-Standard Amino Acids
- Secure and reversible face anonymization with diffusion models
- Riemannian Consistency Model
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
- UCD: Unconditional Discriminator Promotes Nash Equilibrium in GANs
- GRITS: A Spillage-Aware Guided Diffusion Policy for Robot Food Scooping Tasks
- Vicinity-Guided Discriminative Latent Diffusion for Privacy-Preserving Domain Adaptation
- Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- CINDES: Classification induced neural density estimator and simulator
- Learn to Guide Your Diffusion Model
- Diffusion Alignment as Variational Expectation-Maximization
- Selective Underfitting in Diffusion Models
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- Flow Autoencoders are Effective Protein Tokenizers
- DiffAU: Diffusion-Based Ambisonics Upscaling
- DiffCamera: Arbitrary Refocusing on Images
- HilbertA: Hilbert Attention for Image Generation with Diffusion Models
- Contrastive Diffusion Guidance for Spatial Inverse Problems
- AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- Data-to-Energy Stochastic Dynamics
- FLOWER: A Flow-Matching Solver for Inverse Problems
- EnScale: Temporally-consistent multivariate generative downscaling via proper scoring rules
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Exact Solutions to the Quantum Schrödinger Bridge Problem
- ReNF: Rethinking the Design of Neural Long-Term Time Series Forecasters
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies
- Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
- Reweighted Flow Matching via Unbalanced OT for Label-free Long-tailed Generation
- Swift: An Autoregressive Consistency Model for Efficient Weather Forecasting
- Reframing Generative Models for Physical Systems using Stochastic Interpolants
- PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- Let Physics Guide Your Protein Flows: Topology-aware Unfolding and Generation
- Safe and Stable Control via Lyapunov-Guided Diffusion Models
- Score Distillation of Flow Matching Models
- MANI-Pure: Magnitude-Adaptive Noise Injection for Adversarial Purification
- Score-based Membership Inference on Diffusion Models
- SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation
- Segmentor-Guided Counterfactual Fine-Tuning for Locally Coherent and Targeted Image Synthesis
- When Scores Learn Geometry: Rate Separations under the Manifold Hypothesis
- Assessing the risk of future Dunkelflaute events for Germany using generative deep learning
- MarS-FM: Generative Modeling of Molecular Dynamics via Markov State Models
- ExGS: Extreme 3D Gaussian Compression with Diffusion Priors
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- SAIP: A Plug-and-Play Scale-adaptive Module in Diffusion-based Inverse Problems
- CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
- Unsupervised Single-Channel Speech Separation with a Diffusion Prior under Speaker-Embedding Guidance
- SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions
- Semantic Editing with Coupled Stochastic Differential Equations
- Tumor Synthesis conditioned on Radiomics
- MAD: Manifold Attracted Diffusion
- TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
- Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
- OAT-FM: Optimal Acceleration Transport for Improved Flow Matching
- FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- GeoFunFlow: Geometric Function Flow Matching for Inverse Operator Learning over Complex Geometries
- VoiceBridge: Designing Latent Bridge Models for General Speech Restoration at Scale
- VFSI: Validity First Spatial Intelligence for Constraint-Guided Traffic Diffusion
- Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
- EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling
- Tunable-Generalization Diffusion Powered by Self-Supervised Contextual Sub-Data for Low-Dose CT Reconstruction
- SIG-Chat: Spatial Intent-Guided Conversational Gesture Generation Involving How, When and Where
- Defining latent spaces by example: optimisation over the outputs of generative models
- Position-Blind Ptychography: Viability of image reconstruction via data-driven variational inference
- StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer
- Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models
- BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
- Disentanglement of Variations with Multimodal Generative Modeling
- HunyuanImage 3.0 Technical Report
- Multi-Modal Manipulation via Multi-Modal Policy Consensus
- Landing with the Score: Riemannian Optimization through Denoising
- Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling
- CREPE: Controlling Diffusion with Replica Exchange
- Sensitivity Analysis for Diffusion Models
- ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View
- From Noise to Laws: Regularized Time-Series Forecasting via Denoised Dynamic Graphs
- Impute-MACFM: Imputation based on Mask-Aware Flow Matching
- Transport Based Mean Flows for Generative Modeling
- Scale-Wise VAR is Secretly Discrete Diffusion
- Universal Inverse Distillation for Matching Models with Real-Data Supervision (No GANs)
- Overclocking Electrostatic Generative Models
- NIFTY: a Non-Local Image Flow Matching for Texture Synthesis
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- Factor-Based Conditional Diffusion Model for Portfolio Optimization
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models
- Universal Multi-Domain Translation via Diffusion Routers
- FlowDrive: moderated flow matching with data balancing for trajectory planning
- Generation Properties of Stochastic Interpolation under Finite Training Set
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- A Unifying Framework for Parallelizing Sequential Models with Linear Dynamical Systems
- MusicWeaver: Programmable Long-Form Music Generation with Provably Local Editing
- RED-DiffEq: Regularization by denoising diffusion models for solving inverse PDE problems with application to full waveform inversion
- DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models
- Consistency Models as Plug-and-Play Priors for Inverse Problems
- Patch-Based Diffusion for Data-Efficient, Radiologist-Preferred MRI Reconstruction
- Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
- DistillKac: Few-Step Image Generation via Damped Wave Equations
- Score-based Idempotent Distillation of Diffusion Models
- SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
- MeanSE: Efficient Generative Speech Enhancement with Mean Flows
- DAGDiff: Guiding Dual-Arm Grasp Diffusion to Stable and Collision-Free Grasps
- Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?
- Prompt-aware classifier free guidance for diffusion models
- Conditionally Whitened Generative Models for Probabilistic Time Series Forecasting
- Nuclear Diffusion Models for Low-Rank Background Suppression in Videos
- Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
- Energy Guided Geometric Flow Matching
- Flow Matching in the Low-Noise Regime: Pathologies and a Contrastive Remedy
- Actor-Critic without Actor
- NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics
- Federated Flow Matching
- FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
- 4D Driving Scene Generation With Stereo Forcing
- Incomplete Data, Complete Dynamics: A Diffusion Approach
- Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
- Attention U-Net for all-sky continuous gravitational wave searches
- Learnable Sampler Distillation for Discrete Diffusion Models
- Statistical Parameter Calibration with the Generalized Fluctuation Dissipation Theorem and Generative Modeling
- An Efficient Conditional Score-based Filter for High Dimensional Nonlinear Filtering Problems
- DynaFlow: Dynamics-embedded Flow Matching for Physically Consistent Motion Generation from State-only Demonstrations
- Diffusion and Flow-based Copulas: Forgetting and Remembering Dependencies
- PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
- A Recovery Theory for Diffusion Priors: Deterministic Analysis of the Implicit Prior Algorithm
- Metriplectic Conditional Flow Matching for Dissipative Dynamics
- FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference
- AnchorMark: Robust Diffusion Watermarking via Latent-Space Rotation Synchrony
- Reflected diffusion, no-flux continuity equations and confined Lagrangian flows in bounded domains
- Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion
- RFMSR: Residual Flow Matching for Image Super-Resolution
- From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data
- DIPHINE: Diffusion-based Φ-ID Neural Estimator
- Rao-Blackwellized Score Matching on Manifolds
- ELF: Embedded Language Flows
- Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- GSTM-HMU: Generative Spatio-Temporal Modeling for Human Mobility Understanding
- Diffusion Bridge Variational Inference for Deep Gaussian Processes
- Direct Preference Optimization for Speech Autoregressive Diffusion Models
- Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
- Influence of Clean Speech Characteristics on Speech Enhancement Performance
- Training-Free Multi-Style Fusion Through Reference-Based Adaptive Modulation
- FixingGS: Enhancing 3D Gaussian Splatting via Training-Free Score Distillation
- A Gradient Flow Approach to Solving Inverse Problems with Latent Diffusion Models
- Training-Free Data Assimilation with GenCast
- Prompt-Guided Dual Latent Steering for Inversion Problems
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
- Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling
- Audio Super-Resolution with Latent Bridge Models
- Discrete-Time Diffusion-Like Models for Speech Synthesis
- Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs
- Stable Video-Driven Portraits
- Ambiguous Medical Image Segmentation Using Diffusion Schrödinger Bridge
- An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
- Preference Trajectory Modeling via Flow Matching for Sequential Recommendation
- GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
- Efficient Rectified Flow for Image Fusion
- DoubleGen: Debiased Generative Modeling of Counterfactuals
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Similarity-Guided Diffusion for Long-Gap Music Inpainting
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- Blind-Spot Guided Diffusion for Self-supervised Real-World Denoising
- UniTac2Pose: A Unified Approach Learned in Simulation for Category-level Visuotactile In-hand Pose Estimation
- SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
- Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
- HazeFlow: Revisit Haze Physical Model as ODE and Non-Homogeneous Haze Generation for Real-World Dehazing
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- DiffusionNFT: Online Diffusion Reinforcement with Forward Process
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition
- Kuramoto Orientation Diffusion Models
- Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance
- Real-Time Streaming Mel Vocoding with Generative Flow Matching
- Quantum neural ordinary and partial differential equations
- A Novel Task-Driven Diffusion-Based Policy with Affordance Learning for Generalizable Manipulation of Articulated Objects
- Variational Shape Inference for Grasp Diffusion on SE(3)
- MeanFlowSE: one-step generative speech enhancement via conditional mean flow
- MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis
- Generative AI Meets Wireless Sensing: Towards Wireless Foundation Model
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- DICE: Diffusion Consensus Equilibrium for Sparse-view CT Reconstruction
- Adaptive and Iterative Point Cloud Denoising with Score-Based Diffusion Model
- Modular MeanFlow: Towards Stable and Scalable One-Step Generative Modeling
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior
- Defending Diffusion Models Against Membership Inference Attacks via Higher-Order Langevin Dynamics
- Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures
- RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- Inverse Design of Amorphous Materials with Targeted Properties
- Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation
- ProTDyn: a foundation Protein language model for Thermodynamics and Dynamics generation
- Generative Consistency Models for Estimation of Kinetic Parametric Image Posteriors in Total-Body PET
- Semantic Diffusion Posterior Sampling for Cardiac Ultrasound Dehazing
- Cross-Distribution Diffusion Priors-Driven Iterative Reconstruction for Sparse-View CT
- AERIS: Argonne Earth Systems Model for Reliable and Skillful Predictions
- DEFT-VTON: Efficient Virtual Try-On with Consistent Generalised H-Transform
- ReTrack: Data Unlearning in Diffusion Models through Redirecting the Denoising Trajectory
- Bayesian Signal Separation via Plug-and-Play Diffusion-Within-Gibbs Sampling
- Generalizable Holographic Reconstruction via Amplitude-Only Diffusion Priors
- 4D Visual Pre-training for Robot Learning
- Adaptive Sampling Scheduler
- A Statistical Benchmark for Diffusion Posterior Sampling Algorithms
- Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges
- Neural Stochastic Differential Equations on Compact State-Spaces
- IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
- All that structure matches does not glitter
- Solving ill-conditioned polynomial equations using score-based priors with application to multi-target detection
- Data-Efficient Ensemble Weather Forecasting with Diffusion Models
- PINGS: Physics-Informed Neural Network for Fast Generative Sampling
- Robustifying Diffusion-Denoised Smoothing Against Covariate Shift
- ToMA: Token Merge with Attention for Diffusion Models
- Flow Straight and Fast in Hilbert Space: Functional Rectified Flow
- Chord: Chain of Rendering Decomposition for PBR Material Estimation from Generated Texture Images
- Locality in Image Diffusion Models Emerges from Data Statistics
- Sig-DEG for Distillation: Making Diffusion Models Faster and Lighter
- DiFlow-TTS: Discrete Flow Matching with Factorized Speech Tokens for Low-Latency Zero-Shot Text-To-Speech
- FlexiD-Fuse: Flexible number of inputs multi-modal medical image fusion based on diffusion model
- Composable Score-based Graph Diffusion Model for Multi-Conditional Molecular Generation
- Plug-and-play Diffusion Models for Image Compressive Sensing with Data Consistency Projection
- Long time strong convergence analysis of one-step methods for McKean-Vlasov SDEs with superlinear growth coefficients
- ALL-PET: A Low-resource and Low-shot PET Foundation Model in Projection Domain
- CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
- RewardDance: Reward Scaling in Visual Generation
- Joint Model-based Model-free Diffusion for Planning with Constraints
- LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
- PegasusFlow: Parallel Rolling-Denoising Score Sampling for Robot Diffusion Planner Flow Matching
- ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
- Diffusion-Guided Multi-Arm Motion Planning
- ScoreHOI: Physically Plausible Reconstruction of Human-Object Interaction via Score-Guided Diffusion
- A Generalisable Generative Model for Multi-Detector Calorimeter Simulation
- Target matching based generative model for speech enhancement
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
- Enhancements in Score-based Channel Estimation for Real-Time Wireless Systems
- Scaling Transformer-Based Novel View Synthesis Models with Token Disentanglement and Synthetic Data
- Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
- floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
- Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- STAGE: Segmentation-oriented Industrial Anomaly Synthesis via Graded Diffusion with Explicit Mask Alignment
- Continuous Audio Language Models
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- MV-RAG: Retrieval Augmented Multiview Diffusion
- Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching
- CardiacFlow: 3D+t Four-Chamber Cardiac Shape Completion and Generation via Flow Matching
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
- Artificial intelligence for representing and characterizing quantum systems
- Any-Step Density Ratio Estimation via Interval-Annealed Secant Alignment
- STADI: Fine-Grained Step-Patch Diffusion Parallelism for Heterogeneous GPUs
- UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features
- Plug-and-Play Latent Diffusion for Electromagnetic Inverse Scattering with Application to Brain Imaging
- Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
- Transition Models: Rethinking the Generative Learning Objective
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- An invertible generative model for forward and inverse problems
- Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
- DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
- Instance-Wise Adaptive Sampling for Dataset Construction in Approximating Inverse Problem Solutions
- Solving Imaging Inverse Problems Using Plug-and-Play Denoisers: Regularization and Optimization Perspectives
- DCDB: Dynamic Conditional Dual Diffusion Bridge for Ill-posed Multi-Tasks
- On the MIA Vulnerability Gap Between Private GANs and Diffusion Models
- Scale-Adaptive Generative Flows for Multiscale Scientific Data
- A-FloPS: Accelerating Diffusion Sampling with Adaptive Flow Path Sampler
- Generative AI for Crystal Structures: A Review
- Distribution estimation via Flow Matching with Lipschitz guarantees
- A Sharp KL-Convergence Analysis for Diffusion Models under Minimal Assumptions
- Beyond Ensembles: Simulating All-Atom Protein Dynamics in a Learned Latent Space
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- RadioDiff-Loc: Diffusion Model Enhanced Scattering Congnition for NLoS Localization with Sparse Radio Map Estimation
- OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Sem-RaDiff: Diffusion-Based 3D Radar Semantic Perception in Cluttered Agricultural Environments
- On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
- Multimodal Generative Flows for LHC Jets
- Preconditioned Regularized Wasserstein Proximal Sampling
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- Lipschitz-Guided Design of Interpolation Schedules in Generative Models
- A Continuous-Time Consistency Model for 3D Point Cloud Generation
- Any-Order Flexible Length Masked Diffusion
- Are We Really Learning the Score Function? Reinterpreting Diffusion Models Through Wasserstein Gradient Flow Matching
- Controllable 3D Molecular Generation for Structure-Based Drug Design Through Bayesian Flow Networks and Gradient Integration
- Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
- Lattice Random Walk Discretisations of Stochastic Differential Equations
- VarDiU: A Variational Diffusive Upper Bound for One-Step Diffusion Distillation
- Probability Density from Latent Diffusion Models for Out-of-Distribution Detection
- Flowing Straighter with Conditional Flow Matching for Accurate Speech Enhancement
- OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
- Train-Once Plan-Anywhere Kinodynamic Motion Planning via Diffusion Trees
- Phased One-Step Adversarial Equilibrium for Video Diffusion Models
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- Neural Field Turing Machine: A Differentiable Spatial Computer
- Discrete-Guided Diffusion for Scalable and Safe Multi-Robot Motion Planning
- Guiding Noisy Label Conditional Diffusion Models with Score-based Discriminator Correction
- Towards 6G Intelligence: The Role of Generative AI in Future Wireless Networks
- MicroLad: 2D-to-3D Microstructure Reconstruction and Generation via Latent Diffusion and Score Distillation
- Score-Based Diffusion Models in Infinite Dimensions: A Malliavin Calculus Perspective
- Composition and Alignment of Diffusion Models using Constrained Learning
- Energy-Based Flow Matching for Generating 3D Molecular Structure
- On the Application of Diffusion Models for Simultaneous Denoising and Dereverberation
- ROSE: Remove Objects with Side Effects in Videos
- Amortized Sampling with Transferable Normalizing Flows
- Provable Mixed-Noise Learning with Flow-Matching
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
- MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
- Scaling Group Inference for Diverse and High-Quality Generation
- GEN2: A Generative Prediction-Correction Framework for Long-time Emulations of Spatially-Resolved Climate Extremes
- Efficient Identification of Critical Transitions via Flow Matching: A Scalable Generative Approach for Many-Body Systems
- Source-Guided Flow Matching
- Cross-Modality Controlled Molecule Generation with Diffusion Language Model
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
- Physics-Constrained Diffusion Reconstruction with Posterior Correction for Quantitative and Fast PET Imaging
- A Non-Asymptotic Convergent Analysis for Scored-Based Graph Generative Model via a System of Stochastic Differential Equations
- Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation
- FOCUS: Frequency-Optimized Conditioning of DiffUSion Models for mitigating catastrophic forgetting during Test-Time Adaptation
- SBGD: Improving Graph Diffusion Generative Model via Stochastic Block Diffusion
- Sampling by averaging: A multiscale approach to score estimation
- Nonadiabatic force matching for alchemical free-energy estimation
- Comparing Conditional Diffusion Models for Synthesizing Contrast-Enhanced Breast MRI from Pre-Contrast Images
- DiffIER: Optimizing Diffusion Models with Iterative Error Reduction
- AIM 2025 challenge on Inverse Tone Mapping Report: Methods and Results
- DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
- One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
- Reinforced Context Order Recovery for Adaptive Reasoning and Planning
- Score-informed Neural Operator for Enhancing Ordering-based Causal Discovery
- Cognitive Structure Generation: From Educational Priors to Policy Optimization
- FlowMol3: Flow Matching for 3D De Novo Small-Molecule Generation
- ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- Constraint-Aware Flow Matching via Randomized Exploration
- Matrix-game 2.0: An open-source real-time and streaming interactive world model
- Distribution Matching via Generalized Consistency Models
- Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
- Quantum Flow Matching
- Demystifying Foreground-Background Memorization in Diffusion Models
- LoRAtorio: An intrinsic approach to LoRA Skill Composition
- Physics-Informed Diffusion Models for Unsupervised Anomaly Detection in Multivariate Time Series
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- A Semi-supervised Generative Model for Incomplete Multi-view Data Integration with Missing Labels
- Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension
- CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
- 3D FlowMatch Actor: Unified 3D Policy for Single- and Dual-Arm Manipulation
- Ultra-High-Definition Reference-Based Landmark Image Super-Resolution with Generative Diffusion Prior
- Probabilistic Forecasting Method for Offshore Wind Farm Cluster under Typhoon Conditions: a Score-Based Conditional Diffusion Model
- MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
- Nonlinear filtering based on density approximation and deep BSDE prediction
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- TweezeEdit: Consistent and Efficient Image Editing with Path Regularization
- NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
- BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
- PERSONA: Personalized Whole-Body 3D Avatar with Pose-Driven Deformations from a Single Image
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- Enhancing Diffusion Face Generation with Contrastive Embeddings and SegFormer Guidance
- Non-asymptotic convergence bound of conditional diffusion models
- MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention
- Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
- Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
- Measurement-Based Quantum Diffusion Models
- DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
- Patient-Adaptive Focused Transmit Beamforming using Cognitive Ultrasound
- Hybrid Long and Short Range Flows for Point Cloud Filtering
- Elucidating Rectified Flow with Deterministic Sampler: Polynomial Discretization Complexity for Multi and One-step Models
- DiffVolume: Diffusion Models for Volume Generation in Limit Order Books
- An effective potential for generative modelling with active matter
- Learned Regularization for Microwave Tomography
- Score Augmentation for Diffusion Models
- Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild
- Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- When and how can inexact generative models still sample from the data manifold?
- BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion
- Matrix-3D: Omnidirectional Explorable 3D World Generation
- TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
- Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
- Neural Bridge Processes
- Finite-Time Convergence Analysis of ODE-based Generative Models for Stochastic Interpolants
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- A Score-based Diffusion Model Approach for Adaptive Learning of Stochastic Partial Differential Equation Solutions
- D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
- FlowSE: Flow Matching-based Speech Enhancement
- Speech Enhancement based on cascaded two flow
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- Local Diffusion Models and Phases of Data Distributions
- Elastic Diffusion Transformer
- Multivariate Fields of Experts
- FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation
- OM2P: Offline Multi-Agent Mean-Flow Policy
- ADPro: a Test-time Adaptive Diffusion Policy via Manifold-constrained Denoising and Task-aware Initialization for Robotic Manipulation
- Reverse Diffusion Sequential Monte Carlo Samplers
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- Automatic Semantic Alignment of Flow Pattern Representations for Exploration with Large Language Models
- DreamVE: Unified Instruction-based Image and Video Editing
- How and Why: Taming Flow Matching for Unsupervised Anomaly Detection and Localization
- Estimating Musical Surprisal from Audio in Autoregressive Diffusion Model Noise Spaces
- The Cosine Schedule is Fisher-Rao-Optimal for Masked Discrete Diffusion Models
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models
- HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
- Multitask Learning with Stochastic Interpolants
- Turbulent Injection assisted by Diffusion Models for Scale Resolving Simulations
- Conditional Latent Diffusion Models for Zero-Shot Instance Segmentation
- Bridging Diffusion Models and 3D Representations: A 3D Consistent Super-Resolution Framework
- Generating Feasible and Diverse Synthetic Populations Using Diffusion Models
- Likelihood Matching for Diffusion Models
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
- Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
- Robust Single-Stage Fully Sparse 3D Object Detection via Detachable Latent Diffusion
- BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models
- SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance
- Injecting Measurement Information Yields a Fast and Noise-Robust Diffusion-Based Inverse Problem Solver
- MILD: Multi-Layer Diffusion Strategy for Complex and Precise Multi-IP Aware Human Erasing
- Convergence of Deterministic and Stochastic Diffusion-Model Samplers: A Simple Analysis in Wasserstein Distance
- How Diffusion Prior Landscapes Shape the Posterior in Blind Deconvolution
- RDDPM: Robust Denoising Diffusion Probabilistic Model for Unsupervised Anomaly Segmentation
- Inference-time Scaling for Diffusion-based Audio Super-resolution
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- Diffusion models for inverse problems
- QuaDreamer: Controllable Panoramic Video Generation for Quadruped Robots
- Unsupervised Multi-channel Speech Dereverberation via Diffusion
- Scoring ISAC: Benchmarking Integrated Sensing and Communications via Score-Based Generative Modeling
- Improving Noise Efficiency in Privacy-preserving Dataset Distillation
- Versatile Transition Generation with Image-to-Video Diffusion
- LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
- Why Heuristic Weighting Works: A Theoretical Analysis of Denoising Score Matching
- A Spatio-temporal Continuous Network for Stochastic 3D Human Motion Prediction
- DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
- A Plug-and-Play Multi-Criteria Guidance for Diverse In-Betweening Human Motion Generation
- Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning
- Diffusion Models for Future Networks and Communications: A Comprehensive Survey
- TreeDiff: AST-Guided Code Generation with Diffusion LLMs
- Personalized Safety Alignment for Text-to-Image Diffusion Models
- A Reward-Directed Diffusion Framework for Generative Design Optimization
- SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
- On-Device Diffusion Transformer Policy for Efficient Robot Manipulation
- DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose Prior
- DBLP: Noise Bridge Consistency Distillation For Efficient And Reliable Adversarial Purification
- TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
- Superconductivity in atom-intercalated quaternary hydrides under ambient pressure
- Jet Image Generation in High Energy Physics Using Diffusion Models
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- MoGA: 3D Generative Avatar Prior for Monocular Gaussian Avatar Reconstruction
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
- Out-of-Distribution Detection in Medical Imaging via Diffusion Trajectories
- PixNerd: Pixel Neural Field Diffusion
- Adversarial-Guided Diffusion for Multimodal LLM Attacks
- X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
- DISTIL: Data-Free Inversion of Suspicious Trojan Inputs via Latent Diffusion
- Zero-Shot Image Anomaly Detection Using Generative Foundation Models
Discussions
Related