Denoising Diffusion Probabilistic Models
2020/06/19 by Ajay N. Jain, Ho, Jonathan, Pieter Abbeel +2 · 3060 citations
Computer Science · Physics and Astronomy · #FOS: Computer and information sciences #Gaussian Processes and Bayesian Inference #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Model Reduction and Neural Networks
paper · pdf · doi:10.48550/arxiv.2006.11239
openalex publication_date 2020/06/19 · openalex created_date 2020/06/25 · openalex updated_date 2026/07/28
Abstract
DiffuCpG 1. Introduction In this study, we used a generative AI diffusion model to address missing methylation data. We trained the model with Whole-Genome Bisulfite Sequencing data from 26 acute myeloid leukemia samples and validated it with Reduced Representation Bisulfite Sequencing data from 93 myelodysplastic syndrome and 13 normal samples. Additional testing included data from the Illumina 450k methylation array and Single-Cell Reduced Representation Bisulfite Sequencing on HepG2 cells. Our model, DiffuCpG, outperformed previous methods by integrating a broader range of genomic features, utilizing both short- and long-range interactions without increasing input complexity. It demonstrated superior accuracy, scalability, and versatility across various tissues, diseases, and technologies, providing predictions in both binary and continuous methylation states. In this repository, we deposit the code used to build the diffusion models along with necessary example datasets to train and test a diffusion model for methylation imputation purposes. Docker Usage Install Docker Install Docker using the following link:https://docs.docker.com/engine/install/Recommended system specs: Debian 12 bookworm with 16GB RAM or more.Make sure you have the latest Nvidia GPU driver installed and docker can access your Nvidia GPU. Run Docker images with Tissue-specific Models docker pull yay135/diffucpgtssUse our example to generate input samples with Hi-C matrix and CIS (Confidence Interval Cross Sample) data.docker run -it yay135/diffucpgtssthenpython generatetraintestsamples.py The tissue-specific models (pytorch) are for CD34+ cells, GBM and BRCA, they are stored in folders named "model*" in the image. Run the Tissue specific modelsdocker run -it yay135/diffucpgtssthenpython batchrun.py Run Docker images Example Models docker pull yay135/diffucpgIf you do not have a GPU enabled system, pull a CPU-only imagedocker pull yay135/diffucpgcpuprepare your input data directory, use the following command to print a example input data directorydocker run --rm yay135/diffucpg -e trueassume your data directory name is "inputdata"in windowsdocker run --gpus all -v .\inputdata /data --rm yay135/diffucpgin unix or linuxdocker run --gpus all -v ./inputdata:/data --rm yay135/diffucpg Other docker options -d or --device : select which cuda device to run with, default is 0-m or --mingcpg : scan your methyl array, limit only imputing windows with at least m non-missing methyl values, default is m=10-o or --overlap : set number of impute epochs, shift window locations between epochs, get mean imputed values for each CpG location, default is 2example:docker run --gpus all -v ./inputdata:/data --rm yay135/diffucpg -d 1 -m 5 -o 3use cuda device 1, min number of non-missing methyl values in a window is 5, overlap epochs 3 The following tutorials are for non-docker usages. 2. Data and Models Example datasets are available for download using "gdown.sh". The example datasets only contain WGBS methylation data. The model is the DDPM diffusion model, the repository contains a complete implementation for 1-dimensional input. Please refer to https://arxiv.org/abs/2006.11239 and https://huggingface.co/blog/annotated-diffusion for more details. 3. How to use 3.1 System Requirements The number of steps in the diffusion process is set to 2000. Imputing a sample requires 2000 steps. Gpu acceleration is preferred. 16GB of RAM is required. The code is fully tested and operational on the following platform: Distributor ID: DebianDescription: Debian GNU/Linux 12 (bookworm)Release: 12Codename: bookworm 3.2 Clone the Current Project Run the following command to clone the project.git clone https://github.com/yay135/DiffuCpG.git 3.4 Configure Environment Make sure you have the following software installed in your system:Python 3.9+Pytorch 2.0.1+ 3.4 Run Training and Testing python run.pyThe script will download necessary data and install dependencies automatically. 4 Data and Script Details 4.1 RAW Data The methylation arrays downloaded are in the folder "raw", each file is a methylation array. The first 2 columns are "chromosome" and "location". The assembly used for mapping in our project is the "GRCH37 primary assembly". It is also downloaded automatically. The rest of the columns in each file are methylation levels(required) and other biological data (optional) you wish to incorporate to enhance the model. These files in the raw folder are the initial inputs for pipeline,if you wish to use your own data, it must be configured as such before running the pipeline. 4.2 Generate Sample Use script "generatesamples.py" to generate samples for training and testing.The model can not directly read and impute a methylation array file. Instead, each methylation array is divided into windows, each window is 1kb (1000 base pairs) in length, and each training testing sample is generated from a window. Each sample contains at least 5 channels. the first 4 is the sequence one-hot encoding, the 5th is the methylation data. If a base pair location is not a CpG location, the methylation data value for it is "-1". If a CpG's methylation data is missing or waiting for imputaion, its value is also "-1". Other biological data can be added as extra channels. Check out example raw files in the folder "raw" to form your own datasets for training and testing sample generation.For each raw file in the "raw" folder, the first 3 columns are chr, loc, and methylation.The rest of the columns are treated as additional channels and will be added to each sample during generation. '-d' or '--folder': specify raw data folder'-i' or '--index' : which column in a raw file is the methylation array'-t' or '--tol' : how many missing methylation value is tolerated(we recommend 0 for generating training samples and -1 for generating testing samples, 0 will force the script to only select from windows with no missings, -1 will tolerate missing as much as possible.)'-c' or '--chr' : limit which chromosome to use, default is "chr#" to use all chromosomes'-w' or '--winsize' : what window size to use, default is 1000 '-m' or '--mincpg': force generate from window to have a minimum number of CpGs, default is 10 '-n' or '--nsample': number of samples to generate per chromosome '-p' or '--output': samples output folder, default is "out" Use script "generatesamplesconcat.py" to generate samples from long-range interacting windows such as Hi-C interactions or computed correlation.Check out the example long range file in the folder "data" to form your own long-range interacting windows for sample generation and concatenation. 4.3 Training Script Use diffusion.py to train and test a DDPM model using the generated samples'-t' or '--trainfolder' : the folder containing the training samples'-f' or '--modelfolder' : the model folder, will be created if it does not exist'-w' or '--winsize' : window size of each sample, default is 1000'-c' or '--channel': channel size of each sample'-d' or '--cudadevice' : if you have multiple cuda gpus, select which gpu to use, default is 0"-e" or "--epoch" : how many epochs for training, default is 2000"-s" or "--earlystop" : whether to use "early stopping" during training, default is False"-p" or "--patience" : patience for early stopping, default is 10 4.4 Imputation Use diffusioninpainting.py to perform imputation on generated samples.'-t' or '--testfolder' : the folder containing samples for imputation'-o' or '--outfolder': imputed output folder name, default="inpaintingout"'-w' or '--winsize' : window size of each sample, default is 1000'-c' or '--channel': channel size of each sample'-d' or '--cudadevice' : if you have multiple cuda gpus, select which gpu to use, default is 0 Team If you have any questions or concerns about the project, please contact the following team member: Fengyao Yan [email protected]
Citations
Cited by
- Coherent Visualization of 2D Scalar Field Contour Ensembles With Probabilistic Latent Space Modeling
- UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
- Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization
- Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators
- CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models
- Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
- NeXT-IMDL: Build Benchmark for NeXT-Generation Image Manipulation Detection & Localization
- Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation
- Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization
- RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models
- SURE Guided Posterior Sampling: Trajectory Correction for Diffusion-Based Inverse Problems
- Anomaly Detection by Effectively Leveraging Synthetic Images
- PathoSyn: Imaging-Pathology MRI Synthesis via Disentangled Deviation Diffusion
- JADAI: Jointly Amortizing Adaptive Design and Bayesian Inference
- Reverse Personalization
- RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance
- Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- ReDiF: Reinforced Distillation for Few Step Diffusion
- Parallel Diffusion Solver via Residual Dirichlet Policy Optimization
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- Energy-Guided Flow Matching Enables Few-Step Conformer Generation and Ground-State Identification
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- Differentiable Inverse Modeling with Physics-Constrained Latent Diffusion for Heterogeneous Subsurface Parameter Fields
- DeFloMat: Detection with Flow Matching for Stable and Efficient Generative Object Localization
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
- LangPrecip: Language-Aware Multimodal Precipitation Nowcasting
- Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
- Meta-information Guided Cross-domain Synergistic Diffusion Model for Low-dose PET Reconstruction
- Characterizing Motion Encoding in Video Diffusion Timesteps
- Reverse-Time Diffusion Processes for Discrete Time Linear and Nonlinear Systems with non-Gaussian Noise
- Joint Flow Matching for Generator-Consistent Classification
- BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion
- Generative Modeling by Value-Driven Transport
- PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation
- Learning Sampling Parameters for Diffusion Models
- A Multi-stage Constrained Optimization Framework for Data-driven Problems
- Being-H0.7: A Latent World-Action Model from Egocentric Videos
- Restoration Flow Matching-Based Channel Refinement and Equalization Correction for MIMO Semantic Communications
- Normalizing Trajectory Models
- OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models
- Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping
- Large Vision Model-Enhanced Digital Twin with Deep Reinforcement Learning for User Association and Load Balancing in Dynamic Wireless Networks
- Joint Activity Detection and Channel Estimation for Massive Connectivity: Where Message Passing Meets Score-Based Generative Priors
- Advancing Marine Bioacoustics with Deep Generative Models: A Hybrid Augmentation Strategy for Southern Resident Killer Whale Detection
- TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation
- UMI3D: Robust 3D Generation on Unconstrained Multi-Image Inputs via Simultaneous Focus Cross-Attention Routing
- PAC-DP: PAC-Bayesian Diffusion Policy Learning
- Exploration of the generative capabilities of Boltzmann machines applied to social systems under the majority rule
- Diffusion-Guided Search via Exponential Tilting (DiffTilt): An Application to Falsification of Safety-Critical Systems
- TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation
- UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling
- SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation
- All in One: Generative Modeling as Mean-Field Game Design
- The Curse of Precision: A Data Scaling Law for High-Precision Robotic Manipulation
- A Dacorogna-Moser construction of transport maps on ℝd with application to geodesics on the space of couplings
- From Score Learning to Discretized Sampling: An End-to-End Generalization Analysis of Diffusion Models
- PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation
- DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models
- Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations
- Score-Based Stabilization for Time-Dependent Problems
- MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks
- ScaleResfusion: Residual Rectified Flow based on Residual Vector Field
- I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models
- Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors
- Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models
- ProEdit: Inversion-based Editing From Prompts Done Right
- Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging
- FMOPF: Latent Flow Matching with Constraint-Aware Interaction Priors for AC Optimal Power Flow
- AI-generated Images Challenge Visual Trust in High-risk Scenarios
- MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
- Text-based Tactile Graphics Generation for the Visually Impaired
- T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
- Evaluating the resolution of AI-based accelerated MR reconstruction using a deep learning-based model observer
- Diffusion models for SU(2) lattice gauge theory in two dimensions
- G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- TRE: Training-Free Hallucination Detection for Diffusion Language Models
- Generalized Fine-Tuning of Diffusion Models via Stochastic Control and FBSDEs
- EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation
- FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time
- FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation
- SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series
- Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning
- Autoregressive One-Step Generative Modeling for Dynamical System Forecasting
- Concept-based Visual Counterfactual Explanations with Diffusion Models
- Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching
- Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- WiFo-M2: Empower Wireless Communications With Plug-and-Play Environment Sensing via Foundation Model
- Benchmarking deep learning models for Raman spectroscopy across open-source datasets
- Diffusion Posterior Sampling for Super-Resolution under Gaussian Measurement Noise
- Unsupervised Anomaly Detection in Brain MRI via Disentangled Anatomy Learning
- Tilt Matching for Scalable Sampling and Fine-Tuning
- Flexible Multitask Learning with Factorized Diffusion Policy
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- SDUM: A Scalable Deep Unrolled Model for Universal MRI Reconstruction
- UniStateDLO: Unified Generative State Estimation and Tracking of Deformable Linear Objects Under Occlusion for Constrained Manipulation
- UPMRI: Unsupervised Parallel MRI Reconstruction via Projected Conditional Flow Matching
- SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration
- Residual Prior Diffusion: A Probabilistic Framework Integrating Coarse Latent Priors with Diffusion Models
- UrbanDIFF: A Denoising Diffusion Model for Spatial Gap Filling of Urban Land Surface Temperature Under Dense Cloud Cover
- EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
- DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
- Fixed-Threshold Evaluation of a Hybrid CNN-ViT for AI-Generated Image Detection Across Photos and Art
- Generative Multi-Focus Image Fusion
- Physics-informed Diffusion Models for Multi-scale Prediction of Reference Signal Received Power in Wireless Networks
- FUSE: Unifying Spectral and Semantic Cues for Robust AI-Generated Image Detection
- RAPTOR: Real-Time High-Resolution UAV Video Prediction with Efficient Video Attention
- A Reinforcement Learning Approach to Synthetic Data Generation
- Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
- GriDiT: Factorized Grid-Based Diffusion for Efficient Long Image Sequence Generation
- STLDM: Spatio-Temporal Latent Diffusion Model for Precipitation Nowcasting
- Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
- Enhancing diffusion models with Gaussianization preprocessing
- FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
- Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
- PUFM++: Point Cloud Upsampling via Enhanced Flow Matching
- DiEC: Diffusion Embedded Clustering
- Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification
- Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs
- PhononBench:A Large-Scale Phonon-Based Benchmark for Dynamical Stability in Crystal Generation
- Encrypted Traffic Detection in Resource Constrained IoT Networks: A Diffusion Model and LLM Integrated Framework
- Improving Matrix Exponential for Generative AI Flows: A Taylor-Based Approach Beyond Paterson--Stockmeyer
- Towards Generative Location Awareness for Disaster Response: A Probabilistic Cross-view Geolocalization Approach
- MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
- Enriching Earth Observation labeled data with Quantum Conditioned Diffusion Models
- Field-Space Attention for Structure-Preserving Earth System Transformers
- How I Met Your Bias: Investigating Bias Amplification in Diffusion Models
- LoLA: Long Horizon Latent Action Learning for General Robot Manipulation
- Generative Spectrum Cartography: Unified Reconstruction and Active Sensing via Diffusion Models
- UMAMI: Unifying Masked Autoregressive Models and Deterministic Rendering for View Synthesis
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping
- IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation
- Rethinking Knowledge Distillation in Collaborative Machine Learning: Memory, Knowledge, and Their Interactions
- Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking
- SkinGenBench: Generative Model and Preprocessing Effects for Synthetic Dermoscopic Augmentation in Melanoma Diagnosis
- SemanticGen: Video Generation in Semantic Space
- Control Variate Score Matching for Diffusion Models
- Spectral Diffusion for Sampling on \rm SU(N)
- Generating the Past, Present and Future from a Motion-Blurred Image
- VA-π: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
- Over++: Generative Video Compositing for Layer Interaction Effects
- Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior
- Variational Autoregressive Networks Applied to ϕ4 Field Theory Systems
- StoryMem: Multi-shot Long Video Storytelling with Memory
- LacaDM: A Latent Causal Diffusion Model for Multiobjective Reinforcement Learning
- Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
- dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
- VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
- InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-training
- A Flexible Field-Based Policy Learning Framework for Diverse Robotic Systems and Sensors
- Efficient Personalization of Generative Models via Optimal Experimental Design
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- Decoupled Generative Modeling for Human-Object Interaction Synthesis
- VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
- The Ensemble Schrödinger Bridge filter for Nonlinear Data Assimilation
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- OmniEgoCap: Camera-Agnostic Sequence-Level Egocentric Motion Reconstruction
- Is Visual Realism Enough? Evaluating Gait Biometric Fidelity in Generative AI Human Animation
- Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models
- Generative Modeling through Koopman Spectral Analysis: An Operator-Theoretic Perspective
- EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
- Smark: A Watermark for Text-to-Speech Diffusion Models via Discrete Wavelet Transform
- In-Context Audio Control of Video Diffusion Transformers
- SD2AIL: Adversarial Imitation Learning from Synthetic Demonstrations via Diffusion Models
- Is Your Conditional Diffusion Model Actually Denoising?
- Generating Risky Samples with Conformity Constraints via Diffusion Models
- MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
- Preserving Spectral Structure and Statistics in Diffusion Models
- STORM: Search-Guided Generative World Models for Robotic Manipulation
- Plasticine: A Traceable Diffusion Model for Medical Image Translation
- Region-Constraint In-Context Generation for Instructional Video Editing
- MatSpray: Fusing 2D Material World Knowledge on 3D Geometry
- SLIM: Semantic-based Low-bitrate Image compression for Machines by leveraging diffusion
- Is There a Better Source Distribution than Gaussian? Exploring Source Distributions for Image Flow Matching
- MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
- Estimating Solvation Free Energies with Boltzmann Generators
- Detection of AI Generated Images Using Combined Uncertainty Measures and Particle Swarm Optimised Rejection Mechanism
- Efficient Zero-Shot Inpainting with Decoupled Diffusion Guidance
- MatE: Material Extraction from Single-Image via Geometric Prior
- Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation
- DESSERT: Diffusion-based Event-driven Single-frame Synthesis via Residual Training
- RadarGen: Automotive Radar Point Cloud Generation from Cameras
- InfinityEBSD : Metrics-Guided Infinite-Size EBSD Map Generation With Diffusion Models
- InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
- An Empirical Study of Sampling Hyperparameters in Diffusion-Based Super-Resolution
- Kinematics-Aware Diffusion Policy with Consistent 3D Observation and Action Space for Whole-Arm Robotic Manipulation
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- Generative modeling of conditional probability distributions on the level-sets of collective variables
- Beyond Semantic Features: Pixel-level Mapping for Generalized AI-Generated Image Detection
- 3One2: One-step Regression Plus One-step Diffusion for One-hot Modulation in Dual-path Video Snapshot Compressive Imaging
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- Vision-Language Model Guided Image Restoration
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- Enhancing AIGC Service Efficiency with Adaptive Multi-Edge Collaboration in A Distributed System
- Disentangled representations via score-based variational autoencoders
- Interpretable Similarity of Synthetic Image Utility
- SFBD-OMNI: Bridge models for lossy measurement restoration with limited clean samples
- Generative Refocusing: Flexible Defocus Control from a Single Image
- Next-Embedding Prediction Makes Strong Vision Learners
- Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
- Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
- SFTok: Bridging the Performance Gap in Discrete Tokenizers
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- Instant Expressive Gaussian Head Avatars at Over 100 FPS
- FlowDet: Unifying Object Detection and Generative Transport Flows
- FrameDiffuser: G-Buffer-Conditioned Diffusion for Neural Forward Frame Rendering
- Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks
- Prime and Reach: Synthesising Body Motion for Gaze-Primed Object Reach
- Single-View Shape Completion for Robotic Grasping in Clutter
- EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation
- GMODiff: One-Step Gain Map Refinement with Diffusion Priors for HDR Reconstruction
- Simultaneous Secrecy and Covert Communications (SSACC) in Mobility-Aware RIS-Aided Networks
- End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
- VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
- mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
- Large Video Planner Enables Generalizable Robot Control
- Stylized Synthetic Augmentation further improves Corruption Robustness
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations
- Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
- Towards Seamless Interaction: Causal Turn-Level Modeling of Interactive 3D Conversational Head Dynamics
- Accelerating High-Throughput Catalyst Screening by Direct Generation of Equilibrium Adsorption Structures
- Softly Constrained Denoisers for Diffusion Models Applied to Partial Differential Equations
- Robust and Calibrated Detection of Authentic Multimedia Content
- HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens
- FADTI: Fourier and Attention Driven Diffusion for Multivariate Time Series Imputation
- EMFusion: Uncertainty-Aware Conditional Diffusion Model for Multivariate Narrow-band Exposure Forecasting
- Spectral Representation-based Reinforcement Learning
- Where is the Watermark? Interpretable Watermark Detection at the Block Level
- ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision
- WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
- Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
- HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion
- Score-Based Turbo Message Passing for Plug-and-Play Compressive Imaging
- Evaluating Weather Forecasts from a Decision Maker's Perspective
- Towards Transferable Defense Against Malicious Image Edits
- Dual Attention Guided Defense Against Malicious Edits
- Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding
- 4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- Random-Bridges as Stochastic Transports for Generative Models
- Establishing Stochastic Object Models from Noisy Data via Ambient Measurement-Integrated Diffusion
- FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation
- Particulate: Feed-Forward 3D Object Articulation
- Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
- Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- TorchTraceAP: A New Benchmark Dataset for Detecting Performance Anti-Patterns in Computer Vision Models
- SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- An intercomparison of generative machine learning methods for downscaling precipitation at fine spatial scales
- LCMem: A Universal Model for Robust Image Memorization Detection
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- An evaluation of SVBRDF Prediction from Generative Image Models for Appearance Modeling of 3D Scenes
- Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models
- DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
- Towards Interactive Intelligence for Digital Humans
- Directional Textual Inversion for Personalized Text-to-Image Generation
- Image Diffusion Preview with Consistency Solver
- Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- CausalCLIP: Causally-Informed Feature Disentanglement and Filtering for Generalizable Detection of Generated Images
- RecTok: Reconstruction Distillation along Rectified Flow
- Learning to Generate Cross-Task Unexploitable Examples
- KlingAvatar 2.0 Technical Report
- ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
- BézierFlow: Learning Bézier Stochastic Interpolant Schedulers for Few-Step Generation
- Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning
- Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather
- Multi-Robot Motion Planning from Vision and Language using Heat-Inspired Diffusion
- Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models
- What Happens Next? Next Scene Prediction with a Unified Video Model
- JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
- Few-Step Distillation for Text-to-Image Generation: A Practical Guide
- The algorithmic muse and the public domain: Why copyrights legal philosophy precludes protection for generative AI outputs
- Learning Common and Salient Generative Factors Between Two Image Datasets
- Predictive Sample Assignment for Semantically Coherent Out-of-Distribution Detection
- Distillation of Discrete Diffusion by Exact Conditional Distribution Matching
- Pattern-Guided Diffusion Models
- From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation
- Robust Motion Generation using Part-level Reliable Data from Videos
- OptiWing3D: A Diverse Dataset of Optimized Wing Designs
- Exploring the Design Space of Transition Matching
- Diffusion Model-Based Posterior Sampling in Full Waveform Inversion
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- Flow matching Operators for Residual-Augmented Probabilistic Learning of Partial Differential Equations
- On Approaches to Building Surrogate ODE Models for Diffusion Bridges
- InteracTalker: Prompt-Based Human-Object Interaction with Co-Speech Gesture Generation
- Integrating Fourier Neural Operator with Diffusion Model for Autoregressive Predictions of Three-dimensional Turbulence
- Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models
- Coupled Variational Reinforcement Learning for Language Model General Reasoning
- PIS: A Generalized Physical Inversion Solver for Arbitrary Sparse Observations via Set Conditioned Flow Matching
- Skillful Subseasonal-to-Seasonal Forecasting of Extreme Events with a Multi-Sphere Coupled Probabilistic Model
- Generative Spatiotemporal Data Augmentation
- Bayesian Full-waveform Monitoring of CO2 Storage with Fluid-flow Priors via Generative Modeling
- Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution
- Boosting Monocular Metric Depth Estimation via Bokeh Rendering
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- Referring Change Detection in Remote Sensing Imagery
- Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- HydroDiffusion: Diffusion-Based Probabilistic Streamflow Forecasting with a State Space Backbone
- TA-KAND: Two-stage Attention Triple Enhancement and U-KAN based Diffusion For Few-shot Knowledge Graph Completion
- SPDMark: Selective Parameter Displacement for Robust Video Watermarking
- V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Optimal Watermark Generation under Type I and Type II Errors
- A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach
- DREAM-B3P: Dual-Stream Transformer Network Enhanced by Feedback Diffusion Model for Blood-Brain Barrier Penetrating Peptide Prediction
- On the Dangers of Bootstrapping Generation for Continual Learning and Beyond
- Flowception: Temporally Expansive Flow Matching for Video Generation
- PhraseVAE and PhraseLDM: Latent Diffusion for Full-Song Multitrack Symbolic Music Generation
- PersonaLive! Expressive Portrait Image Animation for Live Streaming
- WildCap: Facial Appearance Capture in the Wild via Hybrid Inverse Rendering
- CADKnitter: Compositional CAD Generation from Text and Geometry Guidance
- An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
- Back to the Baseline: Examining Baseline Effects on Explainability Metrics
- Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation
- SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
- AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path
- Symmetry-Aware Steering of Equivariant Diffusion Policies: Benefits and Limits
- A probabilistic framework for crystal structure denoising, phase classification, and order parameters
- SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Bidirectional Normalizing Flow: From Data to Noise and Back
- Generative Modeling from Black-box Corruptions via Self-Consistent Stochastic Interpolants
- AERMANI-Diffusion: Regime-Conditioned Diffusion for Dynamics Learning in Aerial Manipulators
- Learning by Analogy: A Causal Framework for Composition Generalization
- UNAAGI: Atom-Level Diffusion for Generating Non-Canonical Amino Acid Substitutions
- Targeted Data Protection for Diffusion Model by Matching Training Trajectory
- Diffusion differentiable resampling
- Point2Pose: A Generative Framework for 3D Human Pose Estimation with Multi-View Point Cloud Dataset
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation
- Multi-dimensional Preference Alignment by Conditioning Reward Itself
- Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
- Inverse problems with diffusion models: MAP estimation via mode-seeking loss
- StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to-End Diffusion in a Canonical Space
- Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality
- Guided Transfer Learning for Discrete Diffusion Models
- Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation
- DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
- MetaVoxel: Joint Diffusion Modeling of Imaging and Clinical Metadata
- Diffusion Is Your Friend in Show, Suggest and Tell
- A Unified Generative-Predictive Framework for Deterministic Inverse Design
- Splatent: Splatting Diffusion Latents for Novel View Synthesis
- Composing Concepts from Images and Videos via Concept-prompt Binding
- Unconsciously Forget: Mitigating Memorization; Without Knowing What is being Memorized
- Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- A Distributed Framework for Privacy-Enhanced Vision Transformers on the Edge
- VABench: A Comprehensive Benchmark for Audio-Video Generation
- Fast operator learning for mapping correlations
- LoGoColor: Local-Global 3D Colorization for 360° Scenes
- FBA2D: Frequency-based Black-box Attack for AI-generated Image Detection
- OmniPSD: Layered PSD Generation with Diffusion Transformer
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- Lazy Diffusion: Mitigating spectral collapse in generative diffusion-based stable autoregressive emulation of turbulent flows
- Personalized Federated Distillation Assisted Vehicle Edge Caching Strategy
- Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation
- Exposing Vulnerabilities in Counterfeit Prevention Systems Utilizing Physically Unclonable Surface Features
- Masked Generative Policy for Robotic Control
- Food Image Generation on Multi-Noun Categories
- AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
- A Diffusion-Based Framework for High-Resolution Precipitation Forecasting over CONUS
- Astra: General Interactive World Model with Autoregressive Denoising
- Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
- Self-Evolving 3D Scene Generation from a Single Image
- UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
- Generative Urban Flow Modeling: From Geometry to Airflow with Graph Diffusion
- Refining Visual Artifacts in Diffusion Models via Explainable AI-based Flaw Activation Maps
- Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search
- Gradient-Informed Monte Carlo Fine-Tuning of Diffusion Models for Low-Thrust Trajectory Design
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- A Novel Wasserstein Quaternion Generative Adversarial Network for Color Image Generation
- A Survey of Body and Face Motion: Datasets, Performance Evaluation Metrics and Generative Techniques
- Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform
- Dflow-SUR: Enhancing Generative Aerodynamic Inverse Design using Differentiation Throughout Flow Matching
- Inferring Compositional 4D Scenes without Ever Seeing One
- CARD: Correlation Aware Restoration with Diffusion
- One-Step Diffusion Samplers via Self-Distillation and Deterministic Flow
- PAVAS: Physics-Aware Video-to-Audio Synthesis
- Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making
- Diffusion Model Regularized Implicit Neural Representation for CT Metal Artifact Reduction
- Worst-case generation via minimax optimization in Wasserstein space
- TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank
- Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
- OSMO: Open-Source Tactile Glove for Human-to-Robot Skill Transfer
- GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification
- Scalable Offline Model-Based RL with Action Chunks
- One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
- Demo: Generative AI helps Radiotherapy Planning with User Preference
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- Delay-Aware Diffusion Policy: Bridging the Observation-Execution Gap in Dynamic Tasks
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning
- See More, Change Less: Anatomy-Aware Diffusion for Contrast Enhancement
- Physics-Guided Diffusion Priors for Multi-Slice Reconstruction in Scientific Imaging
- Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
- Understanding Diffusion Models via Code Execution
- Materium: An Autoregressive Approach for Material Generation
- Mimir: Hierarchical Goal-Driven Diffusion with Uncertainty Propagation for End-to-End Autonomous Driving
- Equivariant Diffusion for Crystal Structure Prediction
- D3-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- Optimization-Guided Diffusion for Interactive Scene Generation
- A Hetero-Associative Sequential Memory Model Utilizing Neuromorphic Signals: Validated on a Mobile Manipulator
- Adaptive Path Integral Diffusion: AdaPID
- JoPano: Unified Panorama Generation via Joint Modeling
- IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction
- VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
- Optimal and Diffusion Transports in Machine Learning
- TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search
- Task-Model Alignment: A Simple Path to Generalizable AI-Generated Image Detection
- Latent Nonlinear Denoising Score Matching for Enhanced Learning of Structured Distributions
- Selective Masking based Self-Supervised Learning for Image Semantic Segmentation
- Transferring Clinical Knowledge into ECGs Representation
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- 3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization
- An Efficient Test-Time Scaling Approach for Image Generation
- Beyond Hallucinations: A Multimodal-Guided Task-Aware Generative Image Compression for Ultra-Low Bitrate
- Safe Model Predictive Diffusion with Shielding
- Metaphor-based Jailbreak Attacks on Text-to-Image Models
- On The Role of K-Space Acquisition in MRI Reconstruction Domain-Generalization
- PMA-Diffusion: A Physics-guided Mask-Aware Diffusion Framework for TSE from Sparse Observations
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning
- A Comparative Study on Synthetic Facial Data Generation Techniques for Face Recognition
- World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
- SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
- NEAT: Neighborhood-Guided, Efficient, Autoregressive Set Transformer for 3D Molecular Generation
- Fast and Robust Diffusion Posterior Sampling for MR Image Reconstruction Using the Preconditioned Unadjusted Langevin Algorithm
- HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models
- Consist-Retinex: One-Step Noise-Emphasized Consistency Training Accelerates High-Quality Retinex Enhancement
- InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem
- General and Domain-Specific Zero-shot Detection of Generated Images via Conditional Likelihood
- MedDIFT: Multi-Scale Diffusion-Based Correspondence in 3D Medical Imaging
- ProPhy: Progressive Physical Alignment for Dynamic World Simulation
- Generative Stochastic Optimal Transport: Guided Harmonic Path-Integral Diffusion
- Light-X: Generative 4D Video Rendering with Camera and Illumination Control
- China Regional 3km Downscaling Based on Residual Corrective Diffusion Model
- NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation
- OMTRA: A Multi-Task Generative Model for Structure-Based Drug Design
- BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- Generative design of stabilizing controllers with diffusion models: the Youla approach
- Convergence Dynamics of Over-Parameterized Score Matching for a Single Gaussian
- StreamFlow: Theory, Algorithm, and Implementation for High-Efficiency Rectified Flow Generation
- Efficient Generative Transformer Operators For Million-Point PDEs
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- Markov-Renewal Single-Photon LiDAR Simulator
- ICM-SR: Image-Conditioned Manifold Regularization for Image Super-Resolution
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- Setting up for failure: automatic discovery of the neural mechanisms of cognitive errors
- OmniScaleSR: Unleashing Scale-Controlled Diffusion Prior for Faithful and Realistic Arbitrary-Scale Image Super-Resolution
- Complementary Characterization of Agent-Based Models via Computational Mechanics and Diffusion Models
- UnwrapDiff: Conditional Diffusion for Robust InSAR Phase Unwrapping
- Bridging Simulation and Reality: Cross-Domain Transfer with Semantic 2D Gaussian Splatting
- Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
- Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence
- QoSDiff: An Implicit Topological Embedding Learning Framework Leveraging Denoising Diffusion and Adversarial Attention for Robust QoS Prediction
- Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
- Fully Unsupervised Self-debiasing of Text-to-Image Diffusion Models
- LeMat-GenBench: A Unified Evaluation Framework for Crystal Generative Models
- Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
- One-Step Generative Channel Estimation via Average Velocity Field
- Controllable Long-term Motion Generation with Extended Joint Targets
- DeRA: Decoupled Representation Alignment for Video Tokenization
- UniTS: Unified Time Series Generative Model for Remote Sensing
- STeP-Diff: Spatio-Temporal Physics-Informed Diffusion Models for Mobile Fine-Grained Pollution Forecasting
- LatentFM: A Latent Flow Matching Approach for Generative Medical Image Segmentation
- UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
- ReflexFlow: Rethinking Learning Objective for Exposure Bias Alleviation in Flow Matching
- CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
- Decoding Large Language Diffusion Models with Foreseeing Movement
- MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
- Resummed Distribution Functions: Making Perturbation Theory Positive and Normalized
- Minuet: A Diffusion Autoencoder for Compact Semantic Compression of Multi-Band Galaxy Images
- DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature Alignment
- BlurDM: A Blur Diffusion Model for Image Deblurring
- Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
- Towards Irreversible Machine Unlearning for Diffusion Models
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- Transmit Weights, Not Features: Orthogonal-Basis Aided Wireless Point-Cloud Transmission
- LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling
- GaussianBlender: Instant Stylization of 3D Gaussians with Disentangled Latent Spaces
- ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- On the Design of One-step Diffusion via Shortcutting Flow Paths
- Beyond Boundary Frames: Context-Centric Video Interpolation with Audio-Visual Semantics
- Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
- Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features
- MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re-Identification
- NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction
- SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
- Step-by-step Layered Design Generation
- HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration
- CrowdLLM: Building LLM-Based Digital Populations Augmented with Generative Models
- Dimension-free error estimate for diffusion model and optimal scheduling
- CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra
- SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control
- U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
- Glance: Accelerating Diffusion Models with 1 Sample
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- Channel Knowledge Map Construction via Physics-Inspired Diffusion Model Without Prior Observations
- Adversarial Jamming for Autoencoder Distribution Matching
- Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models
- ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data
- Distill, Forget, Repeat: A Framework for Continual Unlearning in Text-to-Image Diffusion Models
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- Co-speech Gesture Video Generation via Motion-Based Graph Retrieval
- A Discrete Neural Operator with Adaptive Sampling for Surrogate Modeling of Parametric Transient Darcy Flows in Porous Media
- OmniPerson: Unified Identity-Preserving Pedestrian Generation
- AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning
- SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction
- Iterative Tilting for Diffusion Fine-Tuning
- Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
- PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
- Unrolled Networks are Conditional Probability Flows in MRI Reconstruction
- Spatiotemporal Pyramid Flow Matching for Climate Emulation
- CoatFusion: Controllable Material Coating in Images
- EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI
- Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning
- Data-Centric Visual Development for Self-Driving Labs
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- Mofasa: A Step Change in Metal-Organic Framework Generation
- Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
- Textured Word-As-Image illustration
- Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
- Reconstructing Multi-Scale Physical Fields from Extremely Sparse Measurements with an Autoencoder-Diffusion Cascade
- ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
- Syndrome-Flow Consistency Model Achieves One-step Denoising Error Correction Codes
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- Modality-Augmented Fine-Tuning of Foundation Robot Policies for Cross-Embodiment Manipulation on GR1 and G1
- InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
- TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
- Diffusion Model in Latent Space for Medical Image Segmentation Task
- Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
- DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling
- mmPred: Radar-based Human Motion Prediction in the Dark
- MDiff4STR: Mask Diffusion Model for Scene Text Recognition
- Forecasting in Offline Reinforcement Learning for Non-stationary Environments
- ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
- fMRI2GES: Co-speech Gesture Reconstruction from fMRI Signal with Dual Brain Decoding Alignment
- Controllable 3D Object Generation with Single Image Prompt
- Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model
- Adaptive-lambda Subtracted Importance Sampled Scores in Machine Unlearning for DDPMs and VAEs
- Cue3D: Quantifying the Role of Image Cues in Single-Image 3D Generation
- TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model
- Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards
- TrajDiff: End-to-end Autonomous Driving without Perception Annotation
- Flow Matching for Tabular Data Synthesis
- Cosine-Similarity Methods for Efficient Training and Sampling in High-Dimensional Latent Spaces
- LAP: Fast LAtent Diffusion Planner for Autonomous Driving
- Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Views
- Diffusion-Based Synthesis of 3D T1w MPRAGE Images from Multi-Echo GRE with Multi-Parametric MRI Integration
- Privacy Preserving Diffusion Models for Mixed-Type Tabular Data Generation
- Digital Surfactant
- SplatFont3D: Structure-Aware Text-to-3D Artistic Font Generation with Part-Level Style Control
- CC-FMO: Camera-Conditioned Zero-Shot Single Image to 3D Scene Generation with Foundation Model Orchestration
- GreenPlanner: Practical Floorplan Layout Generation via an Energy-Aware and Function-Feasible Generative Framework
- RMSup: Physics-Informed Radio Map Super-Resolution for Compute-Enhanced Integrated Sensing and Communications
- Learning Causal States Under Partial Observability and Perturbation
- SMamDiff: Spatial Mamba for Stochastic Human Motion Prediction
- MedCondDiff: Lightweight, Robust, Semantically Guided Diffusion for Medical Image Segmentation
- When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI
- Hybrid Stackelberg Game and Diffusion-based Auction for Two-tier Agentic AI Task Offloading in Internet of Agents
- MVAD : A Comprehensive Multimodal Video-Audio Dataset for AIGC Detection
- BioArc: Discovering Optimal Neural Architectures for Biological Foundation Models
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models
- UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations
- USB: Unified Synthetic Brain Framework for Bidirectional Pathology-Healthy Generation and Editing
- AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
- SmallWorlds: Assessing Dynamics Understanding of World Models in Isolated Environments
- ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts
- Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent
- Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model
- DisMo: Disentangled Motion Representations for Open-World Motion Transfer
- Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods
- Vision Bridge Transformer at Scale
- GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation
- Fast Multi-view Consistent 3D Editing with Video Priors
- REVEAL: Reasoning-enhanced Forensic Evidence Analysis for Explainable AI-generated Image Detection
- GOATex: Geometry & Occlusion-Aware Texturing
- Masked Diffusion for Generative Recommendation
- Guiding Visual Autoregressive Models through Spectrum Weakening
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
- Super-resolution of satellite-derived SST data via Generative Adversarial Networks
- One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer
- CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
- Overcoming the Curvature Bottleneck in MeanFlow
- Scalable Diffusion Transformer for Conditional 4D fMRI Synthesis
- From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts
- Markovian Scale Prediction: A New Era of Visual Autoregressive Generation
- CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance
- MammoRGB: Dual-View Mammogram Synthesis Using Denoising Diffusion Probabilistic Models
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Test-time scaling of diffusions with flow maps
- Structure-Preserving Unpaired Image Translation to Photometrically Calibrate JunoCam with Hubble Data
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- Generative models for crystalline materials
- Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning
- CaFlow: Enhancing Long-Term Action Quality Assessment with Causal Counterfactual Flow
- Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
- Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration
- IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance
- Semantic-Centric Alignment for Zero-shot Panoptic Segmentation with Limited Data
- FoldSAE: Learning to Steer Protein Folding Through Sparse Representations
- AI killed the video star. Audio-driven diffusion model for expressive talking head generation
- Adversarial Flow Models
- Canvas-to-Image: Compositional Image Generation with Multimodal Controls
- A Model and Data Dual-driven Approach for Multitargets Detection under Mainlobe Jamming
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- Do You See What I Say? Generalizable Deepfake Detection based on Visual Speech Recognition
- Artificial Intelligence-Driven Network-on-Chip Design Space Exploration: Neural Network Architectures for Design
- Semantic-Aware Caching for Efficient Image Generation in Edge Computing
- INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts
- GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
- Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer
- Controllable risk scenario generation from human crash data for autonomous vehicle testing
- MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
- VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation
- Merge and Bound: Direct Manipulations on Weights for Class Incremental Learning
- Uni-Inter: Unifying 3D Human Motion Synthesis Across Diverse Interaction Contexts
- MeanFlow Transformers with Representation Autoencoders
- TSGM: Regular and Irregular Time-series Generation using Score-based Generative Models
- Sawtooth Sampling for Time Series Denoising Diffusion Implicit Models
- 3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
- LaGen: Towards Autoregressive LiDAR Scene Generation
- AuthenLoRA: Entangling Stylization with Imperceptible Watermarks for Copyright-Secure LoRA Adapters
- CAHS-Attack: CLIP-Aware Heuristic Search Attack Method for Stable Diffusion
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring
- Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning
- Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
- FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain
- A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation
- From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
- OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
- Efficient Diffusion Planning with Temporal Diffusion
- MFM-point: Multi-scale Flow Matching for Point Cloud Generation
- FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation
- Deep Parameter Interpolation for Scalar Conditioning
- FANoise: Singular Value-Adaptive Noise Modulation for Robust Multimodal Representation Learning
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
- HMARK: Radioactive Multi-Bit Semantic-Latent Watermarking for Diffusion Models
- From Diffusion to One-Step Generation: A Comparative Study of Flow-Based Models with Application to Image Inpainting
- Dynamic Test-Time Compute Scaling in Control Policy: Difficulty-Aware Stochastic Interpolant Policy
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion
- Layer-Aware Video Composition via Split-then-Merge
- Efficient and Fast Generative-Based Singing Voice Separation using a Latent Diffusion Model
- MotionV2V: Editing Motion in a Video
- Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model
- Diffusion Reconstruction-based Data Likelihood Estimation for Core-Set Selection
- CDLM: Consistency Diffusion Language Models For Faster Sampling
- Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
- Manifold Percolation: from generative model to Reinforce learning
- Delta Sampling: Data-Free Knowledge Transfer Across Diffusion Models
- FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
- STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
- Diffusion for Fusion: Designing Stellarators with Generative AI
- BRIC: Bridging Kinematic Plans and Physical Control at Test Time
- Block Cascading: Training Free Acceleration of Block-Causal Video Models
- A Training-Free Approach for Multi-ID Customization via Attention Adjustment and Spatial Control
- Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations
- Advancing Image Classification with Discrete Diffusion Classification Modeling
- The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
- Text-guided Controllable Diffusion for Realistic Camouflage Images Generation
- Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
- Restora-Flow: Mask-Guided Image Restoration with Flow Matching
- UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
- PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- SONIC: Spectral Optimization of Noise for Inpainting with Consistency
- EmoFeedback2: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback
- HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- MambaEye: A Size-Agnostic Visual Encoder with Causal Sequential Processing
- GFT-GCN: Privacy-Preserving 3D Face Mesh Recognition with Spectral Diffusion
- Low-Resolution Editing is All You Need for High-Resolution Editing
- LumiTex: Towards High-Fidelity PBR Texture Generation with Illumination Context
- 3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion
- DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
- Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
- Diffusion-Based Synthetic Brightfield Microscopy Images for Enhanced Single Cell Detection
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- ShapeGen: Towards High-Quality 3D Shape Synthesis
- Terminal Velocity Matching
- Solving Diffusion Inverse Problems with Restart Posterior Sampling
- Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction
- Flow Map Distillation Without Data
- Predicting partially observable dynamical systems via diffusion models with a multiscale inference scheme
- Efficiency vs. Fidelity: A Comparative Analysis of Diffusion Probabilistic Models and Flow Matching on Low-Resource Hardware
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
- ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
- Torsion-Space Diffusion for Protein Backbone Generation with Geometric Refinement
- Understanding, Accelerating, and Improving MeanFlow Training
- Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation
- A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- View-Consistent Diffusion Representations for 3D-Consistent Video Generation
- UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection
- Eevee: Towards Close-up High-resolution Video-based Virtual Try-on
- One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
- FVAR: Visual Autoregressive Modeling via Next Focus Prediction
- FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
- DiP: Taming Diffusion Models in Pixel Space
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
- LATTICE: Democratize High-Fidelity 3D Generation at Scale
- Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
- When and What to Recommend: Joint Modeling of Timing and Content for Active Sequential Recommendation
- ObjectAlign: Neuro-Symbolic Object Consistency Verification and Correction
- Single Image to High-Quality 3D Object via Latent Features
- Masked Diffusion Models are Secretly Learned-Order Autoregressive Models
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
- Unsupervised Multi-View Visual Anomaly Detection via Progressive Homography-Guided Alignment
- Structured Noise Modeling for Enhanced Time-Series Forecasting
- DELTA: Language Diffusion-based EEG-to-Text Architecture
- Demystifying Diffusion Objectives: Reweighted Losses are Better Variational Bounds
- Large Scale Community-Aware Network Generation
- Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
- CoD: A Diffusion Foundation Model for Image Compression
- RigAnyFace: Scaling Neural Facial Mesh Auto-Rigging with Unlabeled Data
- Generative Myopia: Why Diffusion Models Fail at Structure
- Zero-Shot Video Deraining with Video Diffusion Models
- Breaking Forgetting: Training-Free Few-Shot Class-Incremental Learning via Conditional Diffusion
- Uncertainty Quantification in HSI Reconstruction using Physics-Aware Diffusion Priors and Optics-Encoded Measurements
- Jacobian-Aware Posterior Sampling for Inverse Problems
- ConsistCompose: Unified Multimodal Layout Control for Image Composition
- DiM-TS: Bridge the Gap between Selective State Space Models and Time Series for Generative Modeling
- MultiDiffNet: A Multi-Objective Diffusion Framework for Generalizable Brain Decoding
- TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
- Generating Synthetic Human Blastocyst Images for In-Vitro Fertilization Blastocyst Grading
- Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
- Versatile Recompression-Aware Perceptual Image Super-Resolution
- Diffusion-based Surrogate Model for Time-varying Underwater Acoustic Channels
- IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment
- GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models
- FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning
- WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning
- HEAL: Learning-Free Source Free Unsupervised Domain Adaptation for Cross-Modality Medical Image Segmentation
- Generative Model Predictive Control in Manufacturing Processes: A Review
- ArticFlow: Generative Simulation of Articulated Mechanisms
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- REXO: Indoor Multi-View Radar Object Detection via 3D Bounding Box Diffusion
- Diffusion Models are Molecular Dynamics Simulators
- MDG: Masked Denoising Generation for Multi-Agent Behavior Modeling in Traffic Environments
- EvDiff: High Quality Video with an Event Camera
- Radar2Shape: 3D Shape Reconstruction from High-Frequency Radar using Multiresolution Signed Distance Functions
- Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removal
- Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing
- FlexiFlow: decomposable flow matching for generation of flexible molecular ensemble
- FLUID: Training-Free Face De-identification via Latent Identity Substitution
- Spanning Tree Autoregressive Visual Generation
- ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented Diffusion
- RoomPlanner: Explicit Layout Planner for Easier LLM-Driven 3D Room Generation
- DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing
- Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation
- Real-Time Cooked Food Image Synthesis and Visual Cooking Progress Monitoring on Edge Devices
- MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- Diffusion-Inversion-Net (DIN): An End-to-End Direct Probabilistic Framework for Characterizing Hydraulic Conductivities and Quantifying Uncertainty
- UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
- Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content
- Warm Diffusion: Recipe for Blur-Noise Mixture Diffusion Models
- When Motion Learns to Listen: Diffusion-Prior Lyapunov Actor-Critic Framework with LLM Guidance for Stable and Robust AUV Control in Underwater Tasks
- Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment
- Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models
- DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving
- SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
- Loomis Painter: Reconstructing the Painting Process
- MRI Super-Resolution with Deep Learning: A Comprehensive Survey
- TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing
- TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming
- TFCDiff: Robust ECG Denoising via Time-Frequency Complementary Diffusion
- Time dependent loss reweighting for flow matching and diffusion models is theoretically justified
- Boosting Predictive Performance on Tabular Data through Data Augmentation with Latent-Space Flow-Based Diffusion
- Denoising weak lensing mass maps with diffusion model and generative adversarial network
- Motion Transfer-Enhanced StyleGAN for Generating Diverse Macaque Facial Expressions
- Decoupling Complexity from Scale in Latent Diffusion Model
- T2I-Based Physical-World Appearance Attack against Traffic Sign Recognition Systems in Autonomous Driving
- Controllable Layer Decomposition for Reversible Multi-Layer Image Generation
- Towards Overcoming Data Scarcity in Nuclear Energy: A Study on Critical Heat Flux with Physics-consistent Conditional Diffusion Model
- Simba: Towards High-Fidelity and Geometrically-Consistent Point Cloud Completion via Transformation Diffusion
- PairHuman: A High-Fidelity Photographic Dataset for Customized Dual-Person Generation
- LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving
- Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution
- Automatic Uncertainty-Aware Synthetic Data Bootstrapping for Historical Map Segmentation
- MamTiff-CAD: Multi-Scale Latent Diffusion with Mamba+ for Complex Parametric Sequence
- Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning
- PushingBots: Collaborative Pushing via Neural Accelerated Combinatorial Hybrid Optimization
- Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
- cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold
- Neo: Real-Time On-Device 3D Gaussian Splatting with Reuse-and-Update Sorting Acceleration
- Generative Photographic Control for Scene-Consistent Video Cinematic Editing
- What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- SplitFlux: Learning to Decouple Content and Style from a Single Image
- UniSER: A Foundation Model for Unified Soft Effects Removal
- Efficient Score Pre-computation for Diffusion Models via Cross-Matrix Krylov Projection
- BokehFlow: Depth-Free Controllable Bokeh Rendering via Flow Matching
- UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware Diffusion Policy
- FaultDiffusion: Few-Shot Fault Time Series Generation with Diffusion Model
- Transferable Dual-Domain Feature Importance Attack against AI-Generated Image Detector
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization
- GeoSceneGraph: Geometric Scene Graph Diffusion Model for Text-guided 3D Indoor Scene Synthesis
- B-Rep Distance Functions (BR-DF): How to Represent a B-Rep Model by Volumetric Distance Functions?
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- NERD: Network-Regularized Diffusion Sampling For 3D Computed Tomography
- Segmentation-Aware Latent Diffusion for Satellite Image Super-Resolution: Enabling Smallholder Farm Boundary Delineation
- MiAD: Mirage Atom Diffusion for De Novo Crystal Generation
- Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
- H-LDM: Hierarchical Latent Diffusion Models for Controllable and Interpretable PCG Synthesis from Clinical Metadata
- Iterative Diffusion-Refined Neural Attenuation Fields for Multi-Source Stationary CT Reconstruction: NAF Meets Diffusion Model
- AI-driven Generation of MALDI-TOF MS for Microbial Characterization
- StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model
- InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
- Energy-based Autoregressive Generation for Neural Population Dynamics
- CFG-EC: Error Correction Classifier-Free Guidance
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- Coffee: Controllable Diffusion Fine-tuning
- Zero-Training Task-Specific Model Synthesis for Few-Shot Medical Image Classification
- Flood-LDM: Generalizable Latent Diffusion Models for rapid and accurate zero-shot High-Resolution Flood Mapping
- Training-free Detection of AI-generated images via Cropping Robustness
- Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers
- Tractable Probabilistic Models for Investment Planning
- VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping
- Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views
- Generalized Denoising Diffusion Codebook Models (gDDCM): Tokenizing images using a pre-trained diffusion model
- Statistically Accurate and Robust Generative Prediction of Rock Discontinuities with A Tabular Foundation Model
- EL3DD: Extended Latent 3D Diffusion for Language Conditioned Multitask Manipulation
- Force-Aware 3D Contact Modeling for Stable Grasp Generation
- MRIQT: Physics-Aware Diffusion Model for Image Quality Transfer in Neonatal Ultra-Low-Field MRI
- DiffFP: Learning Behaviors from Scratch via Diffusion-based Fictitious Play
- GenTract: Generative Global Tractography
- Conditional Diffusion Model for Multi-Agent Dynamic Task Decomposition
- MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation
- BrainNormalizer: Anatomy-Informed Pseudo-Healthy Brain Reconstruction from Tumor MRI via Edge-Guided ControlNet
- DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection
- Distribution Matching Distillation Meets Reinforcement Learning
- Functional Mean Flow in Hilbert Space
- Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
- An unsupervised posterior sampling framework for multi-purpose seismic data recovery
- Phy-Tac: Toward Human-Like Grasping via Physics-Conditioned Tactile Goals
- Stabilizing Self-Consuming Diffusion Models with Latent Space Filtering
- Example-Based Feature Painting on Textures
- Luminance-Aware Statistical Quantization: Unsupervised Hierarchical Learning for Illumination Enhancement
- SecDiff: Diffusion-Aided Secure Deep Joint Source-Channel Coding Against Adversarial Attacks
- CaloClouds3: Ultra-Fast Geometry-Independent Highly-Granular Calorimeter Simulation
- Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
- EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- Floor Plan-Guided Visual Navigation Incorporating Depth and Directional Cues
- Appreciate the View: A Task-Aware Evaluation Framework for Novel View Synthesis
- Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation
- PID-controlled Langevin Dynamics for Faster Sampling of Generative Models
- TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
- Which Way from B to A: The role of embedding geometry in image interpolation for Stable Diffusion
- DINO-Detect: A Simple yet Effective Framework for Blur-Robust AI-Generated Image Detection
- Diffusion Model Based Signal Recovery Under 1-Bit Quantization
- Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
- MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
- Seeing Through the Rain: Resolving High-Frequency Conflicts in Deraining and Super-Resolution via Diffusion Guidance
- DEMIST: Decoupled Multi-stream latent diffusion for Quantitative Myelin Map Synthesis
- HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models
- Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI Reconstruction via ROI Encoder and visuAl Mapping
- LiDAR-GS++:Improving LiDAR Gaussian Reconstruction via Diffusion Priors
- Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- Chemistry-Enhanced Diffusion-Based Framework for Small-to-Large Molecular Conformation Generation
- Understanding InfoNCE: Transition Probability Matrix Induced Feature Clustering
- TSGDiff: Rethinking Synthetic Time Series Generation from a Pure Graph Perspective
- Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective
- Continuous-time Discrete-space Diffusion Model for Recommendation
- Treatment Stitching with Schrödinger Bridge for Enhancing Offline Reinforcement Learning in Adaptive Treatment Strategies
- ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
- PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling
- FedSDA: Federated Stain Distribution Alignment for Non-IID Histopathological Image Classification
- Noisy MRI Reconstruction via MAP Estimation with an Implicit Deep-Denoiser Prior
- GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
- FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing
- From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
- MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy
- Free3D: 3D Human Motion Emerges from Single-View 2D Supervision
- NP-LoRA: Null Space Projection Unifies Subject and Style in LoRA Fusion
- Chain-of-Generation: Progressive Latent Diffusion for Text-Guided Molecular Design
- Learning Intractable Multimodal Policies with Reparameterization and Diversity Regularization
- Fast Data Attribution for Text-to-Image Models
- One Small Step in Latent, One Giant Leap for Pixels: Fast Latent Upscale Adapter for Your Diffusion Models
- nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation
- GrounDiff: Diffusion-Based Ground Surface Generation from Digital Surface Models
- DermAI: Clinical dermatology acquisition through quality-driven image collection for AI classification in mobile
- DK-Root: A Joint Data-and-Knowledge-Driven Framework for Root Cause Analysis of QoE Degradations in Mobile Networks
- Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance
- DreamPose3D: Hallucinative Diffusion with Prompt Learning for 3D Human Pose Estimation
- Optimizing Input of Denoising Score Matching is Biased Towards Higher Score Norm
- Equivariant Sampling for Improving Diffusion Model-based Image Restoration
- GPDM: Generation-Prior Diffusion Model for Accelerated Direct Attenuation and Scatter Correction of Whole-body 18F-FDG PET
- Incremental Generation is Necessary and Sufficient for Universality in Flow-Based Modelling
- Simulator and Experience Enhanced Diffusion Model for Comprehensive ECG Generation
- FlowCast: Advancing Precipitation Nowcasting with Conditional Flow Matching
- MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
- Parametric Expensive Multi-Objective Optimization via Generative Solution Modeling
- Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling
- Regularized Schrödinger Bridge: Alleviating Distortion and Exposure Bias in Solving Inverse Problems
- Generative Pricing of Basket Options via Signature-Conditioned Mixture Density Networks
- Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
- Hierarchical Memorization in Large Language Models: Evidence from Citation Generation
- WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- Diffusion-Based Solver for CNF Placement on the Cloud-Continuum
- Perturb a Model, Not an Image: Towards Robust Privacy Protection via Anti-Personalized Diffusion Models
- HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition
- Top2Ground: A Height-Aware Dual Conditioning Diffusion Model for Robust Aerial-to-Ground View Generation
- VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion
- StableMorph: High-Quality Face Morph Generation with Stable Diffusion
- Model Predictive Control via Probabilistic Inference: A Tutorial
- Laytrol: Preserving Pretrained Knowledge in Layout Control for Multimodal Diffusion Transformers
- Confidence-Aware Neural Decoding of Overt Speech from EEG: Toward Robust Brain-Computer Interfaces
- Generating Sketches in a Hierarchical Auto-Regressive Process for Flexible Sketch Drawing Manipulation at Stroke-Level
- Parallel Sampling via Autospeculation
- VEDA: 3D Molecular Generation via Variance-Exploding Diffusion with Annealing
- Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- oboro: Text-to-Image Synthesis on Limited Data using Flow-based Diffusion Transformer with MMH Attention
- Rectified Noise: A Generative Model Using Positive-incentive Noise
- HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
- Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
- TimeFlow: Towards Stochastic-Aware and Efficient Time Series Generation via Flow Matching Modeling
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- FlowTIE: Flow-based Transport of Intensity Equation for Phase Gradient Estimation from 4D-STEM Data
- Forecasting implied volatility surface with generative diffusion models
- Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?
- Conditional Diffusion as Latent Constraints for Controllable Symbolic Music Generation
- A Copula-based Semantics-Structure Minimization Framework for QoS Guaranteed Wireless Communications
- Contact Map Transfer with Conditional Diffusion Model for Generalizable Dexterous Grasp Generation
- Inference-Time Scaling of Diffusion Models for Infrared Data Generation
- PADiff: Predictive and Adaptive Diffusion Policies for Ad Hoc Teamwork
- 4DSTR: Advancing Generative 4D Gaussians with Spatial-Temporal Rectification for High-Quality and Consistent 4D Generation
- LiteUpdate: A Lightweight Framework for Updating AI-Generated Image Detectors
- Guiding Generative Models to Uncover Diverse and Novel Crystals via Reinforcement Learning
- Laplacian Score Sharpening for Mitigating Hallucination in Diffusion Models
- BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
- GEWDiff: Geometric Enhanced Wavelet-based Diffusion Model for Hyperspectral Image Super-resolution
- RaLD: Generating High-Resolution 3D Radar Point Clouds with Latent Diffusion
- Diffolio: A Diffusion Model for Multivariate Probabilistic Financial Time-Series Forecasting and Portfolio Construction
- Fine-Tuning Diffusion-Based Recommender Systems via Reinforcement Learning with Reward Function Optimization
- Ambiguity-aware Truncated Flow Matching for Ambiguous Medical Image Segmentation
- Contact Wasserstein Geodesics for Non-Conservative Schrödinger Bridges
- Integrating Reweighted Least Squares with Plug-and-Play Diffusion Priors for Noisy Image Restoration
- Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System
- AvatarTex: High-Fidelity Facial Texture Reconstruction from Single-Image Stylized Avatars
- AnoStyler: Text-Driven Localized Anomaly Generation via Lightweight Style Transfer
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance
- A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models
- Turbo-DDCM: Fast and Flexible Zero-Shot Diffusion-Based Image Compression
- DiffusionUavLoc: Visually Prompted Diffusion for Cross-View UAV Localization
- From Demonstrations to Safe Deployment: Path-Consistent Safety Filtering for Diffusion Policies
- CINEMAE: Leveraging Frozen Masked Autoencoders for Cross-Generator AI Image Detection
- LaneDiffusion: Improving Centerline Graph Learning via Prior Injected BEV Feature Generation
- RelightMaster: Precise Video Relighting with Multi-plane Light Images
- Test-Time Iterative Error Correction for Efficient Diffusion Models
- Gait Recognition via Collaborating Discriminative and Generative Diffusion Models
- Meta-Learning-Driven GFlowNets for 3D Directional Modulation in Mobile Wireless Systems
- Adaptive 3D Reconstruction via Diffusion Priors and Forward Curvature-Matching Likelihood Updates
- 10 Open Challenges Steering the Future of Vision-Language-Action Models
- AD-DAE: Unsupervised Modeling of Longitudinal Alzheimer's Disease Progression with Diffusion Auto-Encoder
- Latent Refinement via Flow Matching for Training-free Linear Inverse Problem Solving
- MALeR: Improving Compositional Fidelity in Layout-Guided Generation
- Neodragon: Mobile Video Generation using Diffusion Transformer
- MiVID: Multi-Strategic Self-Supervision for Video Frame Interpolation using Diffusion Model
- A Dual-Mode ViT-Conditioned Diffusion Framework with an Adaptive Conditioning Bridge for Breast Cancer Segmentation
- Joint Design of Protein Surface and Structure Using a Diffusion Bridge Model
- A PDE Perspective on Generative Diffusion Models
- DiScoFormer: Plug-In Density and Score Estimation with Transformers
- ViTaMIn-B: A Reliable and Efficient Visuo-Tactile Bimanual Manipulation Interface
- Enhancing Diffusion Model Guidance through Calibration and Regularization
- EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation
- SAD-Flower: Flow Matching for Safe, Admissible, and Dynamically Consistent Planning
- Diffusion-Based Electromagnetic Inverse Design of Scattering Structured Media
- Rethinking Metrics and Diffusion Architecture for 3D Point Cloud Generation
- Integrating Score-Based Diffusion Models with Machine Learning-Enhanced Localization for Advanced Data Assimilation in Geological Carbon Storage
- The Causal Round Trip: Generating Authentic Counterfactuals by Eliminating Information Loss
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- SurgiATM: A Physics-Guided Plug-and-Play Model for Deep Learning-Based Smoke Removal in Laparoscopic Surgery
- Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidance
- MoE-DP: An MoE-Enhanced Diffusion Policy for Robust Long-Horizon Robotic Manipulation with Skill Decomposition and Failure Recovery
- Multi-agent Coordination via Flow Matching
- KLASS: KL-Guided Fast Inference in Masked Diffusion Models
- SigmaDock: Untwisting Molecular Docking With Fragment-Based SE(3) Diffusion
- Sublinear iterations can suffice even for DDPMs
- Multimodal Diffusion Forcing for Forceful Manipulation
- Blind Strong Gravitational Lensing Inversion: Joint Inference of Source and Lens Mass with Score-Based Models
- CPO: Condition Preference Optimization for Controllable Image Generation
- Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
- Nowcast3D: Reliable precipitation nowcasting via gray-box learning
- Efficient probabilistic surrogate modeling techniques for partially-observed large-scale dynamical systems
- RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation
- Diffusion Models Bridge Deep Learning and Physics in ENSO Forecasting
- Proto-LeakNet: Towards Signal-Leak Aware Attribution in Synthetic Human Face Imagery
- Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
- Learning to Land Anywhere: Transferable Generative Models for Aircraft Trajectories
- MoSa: Motion Generation with Scalable Autoregressive Modeling
- Text to Sketch Generation with Multi-Styles
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection
- ForeRobo: Unlocking Infinite Simulation Data for 3D Goal-driven Robotic Manipulation
- Robust inference using density-powered Stein operators
- Integrating Score-Based Generative Modeling and Neural ODEs for Accurate Representation of Multiscale Chaotic Dynamics
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- Unified Long Video Inpainting and Outpainting via Overlapping High-Order Co-Denoising
- Periodic Skill Discovery
- EGMOF: Efficient Generation of Metal-Organic Frameworks Using a Hybrid Diffusion-Transformer Architecture
- FP-AbDiff: Improving Score-based Antibody Design by Capturing Nonequilibrium Dynamics through the Underlying Fokker-Planck Equation
- Scaling Multi-Agent Environment Co-Design with Diffusion Models
- Sparse, self-organizing ensembles of local kernels detect rare statistical anomalies
- An Interdisciplinary and Cross-Task Review on Missing Data Imputation
- Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video
- Diffusion Transformer meets Multi-level Wavelet Spectrum for Single Image Super-Resolution
- Conditional Diffusion Model-Enabled Scenario-Specific Neural Receivers for Superimposed Pilot Schemes
- Discrete Bayesian Sample Inference for Graph Generation
- Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models
- Generative Hints
- A Conditional Diffusion Model for Building Energy Modeling Workflows
- AI-Generated Image Detection: An Empirical Study and Future Research Directions
- Bayesian full waveform inversion with learned prior using deep convolutional autoencoder
- Modality-Transition Representation Learning for Visible-Infrared Person Re-Identification
- A Non-Adversarial Approach to Idempotent Generative Modelling
- TAUE: Training-free Noise Transplant and Cultivation Diffusion Model
- Stability of mixed-state phases under weak decoherence
- Wasserstein Convergence of Critically Damped Langevin Diffusions
- Video Text Preservation with Synthetic Text-Rich Videos
- Dexterous Robotic Piano Playing at Scale
- DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping
- Diffusion Models are Robust Pretrainers
- HAGI++: Head-Assisted Gaze Imputation and Generation
- A Roadmap for Predictive Human Immunology
- Wireless Video Semantic Communication with Decoupled Diffusion Multi-frame Compensation
- DL4Proteins Jupyter Notebooks Teach how to use Artificial Intelligence for Biomolecular Structure Prediction and Design
- NSYNC: Negative Synthetic Image Generation for Contrastive Training to Improve Stylized Text-To-Image Translation
- Energy Loss Functions for Physical Systems
- Watermarking Discrete Diffusion Language Models
- Fractional Diffusion Bridge Models
- Lightweight Learning from Actuation-Space Demonstrations via Flow Matching for Whole-Body Soft Robotic Grasping
- Wonder3D++: Cross-domain Diffusion for High-fidelity 3D Generation from a Single Image
- Towards One-step Causal Video Generation via Adversarial Self-Distillation
- XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges
- Modeling Microenvironment Trajectories on Spatial Transcriptomics with NicheFlow
- RefVTON: person-to-person Try on with Additional Unpaired Visual Reference
- Dynamic Population Distribution Aware Human Trajectory Generation with Diffusion Model
- Deep Generative Models for Enhanced Vitreous OCT Imaging
- Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
- TA-LSDiff:Topology-Aware Diffusion Guided by a Level Set Energy for Pancreas Segmentation
- Effective Series Decomposition and Components Learning for Time Series Generation
- Occlusion-Aware Diffusion Model for Pedestrian Intention Prediction
- Privacy-Aware Time Series Synthesis via Public Knowledge Distillation
- Improving Robustness to Out-of-Distribution States in Imitation Learning via Deep Koopman-Boosted Diffusion Policy
- Learning an Efficient Optimizer via Hybrid-Policy Sub-Trajectory Balance
- MIFO: Learning and Synthesizing Multi-Instance from One Image
- Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
- Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models
- Sensitivity Analysis for Climate Science with Generative Flow Models
- TRISKELION-1: Unified Descriptive-Predictive-Generative AI
- OSMGen: Highly Controllable Satellite Image Synthesis using OpenStreetMap Data
- Enhancing Frequency Forgery Clues for Diffusion-Generated Image Detection
- MagicView: Multi-View Consistent Identity Customization via Priors-Guided In-Context Learning
- Diffusion Models at the Drug Discovery Frontier: A Review on Generating Small Molecules versus Therapeutic Peptides
- From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection
- Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals
- Optimal Convergence Analysis of DDPM for General Distributions
- H2-Cache: A Novel Hierarchical Dual-Stage Cache for High-Performance Acceleration of Generative Diffusion Models
- DANCER: Dance ANimation via Condition Enhancement and Rendering with diffusion model
- HiGS: Hierarchical Generative Scene Framework for Multi-Step Associative Semantic Spatial Composition
- E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
- A Step Toward World Models: A Survey on Robotic Manipulation
- Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V
- BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
- GeneFlow: Translation of Single-cell Gene Expression to Histopathological Images via Rectified Flow
- Generative diffusion modeling protocols for improving the Kikuchi pattern indexing in electron back-scatter diffraction
- BI-DCGAN: A Theoretically Grounded Bayesian Framework for Efficient and Diverse GANs
- Generative sampling with physics-informed kernels
- Hybrid Consistency Policy: Decoupling Multi-Modal Diversity and Real-Time Efficiency in Robotic Manipulation
- Enhancing ECG Classification Robustness with Lightweight Unsupervised Anomaly Detection Filters
- Efficient Generative AI Boosts Probabilistic Forecasting of Sudden Stratospheric Warmings
- UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
- GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-guided Latent Diffusion Model?
- Distributional Multi-objective Black-box Optimization for Diffusion-model Inference-time Multi-Target Generation
- Likely Interpolants of Generative Models
- Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- MoTDiff: High-resolution Motion Trajectory estimation from a single blurred image using Diffusion models
- LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
- StructLayoutFormer:Conditional Structured Layout Generation via Structure Serialization and Disentanglement
- Denoising Refinement Diffusion Models for Simultaneous Generation of Multi-scale Mobile Network Traffic
- Security Risk of Misalignment between Text and Image in Multi-modal Model
- Group-Equivariant Diffusion Models for Lattice Field Theory
- A Review of AI-Driven Approaches for Nanoscale Heat Conduction and Radiation
- Dynamic VLM-Guided Negative Prompting for Diffusion Models
- Electric Vehicle Charging Load Modeling: A Survey, Trends, Challenges and Opportunities
- Bias-Corrected Data Synthesis for Imbalanced Learning
- FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
- AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency
- SplitFlow: Flow Decomposition for Inversion-Free Text-to-Image Editing
- On the Dataless Training of Neural Networks
- Reading Radio from Camera: Visually-Grounded, Lightweight, and Interpretable RSSI Prediction
- VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
- Neural Stochastic Flows: Solver-Free Modelling and Inference for SDE Solutions
- Physics-Guided Conditional Diffusion Networks for Microwave Image Reconstruction
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- Off-policy Reinforcement Learning with Model-based Exploration Augmentation
- Echo-Conditioned Denoising Diffusion Probabilistic Models for Multi-Target Tracking in RF Sensing
- Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models
- Hallucinations in Bibliographic Recommendation: Citation Frequency as a Proxy for Training Data Redundancy
- Face De-Identification: A Domain-Centric Survey from Capture to Processing
- Can Deep Generative Models Reproduce Non-Stationary Gaussian Random Fields?
- TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors
- A Priori Sampling of Transition States with Guided Diffusion
- How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models
- Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
- Flow Map Learning via Nongradient Vector Flow
- Existence-Field Diffusion Model for Spatial Point Processes with Variable Cardinality
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models
- FPSGen: Flexible Point Cloud Scene Generation with BEV-Supported Transport Flows
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- Two2Four: Generative Quadruped Puppeteering from Human Motion
- Denoising growth complexity: Data geometry and certified schedules for diffusion sampling
- MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer
- High-Resolution Image Synthesis with Latent Diffusion Models
- Cascading Modular Network (CAM-Net) for Multimodal Image Synthesis
- Mask2IV: Interaction-Centric Video Generation via Mask Trajectories
- Lightweight Transformer for EEG Classification via Balanced Signed Graph Algorithm Unrolling
- Product-Quantised Image Representation for High-Quality Image Synthesis
- Deep learning-based predictive modeling of transonic flow over an airfoil
- Generation of protein dynamics by machine learning
- Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation
- Amortized Moment Matching for Visual Generation
- From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching
- TridentServe: A Stage-level Serving System for Diffusion Pipelines
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
- Multi-scale Autoregressive Models are Laplacian, Discrete, and Latent Diffusion Models in Disguise
- D2 Actor Critic: Diffusion Actor Meets Distributional Critic
- Monte Carlo guided Diffusion for Bayesian linear inverse problems
- TGCM: Topic-Guided Consistency Modeling for One-Step Disentanglement of Interleaved APT Technique Sequences
- The Score Hamiltonian: Mapping Diffusion Models to Adiabatic Transport
- Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models
- Latent diffusion model for conditional reservoir facies generation
- Surflo: Consistent 3D Surface Flow Model with Global State
- High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation
- Physics-informed generative AI for semiconductor manufacturing: Enforcing hard physical constraints in generative models by construction
- Review of end-to-end speech synthesis technology based on deep learning
- HYVINT: Intensity-Driven Hypergraph Generation with Variational Embeddings
- Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving
- WaveGrad: Estimating Gradients for Waveform Generation
- Seeking the Unfamiliar but Memorable: Conceptual Creativity as Meta-Learning
- MIND: Monge Inception Distance for Generative Models Evaluation
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
- DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
- Diffusion Models in Vision: A Survey
- Graph Signal Diffusion Models for Wireless Resource Allocation
- Anytime Sampling for Autoregressive Models via Ordered Autoencoding
- Differentiable Normative Guidance for Nash Bargaining Solution Recovery
- SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
- Generative Modeling via Drifting
- Distance Marching for Generative Modeling
- Meta Flow Maps enable scalable reward alignment
- Generating metamers of human scene understanding
- One-shot Humanoid Whole-body Motion Learning
- Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
- LGCC: Enhancing Flow Matching Based Text-Guided Image Editing with Local Gaussian Coupling and Context Consistency
- Balanced conic rectified flow
- Future of AI Models: A Computational perspective on Model collapse
- Diffusion-Driven Generation of Minimally Preprocessed Brain MRI
- LRT-Diffusion: Calibrated Risk-Aware Guidance for Diffusion Policies
- Breaking the Timescale Barrier: Generative Discovery of Conformational Free-Energy Landscapes and Transition Pathways
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
- Generative View Stitching
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Pearl: A Foundation Model for Placing Every Atom in the Right Location
- Group Relative Attention Guidance for Image Editing
- VideoGPT: Video Generation using VQ-VAE and Transformers
- Causal Ordering for Structure Learning From Time Series
- Leveraging Scale Separation and Stochastic Closure for Data-Driven Prediction of Chaotic Dynamics
- Time-Embedded Algorithm Unrolling for Computational MRI
- Diffusion Models for Wireless Transceivers: From Pilot-Efficient Channel Estimation to AI-Native 6G Receivers
- Deep-Learning-Empowered Programmable Topolectrical Circuits
- Synergizing chemical and AI communities for advancing laboratories of the future
- A Comprehensive Evaluation Framework for Synthetic Trip Data Generation in Public Transport
- UtilGen: Utility-Centric Generative Data Augmentation with Dual-Level Task Adaptation
- PRIVET: Privacy Metric Based on Extreme Value Theory
- ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
- Closing Gaps: An Imputation Analysis of ICU Vital Signs
- Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
- DogMo: A Large-Scale Multi-View RGB-D Dataset for 4D Canine Motion Recovery
- Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
- OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
- Information-Theoretic Discrete Diffusion
- Neural USD: An object-centric framework for iterative editing and control
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- CT-Less Attenuation Correction Using Multiview Ensemble Conditional Diffusion Model on High-Resolution Uncorrected PET Images
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- An efficient probabilistic hardware architecture for diffusion-like models
- Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World
- Diff-TTS: A Denoising Diffusion Model for Text-to-Speech
- Scaffold-Aware Generative Augmentation and Reranking for Enhanced Virtual Screening
- RareFlow: Physics-Aware Flow-Matching for Cross-Sensor Super-Resolution of Rare-Earth Features
- Variational Masked Diffusion Models
- Track, Inpaint, Resplat: Subject-driven 3D and 4D Generation with Progressive Texture Infilling
- A Survey on Efficient Vision-Language-Action Models
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
- Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
- FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
- An Efficient Remote Sensing Super Resolution Method Exploring Diffusion Priors and Multi-Modal Constraints for Crop Type Mapping
- Model-free filtering in high dimensions via projection and score-based diffusions
- Deep Active Inference with Diffusion Policy and Multiple Timescale World Model for Real-World Exploration and Navigation
- Through the Lens: Benchmarking Deepfake Detectors Against Moiré-Induced Distortions
- Introducing physics-informed generative models for targeting structural novelty in the exploration of chemical space
- Residual Diffusion Bridge Model for Image Restoration
- LLM Meets Diffusion: A Hybrid Framework for Crystal Material Generation
- Nested AutoRegressive Models
- Mixed-Density Diffuser: Efficient Planning with Non-Uniform Temporal Resolution
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- Simple Denoising Diffusion Language Models
- VALA: Learning Latent Anchors for Training-Free and Temporally Consistent
- Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner
- LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
- Diffuse to Detect: A Generalizable Framework for Anomaly Detection with Diffusion Models Applications to UAVs and Beyond
- On the Anisotropy of Score-Based Generative Models
- Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models
- Clustering by Denoising: Latent plug-and-play diffusion for single-cell data
- Distributionally Robust Optimization via Diffusion Ambiguity Modeling
- Step2Motion: Locomotion Reconstruction from Pressure Sensing Insoles
- Optimize Any Topology: A Foundation Model for Shape- and Resolution-Free Structural Topology Optimization
- The Deep Bootstrap Framework: Good Online Learners are Good Offline Generalizers
- FlowCritic: Bridging Value Estimation with Flow Matching in Reinforcement Learning
- Conjugate Relation Modeling for Few-Shot Knowledge Graph Completion
- Variational Polya Tree
- Self-Attention Decomposition For Training Free Diffusion Editing
- LO-SDA: Latent Optimization for Score-based Atmospheric Data Assimilation
- DDTR: Diffusion Denoising Trace Recovery
- SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning
- An End-to-End Generative Diffusion Model for Heavy-Ion Collisions
- Transitive RL: Value Learning via Divide and Conquer
- TraceTrans: Translation and Spatial Tracing for Surgical Prediction
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
- GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- ODesign: A World Model for Biomolecular Interaction Design
- T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
- DiffusionLane: Diffusion Model for Lane Detection
- Diffusion-Driven Two-Stage Active Learning for Low-Budget Semantic Segmentation
- DynamicTree: Interactive Real Tree Animation via Sparse Voxel Spectrum
- Scaling Non-Parametric Sampling with Representation
- Expert Validation of Synthetic Cervical Spine Radiographs Generated with a Denoising Diffusion Probabilistic Model
- Discovering Latent Graphs with GFlowNets for Diverse Conditional Image Generation
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing
- LiteDiff
- Two-Steps Diffusion Policy for Robotic Manipulation via Genetic Denoising
- AutoSciDACT: Automated Scientific Discovery through Contrastive Embedding and Hypothesis Testing
- WorldGrow: Generating Infinite 3D World
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
- Disentangled Representation Learning via Modular Compositional Bias
- Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
- Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
- Enhancing Video Inpainting with Aligned Frame Interval Guidance
- Self-diffusion for Solving Inverse Problems
- LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal
- Low-Complexity MIMO Channel Estimation with Latent Diffusion Models
- BADiff: Bandwidth Adaptive Diffusion Model
- Morphologically Intelligent Perturbation Prediction with FORM
- SCORENF: Score-based Normalizing Flows for Sampling Unnormalized distributions
- Text-Guided Diffusion Model-based Generative Communication for Wireless Image Transmission
- Improved Training Technique for Shortcut Models
- Noise is All You Need: Solving Linear Inverse Problems by Noise Combination Sampling with Diffusion Models
- On the flow matching interpretability
- Cold-Diffusion Driven Downward Continuation of Gravity Data
- QSilk: Micrograin Stabilization and Adaptive Quantile Clipping for Detail-Friendly Latent Diffusion
- Fisher meets Feynman: score-based variational inference with a product of experts
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Amortized Active Generation of Pareto Sets
- Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
- Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
- Exploration through Generation: Applying GFlowNets to Structured Search
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- Preventing Shortcuts in Adapter Training via Providing the Shortcuts
- ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
- BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation
- MEIcoder: Decoding Visual Stimuli from Neural Activity by Leveraging Most Exciting Inputs
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- EchoDistill: Bidirectional Concept Distillation for One-Step Diffusion Personalization
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- Exponential Convergence Guarantees for Iterative Markovian Fitting
- Target-aware Image Editing via Cycle-consistent Constraints
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- Evaluating Video Models as Simulators of Multi-Person Pedestrian Trajectories
- Poisson Flow Consistency Training
- IEnSF: Iterative Ensemble Score Filter for Reducing Error in Posterior Score Estimation in Nonlinear Data Assimilation
- Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics
- Compositional Generation for Long-Horizon Coupled PDEs
- StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
- DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
- AlphaFlow: Understanding and Improving MeanFlow Models
- Diffusion Autoencoders with Perceivers for Long, Irregular and Multimodal Astronomical Sequences
- Transferable Black-Box One-Shot Forging of Watermarks via Image Preference Models
- Predicting before Reconstruction: A generative prior framework for MRI acceleration
- Exploring Conditions for Diffusion models in Robotic Control
- Curvilinear Structure-preserving Unpaired Cross-domain Medical Image Translation
- UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- Guiding diffusion models to reconstruct flow fields from sparse data
- A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
- Learning and Simulating Building Evacuation Patterns for Enhanced Safety Design Using Generative Models
- Beyond sparse denoising in frames: minimax estimation with a scattering transform
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning
- BrainCognizer: Brain Decoding with Human Visual Cognition Simulation for fMRI-to-Image Reconstruction
- BrainMCLIP: Brain Image Decoding with Multi-Layer feature Fusion of CLIP
- Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall
- Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning
- CBDiff:Conditional Bernoulli Diffusion Models for Image Forgery Localization
- Optimization Benchmark for Diffusion Models on Dynamical Systems
- Controllable Machine Unlearning via Gradient Pivoting
- A Cross-Environment and Cross-Embodiment Path Planning Framework via a Conditional Diffusion Model
- Protein generation with embedding learning for motif diversification
- A Frequentist Statistical Introduction to Variational Inference, Autoencoders, and Diffusion Models
- UltraGen: High-Resolution Video Generation with Hierarchical Attention
- Diffusion Buffer for Online Generative Speech Enhancement
- Learning Boltzmann Generators via Constrained Mass Transport
- LAND: Lung and Nodule Diffusion for 3D Chest CT Synthesis with Anatomical Guidance
- Beyond Single Images: Retrieval Self-Augmented Unsupervised Camouflaged Object Detection
- SegTune: Structured and Fine-Grained Control for Song Generation
- Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback
- Towards Identifiability of Hierarchical Temporal Causal Representation Learning
- Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
- UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
- Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference
- DP2O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution
- MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning
- PFGS: Pose-Fused 3D Gaussian Splatting for Complete Multi-Pose Object Reconstruction
- Towards Robust Zero-Shot Reinforcement Learning
- World-in-World: World Models in a Closed-Loop World
- HyperDiffusionFields (HyDiF): Diffusion-Guided Hypernetworks for Learning Implicit Molecular Neural Fields
- Gradient Variance Reveals Failure Modes in Flow-Based Generative Models
- Latent-Augmented Discrete Diffusion Models
- HouseTour: A Virtual Real Estate A(I)gent
- Demystifying Transition Matching: When and Why It Can Beat Flow Matching
- ConsistEdit: Highly Consistent and Precise Training-free Visual Editing
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
- Cross-disciplinary perspectives on the potential for artificial intelligence across chemistry
- L2P: Unlocking Latent Potential for Pixel Generation
- Diffusion Models as Dataset Distillation Priors
- Beyond Binary Out-of-Distribution Detection: Characterizing Distributional Shifts with Multi-Statistic Diffusion Trajectories
- Beyond Real Faces: Synthetic Datasets Can Achieve Reliable Recognition Performance without Privacy Compromise
- CharDiff-LP: A Diffusion Model with Character-Level Guidance for License Plate Image Restoration
- Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
- Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- The Evolving Nature of Latent Spaces: From GANs to Diffusion
- On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
- Soft-Masked Diffusion Language Models
- Adaptive Discretization for Consistency Models
- In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models
- Boosting Fidelity for Pre-Trained-Diffusion-Based Low-Light Image Enhancement via Condition Refinement
- KineDiff3D: Kinematic-Aware Diffusion for Category-Level Articulated Object Shape Reconstruction and Generation
- Continuous Q-Score Matching: Diffusion Guided Reinforcement Learning for Continuous-Time Control
- Towards Real-Time Generative Speech Restoration with Flow-Matching
- Adaptive Deterministic Flow Matching for Target Speaker Extraction
- Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling
- SDPA++: A General Framework for Self-Supervised Denoising with Patch Aggregation
- HumanCM: One Step Human Motion Prediction
- Personalized Image Filter: Mastering Your Photographic Style
- From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display
- Class-N-Diff: Classification-Induced Diffusion Model Can Make Fair Skin Cancer Diagnosis
- FLOWR.root: A flow matching based foundation model for joint multi-purpose structure-aware 3D ligand generation and affinity prediction
- H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
- Latent Diffusion Model without Variational Autoencoder
- Deep Compositional Phase Diffusion for Long Motion Sequence Generation
- ObjectTransforms for Uncertainty Quantification and Reduction in Vision-Based Perception for Autonomous Vehicles
- Particle Dynamics for Latent-Variable Energy-Based Models
- VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation
- Deep generative priors for 3D brain analysis
- Operator Flow Matching for Timeseries Forecasting
- Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models
- AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Learning an Image Editing Model without Image Editing Pairs
- Terra: Explorable Native 3D World Model with Point Latents
- Ponimator: Unfolding Interactive Pose for Versatile Human-human Interaction Animation
- WithAnyone: Towards Controllable and ID Consistent Image Generation
- Attention Is All You Need for KV Cache in Diffusion LLMs
- RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion
- TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
- ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
- RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
- Inpainting the Red Planet: Diffusion Models for the Reconstruction of Martian Environments in Virtual Reality
- Generative Models From and For Sampling-Based MPC: A Bootstrapped Approach For Adaptive Contact-Rich Manipulation
- SteeringTTA: Guiding Diffusion Trajectories for Robust Test-Time-Adaptation
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- GOPLA: Generalizable Object Placement Learning via Synthetic Augmentation of Human Arrangement
- GAN-based Content-Conditioned Generation of Handwritten Musical Symbols
- Exploring Cross-Modal Flows for Few-Shot Learning
- Restoring Noisy Demonstration for Imitation Learning With Diffusion Models
- Unsupervised Deep Generative Models for Anomaly Detection in Neuroimaging: A Systematic Scoping Review
- Inference-Time Search using Side Information for Diffusion-based Image Reconstruction
- Nonparametric Data Attribution for Diffusion Models
- Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization
- Spatial Computing Communications for Multi-User Virtual Reality in Distributed Mobile Edge Computing Network
- PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis
- RoBCtrl: Attacking GNN-Based Social Bot Detectors via Reinforced Manipulation of Bots Control Interaction
- Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation
- Salient Concept-Aware Generative Data Augmentation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- Briding Diffusion Posterior Sampling and Monte Carlo methods: a survey
- Capture, Canonicalize, Splat: Zero-Shot 3D Gaussian Avatars from Unstructured Phone Images
- DiffOPF: Diffusion Solver for Optimal Power Flow
- NAPPure: Adversarial Purification for Robust Image Classification under Non-Additive Perturbations
- A Diffusion-Refined Planner with Reinforcement Learning Priors for Confined-Space Parking
- PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
- Cyclic Self-Supervised Diffusion for Ultra Low-field to High-field MRI Synthesis
- CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
- Manifold Decoders: A Framework for Generative Modeling from Nonlinear Embeddings
- VIST3A: Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- Ultra High-Resolution Image Inpainting with Patch-Based Content Consistency Adapter
- Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
- Counting Hallucinations in Diffusion Models
- Graph Generation with Spectral Geodesic Flow Matching
- End-to-End Multi-Modal Diffusion Mamba
- DiffLoc: Diffusion Model-Based High-Precision Positioning for 6G Networks
- UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy
- Adaptive Visual Conditioning for Semantic Consistency in Diffusion-Based Story Continuation
- CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
- NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- Federated Conditional Conformal Prediction via Generative Models
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- Generating healthy counterfactuals with denoising diffusion bridge models
- FlashWorld: High-quality 3D Scene Generation within Seconds
- SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
- Machine Learning-Based Ultrasonic Weld Characterization Using Hierarchical Wave Modeling and Diffusion-Driven Distribution Alignment
- SCOPED: Score-Curvature Out-of-distribution Proximity Evaluator for Diffusion
- Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs
- Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check
- A Connection Between Score Matching and Local Intrinsic Dimension
- RNAGenScape: Property-guided Optimization and Interpolation of mRNA Sequences with Manifold Langevin Dynamics
- What If : Understanding Motion Through Sparse Interactions
- T(R,O) Grasp: Efficient Graph Diffusion of Robot-Object Spatial Transformation for Cross-Embodiment Dexterous Grasping
- DiffEM: Learning from Corrupted Data with Diffusion Models via Expectation Maximization
- Adapting Noise to Data: Generative Flows from 1D Processes
- WaterFlow: Explicit Physics-Prior Rectified Flow for Underwater Saliency Mask Generation
- LayerSync: Self-aligning Intermediate Layers
- Learning Human Motion with Temporally Conditional Mamba
- Unconditional Human Motion and Shape Generation via Balanced Score-Based Diffusion
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- MS-GAGA: Metric-Selective Guided Adversarial Generation Attack
- Continuous Uniqueness and Novelty Metrics for Generative Modeling of Inorganic Crystals
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Scene Coordinate Reconstruction Priors
- Controlling Intent Expressiveness in Robot Motion with Diffusion Models
- A Gradient Guided Diffusion Framework for Chance Constrained Programming
- BIGFix: Bidirectional Image Generation with Token Fixing
- The Impact of Synthetic Data on Object Detection Model Performance: A Comparative Analysis with Real-World Data
- SDGraph: Multi-Level Sketch Representation Learning by Sparse-Dense Graph Architecture
- DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation
- Probabilistic Super-Resolution for Urban Micrometeorology via a Schrödinger Bridge
- Self-Supervised Selective-Guided Diffusion Model for Old-Photo Face Restoration
- Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
- Time-Correlated Video Bridge Matching
- Diffusion models for polarimetric reconstruction of circumstellar environments
- Diffusion Transformers with Representation Autoencoders
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- EReLiFM: Evidential Reliability-Aware Residual Flow Meta-Learning for Open-Set Domain Generalization under Noisy Labels
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- Hierarchical Koopman Diffusion: Fast Generation with Interpretable Diffusion Trajectory
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- PAINT: Parallel-in-time Neural Twins for Dynamical System Reconstruction
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- Y-shaped Generative Flows
- Pre to Post-Treatment Glioblastoma MRI Prediction using a Latent Diffusion Model
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- Reinforced sequential Monte Carlo for amortised sampling
- Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
- Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
- Offline Reinforcement Learning with Generative Trajectory Policies
- Proportion and Perspective Control for Flow-Based Image Generation
- DiffStyleTS: Diffusion Model for Style Transfer in Time Series
- Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
- Coherent Load Profile Synthesis with Conditional Diffusion for LV Distribution Network Scenario Generation
- CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization
- Flows, straight but not so fast: Exploring the design space of Rectified Flows in Protein Design
- Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
- Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation
- NeuroSwift: A Lightweight Cross-Subject Framework for fMRI Visual Reconstruction of Complex Scenes
- Redundancy as a Structural Information Principle for Learning and Generalization
- FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding
- WaveletDiff: Multilevel Wavelet Diffusion For Time Series Generation
- Schrödinger bridge for generative AI: Soft-constrained formulation and convergence analysis
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- CSI Prediction Using Diffusion Models
- Normalization-equivariant Diffusion Models: Learning Posterior Samplers From Noisy And Partial Measurements
- Discrete State Diffusion Models: A Sample Complexity Perspective
- Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
- Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion
- Designing ReLU Generative Networks to Enumerate Trees with a Given Tree Edit Distance
- Injecting Frame-Event Complementary Fusion into Diffusion for Optical Flow in Challenging Scenes
- MonoSE(3)-Diffusion: A Monocular SE(3) Diffusion Framework for Robust Camera-to-Robot Pose Estimation
- SoundReactor: Frame-level Online Video-to-Audio Generation
- Latent Retrieval Augmented Generation of Cross-Domain Protein Binders
- ProteinAE: Protein Diffusion Autoencoders for Structure Encoding
- VGDM: Vision-Guided Diffusion Model for Brain Tumor Detection and Segmentation
- Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
- Generative Modeling of Aerosol State Representations
- ProGress: Structured Music Generation via Graph Diffusion and Hierarchical Music Analysis
- Sketch Animation: State-of-the-art Report
- CauchyNet: Compact and Data-Efficient Learning using Holomorphic Activation Functions
- Multi-Scale Diffusion Transformer for Jointly Simulating User Mobility and Mobile Traffic Pattern
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Local-Global Context-Aware and Structure-Preserving Image Super-Resolution
- Waves of Imagination: Unconditional Spectrogram Generation using Diffusion Architectures
- Calibrating Generative Models
- Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- Squidiff: Predicting cellular development and responses to perturbations using a diffusion model
- Using neural style transfer to study the evolution of animal signal design: A case study in an ornamented fish
- ZK-WAGON: Imperceptible Watermark for Image Generation Models using ZK-SNARKs
- Flow-Matching Guided Deep Unfolding for Hyperspectral Image Reconstruction
- DreamX-World 1.0: A General-Purpose Interactive World Model
- Leveraging Prior Knowledge of Diffusion Model for Person Search
- Rethinking the shape convention of an MLP
- One Pass Is Not Enough: Recursive Latent Refinement for Generative Models
- Asymmetric Flow Models
- Towards Photonic Band Diagram Generation with Transformer-Latent Diffusion Models
- How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
- Domain Knowledge Infused Conditional Generative Models for Accelerating Drug Discovery
- TC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion Control
- SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- FreeViS: Training-free Video Stylization with Inconsistent References
- A Study of the Removability of Speaker-Adversarial Perturbations
- Few-shot multi-token DreamBooth with LoRa for style-consistent character generation
- Failure Prediction at Runtime for Generative Robot Policies
- A Biophysically-Conditioned Generative Framework for 3D Brain Tumor MRI Synthesis
- SynthID-Image: Image watermarking at internet scale
- AdaPM: a Partial Momentum Algorithm for LLM Training
- MSDM: Generating Task-Specific Pathology Images with a Multimodal Conditioned Diffusion Model for Cell and Nuclei Segmentation
- Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
- MCMC: Bridging Rendering, Optimization and Generative AI
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- Lesion-Aware Post-Training of Latent Diffusion Models for Synthesizing Diffusion MRI from CT Perfusion
- DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
- Denoised Diffusion for Object-Focused Image Augmentation
- Efficient Autoregressive Inference for Transformer Probabilistic Models
- Score-Based Density Estimation from Pairwise Comparisons
- Physically Valid Biomolecular Interaction Modeling with Gauss-Seidel Projection
- Modeling Time-Lapse Trajectories to Characterize Cranberry Growth
- Spatial Deconfounder: Interference-Aware Deconfounding for Spatial Causal Inference
- ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
- Permutation-Invariant Spectral Learning via Dyson Diffusion
- InstructX: Towards Unified Visual Editing with MLLM Guidance
- FreqCa: Accelerating Diffusion Models via Frequency-Aware Caching
- SummDiff: Generative Modeling of Video Summarization with Diffusion
- Guided Star-Shaped Masked Diffusion
- Hyperspectral data augmentation with transformer-based diffusion models
- SViM3D: Stable Video Material Diffusion for Single Image 3D Generation
- Expressive Value Learning for Scalable Offline Reinforcement Learning
- Beyond Real Data: Synthetic Data through the Lens of Regularization
- RASALoRE: Region Aware Spatial Attention with Location-based Random Embeddings for Weakly Supervised Anomaly Detection in Brain MRI Scans
- A 3D Generation Framework from Cross Modality to Parameterized Primitive
- ASBench: Image Anomalies Synthesis Benchmark for Anomaly Detection
- FlowLensing: Simulating Gravitational Lensing with Flow Matching
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- Deep Neural Networks Inspired by Differential Equations
- GeoGen: A Two-stage Coarse-to-Fine Framework for Fine-grained Synthetic Location-based Social Network Trajectory Generation
- EB-MBD: Emerging-Barrier Model-Based Diffusion for Safe Trajectory Optimization in Highly Constrained Environments
- Value Flows
- Rectified-CFG++ for Flow Based Models
- InstructUDrag: Joint Text Instructions and Object Dragging for Interactive Image Editing
- Wavefunction Flows: Efficient Quantum Simulation of Continuous Flow Models
- Towards Real-World Deepfake Detection: A Diverse In-the-wild Dataset of Forgery Faces
- FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
- MONKEY: Masking ON KEY-Value Activation Adapter for Personalization
- Curriculum Learning with Synthetic Data for Enhanced Pulmonary Nodule Detection in Chest Radiographs
- Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
- Reinforcing Diffusion Models by Direct Group Preference Optimization
- Geometry-aware Policy Imitation
- FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- DarkHash: A Data-Free Backdoor Attack Against Deep Hashing
- SkipSR: Faster Super Resolution with Token Skipping
- Bridging the Physics-Data Gap with FNO-Guided Conditional Flow Matching: Designing Inductive Bias through Hierarchical Physical Constraints
- Who Said Neural Networks Aren't Linear?
- LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
- NNDM: NNUNet Diffusion Model for Brain Tumor Segmentation
- What is the most optimal diffusion?
- Symbolic-Diffusion: Deep Learning Based Symbolic Regression with D3PM Discrete Token Diffusion
- A Denoising Framework for Real-World Ultra-Low-Dose Lung CT Images Based on an Image Purification Strategy
- Coupled Data and Measurement Space Dynamics for Enhanced Diffusion Posterior Sampling
- Quantum-enhanced Computer Vision: Going Beyond Classical Algorithms
- Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers
- Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
- Approximate Gaussian Mapping for Generative Image Steganography
- Efficient tensor-network simulations of weakly-measured quantum circuits
- EigenScore: OOD Detection using Covariance in Diffusion Models
- Accelerating Inference for Multilayer Neural Networks with Quantum Computers
- MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
- Diffusion-Augmented Reinforcement Learning for Robust Portfolio Optimization under Stress Scenarios
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- Diffusing Trajectory Optimization Problems for Recovery During Multi-Finger Manipulation
- No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual Prompts
- A Denoising Diffusion-Based Evolutionary Algorithm Framework: Application to the Maximum Independent Set Problem
- NPN: Non-Linear Projections of the Null-Space for Imaging Inverse Problems
- TetriServe: Efficiently Serving Mixed DiT Workloads
- DisCo: Reinforcement with Diversity Constraints for Multi-Human Generation
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- A Diffusion Model for Regular Time Series Generation from Irregular Data with Completion and Masking
- Heptapod: Language Modeling on Visual Signals
- Rethinking Nonlinearity: Trainable Gaussian Mixture Modules for Modern Neural Architectures
- Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
- Towards Better Optimization For Listwise Preference in Diffusion Models
- Benchmarking Fake Voice Detection in the Fake Voice Generation Arms Race
- OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
- Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
- Control-Augmented Autoregressive Diffusion for Data Assimilation
- Limited-Angle Tomography Reconstruction via Projector Guided 3D Diffusion
- Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation
- SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation
- TDiff: Thermal Plug-And-Play Prior with Patch-Based Diffusion
- Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model
- SpotDiff: Spotting and Disentangling Interference in Feature Space for Subject-Preserving Image Generation
- Conditional Denoising Diffusion Model-Based Robust MR Image Reconstruction from Highly Undersampled Data
- Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
- Learning What Matters: Steering Diffusion via Spectrally Anisotropic Forward Noise
- Carré du champ flow matching: better quality-generalisation tradeoff in generative models
- \bfD3QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
- ESS-Flow: Training-free guidance of flow-based models as inference in source space
- BlockGPT: Spatio-Temporal Modelling of Rainfall via Frame-Level Autoregression
- Redefining Generalization in Visual Domains: A Two-Axis Framework for Fake Image Detection with FusionDetect
- Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies
- Data Factory with Minimal Human Effort Using VLMs
- PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- FORGE-Tree: Diffusion-Forcing Tree Search for Long-Horizon Robot Manipulation
- Teamwork: Collaborative Diffusion with Low-rank Coordination and Adaptation
- Diffusion-Based Image Editing for Breaking Robust Watermarks
- Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis
- AgeBooth: Controllable Facial Aging and Rejuvenation via Diffusion Models
- Deep Generative Model for Human Mobility Behavior
- High-Fidelity Synthetic ECG Generation via Mel-Spectrogram Informed Diffusion Training
- A Data-Driven Prism: Multi-View Source Separation with Diffusion Model Priors
- SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
- Policy Gradient Guidance Enables Test Time Control
- Learning a distance measure from the information-estimation geometry of data
- FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation
- Diffusion2: Turning 3D Environments into Radio Frequency Heatmaps
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion
- Flow-Matching Based Refiner for Molecular Conformer Generation
- Learning to Generate Rigid Body Interactions with Video Diffusion Models
- ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
- ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion
- ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement
- Social Agent: Mastering Dyadic Nonverbal Behavior Generation via Conversational LLM Agents
- Improved probabilistic regression using diffusion models
- MultiModal Action Conditioned Video Generation
- C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
- 3Dify: a Framework for Procedural 3D-CG Generation Assisted by LLMs Using MCP and RAG
- TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
- MACS: Measurement-Aware Consistency Sampling for Inverse Problems
- Toward a Unified Geometry Understanding: Riemannian Diffusion Framework for Graph Generation and Prediction
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
- RareGraph-Synth: Knowledge-Guided Diffusion Models for Generating Privacy-Preserving Synthetic Patient Trajectories in Ultra-Rare Diseases
- Perspectives on Stochastic Localization
- PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization
- Pulp Motion: Framing-aware multimodal camera and human motion generation
- Mitigating Diffusion Model Hallucinations with Dynamic Guidance
- SER-Diff: Synthetic Error Replay Diffusion for Incremental Brain Tumor Segmentation
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation
- A Diffusion-based Generative Machine Learning Paradigm for Dynamic Contingency Screening
- Bridging Text and Video Generation: A Survey
- Real-time Prediction of Urban Sound Propagation with Conditioned Normalizing Flows
- UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
- Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion
- Spatiotemporal Forecasting as Planning: A Model-Based Reinforcement Learning Approach with Generative World Models
- Score-based generative emulation of impact-relevant Earth system model outputs
- FoilDiff: A Hybrid Transformer Backbone for Diffusion-based Modelling of 2D Airfoil Flow Fields
- Diffusion-Assisted Distillation for Self-Supervised Graph Representation Learning with MLPs
- Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers
- GDiffuSE: Diffusion-based speech enhancement with noise model guidance
- ObCLIP: Oblivious CLoud-Device Hybrid Image Generation with Privacy Preservation
- Self Speculative Decoding for Diffusion Large Language Models
- Self-supervised diffusion model fine-tuning for costate initialization using Markov chain Monte Carlo
- Adaptive Guided Upsampling for Low-light Image Enhancement
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Unlearning in Diffusion models under Data Constraints: A Variational Inference Approach
- Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
- Drax: Speech Recognition with Discrete Flow Matching
- Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
- Beyond Linear Diffusions: Improved Representations for Rare Conditional Generative Modeling
- Diffusion2: Dual Diffusion Model with Uncertainty-Aware Adaptive Noise for Momentary Trajectory Prediction
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Evolutionary Computation as Natural Generative AI
- Referring Expression Comprehension for Small Objects
- Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
- Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- A Novel Cloud-Based Diffusion-Guided Hybrid Model for High-Accuracy Accident Detection in Intelligent Transportation Systems
- OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows
- Memory Forcing: Spatio-Temporal Memory for Consistent Scene Generation on Minecraft
- HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
- Latent Diffusion Unlearning: Protecting Against Unauthorized Personalization Through Trajectory Shifted Perturbations
- When and Where do Events Switch in Multi-Event Video Generation?
- Learning Robust Diffusion Models from Imprecise Supervision
- PocketSR: The Super-Resolution Expert in Your Pocket Mobiles
- Towards Scalable and Consistent 3D Editing
- TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
- DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
- Denoising and Augmentation: A Dual Use of Diffusion Model for Enhanced CSI Recovery
- Dale meets Langevin: A Multiplicative Denoising Diffusion Model
- Diffusion-Based, Data-Assimilation-Enabled Super-Resolution of Hub-height Winds
- Synthetic EEG Generation using Diffusion Models for Motor Imagery Tasks
- Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models
- Deep Generative Continual Learning using Functional LoRA: FunLoRA
- Onto-Epistemological Analysis of AI Explanations
- Purrception: Variational Flow Matching for Vector-Quantized Image Generation
- Multi-task Neural Diffusion Processes
- 3D-CovDiffusion: 3D-Aware Diffusion Policy for Coverage Path Planning
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- Image Generation Based on Image Style Extraction
- LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration
- Combining complex Langevin dynamics with score-based and energy-based diffusion models
- Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models
- EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
- Audio Driven Real-Time Facial Animation for Social Telepresence
- Constrained Diffusion for Protein Design with Hard Structural Constraints
- NLDSI-BWE: Non Linear Dynamical Systems-Inspired Multi Resolution Discriminators for Speech Bandwidth Extension
- NS-Pep: De novo Peptide Design with Non-Standard Amino Acids
- In-Situ Tweedie Discrete Diffusion Models
- Secure and reversible face anonymization with diffusion models
- Syntax-Guided Diffusion Language Models with User-Integrated Personalization
- ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
- Riemannian Consistency Model
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- From 2D to 3D, Deep Learning-based Shape Reconstruction in Magnetic Resonance Imaging: A Review
- Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
- Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack
- Collaborative-Distilled Diffusion Models (CDDM) for Accelerated and Lightweight Trajectory Prediction
- UCD: Unconditional Discriminator Promotes Nash Equilibrium in GANs
- DiffKnock: Diffusion-based Knockoff Statistics for Neural Networks Inference
- GRITS: A Spillage-Aware Guided Diffusion Policy for Robot Food Scooping Tasks
- Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
- Vicinity-Guided Discriminative Latent Diffusion for Privacy-Preserving Domain Adaptation
- Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations
- Generative AI for subgrid turbulence in large-eddy simulations
- Efficient Probabilistic Tensor Networks
- Discrete Wavelet Transform as a Facilitator for Expressive Latent Space Representation in Variational Autoencoders in Satellite Imagery
- CINDES: Classification induced neural density estimator and simulator
- A Geometric Unification of Generative AI with Manifold-Probabilistic Projection Models
- Cascaded Diffusion Framework for Probabilistic Coarse-to-Fine Hand Pose Estimation
- InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
- Learn to Guide Your Diffusion Model
- Diffusion Alignment as Variational Expectation-Maximization
- Diffusion Modeling of the Three-Dimensional Magnetic Field in the Sun's Corona
- Selective Underfitting in Diffusion Models
- Training Large Language Models To Reason In Parallel With Global Forking Tokens
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging
- Flow Autoencoders are Effective Protein Tokenizers
- F-scheduler: illuminating the free-lunch design space for fast sampling of diffusion models
- MOLM: Mixture of LoRA Markers
- Creative synthesis of kinematic mechanisms
- Secure and Robust Watermarking for AI-generated Images: A Comprehensive Survey
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- DA2: Depth Anything in Any Direction
- DiffCamera: Arbitrary Refocusing on Images
- Importance of localized dilatation and distensibility in identifying determinants of thoracic aortic aneurysm with neural operators
- HilbertA: Hilbert Attention for Image Generation with Diffusion Models
- Contrastive Diffusion Guidance for Spatial Inverse Problems
- dParallel: Learnable Parallel Decoding for dLLMs
- Post-Training Quantization via Residual Truncation and Zero Suppression for Diffusion Models
- AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
- Data-to-Energy Stochastic Dynamics
- FLOWER: A Flow-Matching Solver for Inverse Problems
- EnScale: Temporally-consistent multivariate generative downscaling via proper scoring rules
- 3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation
- IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
- EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Fading to Grow: Growing Preference Ratios via Preference Fading Discrete Diffusion for Recommendation
- GaussEdit: Adaptive 3D Scene Editing with Text and Image Prompts
- VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing
- Exact Solutions to the Quantum Schrödinger Bridge Problem
- CO3: Contrasting Concepts Compose Better
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies
- Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
- ART-VITON: Measurement-Guided Latent Diffusion for Artifact-Free Virtual Try-On
- Dragging with Geometry: From Pixels to Geometry-Guided Image Editing
- LieHMR: Autoregressive Human Mesh Recovery with SO(3) Diffusion
- Reweighted Flow Matching via Unbalanced OT for Label-free Long-tailed Generation
- How Diffusion Models Memorize
- Hierarchical Diffusion Motion Planning with Task-Conditioned Uncertainty-Aware Priors
- OmniDFA: A Unified Framework for Open Set Synthesis Image Detection and Few-Shot Attribution
- dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
- Swift: An Autoregressive Consistency Model for Efficient Weather Forecasting
- Effective Model Pruning
- Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
- Reframing Generative Models for Physical Systems using Stochastic Interpolants
- Hierarchical Reasoning Models: Perspectives and Misconceptions
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- Coupling Generative Modeling and an Autoencoder with the Causal Bridge
- Steering an Active Learning Workflow Towards Novel Materials Discovery via Queue Prioritization
- One-shot Conditional Sampling: MMD meets Nearest Neighbors
- Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection
- Norm-Q: Effective Compression Method for Hidden Markov Models in Neuro-Symbolic Applications
- Let Physics Guide Your Protein Flows: Topology-aware Unfolding and Generation
- Guided Diffusion for the Discovery of New Superconductors
- Chance-constrained Flow Matching for High-Fidelity Constraint-aware Generation
- Score Distillation of Flow Matching Models
- MANI-Pure: Magnitude-Adaptive Noise Injection for Adversarial Purification
- BRIDGE -- Building Reinforcement-Learning Depth-to-Image Data Generation Engine for Monocular Depth Estimation
- Score-based Membership Inference on Diffusion Models
- Path Diffuser: Diffusion Model for Data-Driven Traffic Simulator
- SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation
- Double Descent as a Lens for Sample Efficiency in Autoregressive vs. Discrete Diffusion Models
- SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution
- From Code to Action: Hierarchical Learning of Diffusion-VLM Policies
- Segmentor-Guided Counterfactual Fine-Tuning for Locally Coherent and Targeted Image Synthesis
- When Scores Learn Geometry: Rate Separations under the Manifold Hypothesis
- VAGUEGAN: Stealthy Poisoning and Backdoor Attacks on Image Generative Pipelines
- ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation
- Environment-Aware Satellite Image Generation with Diffusion Models
- UP2You: Fast Reconstruction of Yourself from Unconstrained Photo Collections
- Assessing the risk of future Dunkelflaute events for Germany using generative deep learning
- MarS-FM: Generative Modeling of Molecular Dynamics via Markov State Models
- ExGS: Extreme 3D Gaussian Compression with Diffusion Priors
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- RIFLE: Removal of Image Flicker-Banding via Latent Diffusion Enhancement
- SAIP: A Plug-and-Play Scale-adaptive Module in Diffusion-based Inverse Problems
- U-DiT Policy: U-shaped Diffusion Transformers for Robotic Manipulation
- CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
- LaMoGen: Laban Movement-Guided Diffusion for Text-to-Motion Generation
- UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark
- CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers
- RapidMV: Leveraging Spatio-Angular Representations for Efficient and Consistent Text-to-Multi-View Synthesis
- UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
- Real-Aware Residual Model Merging for Deepfake Detection
- ASIA: Adaptive 3D Segmentation using Few Image Annotations
- Anatomy-DT: A Cross-Diffusion Digital Twin for Anatomical Evolution
- SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions
- Semantic Editing with Coupled Stochastic Differential Equations
- A phase transition in diffusion models reveals the hierarchical nature of data
- An Efficient 3D Latent Diffusion Model for T1-contrast Enhanced MRI Generation
- Simulating Post-Neoadjuvant Chemotherapy Breast Cancer MRI via Diffusion Model with Prompt Tuning
- Tumor Synthesis conditioned on Radiomics
- Watermarking Diffusion Language Models
- MAD: Manifold Attracted Diffusion
- TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
- World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
- Artificial Intelligence in Multimodal Learning Process Analytics
- PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion
- Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- VGGT-X: When VGGT Meets Dense Novel View Synthesis
- Fidelity-Aware Data Composition for Robust Robot Generalization
- Uncertainty-Aware Generative Oversampling Using an Entropy-Guided Conditional Variational Autoencoder
- <scp>AI</scp> Methods for Antimicrobial Peptides: Progress and Challenges
- Diffusion Schr "odinger Bridge with Applications to Score-Based\n Generative Modeling
- MapGenerator: a framework for learning a diffusion model for text promptable map generation
- Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
- SCOPE: Semantic Conditioning for Sim2Real Category-Level Object Pose Estimation in Robotics
- Training Agents Inside of Scalable World Models
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- PAD3R: Pose-Aware Dynamic 3D Reconstruction from Casual Videos
- OAT-FM: Optimal Acceleration Transport for Improved Flow Matching
- PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control
- FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
- GANji: A Framework for Introductory AI Image Generation
- GeoFunFlow: Geometric Function Flow Matching for Inverse Operator Learning over Complex Geometries
- Sequential Diffusion Language Models
- Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution
- Reinforcement Learning with Inverse Rewards for World Model Post-training
- Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
- Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
- MoReact: Generating Reactive Motion from Textual Descriptions
- EWC-Guided Diffusion Replay for Exemplar-Free Continual Learning in Medical Imaging
- Tunable-Generalization Diffusion Powered by Self-Supervised Contextual Sub-Data for Low-Dose CT Reconstruction
- Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
- SIG-Chat: Spatial Intent-Guided Conversational Gesture Generation Involving How, When and Where
- Adversarial Diffusion for Robust Reinforcement Learning
- Defining latent spaces by example: optimisation over the outputs of generative models
- GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning
- Position-Blind Ptychography: Viability of image reconstruction via data-driven variational inference
- HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
- DiffPCN: Latent Diffusion Model Based on Multi-view Depth Images for Point Cloud Completion
- Diff-3DCap: Shape Captioning with Diffusion Models
- StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer
- Sparse-Up: Learnable Sparse Upsampling for 3D Generation with High-Fidelity Textures
- Griffin: Generative Reference and Layout Guided Image Composition
- Latent Representation Learning from 3D Brain MRI for Interpretable Prediction in Multiple Sclerosis
- DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
- ZeroScene: A Zero-Shot Framework for 3D Scene Generation from a Single Image and Controllable Texture Editing
- MAN: Latent Diffusion Enhanced Multistage Anti-Noise Network for Efficient and High-Quality Low-Dose CT Image Denoising
- Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models
- BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
- Disentanglement of Variations with Multimodal Generative Modeling
- HunyuanImage 3.0 Technical Report
- Electric Currents for Discrete Data Generation
- Multi-Modal Manipulation via Multi-Modal Policy Consensus
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- Generative Modeling of Shape-Dependent Self-Contact Human Poses
- Landing with the Score: Riemannian Optimization through Denoising
- Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling
- Balanced Diffusion-Guided Fusion for Multimodal Remote Sensing Classification
- Seeing the Unseen in Low-light Spike Streams
- Bridging Gaps in Satellite Observations of River and Delta Landscapes Using Image Warping
- On the design space between molecular mechanics and machine learning force fields
- Machine learning for synthetic gene circuit engineering
- Modelling and design of transcriptional enhancers
- Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models
- CREPE: Controlling Diffusion with Replica Exchange
- More Data or Better Algorithms: Latent Diffusion Augmentation for Deep Imbalanced Regression
- PDE-Transformer: A Continuous Dynamical Systems Approach to Sequence Modeling
- Dense associative memory on the Bures-Wasserstein space
- Follow-Your-Preference: Towards Preference-Aligned Image Inpainting
- Copyright Infringement Detection in Text-to-Image Diffusion Models via Differential Privacy
- CoDA: Coding LM via Diffusion Adaptation
- FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
- From Noise to Laws: Regularized Time-Series Forecasting via Denoised Dynamic Graphs
- Unleashing Flow Policies with Distributional Critics
- Enhancing Blind Face Restoration through Online Reinforcement Learning
- Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces
- GDR-learners: Orthogonal Learning of Generative Models for Potential Outcomes
- ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
- Pixel Motion Diffusion is What We Need for Robot Control
- Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
- Toward an Integrated Machine Learning Model of a Proteomics Experiment
- Transport Based Mean Flows for Generative Modeling
- Scale-Wise VAR is Secretly Discrete Diffusion
- Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance
- LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
- JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation
- Bézier Meets Diffusion: Robust Generation Across Domains for Medical Image Segmentation
- Universal Inverse Distillation for Matching Models with Real-Data Supervision (No GANs)
- Overclocking Electrostatic Generative Models
- Decoding quantum low density parity check codes with diffusion
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- NIFTY: a Non-Local Image Flow Matching for Texture Synthesis
- Adaptive Policy Backbone via Shared Network
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- Aurora: Towards Universal Generative Multimodal Time Series Forecasting
- Conditional Denoising Diffusion Autoencoders for Wireless Semantic Communications
- DHAGrasp: Synthesizing Affordance-Aware Dual-Hand Grasps with Text Instructions
- Guidance Watermarking for Diffusion Models
- Factor-Based Conditional Diffusion Model for Portfolio Optimization
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Comparative Analysis of GAN and Diffusion for MRI-to-CT translation
- Universal Multi-Domain Translation via Diffusion Routers
- Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors
- Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning
- FlowDrive: moderated flow matching with data balancing for trajectory planning
- Structural Information-based Hierarchical Diffusion for Offline Reinforcement Learning
- SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks
- SingRef6D: Monocular Novel Object Pose Estimation with a Single RGB Reference
- Taming Flow-based I2V Models for Creative Video Editing
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- Drag4D: Align Your Motion with Text-Driven 3D Scene Generation
- SRHand: Super-Resolving Hand Images and 3D Shapes via View/Pose-aware Neural Image Representations and Explicit 3D Meshes
- DiTraj: training-free trajectory control for video diffusion transformer
- Noise-to-Notes: Diffusion-based Generation and Refinement for Automatic Drum Transcription
- UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments
- A Unifying Framework for Parallelizing Sequential Models with Linear Dynamical Systems
- DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
- MusicWeaver: Programmable Long-Form Music Generation with Provably Local Editing
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- Generating Stable Placements via Physics-guided Diffusion Models
- RED-DiffEq: Regularization by denoising diffusion models for solving inverse PDE problems with application to full waveform inversion
- DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models
- What Happens Next? Anticipating Future Motion by Generating Point Trajectories
- X-Streamer: Unified Human World Modeling with Audiovisual Interaction
- Consistency Models as Plug-and-Play Priors for Inverse Problems
- DistillKac: Few-Step Image Generation via Damped Wave Equations
- Filtering with Confidence: When Data Augmentation Meets Conformal Prediction
- Score-based Idempotent Distillation of Diffusion Models
- SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
- Un-Doubling Diffusion: LLM-guided Disambiguation of Homonym Duplication
- A Unified Framework for Diffusion Model Unlearning with f-Divergence
- UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition
- SPREAD: Sampling-based Pareto front Refinement via Efficient Adaptive Diffusion
- TF-Restormer: Complex Spectral Prediction for Speech Restoration
- Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
- Prompt-aware classifier free guidance for diffusion models
- Conditionally Whitened Generative Models for Probabilistic Time Series Forecasting
- AIBA: Attention-based Instrument Band Alignment for Text-to-Audio Diffusion
- Nuclear Diffusion Models for Low-Rank Background Suppression in Videos
- Federated Domain Generalization with Domain-specific Soft Prompts Generation
- LiLAW: Lightweight Learnable Adaptive Weighting to Learn Sample Difficulty & Improve Noisy Training
- Neptune-X: Active X-to-Maritime Generation for Universal Maritime Object Detection
- Causal Time Series Generation via Diffusion Models
- Deterministic Discrete Denoising
- Flow Matching in the Low-Noise Regime: Pathologies and a Contrastive Remedy
- Normalizing Flows are Capable Models for Bi-manual Visuomotor Policy
- Actor-Critic without Actor
- NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics
- Federated Flow Matching
- The Unwinnable Arms Race of AI Image Detection
- SimDiff: Simulator-constrained Diffusion Model for Physically Plausible Motion Generation
- PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
- FAST: Foreground-aware Diffusion with Accelerated Sampling Trajectory for Segmentation-oriented Anomaly Synthesis
- AnchDrive: Bootstrapping Diffusion Policies with Hybrid Trajectory Anchors for End-to-End Driving
- 4D Driving Scene Generation With Stereo Forcing
- An Anisotropic Cross-View Texture Transfer with Multi-Reference Non-Local Attention for CT Slice Interpolation
- Practical do-Shapley Explanations with Estimand-Agnostic Causal Inference
- Incomplete Data, Complete Dynamics: A Diffusion Approach
- Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
- Attention U-Net for all-sky continuous gravitational wave searches
- Manifold-Aware Diffusion-Augmented Contrastive Learning for Noise-Robust Biosignal Representation
- Embodied AI: From LLMs to World Models
- Improving Generalizability and Undetectability for Targeted Adversarial Attacks on Multimodal Pre-trained Models
- From Samples to Scenarios: A New Paradigm for Probabilistic Forecasting
- SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding
- Learnable Sampler Distillation for Discrete Diffusion Models
- Governance of Generative AI
- Beyond Human Demonstrations: Diffusion-Based Reinforcement Learning to Generate Data for VLA Training
- Latent Iterative Refinement Flow: A Geometric-Constrained Approach for Few-Shot Generation
- SAGE:State-Aware Guided End-to-End Policy for Multi-Stage Sequential Tasks via Hidden Markov Decision Process
- SCORE: Scaling audio generation using Standardized COmposite REwards
- DynaFlow: Dynamics-embedded Flow Matching for Physically Consistent Motion Generation from State-only Demonstrations
- PPGFlowECG: Latent Rectified Flow with Cross-Modal Encoding for PPG-Guided ECG Generation and Cardiovascular Disease Detection
- Sobolev acceleration for neural networks
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- Diffusion and Flow-based Copulas: Forgetting and Remembering Dependencies
- Diffusion-Based Impedance Learning for Contact-Rich Manipulation Tasks
- Formal Safety Verification and Refinement for Generative Motion Planners via Certified Local Stabilization
- Policy Compatible Skill Incremental Learning via Lazy Learning Interface
- InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
- MMG: Mutual Information Estimation via the MMSE Gap in Diffusion
- StrCGAN: A Generative Framework for Stellar Image Restoration
- PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
- A Recovery Theory for Diffusion Priors: Deterministic Analysis of the Implicit Prior Algorithm
- Talking Head Generation via AU-Guided Landmark Prediction
- TIMED: Adversarial and Autoregressive Refinement of Diffusion-Based Time Series Generation
- Synthesizing Artifact Dataset for Pixel-level Detection
- Metriplectic Conditional Flow Matching for Dissipative Dynamics
- Frame-based Equivariant Diffusion Models for 3D Molecular Generation
- FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference
- Training Skills Like Parameters via Self-Supervised Semantic Diffusion
- AnchorMark: Robust Diffusion Watermarking via Latent-Space Rotation Synchrony
- RFMSR: Residual Flow Matching for Image Super-Resolution
- FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack
- Collaborative feature aggregation for face super-resolution and robust re-identification
- ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate
- Forecasting Land Art Under Climate Scenarios
- From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data
- VETO: Towards Protecting Images From Frontier AI Editing
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration
- Rao-Blackwellized Score Matching on Manifolds
- Deep learning in plant phenotyping: the first ten years
- Matérn Noise for Triangulation-Agnostic Flow Matching on Meshes
- ELF: Embedded Language Flows
- Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes
- VCE: A Zero-Cost Hallucination Mitigation Method of LVLMs via Visual Contrastive Editing
- 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image
- ReDiff: Reliability-Guided Diffusion for Trustworthy Ultra-Low-Field to High-Field MRI Synthesis
- REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning
- Diffusion model-based image generation from rat brain activity
- ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- Deep learning and generative artificial intelligence in aging research and healthy longevity medicine
- Learning a Sampling-Free Variational DNN Plugin from Tiny Training Sets to Refine OOD Segmentation With Uncertainty Estimation
- Vocoder-Projected Feature Discriminator
- FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
- Efficient Model-Based Purification Against Adversarial Attacks for LiDAR Segmentation
- Instant Preference Alignment for Text-to-Image Diffusion Models
- From moral panic to pragmatic governance: reframing AI’s societal impacts in employment, education, and ethics
- UniSino: Physics-Driven Foundational Model for Universal CT Sinogram Standardization
- Vector Quantized Diffusion Model for Text-to-Image Synthesis
- CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
- ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation
- World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation
- Diffusion Bridge Variational Inference for Deep Gaussian Processes
- WaveletGaussian: Wavelet-domain Diffusion for Sparse-view 3D Gaussian Object Reconstruction
- Few-shot Human Action Anomaly Detection via a Unified Contrastive Learning Framework
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- Direct Preference Optimization for Speech Autoregressive Diffusion Models
- Audio-Driven Universal Gaussian Head Avatars
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- Denoising Neural Reranker for Recommender Systems
- Training-Free Multi-Style Fusion Through Reference-Based Adaptive Modulation
- DS-Diffusion: Data Style-Guided Diffusion Model for Time-Series Generation
- Source-Free Domain Adaptive Semantic Segmentation of Remote Sensing Images with Diffusion-Guided Label Enrichment
- FixingGS: Enhancing 3D Gaussian Splatting via Training-Free Score Distillation
- A Gradient Flow Approach to Solving Inverse Problems with Latent Diffusion Models
- On the Edge of Memorization in Diffusion Models
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- Training-Free Data Assimilation with GenCast
- Robustness Feature Adapter for Efficient Adversarial Training
- Latent Danger Zone: Distilling Unified Attention for Cross-Architecture Black-box Attacks
- LiDAR Point Cloud Image-based Generation Using Denoising Diffusion Probabilistic Models
- Towards Application Aligned Synthetic Surgical Image Synthesis
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- Learning Geometry-Aware Nonprehensile Pushing and Pulling with Dexterous Hands
- Diffusion Policies with Offline and Inverse Reinforcement Learning for Promoting Physical Activity in Older Adults Using Wearable Sensors
- A Single Image Is All You Need: Zero-Shot Anomaly Localization Without Training Data
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Unveiling m-Sharpness Through the Structure of Stochastic Gradient Noise
- ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
- SocialTraj: Two-Stage Socially-Aware Trajectory Prediction for Autonomous Driving via Conditional Diffusion Model
- Conditional Diffusion Models for CT Image Synthesis from CBCT: A Systematic Review
- Conditioning in Generative Quantum Denoising Diffusion Models
- Learning Dexterous Manipulation with Quantized Hand State
- Exploring Machine Learning Models for Physical Dose Calculation in Carbon Ion Therapy Using Heterogeneous Imaging Data -- A Proof of Concept Study
- Hierarchical Neural Semantic Representation for 3D Semantic Correspondence
- Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling
- DiffQ: Unified Parameter Initialization for Variational Quantum Algorithms via Diffusion Models
- ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation
- Semantic and Visual Crop-Guided Diffusion Models for Heterogeneous Tissue Synthesis in Histopathology
- DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning
- CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
- Audio Super-Resolution with Latent Bridge Models
- RadarSFD: Single-Frame Diffusion with Pretrained Priors for Radar Point Clouds
- StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
- GEM-T: Generative Tabular Data via Fitting Moments
- Discrete-Time Diffusion-Like Models for Speech Synthesis
- Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs
- OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
- Stable Video-Driven Portraits
- Equilibrium flow: From Snapshots to Dynamics
- Graph Signal Generative Diffusion Models
- Virtual Consistency for Audio Editing
- Guided and Unguided Conditional Diffusion Mechanisms for Structured and Semantically-Aware 3D Point Cloud Generation
- Ambiguous Medical Image Segmentation Using Diffusion Schrödinger Bridge
- Latent Conditioned Loco-Manipulation Using Motion Priors
- Intention-aware Hierarchical Diffusion Model for Long-term Trajectory Anomaly Detection
- Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
- PhysHDR: When Lighting Meets Materials and Scene Geometry in HDR Reconstruction
- Scalable Multi Agent Diffusion Policies for Coverage Control
- A Mutil-conditional Diffusion Transformer for Versatile Seismic Wave Generation
- Density Ratio Estimation via Infinitesimal Classification
- Looking in the mirror: A faithful counterfactual explanation method for interpreting deep image classification models
- Hyperbolic Optimization
- V-CECE: Visual Counterfactual Explanations via Conceptual Edits
- DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
- Animalbooth: multimodal feature enhancement for animal subject personalization
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
- A Novel Metric for Detecting Memorization in Generative Models for Brain MRI Synthesis
- Enhancing Reference-based Sketch Colorization via Separating Reference Representations
- Preference Trajectory Modeling via Flow Matching for Sequential Recommendation
- RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
- A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
- TranTac: Leveraging Transient Tactile Signals for Contact-Rich Robotic Manipulation
- MMPart: Harnessing Multi-Modal Large Language Models for Part-Aware 3D Generation
- GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
- Octree Diffusion for Semantic Scene Generation and Completion
- Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation
- Efficient Rectified Flow for Image Fusion
- OS-DiffVSR: Towards One-step Latent Diffusion Model for High-detailed Real-world Video Super-Resolution
- Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Similarity-Guided Diffusion for Long-Gap Music Inpainting
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- Blind-Spot Guided Diffusion for Self-supervised Real-World Denoising
- SLaM-DiMM: Shared Latent Modeling for Diffusion Based Missing Modality Synthesis in MRI
- A multi-temporal multi-spectral attention-augmented deep convolution neural network with contrastive learning for crop yield prediction
- SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
- CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models
- Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
- HazeFlow: Revisit Haze Physical Model as ODE and Non-Homogeneous Haze Generation for Real-World Dehazing
- SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling
- Lynx: Towards High-Fidelity Personalized Video Generation
- Dynamic Classifier-Free Diffusion Guidance via Online Feedback
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- Deep Learning Empowered Super-Resolution: A Comprehensive Survey and Future Prospects
- Generating Detailed Character Motion from Blocking Poses
- Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- DiffusionNFT: Online Diffusion Reinforcement with Forward Process
- ROOT: Rethinking Offline Optimization as Distributional Translation via Probabilistic Bridge
- Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
- QWD-GAN: Quality-aware Wavelet-driven GAN for Unsupervised Medical Microscopy Images Denoising
- From Canopy to Ground via ForestGen3D: Learning Cross-Domain Generation of 3D Forest Structure from Aerial-to-Terrestrial LiDAR
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition
- Kuramoto Orientation Diffusion Models
- Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- Self-Improving Embodied Foundation Models
- WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- Quantum neural ordinary and partial differential equations
- A Novel Task-Driven Diffusion-Based Policy with Affordance Learning for Generalizable Manipulation of Articulated Objects
- Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
- Variational Shape Inference for Grasp Diffusion on SE(3)
- Diffusion-Based Scenario Tree Generation for Multivariate Time Series Prediction and Multistage Stochastic Optimization
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
- GenKOL: Modular Generative AI Framework For Scalable Virtual KOL Generation
- Controllable Localized Face Anonymization Via Diffusion Inpainting
- MeanFlowSE: one-step generative speech enhancement via conditional mean flow
- Dataset Distillation for Super-Resolution without Class Labels and Pre-trained Models
- FlowCast-ODE: Continuous Hourly Weather Forecasting with Dynamic Flow Matching and ODE Solver
- Data Augmentation via Latent Diffusion Models for Detecting Smell-Related Objects in Historical Artworks
- Generative AI Meets Wireless Sensing: Towards Wireless Foundation Model
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- DICE: Diffusion Consensus Equilibrium for Sparse-view CT Reconstruction
- DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising
- Adaptive and Iterative Point Cloud Denoising with Score-Based Diffusion Model
- Radiolunadiff: Estimation of wireless network signal strength in lunar terrain
- AnoF-Diff: One-Step Diffusion-Based Anomaly Detection for Forceful Tool Use
- OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data
- TinySR: Pruning Diffusion for Real-World Image Super-Resolution
- Modular MeanFlow: Towards Stable and Scalable One-Step Generative Modeling
- A Race Bias Free Face Aging Model for Reliable Kinship Verification
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- VLHSA: Vision-Language Hierarchical Semantic Alignment for Jigsaw Puzzle Solving with Eroded Gaps
- Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior
- GenExam: A Multidisciplinary Text-to-Image Exam
- Defending Diffusion Models Against Membership Inference Attacks via Higher-Order Langevin Dynamics
- Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures
- MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies
- ProFusion: 3D Reconstruction of Protein Complex Structures from Multi-view AFM Images
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
- MetricNet: Recovering Metric Scale in Generative Navigation Policies
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- Inverse Design of Amorphous Materials with Targeted Properties
- Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation
- DiCache: Let Diffusion Model Determine Its Own Cache
- BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching
- Self Identity Mapping
- Morphology-optimized Multi-Scale Fusion: Combining Local Artifacts and Mesoscopic Semantics for Deepfake Detection and Localization
- Generative Consistency Models for Estimation of Kinetic Parametric Image Posteriors in Total-Body PET
- SpeechOp: Inference-Time Task Composition for Generative Speech Processing
- StyleProtect: Safeguarding Artistic Identity in Fine-tuned Diffusion Models
- Teachers that teach the irrelevant: Pre-training machine learned interaction potentials with classical force fields for robust molecular dynamics simulations
- ShortListing Model: A Streamlined SimplexDiffusion for Discrete Variable Generation
- Semantic Diffusion Posterior Sampling for Cardiac Ultrasound Dehazing
- SpecGen: Neural Spectral BRDF Generation via Spectral-Spatial Tri-plane Aggregation
- FlowDrive: Energy Flow Field for End-to-End Autonomous Driving
- Cross-Distribution Diffusion Priors-Driven Iterative Reconstruction for Sparse-View CT
- AERIS: Argonne Earth Systems Model for Reliable and Skillful Predictions
- Valuation of Exotic Options and Counterparty Games Based on Conditional Diffusion
- MIA-EPT: Membership Inference Attack via Error Prediction for Tabular Data
- ReTrack: Data Unlearning in Diffusion Models through Redirecting the Denoising Trajectory
- Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation
- Generalizable Holographic Reconstruction via Amplitude-Only Diffusion Priors
- SPGen: Spherical Projection as Consistent and Flexible Representation for Single Image 3D Shape Generation
- Robust Online Residual Refinement via Koopman-Guided Dynamics Modeling
- 4D Visual Pre-training for Robot Learning
- Diffusion Models Beat GANs on Image Synthesis
- Using KL-Divergence to Focus Frequency Information in Low-Light Image Enhancement
- MSDNet: Efficient 4D Radar Super-Resolution via Multi-Stage Distillation
- End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection
- Adaptive Sampling Scheduler
- A Statistical Benchmark for Diffusion Posterior Sampling Algorithms
- Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges
- Generation diffusion degradation: Simple and efficient design for blind super-resolution
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- HoloGarment: 360° Novel View Synthesis of In-the-Wild Garments
- LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
- Robust Concept Erasure in Diffusion Models: A Theoretical Perspective on Security and Robustness
- Generative AI in Game Development: A Qualitative Research Synthesis
- Igniting VLMs toward the Embodied Space
- DRAG: Data Reconstruction Attack using Guided Diffusion
- IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
- Scaling to Multimodal and Multichannel Heart Sound Classification with Synthetic and Augmented Biosignals
- A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models
- Collective Recourse for Generative Urban Visualizations
- A Controllable 3D Deepfake Generation Framework with Gaussian Splatting
- VH-Diffuser: Variable Horizon Diffusion Planner for Time-Aware Goal-Conditioned Trajectory Planning
- Inference-stage Adaptation-projection Strategy Adapts Diffusion Policy to Cross-manipulators Scenarios
- Tenma: Robust Cross-Embodiment Robot Manipulation with Diffusion Transformer
- All that structure matches does not glitter
- Beyond Sliders: Mastering the Art of Diffusion-based Image Manipulation
- DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
- FEWT: Improving Humanoid Robot Perception with Frequency-Enhanced Wavelet-based Transformers
- PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models
- Styleclone: Face Stylization with Diffusion Based Data Augmentation
- Data-Efficient Ensemble Weather Forecasting with Diffusion Models
- A Novel Local Focusing Mechanism for Deepfake Detection Generalization
- PINGS: Physics-Informed Neural Network for Fast Generative Sampling
- Dual Orthogonal Guidance for Robust Diffusion-based Handwritten Text Generation
- Robustifying Diffusion-Denoised Smoothing Against Covariate Shift
- Text2Sign Diffusion: A Generative Approach for Gloss-Free Sign Language Production
- ToMA: Token Merge with Attention for Diffusion Models
- T2Bs: Text-to-Character Blendshapes via Video Generation
- A Survey of Deep Learning-based Point Cloud Denoising
- InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis
- Score Matching on Large Geometric Graphs for Cosmology Generation
- HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching
- Flow Straight and Fast in Hilbert Space: Functional Rectified Flow
- A Discrepancy-Based Perspective on Dataset Condensation
- GARD: Gamma-based Anatomical Restoration and Denoising for Retinal OCT
- A Differentiable Surrogate Model for the Generation of Radio Pulses from In-Ice Neutrino Interactions
- GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection
- HHI-Assist: A Dataset and Benchmark of Human-Human Interaction in Physical Assistance Scenario
- Few-Part-Shot Font Generation
- Chord: Chain of Rendering Decomposition for PBR Material Estimation from Generated Texture Images
- OnlineHOI: Towards Online Human-Object Interaction Generation and Perception
- RPD-Diff: Region-Adaptive Physics-Guided Diffusion Model for Visibility Enhancement under Dense and Non-Uniform Haze
- Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
- Imagined Autocurricula
- Automated Tuning for Diffusion Inverse Problem Solvers without Generative Prior Retraining
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- Locality in Image Diffusion Models Emerges from Data Statistics
- Sig-DEG for Distillation: Making Diffusion Models Faster and Lighter
- DiFlow-TTS: Discrete Flow Matching with Factorized Speech Tokens for Low-Latency Zero-Shot Text-To-Speech
- I Know Who Clones Your Code: Interpretable Smart Contract Similarity Detection
- Mechanistic Learning with Guided Diffusion Models to Predict Spatio-Temporal Brain Tumor Growth
- Conditioning on PDE Parameters to Generalise Deep Learning Emulation of Stochastic and Chaotic Dynamics
- Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
- Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution
- Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
- Generative Diffusion Contrastive Network for Multi-View Clustering
- Mixture of Semantics Transmission for Generative AI-Enabled Semantic Communication Systems
- Prompt Pirates Need a Map: Stealing Seeds helps Stealing Prompts
- Composable Score-based Graph Diffusion Model for Multi-Conditional Molecular Generation
- FS-Diff: Semantic guidance and clarity-aware simultaneous multimodal image fusion and super-resolution
- Plug-and-play Diffusion Models for Image Compressive Sensing with Data Consistency Projection
- Enabling Regulatory Multi-Agent Collaboration: Architecture, Challenges, and Solutions
- Structural Energy-Guided Sampling for View-Consistent Text-to-3D
- ALL-PET: A Low-resource and Low-shot PET Foundation Model in Projection Domain
- MarkDiffusion: An Open-Source Toolkit for Generative Watermarking of Latent Diffusion Models
- CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
- Integrating Anatomical Priors into a Causal Diffusion Model
- Generative quantum advantage for classical and quantum problems
- ForTIFAI: Fending Off Recursive Training Induced Failure for AI Model Collapse
- RewardDance: Reward Scaling in Visual Generation
- Joint Model-based Model-free Diffusion for Planning with Constraints
- Learning Turbulent Flows with Generative Models: Super-resolution, Forecasting, and Sparse Flow Reconstruction
- LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
- Spherical Brownian Bridge Diffusion Models for Conditional Cortical Thickness Forecasting
- PegasusFlow: Parallel Rolling-Denoising Score Sampling for Robot Diffusion Planner Flow Matching
- Generative Quasi-Continuum Modeling of Confined Fluids at the Nanoscale
- LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
- Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video
- Physics-Guided Rectified Flow for Low-light RAW Image Enhancement
- Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities
- X-Part: high fidelity and structure coherent shape decomposition
- ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
- Diffusion-Guided Multi-Arm Motion Planning
- DiffPlace: A Conditional Diffusion Framework for Simultaneous VLSI Placement Beyond Sequential Paradigms
- Gotta Go Fast When Generating Data with Score-Based Models
- TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
- Feature Space Analysis by Guided Diffusion Model
- ScoreHOI: Physically Plausible Reconstruction of Human-Object Interaction via Score-Guided Diffusion
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- A Generalisable Generative Model for Multi-Detector Calorimeter Simulation
- BREATH: A Bio-Radar Embodied Agent for Tonal and Human-Aware Diffusion Music Generation
- Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier Integrity
- Language Self-Play For Data-Free Training
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
- DreamLifting: A Plug-in Module Lifting MV Diffusion Models for 3D Asset Generation
- Universal Few-Shot Spatial Control for Diffusion Models
- InJecteD: Analyzing Trajectories and Drift Dynamics in Denoising Diffusion Probabilistic Models for 2D Point Cloud Generation
- Astra: A Multi-Agent System for GPU Kernel Performance Optimization
- Enhancements in Score-based Channel Estimation for Real-Time Wireless Systems
- Reconstruction Alignment Improves Unified Multimodal Models
- Breast Cancer Detection in Thermographic Images via Diffusion-Based Augmentation and Nonlinear Feature Fusion
- Scaling Transformer-Based Novel View Synthesis Models with Token Disentanglement and Synthetic Data
- Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference
- BIR-Adapter: A Low-Complexity Diffusion Model Adapter for Blind Image Restoration
- floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
- UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward
- Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training
- LLaDA-VLA: Vision Language Diffusion Action Models
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- CausNVS: Autoregressive Multi-view Diffusion for Flexible 3D Novel View Synthesis
- Continuous Audio Language Models
- Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence
- From Rigging to Waving: 3D-Guided Diffusion for Natural Animation of Hand-Drawn Characters
- BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
- MV-RAG: Retrieval Augmented Multiview Diffusion
- Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction
- Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Home-made Diffusion Model from Scratch to Hatch
- Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching
- CardiacFlow: 3D+t Four-Chamber Cardiac Shape Completion and Generation via Flow Matching
- Stabilizing RED using the Koopman Operator
- Variational Diffusion Models
- GUIDe: Generative and Uncertainty-Informed Inverse Design for On-Demand Nonlinear Functional Responses
- Using pretrained graph neural networks with token mixers as geometric featurizers for conformational dynamics
- Pathology-Informed Latent Diffusion Model for Anomaly Detection in Lymph Node Metastasis
- Semantic-guided LoRA Parameters Generation
- Systematic Review and Meta-analysis of AI-driven MRI Motion Artifact Detection and Correction
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
- Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
- Artificial intelligence for representing and characterizing quantum systems
- A Knowledge-Driven Diffusion Policy for End-to-End Autonomous Driving Based on Expert Routing
- OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation
- STADI: Fine-Grained Step-Patch Diffusion Parallelism for Heterogeneous GPUs
- UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features
- Constraints-Guided Diffusion Reasoner for Neuro-Symbolic Learning
- Plug-and-Play Latent Diffusion for Electromagnetic Inverse Scattering with Application to Brain Imaging
- Guiding Diffusion Models with Reinforcement Learning for Stable Molecule Generation
- Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
- Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
- Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer
- Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
- Transition Models: Rethinking the Generative Learning Objective
- From Editor to Dense Geometry Estimator
- Hyper Diffusion Avatars: Dynamic Human Avatar Generation using Network Weight Space Diffusion
- TauGenNet: Plasma-Driven Tau PET Image Synthesis via Text-Guided 3D Diffusion Models
- K-Syn: K-space Data Synthesis in Ultra Low-data Regimes
- MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation
- Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models
- Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
- SEEDS: Exponential SDE Solvers for Fast High-Quality Sampling from Diffusion Models
- Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
- Human Motion Video Generation: A Survey
- Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
- Modular Embedding Recomposition for Incremental Learning
- Fitting Image Diffusion Models on Video Datasets
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
- Instance-Wise Adaptive Sampling for Dataset Construction in Approximating Inverse Problem Solutions
- In-Context Policy Adaptation via Cross-Domain Skill Diffusion
- LuxDiT: Lighting Estimation with Video Diffusion Transformer
- Efficient Virtuoso: A Latent Diffusion Transformer Model for Goal-Conditioned Trajectory Planning
- Noise is All You Need: rethinking the value of noise on seismic denoising via diffusion models
- SOLD: SELFIES-based Objective-driven Latent Diffusion
- Solving Imaging Inverse Problems Using Plug-and-Play Denoisers: Regularization and Optimization Perspectives
- Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner
- Temporally-Aware Diffusion Model for Brain Progression Modelling with Bidirectional Temporal Regularisation
- DCDB: Dynamic Conditional Dual Diffusion Bridge for Ill-posed Multi-Tasks
- Audio2Face-3D: Audio-driven Realistic Facial Animation For Digital Avatars
- DUViN: Diffusion-Based Underwater Visual Navigation via Knowledge-Transferred Depth Features
- On the MIA Vulnerability Gap Between Private GANs and Diffusion Models
- Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- SynBT: High-quality Tumor Synthesis for Breast Tumor Segmentation by 3D Diffusion Model
- Scale-Adaptive Generative Flows for Multiscale Scientific Data
- A-FloPS: Accelerating Diffusion Sampling with Adaptive Flow Path Sampler
- InfraDiffusion: zero-shot depth map restoration with diffusion models and prompted segmentation from sparse infrastructure point clouds
- Generative AI for Crystal Structures: A Review
- Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots
- Unifi3D: A Study on 3D Representations for Generation and Reconstruction in a Common Framework
- TeRA: Rethinking Text-guided Realistic 3D Avatar Generation
- A Sharp KL-Convergence Analysis for Diffusion Models under Minimal Assumptions
- Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation
- Beyond Ensembles: Simulating All-Atom Protein Dynamics in a Learned Latent Space
- Towards Diagnostic Quality Flat-Panel Detector CT Imaging Using Diffusion Models
- EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation
- PIANO: Physics Informed Autoregressive Network
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- RadioDiff-Loc: Diffusion Model Enhanced Scattering Congnition for NLoS Localization with Sparse Radio Map Estimation
- Latent Gene Diffusion for Spatial Transcriptomics Completion
- An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
- OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models
- Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
- Deep learning-enabled virtual multiplexed immunostaining of label-free tissue for vascular invasion assessment
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- Data-Dependent Smoothing for Protein Discovery with Walk-Jump Sampling
- DroneSR: Rethinking Few-shot Thermal Image Super-Resolution from Drone-based Perspective
- Sem-RaDiff: Diffusion-Based 3D Radar Semantic Perception in Cluttered Agricultural Environments
- Fidelity-preserving enhancement of ptychography with foundational text-to-image models
- Differentiable Expectation-Maximisation and Applications to Gaussian Mixture Model Optimal Transport
- FuXi-TC: A generative framework integrating deep learning and physics-based models for improved tropical cyclone forecasts
- On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
- A Survey on Neural Speech Synthesis
- ADVMEM: Adversarial Memory Initialization for Realistic Test-Time Adaptation via Tracklet-Based Benchmarking
- RDIT: Residual-based Diffusion Implicit Models for Probabilistic Time Series Forecasting
- Non-Identical Diffusion Models in MIMO-OFDM Channel Generation
- Relative Trajectory Balance is equivalent to Trust-PCL
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- Acoustic Interference Suppression in Ultrasound images for Real-Time HIFU Monitoring Using an Image-Based Latent Diffusion Model
- From Noise to Precision: A Diffusion-Driven Approach to Zero-Inflated Precipitation Prediction
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- MILO: A Lightweight Perceptual Quality Metric for Image and Latent-Space Optimization
- CbLDM: A Diffusion Model for recovering nanostructure from atomic pair distribution function
- Conformal Predictive Monitoring for Multi-Modal Scenarios
- RAMS: Residual-based adversarial-gradient moving sample method for scientific machine learning in solving partial differential equations
- FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework
- Latent Space Single-Pixel Imaging Under Low-Sampling Conditions
- StoxLSTM: A Stochastic Extended Long Short-Term Memory Network for Time Series Forecasting
- FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus
- RealMat: Realistic Materials with Diffusion and Reinforcement Learning
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
- Lipschitz-Guided Design of Interpolation Schedules in Generative Models
- A Continuous-Time Consistency Model for 3D Point Cloud Generation
- Controllable Generation of Implied Volatility Surfaces with Variational Autoencoders
- Prior-Guided Residual Diffusion: Calibrated and Efficient Medical Image Segmentation
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
- PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
- Partially Functional Dynamic Backdoor Diffusion-based Causal Model
- A Dataset Generation Scheme Based on Video2EEG-SPGN-Diffusion for SEED-VD
- Any-Order Flexible Length Masked Diffusion
- Tabular Diffusion Counterfactual Explanations
- AImoclips: A Benchmark for Evaluating Emotion Conveyance in Text-to-Music Generation
- Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
- C-DiffDet+: Fusing Global Scene Context with Generative Denoising for High-Fidelity Car Damage Detection
- Modeling Long-term User Behaviors with Diffusion-driven Multi-interest Network for CTR Prediction
- Deep Learning for Personalized Binaural Audio Reproduction
- Double-Constraint Diffusion Model with Nuclear Regularization for Ultra-low-dose PET Reconstruction
- Beyond Negative Transfer: Disentangled Preference-Guided Diffusion for Cross-Domain Sequential Recommendation
- Visually Grounded Narratives: Reducing Cognitive Burden in Researcher-Participant Interaction
- NoiseCutMix: A Novel Data Augmentation Approach by Mixing Estimated Noise in Diffusion Models
- Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation
- Are We Really Learning the Score Function? Reinterpreting Diffusion Models Through Wasserstein Gradient Flow Matching
- Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
- Transforming Agency. On the mode of existence of Large Language Models
- LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
- 3D-LATTE: Latent Space 3D Editing from Textual Instructions
- Data Auctions for Retrieval Augmented Generation
- Generative Latent Space Dynamics of Electron Density
- The Demon is in Ambiguity: Revisiting Situation Recognition with Single Positive Multi-Label Learning
- OptMark: Robust Multi-bit Diffusion Watermarking via Inference Time Optimization
- FLORA: Efficient Synthetic Data Generation for Object Detection in Low-Data Regimes via finetuning Flux LoRA
- Dynamics-Compliant Trajectory Diffusion for Super-Nominal Payload Manipulation
- ECHO: Ego-Centric modeling of Human-Object interactions
- Complete Gaussian Splats from a Single Image with Denoising Diffusion Models
- DLGAN : Time Series Synthesis Based on Dual-Layer Generative Adversarial Networks
- Diverse Signer Avatars with Manual and Non-Manual Feature Modelling for Sign Language Production
- Automated Multi-label Classification of Eleven Retinal Diseases: A Benchmark of Modern Architectures and a Meta-Ensemble on a Large Synthetic Dataset
- Generative AI for Industrial Contour Detection: A Language-Guided Vision System
- PHD: Personalized 3D Human Body Fitting with Point Diffusion
- Weighted Support Points from Random Measures: An Interpretable Alternative for Generative Modeling
- WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration
- First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge
- EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
- EmoCAST: Emotional Talking Portrait via Emotive Text Description
- Physics Informed Generative Models for Magnetic Field Images
- Text-Driven 3D Hand Motion Generation from Sign Language Data
- Unleashing Uncertainty: Efficient Machine Unlearning for Generative AI
- EEGDM: Learning EEG Representation with Latent Diffusion Model
- VarDiU: A Variational Diffusive Upper Bound for One-Step Diffusion Distillation
- CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
- SceneGen: Single-Image 3D Scene Generation in One Feedforward Pass
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Breaking Diffusion with Cache: Exploiting Approximate Caches in Diffusion Models
- Probability Density from Latent Diffusion Models for Out-of-Distribution Detection
- OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
- Train-Once Plan-Anywhere Kinodynamic Motion Planning via Diffusion Trees
- Reverse Imaging for Wide-spectrum Generalization of Cardiac MRI Segmentation
- Phased One-Step Adversarial Equilibrium for Video Diffusion Models
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- Neural Field Turing Machine: A Differentiable Spatial Computer
- A Survey of Affective Recommender Systems: Modeling Attitudes, Emotions, and Moods for Personalization
- Discrete-Guided Diffusion for Scalable and Safe Multi-Robot Motion Planning
- Eigenvalue distribution of the Neural Tangent Kernel in the quadratic scaling
- GS: Generative Segmentation via Label Diffusion
- Diffusion Language Models Know the Answer Before Decoding
- StableIntrinsic: Detail-preserving One-step Diffusion Model for Multi-view Material Estimation
- Fractal Flow: Hierarchical and Interpretable Normalizing Flow via Topic Modeling and Recursive Strategy
- Synthetic Image Detection via Spectral Gaps of QC-RBIM Nishimori Bethe-Hessian Operators
- IDF: Iterative Dynamic Filtering Networks for Generalizable Image Denoising
- IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation
- Guiding Noisy Label Conditional Diffusion Models with Score-based Discriminator Correction
- Data Cartography for Detecting Memorization Hotspots and Guiding Data Interventions in Generative Models
- MotionFlux: Efficient Text-Guided Motion Generation through Rectified Flow Matching and Preference Alignment
- DATR: Diffusion-based 3D Apple Tree Reconstruction Framework with Sparse-View
- Sat2Flow: A Structure-Aware Diffusion Framework for Human Flow Generation from Satellite Imagery
- Towards 6G Intelligence: The Role of Generative AI in Future Wireless Networks
- MicroLad: 2D-to-3D Microstructure Reconstruction and Generation via Latent Diffusion and Score Distillation
- Fast 3D Diffusion for Scalable Granular Media Synthesis
- ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
- Score-Based Diffusion Models in Infinite Dimensions: A Malliavin Calculus Perspective
- MRExtrap: Longitudinal Aging of Brain MRIs using Linear Modeling in Latent Space
- Diffusion Normalizing Flow
- On Surjectivity of Neural Networks: Can you elicit any behavior from your model?
- Efficiently Generating Multidimensional Calorimeter Data with Tensor Decomposition Parameterization
- VibeVoice Technical Report
- VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- One-shot Unsupervised Domain Adaptation with Personalized Diffusion Models
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- Planning-Query-Guided Model Generation for Model-Based Deformable Object Manipulation
- MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations
- Learning with springs and sticks
- STDiff: A State Transition Diffusion Framework for Time Series Imputation in Industrial Systems
- Energy-Based Flow Matching for Generating 3D Molecular Structure
- Alljoined-1.6M: A Million-Trial EEG-Image Dataset for Evaluating Affordable Brain-Computer Interfaces
- Hybrid Perception and Equivariant Diffusion for Robust Multi-Node Rebar Tying
- ROSE: Remove Objects with Side Effects in Videos
- Wan-S2V: Audio-Driven Cinematic Video Generation
- SemLayoutDiff: Semantic Layout Generation with Diffusion Model for Indoor Scene Synthesis
- Scaffold Diffusion: Sparse Multi-Category Voxel Structure Generation with Discrete Diffusion
- DIO: Refining Mutual Information and Causal Chain to Enhance Machine Abstract Reasoning Ability
- CellINR: Implicitly Overcoming Photo-induced Artifacts in 4D Live Fluorescence Microscopy
- FastAvatar: Instant 3D Gaussian Splatting for Faces from Single Unconstrained Poses
- SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation
- BRAIN: Bias-Mitigation Continual Learning Approach to Vision-Brain Understanding
- Amortized Sampling with Transferable Normalizing Flows
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
- Zero-shot Volumetric CT Super-Resolution using 3D Gaussian Splatting with Upsampled 2D X-ray Projection Priors
- Scaling Group Inference for Diverse and High-Quality Generation
- Dream 7B: Diffusion Large Language Models
- Efficient Identification of Critical Transitions via Flow Matching: A Scalable Generative Approach for Many-Body Systems
- Visual Autoregressive Modeling for Instruction-Guided Image Editing
- CurveFlow: Curvature-Guided Flow Matching for Image Generation
- TAIGen: Training-Free Adversarial Image Generation via Diffusion Models
- TOAST: Fast and scalable auto-partitioning based on principled static analysis
- Squeezed Diffusion Models
- Cross-Modality Controlled Molecule Generation with Diffusion Language Model
- HyperDiff: Hypergraph Guided Diffusion Model for 3D Human Pose Estimation
- GSFix3D: Diffusion-Guided Repair of Novel Views in Gaussian Splatting
- Long-Context Speech Synthesis with Context-Aware Memory
- Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model
- On the notion of missingness for path attribution explainability methods in medical settings: Guiding the selection of medically meaningful baselines
- LookOut: Real-World Humanoid Egocentric Navigation
- A Laplace diffusion-based transformer model for heart rate forecasting within daily activity context
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
- Physics-Constrained Diffusion Reconstruction with Posterior Correction for Quantitative and Fast PET Imaging
- Learning Point Cloud Representations with Pose Continuity for Depth-Based Category-Level 6D Object Pose Estimation
- A Non-Asymptotic Convergent Analysis for Scored-Based Graph Generative Model via a System of Stochastic Differential Equations
- MoVieDrive: Multi-Modal Multi-View Urban Scene Video Generation
- FOCUS: Frequency-Optimized Conditioning of DiffUSion Models for mitigating catastrophic forgetting during Test-Time Adaptation
- Generative AI Against Poaching: Latent Composite Flow Matching for Wildlife Conservation
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states
- SBGD: Improving Graph Diffusion Generative Model via Stochastic Block Diffusion
- Knowledge Distillation in Iterative Generative Models for Improved Sampling Speed
- Tooth-Diffusion: Guided 3D CBCT Synthesis with Fine-Grained Tooth Conditioning
- xDiff: Online Diffusion Model for Collaborative Inter-Cell Interference Management in 5G O-RAN
- Learning to Estimate Photospheric Vector Fields from Line-of-Sight Magnetograms
- Diffusion-Driven High-Dimensional Variable Selection
- Improving Deep Learning for Accelerated MRI With Data Filtering
- Comparing Conditional Diffusion Models for Synthesizing Contrast-Enhanced Breast MRI from Pre-Contrast Images
- Generative Super-Resolution of Turbulent Flows via Stochastic Interpolants
- Deep Biomechanically-Guided Interpolation for Keypoint-Based Brain Shift Registration
- Eliminating Rasterization: Direct Vector Floor Plan Generation with DiffPlanner
- OmniTry: Virtual Try-On Anything without Masks
- DiffIER: Optimizing Diffusion Models with Iterative Error Reduction
- Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
- EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
- NovoMolGen: Rethinking Molecular Language Model Pretraining
- DPad: Efficient Diffusion Language Models with Suffix Dropout
- Counterfactual Probabilistic Diffusion with Expert Models
- GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis
- Interpolating between sampling and variational inference with infinite\n stochastic mixtures
- Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
- Reinforced Context Order Recovery for Adaptive Reasoning and Planning
- Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping
- SimGenHOI: Physically Realistic Whole-Body Humanoid-Object Interaction via Generative Modeling and Reinforcement Learning
- Learning local and global prototypes with optimal transport for unsupervised anomaly detection and localization
- 7Bench: a Comprehensive Benchmark for Layout-guided Text-to-image Models
- From Classical Probabilistic Latent Variable Models to Modern Generative AI: A Unified Perspective
- Stable Diffusion-Based Approach for Human De-Occlusion
- Factorized Disentangled Representation Learning for Interpretable Radio Frequency Fingerprint
- Score-informed Neural Operator for Enhancing Ordering-based Causal Discovery
- Cognitive Structure Generation: From Educational Priors to Policy Optimization
- ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models
- 4DNeX: Feed-Forward 4D Generative Modeling Made Easy
- DMS:Diffusion-Based Multi-Baseline Stereo Generation for Improving Self-Supervised Depth Estimation
- EgoTwin: Dreaming Body and View in First Person
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
- Constraint-Aware Flow Matching via Randomized Exploration
- Matrix-game 2.0: An open-source real-time and streaming interactive world model
- Denoising diffusion models for inverse design of inflatable structures with programmable deformations
- Next Visual Granularity Generation
- Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
- Geometry-Aware Video Inpainting for Joint Headset Occlusion Removal and Face Reconstruction in Social XR
- Towards Generalizable Human Activity Recognition: A Survey
- Synthetic Data is Sufficient for Zero-Shot Visual Generalization from Offline Data
- Express4D: Expressive, Friendly, and Extensible 4D Facial Motion Generation Benchmark
- Quantum Flow Matching
- Scalable RF Simulation in Generative 4D Worlds
- Belief-Conditioned One-Step Diffusion: Real-Time Trajectory Planning with Just-Enough Sensing
- DualFit: A Two-Stage Virtual Try-On via Warping and Synthesis
- Generic Event Boundary Detection via Denoising Diffusion
- VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models
- SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress
- Data Shift of Object Detection in Autonomous Driving
- Error Propagation Mechanisms and Compensation Strategies for Quantized Diffusion
- The Rise of Generative AI for Metal-Organic Framework Design and Synthesis
- Assessing User Privacy Leakage in Synthetic Packet Traces: An Attack-Grounded Approach
- LoRAtorio: An intrinsic approach to LoRA Skill Composition
- It's not a FAD: first results in using Flows for unsupervised Anomaly Detection at 40 MHz at the Large Hadron Collider
- Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
- Physics-Informed Diffusion Models for Unsupervised Anomaly Detection in Multivariate Time Series
- Generative Co-Design of Antibody Sequences and Structures via Black-Box Guidance in a Shared Latent Space
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- TimeMachine: Fine-Grained Facial Age Editing with Identity Preservation
- CoreEditor: Correspondence-constrained Diffusion for Consistent 3D Editing
- Better Supervised Fine-tuning for VQA: Integer-Only Loss
- Residual-based Efficient Bidirectional Diffusion Model for Image Dehazing and Haze Generation
- Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension
- GANDiff FR: Hybrid GAN Diffusion Synthesis for Causal Bias Attribution in Face Recognition
- Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward
- CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
- Diffusion is a code repair operator and generator
- HierOctFusion: Multi-scale Octree-based 3D Shape Generation via Part-Whole-Hierarchy Message Passing
- 3D FlowMatch Actor: Unified 3D Policy for Single- and Dual-Arm Manipulation
- Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
- ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing
- Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
- Advances in Speech Separation: Techniques, Challenges, and Future Trends
- Object Fidelity Diffusion for Remote Sensing Image Generation
- Ultra-High-Definition Reference-Based Landmark Image Super-Resolution with Generative Diffusion Prior
- OpenSWI: A Massive-Scale Benchmark Dataset for Surface Wave Dispersion Curve Inversion
- Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Probabilistic Forecasting Method for Offshore Wind Farm Cluster under Typhoon Conditions: a Score-Based Conditional Diffusion Model
- Novel View Synthesis using DDIM Inversion
- DiffuRec: A Diffusion Model for Sequential Recommendation
- KDPE: A Kernel Density Estimation Strategy for Diffusion Policy Trajectory Selection
- A Segmentation-driven Editing Method for Bolt Defect Augmentation and Detection
- MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
- Geospatial Diffusion for Land Cover Imperviousness Change Forecasting
- Increasing the Utility of Synthetic Images through Chamfer Guidance
- Nonlinear filtering based on density approximation and deep BSDE prediction
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- EgoMusic-driven Human Dance Motion Estimation with Skeleton Mamba
- TweezeEdit: Consistent and Efficient Image Editing with Path Regularization
- NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
- Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models
- Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
- Super LiDAR Reflectance for Robotic Perception
- DiffTopo: Solver in the Loop for Inverse Topography via Condition Diffusion Generation
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
- A Semantic-Aware Framework for Safe and Intent-Integrative Assistance in Upper-Limb Exoskeletons
- ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
- 3D latent diffusion models for parameterizing and history matching multiscenario facies systems
- BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
- Story2Board: A Training-Free Approach for Expressive Storyboard Generation
- A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
- PERSONA: Personalized Whole-Body 3D Avatar with Pose-Driven Deformations from a Single Image
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- LIA-X: Interpretable Latent Portrait Animator
- AST-n: A Fast Sampling Approach for Low-Dose CT Reconstruction using Diffusion Models
- Prototype-Guided Diffusion: Visual Conditioning without External Memory
- Hybrid Quantum-Classical Latent Diffusion Models for Medical Image Generation
- OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
- EEGDM: EEG Representation Learning via Generative Diffusion Model
- Perceptual Reality Transformer: Neural Architectures for Simulating Neurological Perception Conditions
- Enhancing Diffusion Face Generation with Contrastive Embeddings and SegFormer Guidance
- Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
- Non-asymptotic convergence bound of conditional diffusion models
- MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention
- CrystalDiT: A Diffusion Transformer for Crystal Generation
- NegFaceDiff: The Power of Negative Context in Identity-Conditioned Diffusion for Synthetic Face Generation
- MInDI-3D: Iterative Deep Learning in 3D for Sparse-view Cone Beam Computed Tomography
- BridgeTA: Bridging the Representation Gap in Knowledge Distillation via Teacher Assistant for Bird's Eye View Map Segmentation
- Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTy
- Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
- Leveraging Failed Samples: A Few-Shot and Training-Free Framework for Generalized Deepfake Detection
- Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
- Personalized Face Super-Resolution with Identity Decoupling and Fitting
- Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
- Semantic-Aware Reconstruction Error for Detecting AI-Generated Images
- Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
- Generative AI-Enabled Robust 6G Uplink: Principles, Challenges, and Directions
- Lung-DDPM+: Efficient Thoracic CT Image Synthesis using Diffusion Probabilistic Model
- RefAdGen: High-Fidelity Advertising Image Generation
- Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
- TaoCache: Structure-Maintained Video Generation Acceleration
- DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
- Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
- Transient Noise Removal via Diffusion-based Speech Inpainting
- DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
- Patient-Adaptive Focused Transmit Beamforming using Cognitive Ultrasound
- Yan: Foundational Interactive Video Generation
- RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space
- Sound Signal Synthesis with Auxiliary Classifier GAN, COVID-19 cough as an example
- DiffVolume: Diffusion Models for Volume Generation in Limit Order Books
- GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
- Never compromise with vulnerabilities: a comprehensive survey on AI governance
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- TARA: Token-Aware LoRA for Composable Personalization in Diffusion Models
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- Flow Battery Manifold Design with Heterogeneous Inputs Through Generative Adversarial Neural Networks
- Towards Safe Imitation Learning via Potential Field-Guided Flow Matching
- CObL: Toward Zero-Shot Ordinal Layering without User Prompting
- Towards Scalable Training for Handwritten Mathematical Expression Recognition
- An effective potential for generative modelling with active matter
- S2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix
- Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
- Score Augmentation for Diffusion Models
- Diffusing the Blind Spot: Uterine MRI Synthesis with Diffusion Models
- Deep Generative Models for Discrete Genotype Simulation
- DiTVR: Zero-Shot Diffusion Transformer for Video Restoration
- Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild
- Grouped Speculative Decoding for Autoregressive Image Generation
- Undress to Redress: A Training-Free Framework for Virtual Try-On
- Attribution Explanations for Deep Neural Networks: A Theoretical Perspective
- Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
- LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
- When and how can inexact generative models still sample from the data manifold?
- Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- Matrix-3D: Omnidirectional Explorable 3D World Generation
- TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal
- DiffVC-OSD: One-Step Diffusion-based Perceptual Neural Video Compression Framework
- FantasyStyle: Controllable Stylized Distillation for 3D Gaussian Splatting
- OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution
- CLUE: Leveraging Low-Rank Adaptation to Capture Latent Uncovered Evidence for Image Forgery Localization
- Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
- Neural Bridge Processes
- Unsupervised Real-World Super-Resolution via Rectified Flow Degradation Modelling
- Intention-Aware Diffusion Model for Pedestrian Trajectory Prediction
- Finite-Time Convergence Analysis of ODE-based Generative Models for Stochastic Interpolants
- HaDM-ST: Histology-Assisted Differential Modeling for Spatial Transcriptomics Generation
- DexFruit: Dexterous Manipulation and Gaussian Splatting Inspection of Fruit
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing
- Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
- Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
- D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
- SLRTP2025 Sign Language Production Challenge: Methodology, Results, and Future Work
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- Local Diffusion Models and Phases of Data Distributions
- Towards Useful and Private Synthetic Omics: Community Benchmarking of Generative Models for Transcriptomics Data
- CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping
- Elastic Diffusion Transformer
- ContourDiff: Unpaired Medical Image Translation with Structural Consistency
- FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation
- ActivityDiff: A diffusion model with Positive and Negative Activity Guidance for De Novo Drug Design
- OM2P: Offline Multi-Agent Mean-Flow Policy
- ADPro: a Test-time Adaptive Diffusion Policy via Manifold-constrained Denoising and Task-aware Initialization for Robotic Manipulation
- Meta-Learning for Speeding Up Large Model Inference in Decentralized Environments
- Multi-Objective Instruction-Aware Representation Learning in Procedural Content Generation RL
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- UGD-IML: A Unified Generative Diffusion-based Framework for Constrained and Unconstrained Image Manipulation Localization
- Bayesian Radio Map Estimation: Fundamentals and Implementation via Diffusion Models
- InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
- Learning 3D Texture-Aware Representations for Parsing Diverse Human Clothing and Body Parts
- Improved Sub-Visible Particle Classification in Flow Imaging Microscopy via Generative AI-Based Image Synthesis
- Reverse Diffusion Sequential Monte Carlo Samplers
- Can Diffusion Models Bridge the Domain Gap in Cardiac MR Imaging?
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- E-React: Towards Emotionally Controlled Synthesis of Human Reactions
- Automatic Semantic Alignment of Flow Pattern Representations for Exploration with Large Language Models
- DreamVE: Unified Instruction-based Image and Video Editing
- AGI for the Earth, the path, possibilities and how to evaluate intelligence of models that work with Earth Observation Data?
- DiffCap: Diffusion-based Real-time Human Motion Capture using Sparse IMUs and a Monocular Camera
- Multi-view Gaze Target Estimation
- GAP: Gaussianize Any Point Clouds with Text Guidance
- Latent Space Diffusion for Topology Optimization
- Hi3DEval: Advancing 3D Generation Evaluation with Hierarchical Validity
- WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
- MagicHOI: Leveraging 3D Priors for Accurate Hand-object Reconstruction from Short Monocular Video Clips
- How and Why: Taming Flow Matching for Unsupervised Anomaly Detection and Localization
- MolSnap: Snap-Fast Molecular Generation with Latent Variational Mean Flow
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- Real-Time Iteration Scheme for Diffusion Policy
- SGDFuse: SAM-Guided Diffusion for High-Fidelity Infrared and Visible Image Fusion
- Rotation Equivariant Arbitrary-scale Image Super-Resolution
- Generative Artificial Intelligence in Medical Imaging: Foundations, Progress, and Clinical Translation
- RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
- PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation
- MetaDiT: Enabling Fine-grained Constraints in High-degree-of Freedom Metasurface Design
- Align-for-Fusion: Harmonizing Triple Preferences via Dual-oriented Diffusion for Cross-domain Sequential Recommendation
- A Study of the Framework and Real-World Applications of Language Embedding for 3D Scene Understanding
- Steering One-Step Diffusion Model with Fidelity-Rich Decoder for Fast Image Compression
- FedMP: Tackling Medical Feature Heterogeneity in Federated Learning from a Manifold Perspective
- ETTA: Efficient Test-Time Adaptation for Vision-Language Models through Dynamic Embedding Updates
- MAISI-v2: Accelerated 3D High-Resolution Medical Image Synthesis with Rectified Flow and Region-specific Contrastive Loss
- HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models
- Multitask Learning with Stochastic Interpolants
- DDTracking: A Deep Generative Framework for Diffusion MRI Tractography with Streamline Local-Global Spatiotemporal Modeling
- TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning
- Two-Way Garment Transfer: Unified Diffusion Framework for Dressing and Undressing Synthesis
- QuantVSR: Low-Bit Post-Training Quantization for Real-World Video Super-Resolution
- Multi-Marginal Stochastic Flow Matching for High-Dimensional Snapshot Data at Irregular Time Points
- Turbulent Injection assisted by Diffusion Models for Scale Resolving Simulations
- DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification
- Intention Enhanced Diffusion Model for Multimodal Pedestrian Trajectory Prediction
- DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models
- Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
- Conditional Latent Diffusion Models for Zero-Shot Instance Segmentation
- Bridging Diffusion Models and 3D Representations: A 3D Consistent Super-Resolution Framework
- Slice or the Whole Pie? Utility Control for AI Models
- Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation
- Generating Feasible and Diverse Synthetic Populations Using Diffusion Models
- Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm
- Point-Based Shape Representation Generation with a Correspondence-Preserving Diffusion Model
- DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models
- Anti-Tamper Protection for Unauthorized Individual Image Generation
- LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences
- OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
- DiWA: Diffusion Policy Adaptation with World Models
- Likelihood Matching for Diffusion Models
- MetaScope: Optics-Driven Neural Network for Ultra-Micro Metalens Endoscopy
- CADD: Context aware disease deviations via restoration of brain images using normative conditional diffusion models
- CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation
- Learning Latent Representations for Image Translation using Frequency Distributed CycleGAN
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
- Diffusion Once and Done: Degradation-Aware LoRA for Efficient All-in-One Image Restoration
- Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
- BDFirewall: Towards Effective and Expeditiously Black-Box Backdoor Defense in MLaaS
- Zero Shot Domain Adaptive Semantic Segmentation by Synthetic Data Generation and Progressive Adaptation
- Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
- Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems
- V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
- Robust Single-Stage Fully Sparse 3D Object Detection via Detachable Latent Diffusion
- BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models
- SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance
- Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback
- LiGen: GAN-Augmented Spectral Fingerprinting for Indoor Positioning
- Diffusion Models with Adaptive Negative Sampling Without External Resources
- Injecting Measurement Information Yields a Fast and Noise-Robust Diffusion-Based Inverse Problem Solver
- FFHQ-Makeup: Paired Synthetic Makeup Dataset with Facial Consistency Across Multiple Styles
- MILD: Multi-Layer Diffusion Strategy for Complex and Precise Multi-IP Aware Human Erasing
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation
- A Closed-Loop Multi-Agent Framework for Aerodynamics-Aware Automotive Styling Design
- Convergence of Deterministic and Stochastic Diffusion-Model Samplers: A Simple Analysis in Wasserstein Distance
- RDDPM: Robust Denoising Diffusion Probabilistic Model for Unsupervised Anomaly Segmentation
- REFLECT: Rectified Flows for Efficient Brain Anomaly Correction Transport
- D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss
- From Pixels to Pathology: Restoration Diffusion for Diagnostic-Consistent Virtual IHC
- Inference-time Scaling for Diffusion-based Audio Super-resolution
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- Qwen-Image Technical Report
- VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
- Forecasting When to Forecast: Accelerating Diffusion Models with Confidence-Gated Taylor
- After the Party: Navigating the Mapping From Color to Ambient Lighting
- Subject or Style: Adaptive and Training-Free Mixture of LoRAs
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
- "Set It Up": Functional Object Arrangement with Compositional Generative Models (Journal Version)
- Diffusion models for inverse problems
- QuaDreamer: Controllable Panoramic Video Generation for Quadruped Robots
- Generative AI-Empowered Secure Communications in Space-Air-Ground Integrated Networks: A Survey and Tutorial
- Unsupervised Multi-channel Speech Dereverberation via Diffusion
- Scoring ISAC: Benchmarking Integrated Sensing and Communications via Score-Based Generative Modeling
- Tackling Ill-posedness of Reversible Image Conversion with Well-posed Invertible Network
- StarPose: 3D Human Pose Estimation via Spatial-Temporal Autoregressive Diffusion
- Fine-grained Multiple Supervisory Network for Multi-modal Manipulation Detecting and Grounding
- Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference
- Diffusion-based 3D Hand Motion Recovery with Intuitive Physics
- Versatile Transition Generation with Image-to-Video Diffusion
- LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
- Why Heuristic Weighting Works: A Theoretical Analysis of Denoising Score Matching
- A Spatio-temporal Continuous Network for Stochastic 3D Human Motion Prediction
- DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
- DiffSemanticFusion: Semantic Raster BEV Fusion for Autonomous Driving via Online HD Map Diffusion
- A Plug-and-Play Multi-Criteria Guidance for Diverse In-Betweening Human Motion Generation
- DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization
- Diffusion Models for Future Networks and Communications: A Comprehensive Survey
- Semantically-Guided Inference for Conditional Diffusion Models: Enhancing Covariate Consistency in Time Series Forecasting
- StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
- Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
- Censored Sampling for Topology Design: Guiding Diffusion with Human Preferences
- TreeDiff: AST-Guided Code Generation with Diffusion LLMs
- CoCoLIT: ControlNet-Conditioned Latent Image Translation for MRI to Amyloid PET Synthesis
- NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection
- Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation
- LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
- Personalized Safety Alignment for Text-to-Image Diffusion Models
- UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
- PromptSafe: Gated Prompt Tuning for Safe Text-to-Image Generation
- ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
- A Reward-Directed Diffusion Framework for Generative Design Optimization
- The Promise of RL for Autoregressive Image Editing
- Flow Matching for Probabilistic Learning of Dynamical Systems from Missing or Noisy Data
- Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
- Unraveling Hidden Representations: A Multi-Modal Layer Analysis for Better Synthetic Content Forensics
- SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
- DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose Prior
- Guiding Diffusion-Based Articulated Object Generation by Partial Point Cloud Alignment and Physical Plausibility Constraints
- DBLP: Noise Bridge Consistency Distillation For Efficient And Reliable Adversarial Purification
- HannesImitation: Grasping with the Hannes Prosthetic Hand via Imitation Learning
- Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
- AutoDebias: Automated Framework for Debiasing Text-to-Image Models
- SDMatte: Grafting Diffusion Models for Interactive Matting
- Occlusion-robust Stylization for Drawing-based 3D Animation
- Steering Guidance for Personalized Text-to-Image Diffusion Models
- TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
- ECGTwin: Personalized ECG Generation Using Controllable Diffusion Model
- ReCoSeg++:Extended Residual-Guided Cross-Modal Diffusion for Brain Tumor Segmentation
- Jet Image Generation in High Energy Physics Using Diffusion Models
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- Minimum Data, Maximum Impact: 20 annotated samples for explainable lung nodule classification
- CIF: A Constrained Inversion Framework for Reliable Message Extraction in Diffusion-Based Generative Steganography
- Learning Personalised Human Internal Cognition from External Expressive Behaviours for Real Personality Recognition
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- CFDagent: A Language-Guided, Zero-Shot Multi-Agent System for Complex Flow Simulation
- One-Step Flow Policy Mirror Descent
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- MoGA: 3D Generative Avatar Prior for Monocular Gaussian Avatar Reconstruction
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
- StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization
- Future Illiteracies -- Architectural Epistemology and Artificial Intelligence
- Out-of-Distribution Detection in Medical Imaging via Diffusion Trajectories
- UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
- Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures
- Training-free Geometric Image Editing on Diffusion Models
- PixNerd: Pixel Neural Field Diffusion
Related