High-Resolution Image Synthesis with Latent Diffusion Models
2022/06/01 by Robin Rombach, Andreas Blattmann, Dominik Lorenz +2 · 1470 citations
Computer Science · #Advanced Image Processing Techniques #Computer Graphics and Visualization Techniques #Generative Adversarial Networks and Image Synthesis
paper · doi:10.1109/cvpr52688.2022.01042
openalex publication_date 2022/06/01 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/30
Abstract
By decomposing the image formation process into a sequential application of denoising autoencoders, diffusion models (DMs) achieve state-of-the-art synthesis results on image data and beyond. Additionally, their formulation allows for a guiding mechanism to control the image generation process without retraining. However, since these models typically operate directly in pixel space, optimization of powerful DMs often consumes hundreds of GPU days and inference is expensive due to sequential evaluations. To enable DM training on limited computational resources while retaining their quality and flexibility, we apply them in the latent space of powerful pretrained autoencoders. In contrast to previous work, training diffusion models on such a representation allows for the first time to reach a near-optimal point between complexity reduction and detail preservation, greatly boosting visual fidelity. By introducing cross-attention layers into the model architecture, we turn diffusion models into powerful and flexible generators for general conditioning inputs such as text or bounding boxes and high-resolution synthesis becomes possible in a convolutional manner. Our latent diffusion models (LDMs) achieve new state of the art scores for image inpainting and class-conditional image synthesis and highly competitive performance on various tasks, including unconditional image generation, text-to-image synthesis, and super-resolution, while significantly reducing computational requirements compared to pixel-based DMs.
Citations
Cited by
- ROGR: Relightable 3D Objects using Generative Relighting
- Cybernetic Resurgences: Machine Music Beyond AI Slop
- Product-Quantised Image Representation for High-Quality Image Synthesis
- Paris: A Decentralized Trained Open-Weight Diffusion Model
- A Survey of Imbalanced Learning on Graphs: Problems, Techniques, and Future Directions
- Survey of Cultural Awareness in Language Models: Text and Beyond
- Rethinking Data Use in Large Language Models
- ProteinCLIP: enhancing protein language models with natural language
- AI-generated visuals of car-free US cities help improve support for sustainable policies
- Amortized Moment Matching for Visual Generation
- Domain Generalization for Semantic Segmentation: A Survey
- PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
- Multi-scale Autoregressive Models are Laplacian, Discrete, and Latent Diffusion Models in Disguise
- ED<sup>4</sup>: Explicit Data-Level Debiasing for Deepfake Detection
- The Score Hamiltonian: Mapping Diffusion Models to Adiabatic Transport
- BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation
- Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models
- Latent diffusion model for conditional reservoir facies generation
- Surflo: Consistent 3D Surface Flow Model with Global State
- NOVA3R: Non-pixel-aligned Visual Transformer for Amodal 3D Reconstruction
- Flows: Building Blocks of Reasoning and Collaborating AI
- RadEdit: Stress-Testing Biomedical Vision Models via Diffusion Image Editing
- High-Frequency Space Diffusion Model for Accelerated MRI
- GUing: A Mobile GUI Search Engine using a Vision-Language Model
- Seeking the Unfamiliar but Memorable: Conceptual Creativity as Meta-Learning
- A Survey of Multimodal Controllable Diffusion Models
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- Playing with AI Chat: Positioning “Dangerous” Language Model Futures through Interactive Fiction
- DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation
- Diffusion Models in Vision: A Survey
- SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
- RA-Det: Towards Universal Detection of AI-Generated Images via Robustness Asymmetry
- SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
- Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- Generative Modeling via Drifting
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- Distance Marching for Generative Modeling
- Walk through Paintings: Egocentric World Models from Internet Priors
- Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models
- Generating metamers of human scene understanding
- Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch Generation
- EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift
- PSTF-AttControl: Per-Subject-Tuning-Free Personalized Image Generation with Controllable Face Attributes
- Resi-VidTok: An Efficient and Decomposed Progressive Tokenization Framework for Ultra-Low-Rate and Lightweight Video Transmission
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Group Relative Attention Guidance for Image Editing
- Diffusion Models for Wireless Transceivers: From Pilot-Efficient Channel Estimation to AI-Native 6G Receivers
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- UtilGen: Utility-Centric Generative Data Augmentation with Dual-Level Task Adaptation
- See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
- ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
- Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
- Compositional Image Synthesis with Inference-Time Scaling
- DogMo: A Large-Scale Multi-View RGB-D Dataset for 4D Canine Motion Recovery
- OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
- Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
- Neural USD: An object-centric framework for iterative editing and control
- AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- An efficient probabilistic hardware architecture for diffusion-like models
- SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
- TurboPortrait3D: Single-step diffusion-based fast portrait novel-view synthesis
- A PDE-Informed Latent Diffusion Model for 2-m Temperature Downscaling
- Rethinking Noise Sampling in Class-Imbalanced Diffusion Models
- Track, Inpaint, Resplat: Subject-driven 3D and 4D Generation with Progressive Texture Infilling
- FARMER: Flow AutoRegressive Transformer over Pixels
- Reduced AI Acceptance After the Generative AI Boom: Evidence From a Two-Wave Survey Study
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
- FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
- An Efficient Remote Sensing Super Resolution Method Exploring Diffusion Priors and Multi-Modal Constraints for Crop Type Mapping
- Autoregressive Styled Text Image Generation, but Make it Reliable
- Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI
- UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- Simple Denoising Diffusion Language Models
- SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner
- LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
- Switchable Token-Specific Codebook Quantization For Face Image Compression
- Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
- Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models
- MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control
- A Free Probabilistic Framework for Denoising Diffusion Models: Entropy, Transport, and Reverse Processes
- Optimize Any Topology: A Foundation Model for Shape- and Resolution-Free Structural Topology Optimization
- SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning
- TraceTrans: Translation and Spatial Tracing for Surgical Prediction
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
- GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- Diffusion-Driven Two-Stage Active Learning for Low-Budget Semantic Segmentation
- Efficient Utility-Preserving Machine Unlearning with Implicit Gradient Surgery
- Discovering Latent Graphs with GFlowNets for Diverse Conditional Image Generation
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing
- LiteDiff
- Visual Diffusion Models are Geometric Solvers
- WorldGrow: Generating Infinite 3D World
- S3OD: Towards Generalizable Salient Object Detection with Synthetic Data
- Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
- Disentangled Representation Learning via Modular Compositional Bias
- Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
- Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
- Bridging the gap to real-world language-grounded visual concept learning
- LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal
- TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
- Low-Complexity MIMO Channel Estimation with Latent Diffusion Models
- BADiff: Bandwidth Adaptive Diffusion Model
- FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
- Text-Guided Diffusion Model-based Generative Communication for Wireless Image Transmission
- Improved Training Technique for Shortcut Models
- Noise is All You Need: Solving Linear Inverse Problems by Noise Combination Sampling with Diffusion Models
- SafetyPairs: Isolating Safety Critical Image Features with Counterfactual Image Generation
- QSilk: Micrograin Stabilization and Adaptive Quantile Clipping for Detail-Friendly Latent Diffusion
- Epipolar Geometry Improves Video Generation Models
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
- Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- Preventing Shortcuts in Adapter Training via Providing the Shortcuts
- ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
- BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation
- CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- EchoDistill: Bidirectional Concept Distillation for One-Step Diffusion Personalization
- Positional Encoding Field
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
- EditInfinity: Image Editing with Binary-Quantized Generative Models
- Target-aware Image Editing via Cycle-consistent Constraints
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- Evaluating Video Models as Simulators of Multi-Person Pedestrian Trajectories
- A Contact-Driven Framework for Manipulating in the Blind
- Inverse Image-Based Rendering for Light Field Generation from Single Images
- StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
- DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
- AlphaFlow: Understanding and Improving MeanFlow Models
- LayerComposer: Multi-Human Personalized Generation via Layered Canvas
- From Masks to Worlds: A Hitchhiker's Guide to World Models
- Transferable Black-Box One-Shot Forging of Watermarks via Image Preference Models
- Exploring Conditions for Diffusion models in Robotic Control
- UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- Guiding diffusion models to reconstruct flow fields from sparse data
- Seed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assets
- A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
- SynCast: Synergizing Contradictions in Precipitation Nowcasting via Diffusion Sequential Preference Optimization
- Latent Space Factorization in LoRA
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- [De|Re]constructing VLMs' Reasoning in Counting
- BrainCognizer: Brain Decoding with Human Visual Cognition Simulation for fMRI-to-Image Reconstruction
- Advances in 4D Representation: Geometry, Motion, and Interaction
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- Step-Aware Residual-Guided Diffusion for EEG Spatial Super-Resolution
- CBDiff:Conditional Bernoulli Diffusion Models for Image Forgery Localization
- Machine Olfaction and Embedded AI Are Shaping the New Global Sensing Industry
- D2D: Detector-to-Differentiable Critic for Improved Numeracy in Text-to-Image Generation
- Compressing Biology: Evaluating the Stable Diffusion VAE for Phenotypic Drug Discovery
- Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
- Controllable Machine Unlearning via Gradient Pivoting
- Protein generation with embedding learning for motif diversification
- A Frequentist Statistical Introduction to Variational Inference, Autoencoders, and Diffusion Models
- UltraGen: High-Resolution Video Generation with Hierarchical Attention
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- LAND: Lung and Nodule Diffusion for 3D Chest CT Synthesis with Anatomical Guidance
- Beyond Single Images: Retrieval Self-Augmented Unsupervised Camouflaged Object Detection
- ImageGem: In-the-wild Generative Image Interaction Dataset for Generative Model Personalization
- SegTune: Structured and Fine-Grained Control for Song Generation
- Learning Human-Object Interaction as Groups
- Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback
- GPTFace: Generative Pre-training of Facial-Linguistic Transformer by Span Masking and Weakly Correlated Text-image Data
- GeoDiff: Geometry-Guided Diffusion for Metric Depth Estimation
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
- VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
- PFGS: Pose-Fused 3D Gaussian Splatting for Complete Multi-Pose Object Reconstruction
- World-in-World: World Models in a Closed-Loop World
- Gradient Variance Reveals Failure Modes in Flow-Based Generative Models
- Latent-Augmented Discrete Diffusion Models
- Demystifying Transition Matching: When and Why It Can Beat Flow Matching
- Unbiased Gradient Low-Rank Projection
- Elastic ViTs from Pretrained Models without Retraining
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- Distributional Semantics: Meaning Through Culture and Interaction
- L2P: Unlocking Latent Potential for Pixel Generation
- FMBoost: Boosting Latent Diffusion with Flow Matching
- Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
- Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- The Evolving Nature of Latent Spaces: From GANs to Diffusion
- Adaptive Discretization for Consistency Models
- Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling
- Fair and Interpretable Deepfake Detection in Videos
- CaMiT: A Time-Aware Car Model Dataset for Classification and Generation
- Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling
- One-step Diffusion Models with Bregman Density Ratio Matching
- Prominence-Aware Artifact Detection and Dataset for Image Super-Resolution
- Efficient High-Accuracy PDEs Solver with the Linear Attention Neural Operator
- From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- Class-N-Diff: Classification-Induced Diffusion Model Can Make Fair Skin Cancer Diagnosis
- FLOWR.root: A flow matching based foundation model for joint multi-purpose structure-aware 3D ligand generation and affinity prediction
- AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory
- H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
- Latent Diffusion Model without Variational Autoencoder
- GuideFlow3D: Optimization-Guided Rectified Flow For Appearance Transfer
- ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection
- Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models
- AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
- Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Terra: Explorable Native 3D World Model with Point Latents
- Attention Is All You Need for KV Cache in Diffusion LLMs
- LoRAverse: A Submodular Framework to Retrieve Diverse Adapters for Diffusion Models
- Constantly Improving Image Models Need Constantly Improving Benchmarks
- DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
- Scaling Tumor Segmentation: Best Lessons from Real and Synthetic Data
- FraQAT: Quantization Aware Training with Fractional bits
- Inpainting the Red Planet: Diffusion Models for the Reconstruction of Martian Environments in Virtual Reality
- DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Consistent text-to-image generation via scene de-contextualization
- Exploring Cross-Modal Flows for Few-Shot Learning
- Exploring Image Representation with Decoupled Classical Visual Descriptors
- Restoring Noisy Demonstration for Imitation Learning With Diffusion Models
- Unsupervised Deep Generative Models for Anomaly Detection in Neuroimaging: A Systematic Scoping Review
- Inference-Time Search using Side Information for Diffusion-based Image Reconstruction
- Nonparametric Data Attribution for Diffusion Models
- Generalist vs Specialist Time Series Foundation Models: Investigating Potential Emergent Behaviors in Assessing Human Health Using PPG Signals
- LOTA: Bit-Planes Guided AI-Generated Image Detection
- Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation
- Vector Quantization in the Brain: Grid-like Codes in World Models
- Salient Concept-Aware Generative Data Augmentation
- CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
- VIST3A: Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- Ultra High-Resolution Image Inpainting with Patch-Based Content Consistency Adapter
- Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
- Counting Hallucinations in Diffusion Models
- End-to-End Multi-Modal Diffusion Mamba
- Multi-Agent Design Assistant for the Simulation of Inertial Fusion Energy
- UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy
- Group-Wise Optimization for Self-Extensible Codebooks in Vector Quantized Models
- CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
- NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models
- The Mechanistic Emergence of Symbol Grounding in Language Models
- CausalVerse: Benchmarking Causal Representation Learning with Configurable High-Fidelity Simulations
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- Km-scale dynamical downscaling through conformalized latent diffusion models
- Generating healthy counterfactuals with denoising diffusion bridge models
- FlashWorld: High-quality 3D Scene Generation within Seconds
- NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
- SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
- Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check
- A Connection Between Score Matching and Local Intrinsic Dimension
- RNAGenScape: Property-guided Optimization and Interpolation of mRNA Sequences with Manifold Langevin Dynamics
- Efficient Perceptual Image Super Resolution: AIM 2025 Study and Benchmark
- LayerSync: Self-aligning Intermediate Layers
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- MS-GAGA: Metric-Selective Guided Adversarial Generation Attack
- Targeted Pooled Latent-Space Steganalysis Applied to Generative Steganography, with a Fix
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Vectorized Video Representation with Easy Editing via Hierarchical Spatio-Temporally Consistent Proxy Embedding
- FedMMKT:Co-Enhancing a Server Text-to-Image Model and Client Task Models in Multi-Modal Federated Learning
- BIGFix: Bidirectional Image Generation with Token Fixing
- DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation
- ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
- Self-Supervised Selective-Guided Diffusion Model for Old-Photo Face Restoration
- G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior
- VIDMP3: Video Editing by Representing Motion with Pose and Position Priors
- Time-Correlated Video Bridge Matching
- Diffusion Transformers with Representation Autoencoders
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- Robust Plant Disease Diagnosis with Few Target-Domain Samples
- DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- Pre to Post-Treatment Glioblastoma MRI Prediction using a Latent Diffusion Model
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
- Continual Personalization for Diffusion Models
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- HiMaCon: Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data
- Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
- Joint Discriminative-Generative Modeling via Dual Adversarial Training
- Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
- MoMaps: Semantics-Aware Scene Motion Generation with Motion Maps
- CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization
- ROFI: A Deep Learning-Based Ophthalmic Sign-Preserving and Reversible Patient Face Anonymizer
- Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
- Zero-shot Face Editing via ID-Attribute Decoupled Inversion
- Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation
- Perspective-aware 3D Gaussian Inpainting with Multi-view Consistency
- NeuroSwift: A Lightweight Cross-Subject Framework for fMRI Visual Reconstruction of Complex Scenes
- DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
- Blade: A Derivative-free Bayesian Inversion Method using Diffusion Priors
- DAWP: A framework for global observation forecasting via Data Assimilation and Weather Prediction in satellite observation space
- Redundancy as a Structural Information Principle for Learning and Generalization
- DreamMakeup: Face Makeup Customization using Latent Diffusion Models
- FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding
- Prompt-Guided Spatial Understanding with RGB-D Transformers for Fine-Grained Object Relation Reasoning
- Schrödinger bridge for generative AI: Soft-constrained formulation and convergence analysis
- MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models
- Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
- Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
- Trustworthy Retrosynthesis: Eliminating Hallucinations with a Diverse Ensemble of Reaction Scorers
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Unified Open-World Segmentation with Multi-Modal Prompts
- Jigsaw3D: Disentangled 3D Style Transfer via Patch Shuffling and Masking
- Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
- ProteinAE: Protein Diffusion Autoencoders for Structure Encoding
- DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis
- Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
- Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods
- Bridging Perspectives: Foundation Model Guided BEV Maps for 3D Object Detection and Tracking
- VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation Framework
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- Multi-Scale Diffusion Transformer for Jointly Simulating User Mobility and Mobile Traffic Pattern
- Color3D: Controllable and Consistent 3D Colorization with Personalized Colorizer
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Local-Global Context-Aware and Structure-Preserving Image Super-Resolution
- Generative Latent Video Compression
- Denoising Diffusion as a New Framework for Underwater Images
- Astronomia ex machina: a history, primer, and outlook on neural networks in astronomy
- ZK-WAGON: Imperceptible Watermark for Image Generation Models using ZK-SNARKs
- The Evolution of Artificial Intelligence Paradigms – Implications for Performance, Scalability, and Responsible Deployment
- StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold
- Leveraging Prior Knowledge of Diffusion Model for Person Search
- Asymmetric Flow Models
- Learning Regularization Functionals for Inverse Problems: A Comparative Study
- Combined Representation and Generation with Diffusive State Predictive Information Bottleneck
- Cross-Sensor Touch Generation
- TC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion Control
- Few-shot multi-token DreamBooth with LoRa for style-consistent character generation
- A Biophysically-Conditioned Generative Framework for 3D Brain Tumor MRI Synthesis
- SynthID-Image: Image watermarking at internet scale
- Online Video Depth Anything: Temporally-Consistent Depth Prediction with Low Memory Consumption
- Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- Lesion-Aware Post-Training of Latent Diffusion Models for Synthesizing Diffusion MRI from CT Perfusion
- Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
- Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
- Score-Based Density Estimation from Pairwise Comparisons
- HandEval: Taking the First Step Towards Hand Quality Evaluation in Generated Images
- D-TPT: Dimensional Entropy Maximization for Calibrating Test-Time Prompt Tuning in Vision-Language Models
- Geodesic Calculus on Implicitly Defined Latent Manifolds
- HeadsUp! High-Fidelity Portrait Image Super-Resolution
- LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
- MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
- MultiCOIN: Multi-Modal COntrollable Video INbetweening
- X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering
- FreqCa: Accelerating Diffusion Models via Frequency-Aware Caching
- SummDiff: Generative Modeling of Video Summarization with Diffusion
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- Hyperspectral data augmentation with transformer-based diffusion models
- SViM3D: Stable Video Material Diffusion for Single Image 3D Generation
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- Guitar Tone Morphing by Diffusion-based Model
- ComGS: Efficient 3D Object-Scene Composition via Surface Octahedral Probes
- SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
- Rectified-CFG++ for Flow Based Models
- FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring
- MONKEY: Masking ON KEY-Value Activation Adapter for Personalization
- Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
- Optimal Stopping in Latent Diffusion Models
- Reinforcing Diffusion Models by Direct Group Preference Optimization
- SimCast: Enhancing Precipitation Nowcasting with Short-to-Long Term Knowledge Distillation
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- High-dimensional Analysis of Synthetic Data Selection
- SkipSR: Faster Super Resolution with Token Skipping
- From Data to Rewards: a Bilevel Optimization Perspective on Maximum Likelihood Estimation
- NNDM: NNUNet Diffusion Model for Brain Tumor Segmentation
- What is the most optimal diffusion?
- Symbolic-Diffusion: Deep Learning Based Symbolic Regression with D3PM Discrete Token Diffusion
- Low-Compute Watermark Removal via Dual-Domain Natural Projection
- A Denoising Framework for Real-World Ultra-Low-Dose Lung CT Images Based on an Image Purification Strategy
- Quantum-enhanced Computer Vision: Going Beyond Classical Algorithms
- Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers
- Approximate Gaussian Mapping for Generative Image Steganography
- EigenScore: OOD Detection using Covariance in Diffusion Models
- A Digital Twin Framework for Metamorphic Testing of Autonomous Driving Systems Using Generative Model
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- The Digital Mirror: Gender Bias and Occupational Stereotypes in AI-Generated Images
- MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
- DisCo: Reinforcement with Diversity Constraints for Multi-Human Generation
- StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance
- NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation
- A Diffusion Model for Regular Time Series Generation from Irregular Data with Completion and Masking
- Heptapod: Language Modeling on Visual Signals
- Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
- Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
- Towards Better Optimization For Listwise Preference in Diffusion Models
- VUGEN: Visual Understanding priors for GENeration
- scPPDM: A Diffusion Model for Single-Cell Drug-Response Prediction
- OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
- Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
- Three Forms of Stochastic Injection for Improved Distribution-to-Distribution Generative Modeling
- DreamOmni2: Multimodal Instruction-based Editing and Generation
- Position: Towards Responsible Evaluation for Text-to-Speech
- Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security
- SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation
- Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model
- SpotDiff: Spotting and Disentangling Interference in Feature Space for Subject-Preserving Image Generation
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
- Fine-grained Defocus Blur Control for Generative Image Models
- Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
- Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
- Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
- Carré du champ flow matching: better quality-generalisation tradeoff in generative models
- \bfD3QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
- ESS-Flow: Training-free guidance of flow-based models as inference in source space
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- Redefining Generalization in Visual Domains: A Two-Axis Framework for Fake Image Detection with FusionDetect
- Teleportraits: Training-Free People Insertion into Any Scene
- VENTURA: Adapting Image Diffusion Models for Unified Task Conditioned Navigation
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- FORGE-Tree: Diffusion-Forcing Tree Search for Long-Horizon Robot Manipulation
- Diffusion-Based Image Editing for Breaking Robust Watermarks
- Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis
- AgeBooth: Controllable Facial Aging and Rejuvenation via Diffusion Models
- A Data-Driven Prism: Multi-View Source Separation with Diffusion Model Priors
- Factuality Matters: When Image Generation and Editing Meet Structured Visuals
- SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
- FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation
- Diffusion2: Turning 3D Environments into Radio Frequency Heatmaps
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- AvatarVTON: 4D Virtual Try-On for Animatable Avatars
- Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
- ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion
- ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement
- Improved probabilistic regression using diffusion models
- MultiModal Action Conditioned Video Generation
- C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
- TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
- MACS: Measurement-Aware Consistency Sampling for Inverse Problems
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- Pulp Motion: Framing-aware multimodal camera and human motion generation
- Mitigating Diffusion Model Hallucinations with Dynamic Guidance
- SER-Diff: Synthetic Error Replay Diffusion for Incremental Brain Tumor Segmentation
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation
- Bridging Text and Video Generation: A Survey
- FoilDiff: A Hybrid Transformer Backbone for Diffusion-based Modelling of 2D Airfoil Flow Fields
- Diffusion-Assisted Distillation for Self-Supervised Graph Representation Learning with MLPs
- Scaling Sequence-to-Sequence Generative Neural Rendering
- ObCLIP: Oblivious CLoud-Device Hybrid Image Generation with Privacy Preservation
- Self Speculative Decoding for Diffusion Large Language Models
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Unlearning in Diffusion models under Data Constraints: A Variational Inference Approach
- SITCOM: Scaling Inference-Time COMpute for VLAs
- What Makes Diffusion Language Models Super Data Learners?
- MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator
- World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge
- MASC: Boosting Autoregressive Image Generation with a Manifold-Aligned Semantic Clustering
- Diffusion2: Dual Diffusion Model with Uncertainty-Aware Adaptive Noise for Momentary Trajectory Prediction
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
- Referring Expression Comprehension for Small Objects
- Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- Wave-GMS: Lightweight Multi-Scale Generative Model for Medical Image Segmentation
- UniShield: An Adaptive Multi-Agent Framework for Unified Forgery Image Detection and Localization
- Learning Robust Diffusion Models from Imprecise Supervision
- PocketSR: The Super-Resolution Expert in Your Pocket Mobiles
- Towards Scalable and Consistent 3D Editing
- Flip Distribution Alignment VAE for Multi-Phase MRI Synthesis
- Fine-Tuning Diffusion Models via Intermediate Distribution Shaping
- Deep Generative Continual Learning using Functional LoRA: FunLoRA
- Purrception: Variational Flow Matching for Vector-Quantized Image Generation
- Image Generation Based on Image Style Extraction
- LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration
- IMAGEdit: Let Any Subject Transform
- Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models
- EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
- ReSWD: ReSTIR'd, not shaken. Combining Reservoir Sampling and Sliced Wasserstein Distance for Variance Reduction
- In-Situ Tweedie Discrete Diffusion Models
- Secure and reversible face anonymization with diffusion models
- ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
- SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model
- Riemannian Consistency Model
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
- From 2D to 3D, Deep Learning-based Shape Reconstruction in Magnetic Resonance Imaging: A Review
- ProtoMask: Segmentation-Guided Prototype Learning
- Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
- Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack
- VIRTUE: Visual-Interactive Text-Image Universal Embedder
- Vicinity-Guided Discriminative Latent Diffusion for Privacy-Preserving Domain Adaptation
- Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- Photorealistic Inpainting for Perturbation-based Explanations in Ecological Monitoring
- Generative AI for subgrid turbulence in large-eddy simulations
- Discrete Wavelet Transform as a Facilitator for Expressive Latent Space Representation in Variational Autoencoders in Satellite Imagery
- A Geometric Unification of Generative AI with Manifold-Probabilistic Projection Models
- Cascaded Diffusion Framework for Probabilistic Coarse-to-Fine Hand Pose Estimation
- Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability
- InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
- Learn to Guide Your Diffusion Model
- Diffusion Alignment as Variational Expectation-Maximization
- Selective Underfitting in Diffusion Models
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging
- Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
- MOLM: Mixture of LoRA Markers
- Creative synthesis of kinematic mechanisms
- Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
- DA2: Depth Anything in Any Direction
- Contrastive Diffusion Guidance for Spatial Inverse Problems
- dParallel: Learnable Parallel Decoding for dLLMs
- DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick
- Post-Training Quantization via Residual Truncation and Zero Suppression for Diffusion Models
- Data-to-Energy Stochastic Dynamics
- EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- 3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation
- IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
- Marginal Flow: a flexible and efficient framework for density estimation
- EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- GaussEdit: Adaptive 3D Scene Editing with Text and Image Prompts
- DGM4+: Dataset Extension for Global Scene Inconsistency
- SeMoBridge: Semantic Modality Bridge for Efficient Few-Shot Adaptation of CLIP
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing
- CO3: Contrasting Concepts Compose Better
- Revoking Amnesia: RL-based Trajectory Optimization to Resurrect Erased Concepts in Diffusion Models
- Vector sketch animation generation with differentialable motion trajectories
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
- ART-VITON: Measurement-Guided Latent Diffusion for Artifact-Free Virtual Try-On
- Dragging with Geometry: From Pixels to Geometry-Guided Image Editing
- LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing
- How Diffusion Models Memorize
- Reframing Generative Models for Physical Systems using Stochastic Interpolants
- Hierarchical Reasoning Models: Perspectives and Misconceptions
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
- IRIS: Intrinsic Reward Image Synthesis
- One-shot Conditional Sampling: MMD meets Nearest Neighbors
- Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection
- Guided Diffusion for the Discovery of New Superconductors
- Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
- LayerD: Decomposing Raster Graphic Designs into Layers
- CharGen: Fast and Fluent Portrait Modification
- Score-based Membership Inference on Diffusion Models
- Path Diffuser: Diffusion Model for Data-Driven Traffic Simulator
- SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation
- Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
- SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution
- When Scores Learn Geometry: Rate Separations under the Manifold Hypothesis
- VAGUEGAN: Stealthy Poisoning and Backdoor Attacks on Image Generative Pipelines
- ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation
- Environment-Aware Satellite Image Generation with Diffusion Models
- UP2You: Fast Reconstruction of Yourself from Unconstrained Photo Collections
- ExGS: Extreme 3D Gaussian Compression with Diffusion Priors
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- RIFLE: Removal of Image Flicker-Banding via Latent Diffusion Enhancement
- Enabling Physical AI through Biological Principles
- Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency
- UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark
- A Data-Centric Perspective on the Influence of Image Data Quality in Machine Learning Models
- CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers
- RapidMV: Leveraging Spatio-Angular Representations for Efficient and Consistent Text-to-Multi-View Synthesis
- Agentic Services Computing
- From Satellite to Street: A Hybrid Framework Integrating Stable Diffusion and PanoGAN for Consistent Cross-View Synthesis
- Real-Aware Residual Model Merging for Deepfake Detection
- NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis
- Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
- Similarity-Aware Selective State-Space Modeling for Semantic Correspondence
- Cycle Diffusion Model for Counterfactual Image Generation
- Semantic Editing with Coupled Stochastic Differential Equations
- A phase transition in diffusion models reveals the hierarchical nature of data
- Simulating Post-Neoadjuvant Chemotherapy Breast Cancer MRI via Diffusion Model with Prompt Tuning
- Tumor Synthesis conditioned on Radiomics
- World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
- PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion
- DFG-PCN: Point Cloud Completion with Degree-Flexible Point Graph
- Fidelity-Aware Data Composition for Robust Robot Generalization
- DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
- Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
- NeoWorld: Neural Simulation of Explorable Virtual Worlds via Progressive 3D Unfolding
- Personalized Vision via Visual In-Context Learning
- Scalable GANs with Transformers
- SCOPE: Semantic Conditioning for Sim2Real Category-Level Object Pose Estimation in Robotics
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- Editing Physiological Signals in Videos Using Latent Representations
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- Sequential Diffusion Language Models
- SIE3D: Single-image Expressive 3D Avatar generation via Semantic Embedding and Perceptual Expression Loss
- RPG360: Robust 360 Depth Estimation with Perspective Foundation Models and Graph Optimization
- AnyDepth: Depth Estimation Made Easy
- Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution
- Reinforcement Learning with Inverse Rewards for World Model Post-training
- Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
- SIG-Chat: Spatial Intent-Guided Conversational Gesture Generation Involving How, When and Where
- Defining latent spaces by example: optimisation over the outputs of generative models
- Texture Vector-Quantization and Reconstruction Aware Prediction for Generative Super-Resolution
- GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning
- ReLumix: Extending Image Relighting to Video via Video Diffusion Models
- Position-Blind Ptychography: Viability of image reconstruction via data-driven variational inference
- HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
- AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
- Diff-3DCap: Shape Captioning with Diffusion Models
- StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer
- CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement
- Sparse-Up: Learnable Sparse Upsampling for 3D Generation with High-Fidelity Textures
- Griffin: Generative Reference and Layout Guided Image Composition
- DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
- ZeroScene: A Zero-Shot Framework for 3D Scene Generation from a Single Image and Controllable Texture Editing
- MAN: Latent Diffusion Enhanced Multistage Anti-Noise Network for Efficient and High-Quality Low-Dose CT Image Denoising
- StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
- Toward a Holistic Approach to Continual Model Merging
- Foundation Model-Based Adaptive Semantic Image Transmission for Dynamic Wireless Environments
- Towards Interpretable Visual Decoding with Attention to Brain Representations
- HunyuanImage 3.0 Technical Report
- Modeling the language cortex with form-independent and enriched representations of sentence meaning reveals remarkable semantic abstractness
- No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- Generative Modeling of Shape-Dependent Self-Contact Human Poses
- Seeing the Unseen in Low-light Spike Streams
- CREPE: Controlling Diffusion with Replica Exchange
- More Data or Better Algorithms: Latent Diffusion Augmentation for Deep Imbalanced Regression
- Stochastic Interpolants via Conditional Dependent Coupling
- Follow-Your-Preference: Towards Preference-Aligned Image Inpainting
- ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View
- Data-Efficient Training by Evolved Sampling
- FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
- Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing
- Enhancing Blind Face Restoration through Online Reinforcement Learning
- FishAI 2.0: Marine Fish Image Classification with Multi-modal Few-shot Learning
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
- Pixel Motion Diffusion is What We Need for Robot Control
- Machine Learning, Understanding, and Interaction
- Toward an Integrated Machine Learning Model of a Proteomics Experiment
- Scale-Wise VAR is Secretly Discrete Diffusion
- Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance
- LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
- JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation
- LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- NIFTY: a Non-Local Image Flow Matching for Texture Synthesis
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing
- REFINE-CONTROL: A Semi-supervised Distillation Method For Conditional Image Generation
- Guidance Watermarking for Diffusion Models
- Factor-Based Conditional Diffusion Model for Portfolio Optimization
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models
- Universal Multi-Domain Translation via Diffusion Routers
- FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration
- Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
- SemanticControl: A Training-Free Approach for Handling Loosely Aligned Visual Conditions in ControlNet
- Generation Properties of Stochastic Interpolation under Finite Training Set
- Taming Flow-based I2V Models for Creative Video Editing
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
- Drag4D: Align Your Motion with Text-Driven 3D Scene Generation
- StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
- DeHate: A Stable Diffusion-based Multimodal Approach to Mitigate Hate Speech in Images
- MusicWeaver: Programmable Long-Form Music Generation with Provably Local Editing
- Pushing Toward the Simplex Vertices: A Simple Remedy for Code Collapse in Smoothed Vector Quantization
- Large Material Gaussian Model for Relightable 3D Generation
- Memory Self-Regeneration: Uncovering Hidden Knowledge in Unlearned Models
- DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models
- Guiding Audio Editing with Audio Language Model
- X-Streamer: Unified Human World Modeling with Audiovisual Interaction
- No Alignment Needed for Generation: Learning Linearly Separable Representations in Diffusion Models
- AI for Sustainable Future Foods
- SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models
- Filtering with Confidence: When Data Augmentation Meets Conformal Prediction
- Score-based Idempotent Distillation of Diffusion Models
- SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
- DyME: Dynamic Multi-Concept Erasure in Diffusion Models with Bi-Level Orthogonal LoRA Adaptation
- Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
- A Unified Framework for Diffusion Model Unlearning with f-Divergence
- UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition
- PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
- GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions
- Neptune-X: Active X-to-Maritime Generation for Universal Maritime Object Detection
- Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
- Dense Semantic Matching with VGGT Prior
- FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
- SimDiff: Simulator-constrained Diffusion Model for Physically Plausible Motion Generation
- NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics
- MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation
- CusEnhancer: A Zero-Shot Scene and Controllability Enhancement Method for Photo Customization via ResInversion
- The Unwinnable Arms Race of AI Image Detection
- FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
- Efficient Encoder-Free Pose Conditioning and Pose Control for Virtual Try-On
- FAST: Foreground-aware Diffusion with Accelerated Sampling Trajectory for Segmentation-oriented Anomaly Synthesis
- Generative Model Inversion Through the Lens of the Manifold Hypothesis
- ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
- Manifold-Aware Diffusion-Augmented Contrastive Learning for Noise-Robust Biosignal Representation
- Latent Iterative Refinement Flow: A Geometric-Constrained Approach for Few-Shot Generation
- An Efficient Conditional Score-based Filter for High Dimensional Nonlinear Filtering Problems
- DynaFlow: Dynamics-embedded Flow Matching for Physically Consistent Motion Generation from State-only Demonstrations
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
- MMG: Mutual Information Estimation via the MMSE Gap in Diffusion
- Interpreting ResNet-based CLIP via Neuron-Attention Decomposition
- Seedream 4.0: Toward Next-generation Multimodal Image Generation
- Synthesizing Artifact Dataset for Pixel-level Detection
- Frame-based Equivariant Diffusion Models for 3D Molecular Generation
- VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection
- MeshFM: 2D Features Are All You Need for 3D Shape Understanding
- TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment
- A two-stage interaction approach for enhancing generalization of deepfake detection
- RFMSR: Residual Flow Matching for Image Super-Resolution
- ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate
- Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation
- Forecasting Land Art Under Climate Scenarios
- Can Vision-Language Models Reason about AI Edits in Images?
- From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data
- Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models
- Deep learning in plant phenotyping: the first ten years
- Prompting for Discovery: Flexible Sense-Making for AI Art-Making with Dreamsheets
- ELF: Embedded Language Flows
- Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes
- FADE: A Task-Agnostic Upsampling Operator for Encoder–Decoder Architectures
- Continual Learning with Vision-Language Models via Semantic-Geometry Preservation
- Integrating phenotyping and modelling approaches StomaGAN: improving image-based analysis of stomata through generative adversarial networks
- System 0/1/2/3: Quad-Process Theory for Multitimescale Embodied Collective Cognitive Systems
- ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models
- Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
- Generative Feature Imputing -- A Technique for Error-resilient Semantic Communication
- Dual-conditioned diffusion model with anatomical guidance for geometric distortion correction in prostate MRI
- From moral panic to pragmatic governance: reframing AI’s societal impacts in employment, education, and ethics
- Diffusion-Based Data Augmentation for Medical Image Segmentation
- UniSino: Physics-Driven Foundational Model for Universal CT Sinogram Standardization
- ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation
- From Global to Local: Social Bias Transfer in CLIP
- Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation
- WaveletGaussian: Wavelet-domain Diffusion for Sparse-view 3D Gaussian Object Reconstruction
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- SAEmnesia: Erasing Concepts in Diffusion Models with Supervised Sparse Autoencoders
- RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- Training-Free Multi-Style Fusion Through Reference-Based Adaptive Modulation
- GeoRemover: Removing Objects and Their Causal Visual Artifacts
- FixingGS: Enhancing 3D Gaussian Splatting via Training-Free Score Distillation
- A Gradient Flow Approach to Solving Inverse Problems with Latent Diffusion Models
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- Training-Free Data Assimilation with GenCast
- Prompt-Guided Dual Latent Steering for Inversion Problems
- Flow marching for a generative PDE foundation model
- Latent Danger Zone: Distilling Unified Attention for Cross-Architecture Black-box Attacks
- OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
- Towards Application Aligned Synthetic Surgical Image Synthesis
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- Is It Certainly a Deepfake? Reliability Analysis in Detection & Generation Ecosystem
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Autoregressive-Gaussian Mixture Models: Efficient Generative Modeling of WSS Signals
- Degradation-Aware All-in-One Image Restoration via Latent Prior Encoding
- Conditional Diffusion Models for CT Image Synthesis from CBCT: A Systematic Review
- Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling
- Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
- DiffQ: Unified Parameter Initialization for Variational Quantum Algorithms via Diffusion Models
- MEF: A Systematic Evaluation Framework for Text-to-Image Models
- Semantic and Visual Crop-Guided Diffusion Models for Heterogeneous Tissue Synthesis in Histopathology
- Diff-GNSS: Diffusion-based Pseudorange Error Estimation
- ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
- Audio Super-Resolution with Latent Bridge Models
- RadarSFD: Single-Frame Diffusion with Pretrained Priors for Radar Point Clouds
- LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
- StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
- SPFSplatV2: Efficient Self-Supervised Pose-Free 3D Gaussian Splatting from Sparse Views
- nDNA -- the Semantic Helix of Artificial Cognition
- SynergyNet: Fusing Generative Priors and State-Space Models for Facial Beauty Prediction
- Stencil: Subject-Driven Generation with Context Guidance
- Intention-aware Hierarchical Diffusion Model for Long-term Trajectory Anomaly Detection
- PhysHDR: When Lighting Meets Materials and Scene Geometry in HDR Reconstruction
- VidCLearn: A Continual Learning Approach for Text-to-Video Generation
- VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
- Animalbooth: multimodal feature enhancement for animal subject personalization
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
- A Novel Metric for Detecting Memorization in Generative Models for Brain MRI Synthesis
- RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
- The Programmer’s Assistant: Conversational Interaction with a Large Language Model for Software Development
- OS-DiffVSR: Towards One-step Latent Diffusion Model for High-detailed Real-world Video Super-Resolution
- Octree Diffusion for Semantic Scene Generation and Completion
- Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation
- Efficient Rectified Flow for Image Fusion
- Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
- DoubleGen: Debiased Generative Modeling of Counterfactuals
- SonoCraftAR: Towards Supporting Personalized Authoring of Sound-Reactive AR Interfaces by Deaf and Hard of Hearing Users
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- Blind-Spot Guided Diffusion for Self-supervised Real-World Denoising
- SLaM-DiMM: Shared Latent Modeling for Diffusion Based Missing Modality Synthesis in MRI
- From Prompt Engineering to Prompt Craft
- SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
- CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models
- Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
- Lynx: Towards High-Fidelity Personalized Video Generation
- Dynamic Classifier-Free Diffusion Guidance via Online Feedback
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- Deep Learning Empowered Super-Resolution: A Comprehensive Survey and Future Prospects
- Minimal Semantic Sufficiency Meets Unsupervised Domain Generalization
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- Structured Information for Improving Spatial Relationships in Text-to-Image Generation
- The Iconicity of the Generated Image
- Local Mechanisms of Compositional Generalization in Conditional Diffusion
- Efficient Multimodal Dataset Distillation via Generative Models
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition
- Kuramoto Orientation Diffusion Models
- Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
- Geometric Image Synchronization with Deep Watermarking
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- SPATIALGEN: Layout-guided 3D Indoor Scene Generation
- Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
- Variational Shape Inference for Grasp Diffusion on SE(3)
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
- GenKOL: Modular Generative AI Framework For Scalable Virtual KOL Generation
- Controllable Localized Face Anonymization Via Diffusion Inpainting
- Radiology Report Conditional 3D CT Generation with Multi Encoder Latent diffusion Model
- Dataset Distillation for Super-Resolution without Class Labels and Pre-trained Models
- UMind: A Unified Multitask Network for Zero-Shot M/EEG Visual Decoding
- Data Augmentation via Latent Diffusion Models for Detecting Smell-Related Objects in Historical Artworks
- Generative AI Meets Wireless Sensing: Towards Wireless Foundation Model
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- DACoN: DINO for Anime Paint Bucket Colorization with Any Number of Reference Images
- Adaptive and Iterative Point Cloud Denoising with Score-Based Diffusion Model
- EatGAN: An Edge-Attention Guided Generative Adversarial Network for Single Image Super-Resolution
- The Describe-Then-Generate Bottleneck: How VLM Descriptions Alter Image Generation Outcomes
- TTSR: A Transformer-Based Topography Neural Network for Digital Elevation Model Super-Resolution
- TinySR: Pruning Diffusion for Real-World Image Super-Resolution
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- AToken: A Unified Tokenizer for Vision
- GenExam: A Multidisciplinary Text-to-Image Exam
- MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies
- Data Leakage in Visual Datasets
- EDITS: Enhancing Dataset Distillation with Implicit Textual Semantics
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation
- DiCache: Let Diffusion Model Determine Its Own Cache
- BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching
- Generative Image Coding with Diffusion Prior
- Controllable-Continuous Color Editing in Diffusion Model via Color Mapping
- SpeechOp: Inference-Time Task Composition for Generative Speech Processing
- CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion
- StyleProtect: Safeguarding Artistic Identity in Fine-tuned Diffusion Models
- DEFT-VTON: Efficient Virtual Try-On with Consistent Generalised H-Transform
- BiasMap: Leveraging Cross-Attentions to Discover and Mitigate Hidden Social Biases in Text-to-Image Generation
- ERF-BA-TFD+: A Multimodal Model for Audio-Visual Deepfake Detection
- EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing
- Image Realness Assessment and Localization with Multimodal Features
- MIA-EPT: Membership Inference Attack via Error Prediction for Tabular Data
- What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment
- 4D Visual Pre-training for Robot Learning
- From reactive to cognitive: brain-inspired spatial intelligence for embodied agents
- Double Helix Diffusion for Cross-Domain Anomaly Image Generation
- Joint AoI and Handover Optimization in Space-Air-Ground Integrated Network
- Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion
- Image Tokenizer Needs Post-Training
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- From Autoencoders to CycleGAN: Robust Unpaired Face Manipulation via Adversarial Learning
- Data-Driven Analysis of Text-Conditioned AI-Generated Music: A Case Study with Suno and Udio
- LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
- Robust Concept Erasure in Diffusion Models: A Theoretical Perspective on Security and Robustness
- SERES: Semantic-aware neural reconstruction from sparse views
- DRAG: Data Reconstruction Attack using Guided Diffusion
- IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
- Artist-Created Mesh Generation from Raw Observation
- Removal Attack and Defense on AI-generated Content Latent-based Watermarking
- Beyond Sliders: Mastering the Art of Diffusion-based Image Manipulation
- PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models
- A Novel Local Focusing Mechanism for Deepfake Detection Generalization
- STASE: A spatialized text-to-audio synthesis engine for music generation
- Text2Sign Diffusion: A Generative Approach for Gloss-Free Sign Language Production
- MetaSeal: Defending Against Image Attribution Forgery Through Content-Dependent Cryptographic Watermarks
- Every Camera Effect, Every Time, All at Once: 4D Gaussian Ray Tracing for Physics-based Camera Effect Data Generation
- T2Bs: Text-to-Character Blendshapes via Video Generation
- InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis
- HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching
- A Discrepancy-Based Perspective on Dataset Condensation
- MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
- Mask Consistency Regularization in Object Removal
- GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection
- HHI-Assist: A Dataset and Benchmark of Human-Human Interaction in Physical Assistance Scenario
- Chord: Chain of Rendering Decomposition for PBR Material Estimation from Generated Texture Images
- RPD-Diff: Region-Adaptive Physics-Guided Diffusion Model for Visibility Enhancement under Dense and Non-Uniform Haze
- Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
- Accelerating 3D Photoacoustic Computed Tomography with End-to-End Physics-Aware Neural Operators
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- Sig-DEG for Distillation: Making Diffusion Models Faster and Lighter
- Aesthetic Experience and Educational Value in Co-creating Art with Generative AI: Evidence from a Survey of Young Learners
- Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
- Mixture of Semantics Transmission for Generative AI-Enabled Semantic Communication Systems
- Prompt Pirates Need a Map: Stealing Seeds helps Stealing Prompts
- Fine-Grained Customized Fashion Design with Image-into-Prompt benchmark and dataset from LMM
- A novel method and dataset for depth-guided image deblurring from smartphone Lidar
- Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios
- ALL-PET: A Low-resource and Low-shot PET Foundation Model in Projection Domain
- Generating Synthetic Contrast-Enhanced Chest CT Images from Non-Contrast Scans Using Slice-Consistent Brownian Bridge Diffusion Network
- OpenFake: An Open Dataset and Platform Toward Real-World Deepfake Detection
- MarkDiffusion: An Open-Source Toolkit for Generative Watermarking of Latent Diffusion Models
- Integrating Anatomical Priors into a Causal Diffusion Model
- Diffusion-Based Action Recognition Generalizes to Untrained Domains
- RewardDance: Reward Scaling in Visual Generation
- Deep learning in multiple animal tracking: A survey
- Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
- RoentMod: A Synthetic Chest X-Ray Modification Model to Identify and Correct Image Interpretation Model Shortcuts
- LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
- Modulating human brain responses via optimal natural image selection and synthetic image generation
- Delta-SVD: Efficient Compression for Personalized Text-to-Image Models
- EfficientIML: Efficient High-Resolution Image Manipulation Localization
- Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
- Spherical Brownian Bridge Diffusion Models for Conditional Cortical Thickness Forecasting
- LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
- Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video
- Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities
- MemoVis: A GenAI-Powered Tool for Creating Companion Reference Images for 3D Design Feedback
- Feature Space Analysis by Guided Diffusion Model
- ScoreHOI: Physically Plausible Reconstruction of Human-Object Interaction via Score-Guided Diffusion
- SplatFill: 3D Scene Inpainting via Depth-Guided Gaussian Splatting
- LINR Bridge: Vector Graphic Animation via Neural Implicits and Video Diffusion Priors
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- A Generalisable Generative Model for Multi-Detector Calorimeter Simulation
- Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier Integrity
- Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
- DreamLifting: A Plug-in Module Lifting MV Diffusion Models for 3D Asset Generation
- Improving Performance, Robustness, and Fairness of Radiographic AI Models with Finely-Controllable Synthetic Data
- Testing chatbots on the creation of encoders for audio conditioned image generation
- Privacy Preserving Semantic Communications Using Vision Language Models: A Segmentation and Generation Approach
- Scaling Transformer-Based Novel View Synthesis Models with Token Disentanglement and Synthetic Data
- BIR-Adapter: A Low-Complexity Diffusion Model Adapter for Blind Image Restoration
- Are Targeted Data Poisoning Attacks as Effective as We Think?
- UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward
- Automated Evaluation of Gender Bias Across 13 Large Multimodal Models
- P3-SAM: Native 3D Part Segmentation
- LLaDA-VLA: Vision Language Diffusion Action Models
- STAGE: Segmentation-oriented Industrial Anomaly Synthesis via Graded Diffusion with Explicit Mask Alignment
- CausNVS: Autoregressive Multi-view Diffusion for Flexible 3D Novel View Synthesis
- CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models
- Contrastive Anatomy-Contrast Disentanglement: A Domain-General MRI Harmonization Method
- O3Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation
- Interleaving Reasoning for Better Text-to-Image Generation
- SynthDrive: Scalable Real2Sim2Real Sensor Simulation Pipeline for High-Fidelity Asset Generation and Driving Data Synthesis
- Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
- Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- Imagining Alternatives: Towards High-Resolution 3D Counterfactual Medical Image Generation via Language Guidance
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Home-made Diffusion Model from Scratch to Hatch
- Effectively obtaining acoustic, visual and textual data from videos
- CardiacFlow: 3D+t Four-Chamber Cardiac Shape Completion and Generation via Flow Matching
- Tell-Tale Watermarks for Explanatory Reasoning in Synthetic Media Forensics
- SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
- OptiProxy-NAS: Optimization Proxy based End-to-End Neural Architecture Search
- FlowSeek: Optical Flow Made Easier with Depth Foundation Models and Motion Bases
- Pathology-Informed Latent Diffusion Model for Anomaly Detection in Lymph Node Metastasis
- Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
- Semantic-guided LoRA Parameters Generation
- A Scalable Attention-Based Approach for Image-to-3D Texture Mapping
- Between fact and fairy: tracing the hallucination metaphor in AI discourse
- LUIVITON: Learned Universal Interoperable VIrtual Try-ON
- AURAD: Anatomy-Pathology Unified Radiology Synthesis with Progressive Representations
- SemSteDiff: Generative Diffusion Model-based Coverless Semantic Steganography Communication
- STADI: Fine-Grained Step-Patch Diffusion Parallelism for Heterogeneous GPUs
- Plug-and-Play Latent Diffusion for Electromagnetic Inverse Scattering with Application to Brain Imaging
- Inpaint4Drag: Repurposing Inpainting Models for Drag-Based Image Editing via Bidirectional Warping
- Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image -- Technical Preview
- Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
- The Telephone Game: Evaluating Semantic Drift in Unified Models
- Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer
- Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
- Transition Models: Rethinking the Generative Learning Objective
- SSGaussian: Semantic-Aware and Structure-Preserving 3D Style Transfer
- AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
- From Editor to Dense Geometry Estimator
- Noisy Label Refinement with Semantically Reliable Synthetic Images
- Hyper Diffusion Avatars: Dynamic Human Avatar Generation using Network Weight Space Diffusion
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- TauGenNet: Plasma-Driven Tau PET Image Synthesis via Text-Guided 3D Diffusion Models
- DUDE: Diffusion-Based Unsupervised Cross-Domain Image Retrieval
- K-Syn: K-space Data Synthesis in Ultra Low-data Regimes
- Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
- Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
- Weakly-Supervised Learning of Dense Functional Correspondences
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
- Estudio de la eficiencia en la escalabilidad de GPUs para el entrenamiento de Inteligencia Artificial
- LuxDiT: Lighting Estimation with Video Diffusion Transformer
- Solving Imaging Inverse Problems Using Plug-and-Play Denoisers: Regularization and Optimization Perspectives
- Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner
- Audio2Face-3D: Audio-driven Realistic Facial Animation For Digital Avatars
- Enhancing Robustness in Post-Processing Watermarking: An Ensemble Attack Network Using CNNs and Transformers
- Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- InfraDiffusion: zero-shot depth map restoration with diffusion models and prompted segmentation from sparse infrastructure point clouds
- Unifi3D: A Study on 3D Representations for Generation and Reconstruction in a Common Framework
- TeRA: Rethinking Text-guided Realistic 3D Avatar Generation
- Data-Driven Loss Functions for Inference-Time Optimization in Text-to-Image Generation
- Enhancing Zero-Shot Pedestrian Attribute Recognition with Synthetic Data Generation: A Comparative Study with Image-To-Image Diffusion Models
- Conditional-t3VAE: Equitable Latent Space Allocation for Fair Generation
- EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation
- FlexMUSE: Multimodal Unification and Semantics Enhancement Framework with Flexible interaction for Creative Writing
- RadioDiff-Loc: Diffusion Model Enhanced Scattering Congnition for NLoS Localization with Sparse Radio Map Estimation
- Latent Gene Diffusion for Spatial Transcriptomics Completion
- Exploring Diffusion Models for Generative Forecasting of Financial Charts
- An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
- A Data-Centric Approach to Pedestrian Attribute Recognition: Synthetic Augmentation via Prompt-driven Diffusion Models
- OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models
- Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
- DroneSR: Rethinking Few-shot Thermal Image Super-Resolution from Drone-based Perspective
- Fidelity-preserving enhancement of ptychography with foundational text-to-image models
- Head-Related Transfer Function Individualization Using Anthropometric Features and Spatially Independent Latent Representation
- RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
- On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
- Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
- Relative Trajectory Balance is equivalent to Trust-PCL
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- CbLDM: A Diffusion Model for recovering nanostructure from atomic pair distribution function
- GaussianObject: High-Quality 3D Object Reconstruction from Four Views with Gaussian Splatting
- Latent Space Single-Pixel Imaging Under Low-Sampling Conditions
- FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
- A Unified Low-level Foundation Model for Enhancing Pathology Image Quality
- Neural Scene Designer: Self-Styled Semantic Image Manipulation
- Bidirectional Sparse Attention for Faster Video Diffusion Training
- Delta Rectified Flow Sampling for Text-to-Image Editing
- GaussianGAN: Real-Time Photorealistic controllable Human Avatars
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- IntrinsicReal: Adapting IntrinsicAnything from Synthetic to Real Objects
- No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
- ER-LoRA: Effective-Rank Guided Adaptation for Weather-Generalized Depth Estimation
- Tabular Diffusion Counterfactual Explanations
- Modeling Long-term User Behaviors with Diffusion-driven Multi-interest Network for CTR Prediction
- DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective
- Visually Grounded Narratives: Reducing Cognitive Burden in Researcher-Participant Interaction
- NoiseCutMix: A Novel Data Augmentation Approach by Mixing Estimated Noise in Diffusion Models
- 3D-LATTE: Latent Space 3D Editing from Textual Instructions
- Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
- Generative Latent Space Dynamics of Electron Density
- Learning from Silence and Noise for Visual Sound Source Localization
- FLORA: Efficient Synthetic Data Generation for Object Detection in Low-Data Regimes via finetuning Flux LoRA
- Complete Gaussian Splats from a Single Image with Denoising Diffusion Models
- Diverse Signer Avatars with Manual and Non-Manual Feature Modelling for Sign Language Production
- Generative AI for Industrial Contour Detection: A Language-Guided Vision System
- ELTA 2.0: Rethinking Long-Tail for Image Aesthetics Assessment
- Revisiting Deepfake Detection: Chronological Continual Learning and the Limits of Generalization
- A Survey of Reasoning with Foundation Models: Concepts, Methodologies, and Outlook
- Weighted Support Points from Random Measures: An Interpretable Alternative for Generative Modeling
- Efficient Diffusion Model for Image Restoration by Residual Shifting
- DiffusionAD: Norm-Guided One-Step Denoising Diffusion for Anomaly Detection
- Efficient Diffusion Models: A Comprehensive Survey From Principles to Practices
- WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration
- Dress&Dance: Dress up and Dance as You Like It - Technical Preview
- DrivingGaussian++: Towards Realistic Reconstruction and Editable Simulation for Surrounding Dynamic Driving Scenes
- EmoCAST: Emotional Talking Portrait via Emotive Text Description
- Physics Informed Generative Models for Magnetic Field Images
- Embracing Aleatoric Uncertainty: Generating Diverse 3D Human Motion
- Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
- EEGDM: Learning EEG Representation with Latent Diffusion Model
- VarDiU: A Variational Diffusive Upper Bound for One-Step Diffusion Distillation
- CraftGraffiti: Exploring Human Identity with Custom Graffiti Art via Facial-Preserving Diffusion Models
- CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
- SceneGen: Single-Image 3D Scene Generation in One Feedforward Pass
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Realistic and Controllable 3D Gaussian-Guided Object Editing for Driving Video Generation
- Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation
- Safe-Control: A Safety Patch for Mitigating Unsafe Content in Text-to-Image Generation Models
- Audio-Guided Visual Editing with Complex Multi-Modal Prompts
- Probability Density from Latent Diffusion Models for Out-of-Distribution Detection
- OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
- FastFit: Accelerating Multi-Reference Virtual Try-On via Cacheable Diffusion Models
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- Disentangling Latent Embeddings with Sparse Linear Concept Subspaces (SLiCS)
- Quantum latent distributions in deep generative models
- Fractal Flow: Hierarchical and Interpretable Normalizing Flow via Topic Modeling and Recursive Strategy
- Q-Align: Alleviating Attention Leakage in Zero-Shot Appearance Transfer via Query-Query Alignment
- Charting the Future of Scholarly Knowledge with AI: A Community Perspective
- IDF: Iterative Dynamic Filtering Networks for Generalizable Image Denoising
- Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model
- IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation
- DATR: Diffusion-based 3D Apple Tree Reconstruction Framework with Sparse-View
- MonoRelief V2: Leveraging Real Data for High-Fidelity Monocular Relief Recovery
- MicroLad: 2D-to-3D Microstructure Reconstruction and Generation via Latent Diffusion and Score Distillation
- Fast 3D Diffusion for Scalable Granular Media Synthesis
- ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
- Color Bind: Exploring Color Perception in Text-to-Image Models
- SDiFL: Stable Diffusion-Driven Framework for Image Forgery Localization
- MRExtrap: Longitudinal Aging of Brain MRIs using Linear Modeling in Latent Space
- Global Motion Corresponder for 3D Point-Based Scene Interpolation under Large Motion
- Efficiently Generating Multidimensional Calorimeter Data with Tensor Decomposition Parameterization
- VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
- One-shot Unsupervised Domain Adaptation with Personalized Diffusion Models
- FastMesh: Efficient Artistic Mesh Generation via Component Decoupling
- MDD: a Mask Diffusion Detector to Protect Speaker Verification Systems from Adversarial Perturbations
- RDDM: Practicing RAW Domain Diffusion Model for Real-world Image Restoration
- USO: Unified Style and Subject-Driven Generation via Disentangled and Reward Learning
- Embedding Font Impression Word Tags Based on Co-occurrence
- HyperTASR: Hypernetwork-Driven Task-Aware Scene Representations for Robust Manipulation
- ROSE: Remove Objects with Side Effects in Videos
- The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation
- BRAIN: Bias-Mitigation Continual Learning Approach to Vision-Brain Understanding
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images
- Collaborative Multi-Modal Coding for High-Quality 3D Generation
- GenTune: Toward Traceable Prompts to Improve Controllability of Image Refinement in Environment Design
- Zero-shot CT Super-Resolution using Diffusion-based 2D Projection Priors and Signed 3D Gaussians
- Scaling Group Inference for Diverse and High-Quality Generation
- BrainPath: A Biologically-Informed AI Framework for Individualized Aging Brain Generation
- WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception
- Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
- Snap-Snap: Taking Two Images to Reconstruct 3D Human Gaussians in Milliseconds
- From Sound to Sight: Towards AI-authored Music Videos
- GSFix3D: Diffusion-Guided Repair of Novel Views in Gaussian Splatting
- SATURN: Autoregressive Image Generation Guided by Scene Graphs
- Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation
- Towards PerSense++: Advancing Training-Free Personalized Instance Segmentation in Dense Images
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states
- SBGD: Improving Graph Diffusion Generative Model via Stochastic Block Diffusion
- Virtual Community: An Open World for Humans, Robots, and Society
- Tooth-Diffusion: Guided 3D CBCT Synthesis with Fine-Grained Tooth Conditioning
- Learning to See Through Flare
- Comparing Conditional Diffusion Models for Synthesizing Contrast-Enhanced Breast MRI from Pre-Contrast Images
- OmniTry: Virtual Try-On Anything without Masks
- Bridging Clear and Adverse Driving Conditions
- EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- AIM 2025 challenge on Inverse Tone Mapping Report: Methods and Results
- DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
- Sim-to-Real Dynamic Object Manipulation on Conveyor Systems via Optimization Path Shaping
- Pixels Under Pressure: Exploring Fine-Tuning Paradigms for Foundation Models in High-Resolution Medical Imaging
- Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
- ID-Card Synthetic Generation: Toward a Simulated Bona fide Dataset
- Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping
- 7Bench: a Comprehensive Benchmark for Layout-guided Text-to-image Models
- CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
- Deadline-Aware Bandwidth Allocation for Semantic Generative Communication with Diffusion Models
- Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score
- Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models
- DMS:Diffusion-Based Multi-Baseline Stereo Generation for Improving Self-Supervised Depth Estimation
- EgoTwin: Dreaming Body and View in First Person
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- REVEAL -- Reasoning and Evaluation of Visual Evidence through Aligned Language
- Leveraging Diffusion Models for Stylization using Multiple Style Images
- CTFlow: Video-Inspired Latent Flow Matching for 3D CT Synthesis
- AI for PET image reconstruction
- Next Visual Granularity Generation
- Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
- Synthetic Data is Sufficient for Zero-Shot Visual Generalization from Offline Data
- Trust Region Constrained Measure Transport in Path Space for Stochastic Optimal Control and Inference
- Express4D: Expressive, Friendly, and Extensible 4D Facial Motion Generation Benchmark
- Quantum Flow Matching
- Demystifying Foreground-Background Memorization in Diffusion Models
- DualFit: A Two-Stage Virtual Try-On via Warping and Synthesis
- Generic Event Boundary Detection via Denoising Diffusion
- UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
- OVG-HQ: Online Video Grounding with Hybrid-modal Queries
- SPG: Style-Prompting Guidance for Style-Specific Content Creation
- LoRAtorio: An intrinsic approach to LoRA Skill Composition
- Physics-Informed Diffusion Models for Unsupervised Anomaly Detection in Multivariate Time Series
- Remove360: Benchmarking Residuals After Object Removal in 3D Gaussian Splatting
- Guiding WaveMamba with Frequency Maps for Image Debanding
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- Probing the Representational Power of Sparse Autoencoders in Vision Models
- Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception
- CoreEditor: Correspondence-constrained Diffusion for Consistent 3D Editing
- StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation
- Better Supervised Fine-tuning for VQA: Integer-Only Loss
- Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension
- CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
- Diffusion is a code repair operator and generator
- GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning
- Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
- Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
- Object Fidelity Diffusion for Remote Sensing Image Generation
- Agentic Design Review System
- Forgery Guided Learning Strategy with Dual Perception Network for Deepfake Cross-domain Detection
- Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
- NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
- CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
- Novel View Synthesis using DDIM Inversion
- DiffuRec: A Diffusion Model for Sequential Recommendation
- Considering the ethics of large machine learning models in the chemical sciences
- A Segmentation-driven Editing Method for Bolt Defect Augmentation and Detection
- Hybrid Generative Fusion for Efficient and Privacy-Preserving Face Recognition Dataset Generation
- Nonlinear filtering based on density approximation and deep BSDE prediction
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- TweezeEdit: Consistent and Efficient Image Editing with Path Regularization
- NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
- Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models
- AtomDiffuser: Time-Aware Degradation Modeling for Drift and Beam Damage in STEM Imaging
- Integrating Reinforcement Learning with Visual Generative Models: Foundations and Advances
- High Fidelity Text to Image Generation with Contrastive Alignment and Structural Guidance
- SynSpill: Improved Industrial Spill Detection With Synthetic Data
- MANGO: Multimodal Attention-based Normalizing Flow Approach to Fusion Learning
- Stable Diffusion Models are Secretly Good at Visual In-Context Learning
- Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
- From Promise to Practical Reality: Transforming Diffusion MRI Analysis with Fast Deep Learning Enhancement
- Story2Board: A Training-Free Approach for Expressive Storyboard Generation
- A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
- PERSONA: Personalized Whole-Body 3D Avatar with Pose-Driven Deformations from a Single Image
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- Quo Vadis Handwritten Text Generation for Handwritten Text Recognition?
- Prototype-Guided Diffusion: Visual Conditioning without External Memory
- Hybrid Quantum-Classical Latent Diffusion Models for Medical Image Generation
- OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
- Enhancing Diffusion Face Generation with Contrastive Embeddings and SegFormer Guidance
- On the Generalization Limits of Quantum Generative Adversarial Networks with Pure State Generators
- Non-asymptotic convergence bound of conditional diffusion models
- GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors
- NegFaceDiff: The Power of Negative Context in Identity-Conditioned Diffusion for Synthetic Face Generation
- Preacher: Paper-to-Video Agentic System
- MInDI-3D: Iterative Deep Learning in 3D for Sparse-view Cone Beam Computed Tomography
- SVG-Head: Hybrid Surface-Volumetric Gaussians for High-Fidelity Head Reconstruction and Real-Time Editing
- Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTy
- Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
- IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
- Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
- DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
- Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
- Semantic-Aware Reconstruction Error for Detecting AI-Generated Images
- Understanding Dementia Speech Alignment with Diffusion-Based Image Generation
- Lung-DDPM+: Efficient Thoracic CT Image Synthesis using Diffusion Probabilistic Model
- Per-Query Visual Concept Learning
- Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
- Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
- DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
- SafeFix: Targeted Model Repair via Controlled Image Generation
- Yan: Foundational Interactive Video Generation
- Unlocking the Potential of Diffusion Priors in Blind Face Restoration
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- TARA: Token-Aware LoRA for Composable Personalization in Diffusion Models
- CObL: Toward Zero-Shot Ordinal Layering without User Prompting
- CD-TVD: Contrastive Diffusion for 3D Super-Resolution with Scarce High-Resolution Time-Varying Data
- S2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix
- WeChat-YATT: A Scalable, Simple, Efficient, and Production Ready Training Library
- Diffusing the Blind Spot: Uterine MRI Synthesis with Diffusion Models
- LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering
- Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
- Comparison Reveals Commonality: Customized Image Generation through Contrastive Inversion
- Matrix-3D: Omnidirectional Explorable 3D World Generation
- DiffVC-OSD: One-Step Diffusion-based Perceptual Neural Video Compression Framework
- OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution
- A Spin Glass Characterization of Neural Networks
- Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
- Neural Bridge Processes
- Perceptual Evaluation of GANs and Diffusion Models for Generating X-rays
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
- D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
- Restage4D: Reanimating Deformable 3D Reconstruction from a Single Video
- Towards Robust Red-Green Watermarking for Autoregressive Image Generators
- CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation
- Multimodal learning with next-token prediction for large multimodal models
- Elastic Diffusion Transformer
- ContourDiff: Unpaired Medical Image Translation with Structural Consistency
- LightSwitch: Multi-view Relighting with Material-guided Diffusion
- FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation
- Meta-Learning for Speeding Up Large Model Inference in Decentralized Environments
- Multi-Objective Instruction-Aware Representation Learning in Procedural Content Generation RL
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- VISTAR:A User-Centric and Role-Driven Benchmark for Text-to-Image Evaluation
- Automated Code Development for PDE Solvers Using Large Language Models
- InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
- Improved Sub-Visible Particle Classification in Flow Imaging Microscopy via Generative AI-Based Image Synthesis
- ETA: Energy-based Test-time Adaptation for Depth Completion
- AnimateScene: Camera-controllable Animation in Any Scene
- Improving Diagnostic Accuracy for Oral Cancer with inpainting Synthesis Lesions Generated Using Diffusion Models
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- Clinically-guided Data Synthesis for Laryngeal Lesion Detection
- SynSeg: Feature Synergy for Multi-Category Contrastive Learning in End-to-End Open-Vocabulary Semantic Segmentation
- DreamVE: Unified Instruction-based Image and Video Editing
- GAP: Gaussianize Any Point Clouds with Text Guidance
- Hi3DEval: Advancing 3D Generation Evaluation with Hierarchical Validity
- WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
- Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
- Adapting Vision-Language Models Without Labels: A Comprehensive Survey
- Symmetry Understanding of 3D Shapes via Chirality Disentanglement
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation
- Align-for-Fusion: Harmonizing Triple Preferences via Dual-oriented Diffusion for Cross-domain Sequential Recommendation
- HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- Single-Step Reconstruction-Free Anomaly Detection and Segmentation via Diffusion Models
- BridgeDepth: Bridging Monocular and Stereo Reasoning with Latent Alignment
- Multitask Learning with Stochastic Interpolants
- One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion
- Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model
- TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
- Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting
- DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models
- IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control
- Conditional Latent Diffusion Models for Zero-Shot Instance Segmentation
- Slice or the Whole Pie? Utility Control for AI Models
- Generating Feasible and Diverse Synthetic Populations Using Diffusion Models
- StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback
- Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm
- Anti-Tamper Protection for Unauthorized Individual Image Generation
- LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences
- HPSv3: Towards Wide-Spectrum Human Preference Score
- CADD: Context aware disease deviations via restoration of brain images using normative conditional diffusion models
- Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
- RAAG: Ratio Aware Adaptive Guidance
- Learning Latent Representations for Image Translation using Frequency Distributed CycleGAN
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
- Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation
- Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
- Zero Shot Domain Adaptive Semantic Segmentation by Synthetic Data Generation and Progressive Adaptation
- ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
- Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
- Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems
- V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
- BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models
- SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance
- UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
- H3R: Hybrid Multi-view Correspondence for Generalizable 3D Reconstruction
- Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
- Multi-human Interactive Talking Dataset
- Separating Shared and Domain-Specific LoRAs for Multi-Domain Learning
- Diffusion Models with Adaptive Negative Sampling Without External Resources
- Injecting Measurement Information Yields a Fast and Noise-Robust Diffusion-Based Inverse Problem Solver
- FFHQ-Makeup: Paired Synthetic Makeup Dataset with Facial Consistency Across Multiple Styles
- MILD: Multi-Layer Diffusion Strategy for Complex and Precise Multi-IP Aware Human Erasing
- When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models
- LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation
- A Closed-Loop Multi-Agent Framework for Aerodynamics-Aware Automotive Styling Design
- LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
- How Diffusion Prior Landscapes Shape the Posterior in Blind Deconvolution
- RDDPM: Robust Denoising Diffusion Probabilistic Model for Unsupervised Anomaly Segmentation
- REFLECT: Rectified Flows for Efficient Brain Anomaly Correction Transport
- Rethinking Transparent Object Grasping: Depth Completion with Monocular Depth Estimation and Instance Mask
- Improving Generalization of Language-Conditioned Robot Manipulation
- Inference-time Scaling for Diffusion-based Audio Super-resolution
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- Qwen-Image Technical Report
- Dream-to-Recon: Monocular 3D Reconstruction with Diffusion-Depth Distillation from Single Images
- VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
- Forecasting When to Forecast: Accelerating Diffusion Models with Confidence-Gated Taylor
- Subject or Style: Adaptive and Training-Free Mixture of LoRAs
- DreamPainter: Image Background Inpainting for E-commerce Scenarios
- Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention
- Diffusion models for inverse problems
- QuaDreamer: Controllable Panoramic Video Generation for Quadruped Robots
- Proactive Disentangled Modeling of Trigger-Object Pairings for Backdoor Defense
- Improving Noise Efficiency in Privacy-preserving Dataset Distillation
- Versatile Transition Generation with Image-to-Video Diffusion
- MiraGe: Multimodal Discriminative Representation Learning for Generalizable AI-Generated Image Detection
- DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization
- Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning
- Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning
- Diffusion Models for Future Networks and Communications: A Comprehensive Survey
- Semantically-Guided Inference for Conditional Diffusion Models: Enhancing Covariate Consistency in Time Series Forecasting
- Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
- Can3Tok: Canonical 3D Tokenization and Latent Modeling of Scene-Level 3D Gaussians
- Physically-based Lighting Generation for Robotic Manipulation
- Artificial Intelligence and Misinformation in Art: Can Vision Language Models Judge the Hand or the Machine Behind the Canvas?
- NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection
- LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
- Personalized Safety Alignment for Text-to-Image Diffusion Models
- Dataset Condensation with Color Compensation
- UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
- ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
- COLLAGE: Adaptive Fusion-based Retrieval for Augmented Policy Learning
- DisTaC: Conditioning Task Vectors via Distillation for Robust Model Merging
- The Promise of RL for Autoregressive Image Editing
- Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
- Unraveling Hidden Representations: A Multi-Modal Layer Analysis for Better Synthetic Content Forensics
- LeakyCLIP: Extracting Training Data from CLIP
- Revisiting Adversarial Patch Defenses on Object Detectors: Unified Evaluation, Large-Scale Dataset, and New Insights
- GECO: Geometrically Consistent Embedding with Lightspeed Inference
- Training-Free Class Purification for Open-Vocabulary Semantic Segmentation
- DBLP: Noise Bridge Consistency Distillation For Efficient And Reliable Adversarial Purification
- Video Color Grading via Look-Up Table Generation
- Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
- AutoDebias: Automated Framework for Debiasing Text-to-Image Models
- SDMatte: Grafting Diffusion Models for Interactive Matting
- Reducing the gap between general purpose data and aerial images in concentrated solar power plants
- Diffusion-Based User-Guided Data Augmentation for Coronary Stenosis Detection
- Sel3DCraft: Interactive Visual Prompts for User-Friendly Text-to-3D Generation
- Contact-Aware Amodal Completion for Human-Object Interaction via Multi-Regional Inpainting
- Video Forgery Detection with Optical Flow Residuals and Spatial-Temporal Consistency
- Steering Guidance for Personalized Text-to-Image Diffusion Models
- AniMer+: Unified Pose and Shape Estimation Across Mammalia and Aves via Family-Aware Transformer
- ECGTwin: Personalized ECG Generation Using Controllable Diffusion Model
- LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
- Wind Power Scenario Generation based on the Generalized Dynamic Factor Model and Generative Adversarial Network
- BOOD: Boundary-based Out-Of-Distribution Data Generation
- ReCoSeg++:Extended Residual-Guided Cross-Modal Diffusion for Brain Tumor Segmentation
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- Minimum Data, Maximum Impact: 20 annotated samples for explainable lung nodule classification
- CIF: A Constrained Inversion Framework for Reliable Message Extraction in Diffusion-Based Generative Steganography
- Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence
- Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
- SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions
- MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- I2V-GS: Infrastructure-to-Vehicle View Transformation with Gaussian Splatting for Autonomous Driving Data Generation
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- MoGA: 3D Generative Avatar Prior for Monocular Gaussian Avatar Reconstruction
- Latent Diffusion Based Face Enhancement under Degraded Conditions for Forensic Face Recognition
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth Diffusion
- StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization
- UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
- Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures
- Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking Heads
- Training-free Geometric Image Editing on Diffusion Models
- PixNerd: Pixel Neural Field Diffusion
- Adversarial-Guided Diffusion for Multimodal LLM Attacks
- UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
- BS-1-to-N: Diffusion-Based Environment-Aware Cross-BS Channel Knowledge Map Generation for Cell-Free Networks
- The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models
- X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
- AUV-Fusion: Cross-Modal Adversarial Fusion of User Interactions and Visual Perturbations Against VARS
- DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
- Bi-Level Optimization for Self-Supervised AI-Generated Face Detection
- GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
- ShortFT: Diffusion Model Alignment via Shortcut-based Fine-Tuning
- Subtyping Breast Lesions via Generative Augmentation based Long-tailed Recognition in Ultrasound
- LoReUn: Data Itself Implicitly Provides Cues to Improve Machine Unlearning
- Exploiting Diffusion Prior for Task-driven Image Restoration
- TIR-Diffusion: Diffusion-based Thermal Infrared Image Denoising via Latent and Wavelet Domain Optimization
- On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations
- UFV-Splatter: Pose-Free Feed-Forward 3D Gaussian Splatting Adapted to Unfavorable Views
- Next Tokens Denoising for Speech Synthesis
- SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
Related