Scalable Diffusion Models with Transformers
2022/12/19 by William Peebles, Saining Xie, Peebles, William +1 · 1194 citations
Medicine · Computer Science · #Advanced Neuroimaging Techniques and Applications #Generative Adversarial Networks and Image Synthesis #Music and Audio Processing
paper · pdf · doi:10.48550/arxiv.2212.09748
Abstract
We explore a new class of diffusion models based on the transformer architecture. We train latent diffusion models of images, replacing the commonly-used U-Net backbone with a transformer that operates on latent patches. We analyze the scalability of our Diffusion Transformers (DiTs) through the lens of forward pass complexity as measured by Gflops. We find that DiTs with higher Gflops -- through increased transformer depth/width or increased number of input tokens -- consistently have lower FID. In addition to possessing good scalability properties, our largest DiT-XL/2 models outperform all prior diffusion models on the class-conditional ImageNet 512x512 and 256x256 benchmarks, achieving a state-of-the-art FID of 2.27 on the latter.
Cited by
- Qwen-Music Technical Report
- Stochastic Siamese MAE Pretraining for Longitudinal Medical Images
- Web World Models
- HY-Motion 1.0: Scaling Flow Matching Models for Text-To-Motion Generation
- Diffusion priors enhanced velocity model building from time-lag images using a neural operator
- Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization
- RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models
- Fusion or Confusion? Multimodal Complexity Is Not All You Need
- ShapeR: Robust Conditional 3D Shape Generation from Casual Captures
- FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- ViDS: Video Diffusion Shader using 3D Face Tracking
- EmoCtrl: Controllable Emotional Image Content Generation
- SpotEdit: Selective Region Editing in Diffusion Transformers
- Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
- Learning Sampling Parameters for Diffusion Models
- Restoration Flow Matching-Based Channel Refinement and Equalization Correction for MIMO Semantic Communications
- ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation
- MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving
- Normalizing Trajectory Models
- OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models
- STEER: Steerable Dyadic Head Avatars
- Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
- Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
- UMI3D: Robust 3D Generation on Unconstrained Multi-Image Inputs via Simultaneous Focus Cross-Attention Routing
- A Reference-Free Framework for Evaluating Single-Frame ISP Pipelines
- X-Stage: An Overlooked Pipeline Stage for Communication-Computation Overlap in DiT Inference
- Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
- Beyond Background Bias: Saliency-Driven Prototype Alignment for Dataset Distillation
- I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models
- ProEdit: Inversion-based Editing From Prompts Done Right
- MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
- T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
- Differencing the Diffusion Trajectory toward Uncertain Components for Time Series Forecasting
- ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing
- FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation
- Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning
- Autoregressive One-Step Generative Modeling for Dynamical System Forecasting
- Latent Space Probing for Adult Content Detection in Video Generative Models
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
- InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
- PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics
- Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
- Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
- StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
- SDUM: A Scalable Deep Unrolled Model for Universal MRI Reconstruction
- Physics-informed Diffusion Models for Multi-scale Prediction of Reference Signal Received Power in Wireless Networks
- HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
- GriDiT: Factorized Grid-Based Diffusion for Efficient Long Image Sequence Generation
- UltraShape 1.0: High-Fidelity 3D Shape Generation via Scalable Geometric Refinement
- Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
- Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
- DiEC: Diffusion Embedded Clustering
- Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification
- Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs
- DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
- MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
- LoLA: Long Horizon Latent Action Learning for General Robot Manipulation
- UMAMI: Unifying Masked Autoregressive Models and Deterministic Rendering for View Synthesis
- Block-Recurrent Dynamics in Vision Transformers
- SemanticGen: Video Generation in Semantic Space
- The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
- VA-π: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
- StoryMem: Multi-shot Long Video Storytelling with Memory
- Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
- Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface
- JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- OmniEgoCap: Camera-Agnostic Sequence-Level Egocentric Motion Reconstruction
- EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
- Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
- Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation
- Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
- Preserving Spectral Structure and Statistics in Diffusion Models
- Local Patches Meet Global Context: Scalable 3D Diffusion Priors for Computed Tomography Reconstruction
- MatE: Material Extraction from Single-Image via Geometric Prior
- DESSERT: Diffusion-based Event-driven Single-frame Synthesis via Residual Training
- Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
- Dexterous World Models
- RadarGen: Automotive Radar Point Cloud Generation from Cameras
- Mitty: Diffusion-based Human-to-Robot Video Generation
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- RoomEditor++: A Parameter-Sharing Diffusion Architecture for High-Fidelity Furniture Synthesis
- Next-Embedding Prediction Makes Strong Vision Learners
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
- Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation
- DeContext as Defense: Safe Image Editing in Diffusion Transformers
- Don't Guess, Escalate: Towards Explainable Uncertainty-Calibrated AI Forensic Agents
- ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation
- DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
- End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
- Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
- mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
- Large Video Planner Enables Generalizable Robot Control
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- IC-Effect: Precise and Efficient Video Effects Editing via In-Context Learning
- Reducing Pilots in Channel Estimation with Predictive Foundation Models
- ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision
- CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion
- Spatia: Video Generation with Updatable Spatial Memory
- Generative Preprocessing for Image Compression with Pre-trained Diffusion Models
- FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows
- Native and Compact Structured Latents for 3D Generation
- WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
- V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
- ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation
- SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling
- DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training
- PrediFlow: A Flow-Based Prediction-Refinement Framework for Real-Time Human Motion Prediction in Human-Robot Collaboration
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
- An evaluation of SVBRDF Prediction from Generative Image Models for Appearance Modeling of 3D Scenes
- Feedforward 3D Editing via Text-Steerable Image-to-3D
- Towards Interactive Intelligence for Digital Humans
- Directional Textual Inversion for Personalized Text-to-Image Generation
- World Models Can Leverage Human Videos for Dexterous Manipulation
- Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
- Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation
- Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10×
- PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence
- RecTok: Reconstruction Distillation along Rectified Flow
- KlingAvatar 2.0 Technical Report
- CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- Sequence of Expert: Boosting Imitation Planners for Autonomous Driving through Temporal Alternation
- SneakPeek: Future-Guided Instructional Streaming Video Generation
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
- Progressive Conditioned Scale-Shift Recalibration of Self-Attention for Online Test-time Adaptation
- Composite Classifier-Free Guidance for Multi-Modal Conditioning in Wind Dynamics Super-Resolution
- Resolution-Independent Neural Operators for Multi-Rate Sparse-View CT
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- SPDMark: Selective Parameter Displacement for Robust Video Watermarking
- V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- RePack then Refine: Efficient Diffusion Transformer with Vision Foundation Model
- BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
- FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint
- SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
- Flowception: Temporally Expansive Flow Matching for Video Generation
- JoyAvatar: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion
- PhraseVAE and PhraseLDM: Latent Diffusion for Full-Song Multitrack Symbolic Music Generation
- REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
- VFMF: World Modeling by Forecasting Vision Foundation Model Features
- Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation
- SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
- SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Bidirectional Normalizing Flow: From Data to Noise and Back
- Towards Efficient and Effective Multi-Camera Encoding for End-to-End Driving
- OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis
- Stronger Normalization-Free Transformers
- What matters for Representation Alignment: Global Information or Spatial Structure?
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- FALCON: Few-step Accurate Likelihoods for Continuous Flows
- Guided Transfer Learning for Discrete Diffusion Models
- AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
- DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
- UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
- Composing Concepts from Images and Videos via Concept-prompt Binding
- Learning Robot Manipulation from Audio World Models
- DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance
- VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification
- UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents
- FunPhase: A Periodic Functional Autoencoder for Motion Generation via Phase Manifolds
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- OmniPSD: Layered PSD Generation with Diffusion Transformer
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
- Food Image Generation on Multi-Noun Categories
- Astra: General Interactive World Model with Autoregressive Denoising
- Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
- UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
- CFO: Learning Continuous-Time PDE Dynamics via Flow-Matched Neural Operators
- Fast-ARDiff: An Entropy-informed Acceleration Framework for Continuous Space Autoregressive Generation
- OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds
- Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
- Inferring Compositional 4D Scenes without Ever Seeing One
- OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
- MolSculpt: Sculpting 3D Molecular Geometries from Chemical Syntax
- PAVAS: Physics-Aware Video-to-Audio Synthesis
- Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank
- Is Generation Required for Data-Efficient Perception?
- One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
- ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning
- MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation
- Training-Free Vector Quantization via Gaussian VAEs
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
- M-STAR: Multi-Scale Spatiotemporal Autoregression for Human Mobility Modeling
- Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach
- Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism
- D3-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction
- WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
- From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images
- UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
- JoPano: Unified Panorama Generation via Joint Modeling
- IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction
- Spatial Retrieval Augmented Autonomous Driving
- TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search
- MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- Scaling Zero-Shot Reference-to-Video Generation
- 3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization
- Rethinking Training Dynamics in Scale-wise Autoregressive Generation
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
- A Comparative Study on Synthetic Facial Data Generation Techniques for Face Recognition
- SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
- USV: Unified Sparsification for Accelerating Video Diffusion Models
- ProPhy: Progressive Physical Alignment for Dynamic World Simulation
- Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models
- Light-X: Generative 4D Video Rendering with Camera and Illumination Control
- BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image
- Reflection Removal through Efficient Adaptation of Diffusion Transformers
- StreamFlow: Theory, Algorithm, and Implementation for High-Efficiency Rectified Flow Generation
- Efficient Generative Transformer Operators For Million-Point PDEs
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World
- YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases
- Generative Recursive Reasoning
- ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild
- Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
- Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence
- COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
- Refaçade: Editing Object with Given Reference Texture
- VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
- Not All Birds Look The Same: Identity-Preserving Generation For Birds
- UniTS: Unified Time Series Generative Model for Remote Sensing
- UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
- ReflexFlow: Rethinking Learning Objective for Exposure Bias Alleviation in Flow Matching
- CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
- Decoding Large Language Diffusion Models with Foreseeing Movement
- MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
- SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows
- C3G: Learning Compact 3D Representations with 2K Gaussians
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
- LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling
- ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- On the Design of One-step Diffusion via Shortcutting Flow Paths
- Beyond Boundary Frames: Context-Centric Video Interpolation with Audio-Visual Semantics
- AdaPower: Specializing World Foundation Models for Predictive Manipulation
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation
- CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
- GeoVideo: Introducing Geometric Regularization into Video Generation Model
- SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
- PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation
- MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues
- CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models
- Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
- MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra
- TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- YingVideo-MV: Music-Driven Multi-Stage Video Generation
- Safeguarded Stochastic Polyak Step Sizes for Non-smooth Optimization: Robust Performance Without Small (Sub)Gradients
- Understanding and Harnessing Sparsity in Unified Multimodal Models
- Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
- Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
- Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation
- Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
- Weight Space Representation Learning via Neural Field Adaptation
- Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
- ViT3: Unlocking Test-Time Training in Vision
- Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- Modality-Augmented Fine-Tuning of Foundation Robot Policies for Cross-Embodiment Manipulation on GR1 and G1
- TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
- Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
- ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
- DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models
- Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model
- CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception and Understanding
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- TrajDiff: End-to-end Autonomous Driving without Perception Annotation
- Silhouette-based Gait Foundation Model
- Cosine-Similarity Methods for Efficient Training and Sampling in High-Dimensional Latent Spaces
- LAP: Fast LAtent Diffusion Planner for Autonomous Driving
- Digital Surfactant
- CC-FMO: Camera-Conditioned Zero-Shot Single Image to 3D Scene Generation with Foundation Model Orchestration
- WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
- Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models
- UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations
- PhysGen: Physically Grounded 3D Shape Generation for Industrial Design
- Image Generation as a Visual Planner for Robotic Manipulation
- What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards
- AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
- DisMo: Disentangled Motion Representations for Open-World Motion Transfer
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- Vision Bridge Transformer at Scale
- DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
- GOATex: Geometry & Occlusion-Aware Texturing
- Guiding Visual Autoregressive Models through Spectrum Weakening
- McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning
- BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation
- One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer
- db-SP: Accelerating Sparse Attention for Visual Generative Models with Dual-Balanced Sequence Parallelism
- Overcoming the Curvature Bottleneck in MeanFlow
- Scalable Diffusion Transformer for Conditional 4D fMRI Synthesis
- InstanceV: Instance-Level Video Generation
- Markovian Scale Prediction: A New Era of Visual Autoregressive Generation
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
- Adversarial Flow Models
- Canvas-to-Image: Compositional Image Generation with Multimodal Controls
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer
- MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices
- Going with the Speed of Sound: Pushing Neural Surrogates into Highly-turbulent Transonic Regimes
- MeanFlow Transformers with Representation Autoencoders
- 3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
- Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning
- SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
- Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
- FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain
- Deep Parameter Interpolation for Scalar Conditioning
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
- Layer-Aware Video Composition via Split-then-Merge
- DINO-Tok: Adapting DINO for Visual Tokenizers
- A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
- PixelDiT: Pixel Diffusion Transformers for Image Generation
- MotionV2V: Editing Motion in a Video
- iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
- Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
- HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
- FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
- STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
- A Training-Free Approach for Multi-ID Customization via Attention Adjustment and Spatial Control
- Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations
- PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
- Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
- UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- Low-Resolution Editing is All You Need for High-Resolution Editing
- Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks
- Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation
- Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation
- ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
- Terminal Velocity Matching
- Cloud4D: Estimating Cloud Properties at a High Spatial and Temporal Resolution
- Flow Map Distillation Without Data
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation
- SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis
- Learning Plug-and-play Memory for Guiding Video Diffusion Models
- EnfoPath: Energy-Informed Analysis of Generative Trajectories in Flow Matching
- Understanding, Accelerating, and Improving MeanFlow Training
- View-Consistent Diffusion Representations for 3D-Consistent Video Generation
- Eevee: Towards Close-up High-resolution Video-based Virtual Try-on
- One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
- FVAR: Visual Autoregressive Modeling via Next Focus Prediction
- FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
- DiP: Taming Diffusion Models in Pixel Space
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- LATTICE: Democratize High-Fidelity 3D Generation at Scale
- Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
- Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation
- Demystifying Diffusion Objectives: Reweighted Losses are Better Variational Bounds
- Zero-Shot Video Deraining with Video Diffusion Models
- TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
- EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
- Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
- UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
- Plan-X: Instruct Video Generation via Semantic Planning
- RynnVLA-002: A Unified Vision-Language-Action and World Model
- Counterfactual World Models via Digital Twin-conditioned Video Diffusion
- PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention
- One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- Spanning Tree Autoregressive Visual Generation
- DepthFocus: Controllable Depth Estimation for See-Through Scenes
- UAM: A Unified Attention-Mamba Backbone of Multimodal Framework for Tumor Cell Classification
- Loomis Painter: Reconstructing the Painting Process
- TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing
- TFCDiff: Robust ECG Denoising via Time-Frequency Complementary Diffusion
- Flow and Depth Assisted Video Prediction with Latent Transformer
- Decoupling Complexity from Scale in Latent Diffusion Model
- NaTex: Seamless Texture Generation as Latent Color Diffusion
- Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
- Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
- Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
- First Frame Is the Place to Go for Video Content Customization
- Generative Photographic Control for Scene-Consistent Video Cinematic Editing
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
- SplitFlux: Learning to Decouple Content and Style from a Single Image
- Insert In Style: A Zero-Shot Generative Framework for Harmonious Cross-Domain Object Composition
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
- InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- ActVAR: Activating Mixtures of Weights and Tokens for Efficient Visual Autoregressive Generation
- Training-Free Multi-View Extension of IC-Light for Textual Position-Aware Scene Relighting
- Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos
- GenTract: Generative Global Tractography
- Distribution Matching Distillation Meets Reinforcement Learning
- Scalable Simulation-Based Model Inference with Test-Time Complexity Control
- EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
- DINO-Detect: A Simple yet Effective Framework for Blur-Robust AI-Generated Image Detection
- Decoupled Action Head: Confining Task Knowledge to Conditioning Layers
- Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
- GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
- EgoCogNav: Cognition-aware Human Egocentric Navigation
- Arcee: Differentiable Recurrent State Chain for Generative Vision Modeling with Mamba SSMs
- Scalable Policy Evaluation with Video World Models
- A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation
- MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
- Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions
- Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
- Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- oboro: Text-to-Image Synthesis on Limited Data using Flow-based Diffusion Transformer with MMH Attention
- Guiding Generative Models to Uncover Diverse and Novel Crystals via Reinforcement Learning
- E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
- GNN-Enabled Robust Hybrid Beamforming with Score-Based CSI Generation and Denoising
- RelightMaster: Precise Video Relighting with Multi-plane Light Images
- Latent Refinement via Flow Matching for Training-free Linear Inverse Problem Solving
- Neodragon: Mobile Video Generation using Diffusion Transformer
- Enhancing Diffusion Model Guidance through Calibration and Regularization
- VLM-driven Skill Selection for Robotic Assembly Tasks
- On Flow Matching KL Divergence
- Rethinking Metrics and Diffusion Architecture for 3D Point Cloud Generation
- TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
- Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark
- MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
- Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
- Diffusion Transformer meets Multi-level Wavelet Spectrum for Single Image Super-Resolution
- Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models
- SE(3)-PoseFlow: Estimating 6D Pose Distributions for Uncertainty-Aware Robotic Manipulation
- Fractional Diffusion Bridge Models
- Lightweight Learning from Actuation-Space Demonstrations via Flow Matching for Whole-Body Soft Robotic Grasping
- Towards One-step Causal Video Generation via Adversarial Self-Distillation
- The Hidden Power of Normalization Layers in Neural Networks: Exponential Capacity Control
- RefVTON: person-to-person Try on with Additional Unpaired Visual Reference
- Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
- Occlusion-Aware Diffusion Model for Pedestrian Intention Prediction
- MIFO: Learning and Synthesizing Multi-Instance from One Image
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- iFlyBot-VLA Technical Report
- MagicView: Multi-View Consistent Identity Customization via Priors-Guided In-Context Learning
- Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges
- Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
- E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
- Learning Generalizable Visuomotor Policy through Dynamics-Alignment
- Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
- MolChord: Structure-Sequence Alignment for Protein-Guided Drug Design
- Emu3.5: Native Multimodal Models are World Learners
- Co-Evolving Latent Action World Models
- UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
- LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
- Denoising Refinement Diffusion Models for Simultaneous Generation of Multi-scale Mobile Network Traffic
- π_
RL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models - VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- RegionE: Adaptive Region-Aware Generation for Efficient Image Editing
- HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models
- Flow Map Learning via Nongradient Vector Flow
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer
- Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation
- Product-Quantised Image Representation for High-Quality Image Synthesis
- Paris: A Decentralized Trained Open-Weight Diffusion Model
- Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method
- BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation
- Neural Texture Compression using Hypernetworks
- Surflo: Consistent 3D Surface Flow Model with Global State
- S23DR 2026 Winning Solution
- Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- Alice v1: Distillation-Enhanced Video Generation Surpassing Closed-Source Models
- SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
- SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Generative Modeling via Drifting
- Distance Marching for Generative Modeling
- Walk through Paintings: Egocentric World Models from Internet Priors
- What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
- Generative View Stitching
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Group Relative Attention Guidance for Image Editing
- UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
- Bayesian Speech synthesizers Can Learn from Multiple Teachers
- ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
- Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
- Neural USD: An object-centric framework for iterative editing and control
- TRELLISWorld: Training-Free World Generation from Object Generators
- RareFlow: Physics-Aware Flow-Matching for Cross-Sensor Super-Resolution of Rare-Earth Features
- Sequence Modeling with Spectral Mean Flows
- A Survey on Efficient Vision-Language-Action Models
- FARMER: Flow AutoRegressive Transformer over Pixels
- Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
- FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
- Sampling from Energy distributions with Target Concrete Score Identity
- Mixed-Density Diffuser: Efficient Planning with Non-Uniform Temporal Resolution
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- Simple Denoising Diffusion Language Models
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- On the Anisotropy of Score-Based Generative Models
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- SeeDNorm: Self-Rescaled Dynamic Normalization
- LO-SDA: Latent Optimization for Score-based Atmospheric Data Assimilation
- CANDI: Hybrid Discrete-Continuous Diffusion Models
- PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
- GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- ACG: Action Coherence Guidance for Flow-based VLA models
- LongCat-Video Technical Report
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- BachVid: Training-Free Video Generation with Consistent Background and Character
- StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks
- FlowSynth: Instrument Generation Through Distributional Flow Matching and Test-Time Search
- Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
- Enhancing Video Inpainting with Aligned Frame Interval Guidance
- TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
- Sparser Block-Sparse Attention via Token Permutation
- Improved Training Technique for Shortcut Models
- World Models Should Prioritize the Unification of Physical and Social Dynamics
- Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- Distilled Decoding 2: One-step Sampling of Image Auto-regressive Models with Conditional Score Distillation
- Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- Video-As-Prompt: Unified Semantic Control for Video Generation
- Preventing Shortcuts in Adapter Training via Providing the Shortcuts
- Positional Encoding Field
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- Evaluating Video Models as Simulators of Multi-Person Pedestrian Trajectories
- Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics
- Attentive Convolution: Unifying the Expressivity of Self-Attention with Convolutional Efficiency
- DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
- AlphaFlow: Understanding and Improving MeanFlow Models
- LayerComposer: Multi-Human Personalized Generation via Layered Canvas
- Diffusion Autoencoders with Perceivers for Long, Irregular and Multimodal Astronomical Sequences
- Exploring Conditions for Diffusion models in Robotic Control
- UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
- Guiding diffusion models to reconstruct flow fields from sparse data
- A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
- GigaBrain-0: A World Model-Powered Vision-Language-Action Model
- Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- D2D: Detector-to-Differentiable Critic for Improved Numeracy in Text-to-Image Generation
- UltraGen: High-Resolution Video Generation with Hierarchical Attention
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose Estimation
- SegTune: Structured and Fine-Grained Control for Song Generation
- MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
- Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
- VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
- Latent-Augmented Discrete Diffusion Models
- Accelerating Vision Transformers with Adaptive Patch Sizes
- Demystifying Transition Matching: When and Why It Can Beat Flow Matching
- Unbiased Gradient Low-Rank Projection
- RaindropGS: A Benchmark for 3D Gaussian Splatting under Raindrop Conditions
- L2P: Unlocking Latent Potential for Pixel Generation
- Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning
- On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
- Soft-Masked Diffusion Language Models
- Fighter: Unveiling the Graph Convolutional Nature of Transformers in Time Series Modeling
- Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling
- Boosting Fidelity for Pre-Trained-Diffusion-Based Low-Light Image Enhancement via Condition Refinement
- Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
- Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling
- One-step Diffusion Models with Bregman Density Ratio Matching
- Efficient High-Accuracy PDEs Solver with the Linear Attention Neural Operator
- Class-N-Diff: Classification-Induced Diffusion Model Can Make Fair Skin Cancer Diagnosis
- H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows
- Latent Diffusion Model without Variational Autoencoder
- AB-UPT for Automotive and Aerospace Applications
- Cost Savings from Automatic Quality Assessment of Generated Images
- The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
- AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
- Learning an Image Editing Model without Image Editing Pairs
- Terra: Explorable Native 3D World Model with Point Latents
- Ponimator: Unfolding Interactive Pose for Versatile Human-human Interaction Animation
- WithAnyone: Towards Controllable and ID Consistent Image Generation
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- Scaling Tumor Segmentation: Best Lessons from Real and Synthetic Data
- Inpainting the Red Planet: Diffusion Models for the Reconstruction of Martian Environments in Virtual Reality
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Matcha: Multi-Stage Riemannian Flow Matching for Accurate and Physically Valid Molecular Docking
- Exploring Image Representation with Decoupled Classical Visual Descriptors
- Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning
- From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance
- TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- DeDelayed: Deleting Remote Inference Delay via On-Device Correction
- Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
- End-to-End Multi-Modal Diffusion Mamba
- UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy
- PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- FlashWorld: High-quality 3D Scene Generation within Seconds
- SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
- A Connection Between Score Matching and Local Intrinsic Dimension
- FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution
- CoRA: Covariate-Aware Adaptation of Time Series Foundation Models
- LayerSync: Self-aligning Intermediate Layers
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- BIGFix: Bidirectional Image Generation with Token Fixing
- Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
- Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
- Diffusion Transformers with Representation Autoencoders
- EReLiFM: Evidential Reliability-Aware Residual Flow Meta-Learning for Open-Set Domain Generalization under Noisy Labels
- There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- PAINT: Parallel-in-time Neural Twins for Dynamical System Reconstruction
- Efficient Inference for Coupled Hidden Markov Models in Continuous Time and Discrete Space
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
- Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
- Self-Forcing++: Towards Minute-Scale High-Quality Video Generation
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
- Joint Discriminative-Generative Modeling via Dual Adversarial Training
- DiffStyleTS: Diffusion Model for Style Transfer in Time Series
- Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation
- DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
- WaveletDiff: Multilevel Wavelet Diffusion For Time Series Generation
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- CSI Prediction Using Diffusion Models
- AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Unified Open-World Segmentation with Multi-Modal Prompts
- Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
- Latent Retrieval Augmented Generation of Cross-Domain Protein Binders
- ProteinAE: Protein Diffusion Autoencoders for Structure Encoding
- DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis
- EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
- Multi-Scale Diffusion Transformer for Jointly Simulating User Mobility and Mobile Traffic Pattern
- SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
- Tapered Language Models
- DreamX-World 1.0: A General-Purpose Interactive World Model
- Asymmetric Flow Models
- SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- FreeViS: Training-free Video Stylization with Inconsistent References
- Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
- DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
- Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- HeadsUp! High-Fidelity Portrait Image Super-Resolution
- Graph Diffusion Transformers are In-Context Molecular Designers
- MultiCOIN: Multi-Modal COntrollable Video INbetweening
- FreqCa: Accelerating Diffusion Models via Frequency-Aware Caching
- SummDiff: Generative Modeling of Video Summarization with Diffusion
- MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
- Hyperspectral data augmentation with transformer-based diffusion models
- TIGER: A Topology-Agnostic, Hierarchical Graph Network for Event Reconstruction
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- FlowLensing: Simulating Gravitational Lensing with Flow Matching
- IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction
- SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
- Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
- FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control
- TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
- VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
- LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
- DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
- Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers
- WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
- MATRIX: Mask Track Alignment for Interaction-aware Video Generation
- Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
- Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation
- Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers
- A Diffusion Model for Regular Time Series Generation from Irregular Data with Completion and Masking
- Heptapod: Language Modeling on Visual Signals
- scPPDM: A Diffusion Model for Single-Cell Drug-Response Prediction
- GyroSwin: 5D Surrogates for Gyrokinetic Plasma Turbulence Simulations
- DreamOmni2: Multimodal Instruction-based Editing and Generation
- SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation
- Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model
- Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
- Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
- \bfD3QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
- The Safety Challenge of World Models for Embodied AI Agents: A Review
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- VCoT-Grasp: Grasp Foundation Models with Visual Chain-of-Thought Reasoning for Language-driven Grasp Generation
- Fine-Tuning Masked Diffusion for Provable Self-Correction
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
- A Data-Driven Prism: Multi-View Source Separation with Diffusion Model Priors
- Factuality Matters: When Image Generation and Editing Meet Structured Visuals
- FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation
- StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion
- Learning to Generate Rigid Body Interactions with Video Diffusion Models
- Pack and Force Your Memory: Long-form and Consistent Video Generation
- Diffusion Transformers for Imputation: Statistical Efficiency and Uncertainty Quantification
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
- Contrastive Representation Regularization for Vision-Language-Action Models
- REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization
- Pulp Motion: Framing-aware multimodal camera and human motion generation
- LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
- UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
- FoilDiff: A Hybrid Transformer Backbone for Diffusion-based Modelling of 2D Airfoil Flow Fields
- Scaling Sequence-to-Sequence Generative Neural Rendering
- Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Drax: Speech Recognition with Discrete Flow Matching
- MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator
- ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
- MASC: Boosting Autoregressive Image Generation with a Manifold-Aligned Semantic Clustering
- Generating Human Motion Videos using a Cascaded Text-to-Video Framework
- Proximal Diffusion Neural Sampler
- Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
- Neon: Negative Extrapolation From Self-Training Improves Image Generation
- Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Memory Forcing: Spatio-Temporal Memory for Consistent Scene Generation on Minecraft
- What Drives Compositional Generalization in Visual Generative Models?
- When and Where do Events Switch in Multi-Event Video Generation?
- SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
- FlexiQ: Adaptive Mixed-Precision Quantization for Latency/Accuracy Trade-Offs in Deep Neural Networks
- Purrception: Variational Flow Matching for Vector-Quantized Image Generation
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- Warm-Starting Optimization-Based Motion Planning for Robotic Manipulators via Point Cloud-Conditioned Flow Matching
- Image Generation Based on Image Style Extraction
- LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration
- IMAGEdit: Let Any Subject Transform
- Syntax-Guided Diffusion Language Models with User-Integrated Personalization
- SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model
- Arbitrary Generative Video Interpolation
- Cascaded Diffusion Framework for Probabilistic Coarse-to-Fine Hand Pose Estimation
- InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
- Learn to Guide Your Diffusion Model
- Selective Underfitting in Diffusion Models
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
- AReUReDi: Annealed Rectified Updates for Refining Discrete Flows with Multi-Objective Guidance
- Flow Autoencoders are Effective Protein Tokenizers
- Post-Training Quantization for Audio Diffusion Transformers
- Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
- Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- DA2: Depth Anything in Any Direction
- Video Object Segmentation-Aware Audio Generation
- HilbertA: Hilbert Attention for Image Generation with Diffusion Models
- Post-Training Quantization via Residual Truncation and Zero Suppression for Diffusion Models
- AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- Refine Drugs, Don't Complete Them: Uniform-Source Discrete Flows for Fragment-Based Drug Discovery
- MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- LieHMR: Autoregressive Human Mesh Recovery with SO(3) Diffusion
- LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing
- OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation
- LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
- Reframing Generative Models for Physical Systems using Stochastic Interpolants
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
- FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
- Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
- Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
- Score Distillation of Flow Matching Models
- SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation
- SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution
- Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
- ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation
- MarS-FM: Generative Modeling of Molecular Dynamics via Markov State Models
- VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
- U-DiT Policy: U-shaped Diffusion Transformers for Robotic Manipulation
- CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
- CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers
- RapidMV: Leveraging Spatio-Angular Representations for Efficient and Consistent Text-to-Multi-View Synthesis
- UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
- Real-Aware Residual Model Merging for Deepfake Detection
- NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis
- Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
- FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation
- UniVid: The Open-Source Unified Video Model
- PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion
- Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- Fidelity-Aware Data Composition for Robust Robot Generalization
- DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
- Fast, accurate, and precise detector simulation with vision transformers
- Personalized Vision via Visual In-Context Learning
- SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
- Scalable GANs with Transformers
- Training Agents Inside of Scalable World Models
- SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
- OAT-FM: Optimal Acceleration Transport for Improved Flow Matching
- FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation
- Editing Physiological Signals in Videos Using Latent Representations
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- GeoFunFlow: Geometric Function Flow Matching for Inverse Operator Learning over Complex Geometries
- Autoregressive Video Generation beyond Next Frames Prediction
- SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
- VoiceBridge: Designing Latent Bridge Models for General Speech Restoration at Scale
- Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution
- Reinforcement Learning with Inverse Rewards for World Model Post-training
- HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
- AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
- StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer
- CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement
- DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
- Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models
- HunyuanImage 3.0 Technical Report
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
- Stochastic Interpolants via Conditional Dependent Coupling
- Impute-MACFM: Imputation based on Mask-Aware Flow Matching
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- RefAM: Attention Magnets for Zero-Shot Referral Segmentation
- Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
- WoW: Towards a World omniscient World model Through Embodied Interaction
- Scale-Wise VAR is Secretly Discrete Diffusion
- LongLive: Real-time Interactive Long Video Generation
- LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer
- Decoding quantum low density parity check codes with diffusion
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- Aurora: Towards Universal Generative Multimodal Time Series Forecasting
- FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing
- Factor-Based Conditional Diffusion Model for Portfolio Optimization
- MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
- Generation Properties of Stochastic Interpolation under Finite Training Set
- Taming Flow-based I2V Models for Creative Video Editing
- Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers
- StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
- DiTraj: training-free trajectory control for video diffusion transformer
- LongScape: Advancing Long-Horizon Embodied World Models with Context-Aware MoE
- MusicWeaver: Programmable Long-Form Music Generation with Provably Local Editing
- No Alignment Needed for Generation: Learning Linearly Separable Representations in Diffusion Models
- Does FLUX Already Know How to Perform Physically Plausible Image Composition?
- UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition
- SPREAD: Sampling-based Pareto front Refinement via Efficient Adaptive Diffusion
- DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
- Flow Matching in the Low-Noise Regime: Pathologies and a Contrastive Remedy
- FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
- NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics
- FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
- Parse-Augment-Distill: Learning Generalizable Bimanual Visuomotor Policies from Single Human Video
- Rectified Decoupled Dataset Distillation: A Closer Look for Fair and Comprehensive Evaluation
- CAMILA: Context-Aware Masking for Image Editing with Language Alignment
- Frame-based Equivariant Diffusion Models for 3D Molecular Generation
- ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
- World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models
- QuantWAMs: Calibrating at the Right Granularity for World Action Models
- From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data
- Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
- ELF: Embedded Language Flows
- Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes
- 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image
- MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
- ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models
- Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
- Use What You Know: Causal Foundation Models with Partial Graphs
- World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- FlexSED: Towards Open-Vocabulary Sound Event Detection
- Training-Free Multi-Style Fusion Through Reference-Based Adaptive Modulation
- Residual Off-Policy RL for Finetuning Behavior Cloning Policies
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- Flow marching for a generative PDE foundation model
- OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- Optimizing Inference in Transformer-Based Models: A Multi-Method Benchmark
- StereoFoley: Object-Aware Stereo Audio Generation from Video
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
- SISMA: Semantic Face Image Synthesis with Mamba
- Audio Super-Resolution with Latent Bridge Models
- TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
- OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
- HOGraspFlow: Exploring Vision-based Generative Grasp Synthesis with Hand-Object Priors and Taxonomy Awareness
- Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
- VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
- History-Aware Visuomotor Policy Learning via Point Tracking
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
- JCo-MVTON: Jointly Controllable Multi-Modal Diffusion Transformer for Mask-Free Virtual Try-on
- GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
- FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models
- CGTGait: Collaborative Graph and Transformer for Gait Emotion Recognition
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Dynamic Objects Relocalization in Changing Environments with Flow Matching
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling
- Lynx: Towards High-Fidelity Personalized Video Generation
- SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
- Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
- Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice
- Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
- CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
- MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis
- Dataset Distillation for Super-Resolution without Class Labels and Pre-trained Models
- FlowCast-ODE: Continuous Hourly Weather Forecasting with Dynamic Flow Matching and ODE Solver
- DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
- TinySR: Pruning Diffusion for Real-World Image Super-Resolution
- AToken: A Unified Tokenizer for Vision
- DreamControl: Human-Inspired Whole-Body Humanoid Control for Scene Interaction via Guided Diffusion
- MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies
- MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling
- EDITS: Enhancing Dataset Distillation with Implicit Textual Semantics
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation
- DiCache: Let Diffusion Model Determine Its Own Cache
- BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching
- MobiGPT: A Foundation Model for Mobile Wireless Networks
- SpeechOp: Inference-Time Task Composition for Generative Speech Processing
- AIM 2025 Low-light RAW Video Denoising Challenge: Dataset, Methods and Results
- ShortListing Model: A Streamlined SimplexDiffusion for Discrete Variable Generation
- FoundDiff: Foundational Diffusion Model for Generalizable Low-Dose CT Denoising
- AERIS: Argonne Earth Systems Model for Reliable and Skillful Predictions
- Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation
- SPGen: Spherical Projection as Consistent and Flexible Representation for Single Image 3D Shape Generation
- Image Tokenizer Needs Post-Training
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- HoloGarment: 360° Novel View Synthesis of In-the-Wild Garments
- SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation
- PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models
- ToMA: Token Merge with Attention for Diffusion Models
- InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis
- HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching
- Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
- DiFlow-TTS: Discrete Flow Matching with Factorized Speech Tokens for Low-Latency Zero-Shot Text-To-Speech
- Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
- Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios
- CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
- Integrating Anatomical Priors into a Causal Diffusion Model
- MoWE : A Mixture of Weather Experts
- Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
- Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video
- X-Part: high fidelity and structure coherent shape decomposition
- ArtifactGen: Benchmarking WGAN-GP vs Diffusion for Label-Aware EEG Artifact Synthesis
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- A Generalisable Generative Model for Multi-Detector Calorimeter Simulation
- Reconstruction Alignment Improves Unified Multimodal Models
- Scaling Transformer-Based Novel View Synthesis Models with Token Disentanglement and Synthetic Data
- UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward
- LLaDA-VLA: Vision Language Diffusion Action Models
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- Physics-Guided Diffusion Transformer with Spherical Harmonic Posterior Sampling for High-Fidelity Angular Super-Resolution in Diffusion MRI
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Home-made Diffusion Model from Scratch to Hatch
- EditIDv2: Editable ID Customization with Data-Lubricated ID Feature Integration for Text-to-Image Generation
- SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
- STADI: Fine-Grained Step-Patch Diffusion Parallelism for Heterogeneous GPUs
- veScale: Consistent and Efficient Tensor Programming with Eager-Mode SPMD
- Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image -- Technical Preview
- Transition Models: Rethinking the Generative Learning Objective
- From Editor to Dense Geometry Estimator
- Hyper Diffusion Avatars: Dynamic Human Avatar Generation using Network Weight Space Diffusion
- Human Motion Video Generation: A Survey
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
- LuxDiT: Lighting Estimation with Video Diffusion Transformer
- Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- Unifi3D: A Study on 3D Representations for Generation and Reconstruction in a Common Framework
- Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation
- Latent Gene Diffusion for Spatial Transcriptomics Completion
- OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- CbLDM: A Diffusion Model for recovering nanostructure from atomic pair distribution function
- Latent Space Single-Pixel Imaging Under Low-Sampling Conditions
- FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus
- Bidirectional Sparse Attention for Faster Video Diffusion Training
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- DarkVRAI: Capture-Condition Conditioning and Burst-Order Selective Scan for Low-light RAW Video Denoising
- HADIS: Hybrid Adaptive Diffusion Model Serving for Efficient Text-to-Image Generation
- Any-Order Flexible Length Masked Diffusion
- Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
- Is Synthetic Image Augmentation Useful for Imbalanced Classification Problems? Case-Study on the MIDOG2025 Atypical Cell Detection Competition
- DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective
- Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online
- ECHO: Ego-Centric modeling of Human-Object interactions
- Stage-Diff: Stage-wise Long-Term Time Series Generation Based on Diffusion Models
- PHD: Personalized 3D Human Body Fitting with Point Diffusion
- EEGDM: Learning EEG Representation with Latent Diffusion Model
- CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
- SceneGen: Single-Image 3D Scene Generation in One Feedforward Pass
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Mixture of Contexts for Long Video Generation
- Waver: Wave Your Way to Lifelike Video Generation
- FastFit: Accelerating Multi-Reference Virtual Try-On via Cacheable Diffusion Models
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- Fast 3D Diffusion for Scalable Granular Media Synthesis
- ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
- On Surjectivity of Neural Networks: Can you elicit any behavior from your model?
- VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- ROSE: Remove Objects with Side Effects in Videos
- Scaffold Diffusion: Sparse Multi-Category Voxel Structure Generation with Discrete Diffusion
- SAT-SKYLINES: 3D Building Generation from Satellite Imagery and Coarse Geometric Priors
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception
- Visual Autoregressive Modeling for Instruction-Guided Image Editing
- Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration
- HandCraft: Dynamic Sign Generation for Synthetic Data Augmentation
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states
- InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing
- OmniTry: Virtual Try-On Anything without Masks
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
- Precise Action-to-Video Generation Through Visual Action Prompts
- Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- FlowMol3: Flow Matching for 3D De Novo Small-Molecule Generation
- Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models
- EgoTwin: Dreaming Body and View in First Person
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- Matrix-game 2.0: An open-source real-time and streaming interactive world model
- CTFlow: Video-Inspired Latent Flow Matching for 3D CT Synthesis
- Next Visual Granularity Generation
- StyleMM: Stylized 3D Morphable Face Model via Text-Driven Aligned Image Translation
- Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
- ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing
- Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
- TweezeEdit: Consistent and Efficient Image Editing with Path Regularization
- SynBrain: Enhancing Visual-to-fMRI Synthesis via Probabilistic Representation Learning
- BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
- A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
- LIA-X: Interpretable Latent Portrait Animator
- Enhancing Diffusion Face Generation with Contrastive Embeddings and SegFormer Guidance
- Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
- GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors
- Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
- Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
- Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
- TaoCache: Structure-Maintained Video Generation Acceleration
- Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
- Transient Noise Removal via Diffusion-based Speech Inpainting
- DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
- RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space
- GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- Cut2Next: Generating Next Shot via In-Context Tuning
- Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control
- TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
- S2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix
- Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
- Grouped Speculative Decoding for Autoregressive Image Generation
- LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- Exploiting Layer Normalization Fine-tuning in Visual Transformer Foundation Models for Classification
- Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation
- Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
- Neural Bridge Processes
- DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
- Towards High-Order Mean Flow Generative Models: Feasibility, Expressivity, and Provably Efficient Criteria
- RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video
- CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping
- Multimodal learning with next-token prediction for large multimodal models
- Elastic Diffusion Transformer
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- Fast, Convex and Conditioned Network for Multi-Fidelity Vectors and Stiff Univariate Differential Equations
- KnapFormer: An Online Load Balancer for Efficient Diffusion Transformers Training
- WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
- Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
- PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation
- REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
- HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model
- LayerT2V: Interactive Multi-Object Trajectory Layering for Video Generation
- Conditional Latent Diffusion Models for Zero-Shot Instance Segmentation
- LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences
- CADD: Context aware disease deviations via restoration of brain images using normative conditional diffusion models
- SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
- RAAG: Ratio Aware Adaptive Guidance
- Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation
- Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems
- Multi-human Interactive Talking Dataset
- DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework
- Forecasting When to Forecast: Accelerating Diffusion Models with Confidence-Gated Taylor
- Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
- Imbalance-Robust and Sampling-Efficient Continuous Conditional GANs via Adaptive Vicinal Learning and Auxiliary Regularization
- Can3Tok: Canonical 3D Tokenization and Latent Modeling of Scene-Level 3D Gaussians
- Enhancing Diffusion-based Dataset Distillation via Adversary-Guided Curriculum Sampling
- Dataset Condensation with Color Compensation
- Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
- DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
- Video Forgery Detection with Optical Flow Residuals and Spatial-Temporal Consistency
- Steering Guidance for Personalized Text-to-Image Diffusion Models
- ECGTwin: Personalized ECG Generation Using Controllable Diffusion Model
- LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
- On Learning Closed-Loop Probabilistic Multi-Agent Simulator
- Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-rigid Shape Matching
- DivControl: Knowledge Diversion for Controllable Image Generation
- Mitigating Resolution-Drift in Federated Learning: Case of Keypoint Detection
- PixNerd: Pixel Neural Field Diffusion
- Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath Prediction
- HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
- DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
- HDR Environment Map Estimation with Latent Diffusion Models
- GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
- MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
- Generative Pre-training for Subjective Tasks: A Diffusion Transformer-Based Framework for Facial Beauty Prediction
- Local Prompt Adaptation for Style-Consistent Multi-Object Generation in Diffusion Models
- SCALAR: Scale-wise Controllable Visual Autoregressive Learning
- Data Augmentation for Spoken Grammatical Error Correction
- Reconstruct or Generate: Exploring the Spectrum of Generative Modeling for Cardiac MRI
- A New One-Shot Federated Learning Framework for Medical Imaging Classification with Feature-Guided Rectified Flow and Knowledge Distillation
- PDT: Point Distribution Transformation with Diffusion Models
- A Survey of Multimodal Hallucination Evaluation and Detection
- Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis
- BokehDiff: Neural Lens Blur with One-Step Diffusion
- TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
- Captain Cinema: Towards Short Movie Generation
- Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows
- Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement
- Demystify Protein Generation with Hierarchical Conditional Diffusion Models
- Applications of modular co-design for <i>de novo</i> 3D molecule generation
Related