Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
2023/11/25 by Andreas Blattmann, Blattmann, Andreas, Tim Dockhorn +21 · 460 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
paper · pdf · doi:10.48550/arxiv.2311.15127
openalex publication_date 2023/11/25 · openalex created_date 2023/11/29 · openalex updated_date 2026/07/28
Abstract
We present Stable Video Diffusion - a latent video diffusion model for high-resolution, state-of-the-art text-to-video and image-to-video generation. Recently, latent diffusion models trained for 2D image synthesis have been turned into generative video models by inserting temporal layers and finetuning them on small, high-quality video datasets. However, training methods in the literature vary widely, and the field has yet to agree on a unified strategy for curating video data. In this paper, we identify and evaluate three different stages for successful training of video LDMs: text-to-image pretraining, video pretraining, and high-quality video finetuning. Furthermore, we demonstrate the necessity of a well-curated pretraining dataset for generating high-quality videos and present a systematic curation process to train a strong base model, including captioning and filtering strategies. We then explore the impact of finetuning our base model on high-quality data and train a text-to-video model that is competitive with closed-source video generation. We also show that our base model provides a powerful motion representation for downstream tasks such as image-to-video generation and adaptability to camera motion-specific LoRA modules. Finally, we demonstrate that our model provides a strong multi-view 3D-prior and can serve as a base to finetune a multi-view diffusion model that jointly generates multiple views of objects in a feedforward fashion, outperforming image-based methods at a fraction of their compute budget. We release code and model weights at https://github.com/Stability-AI/generative-models .
Cited by
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
- Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
- Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
- Video Understanding: From Geometry and Semantics to Unified Models
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- Reverse Personalization
- Guided Path Sampling: Steering Diffusion Models Back on Track with Principled Path Guidance
- SCPainter: A Unified Framework for Realistic 3D Asset Insertion and Novel View Synthesis
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models
- ID-V2V: Identity-Preserving Video Restylization
- MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
- Autoregressive One-Step Generative Modeling for Dynamical System Forecasting
- Latent Space Probing for Adult Content Detection in Video Generative Models
- High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
- PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics
- Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
- EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
- UMAMI: Unifying Masked Autoregressive Models and Deterministic Rendering for View Synthesis
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking
- SemanticGen: Video Generation in Semantic Space
- Learning to Refocus with Video Diffusion Models
- Generating the Past, Present and Future from a Motion-Blurred Image
- WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion
- ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars
- StoryMem: Multi-shot Long Video Storytelling with Memory
- WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
- In-Context Audio Control of Video Diffusion Transformers
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text
- StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction
- FrameDiffuser: G-Buffer-Conditioned Diffusion for Neural Forward Frame Rendering
- Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models
- Learning High-Quality Initial Noise for Single-View Synthesis with Diffusion Models
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- Multi-View Foundation Models
- End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
- Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
- Large Video Planner Enables Generalizable Robot Control
- Spatia: Video Generation with Updatable Spatial Memory
- TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
- Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure
- V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
- Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding
- DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos
- Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation
- MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator
- Grab-3D: Detecting AI-Generated Videos from 3D Geometric Temporal Consistency
- Towards Physically-Based Sky-Modeling For Image Based Lighting
- Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation
- Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10×
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence
- KlingAvatar 2.0 Technical Report
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- Generative Spatiotemporal Data Augmentation
- Unified Control for Inference-Time Guidance of Denoising Diffusion Models
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- SPDMark: Selective Parameter Displacement for Robust Video Watermarking
- V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
- BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
- FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint
- Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context
- PersonaLive! Expressive Portrait Image Animation for Live Streaming
- OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis
- Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces
- ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- Robustness of Probabilistic Models to Low-Quality Data: A Multi-Perspective Analysis
- Evaluating Gemini Robotics Policies in a Veo World Simulator
- AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
- Splatent: Splatting Diffusion Latents for Novel View Synthesis
- Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- OmniPSD: Layered PSD Generation with Diffusion Transformer
- Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
- Astra: General Interactive World Model with Autoregressive Denoising
- EgoX: Egocentric Video Generation from a Single Exocentric Video
- Blur2Sharp: Human Novel Pose and View Synthesis with Generative Prior Refinement
- Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
- Unified Camera Positional Encoding for Controlled Video Generation
- Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
- IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction
- Pseudo Anomalies Are All You Need: Diffusion-Based Generation for Weakly-Supervised Video Anomaly Detection
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- Scaling Zero-Shot Reference-to-Video Generation
- World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
- SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
- USV: Unified Sparsification for Accelerating Video Diffusion Models
- HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models
- InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem
- Light-X: Generative 4D Video Rendering with Camera and Illumination Control
- Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression
- BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
- Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence
- VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
- EgoLCD: Egocentric Video Generation with Long Context Diffusion
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- Beyond Boundary Frames: Context-Centric Video Interpolation with Audio-Visual Semantics
- CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
- GeoVideo: Introducing Geometric Regularization into Video Generation Model
- SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
- Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
- CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- YingVideo-MV: Music-Driven Multi-Stage Video Generation
- Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
- Generative Video Motion Editing with 3D Point Tracks
- Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos
- Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
- ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling
- AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
- MM-ACT: Learn from Multimodal Parallel Generation to Act
- TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model
- Audio-Visual World Models: Grounding Multisensory Imagination for Embodied Agents
- TrajDiff: End-to-end Autonomous Driving without Perception Annotation
- CC-FMO: Camera-Conditioned Zero-Shot Single Image to 3D Scene Generation with Foundation Model Orchestration
- MVAD : A Comprehensive Multimodal Video-Audio Dataset for AIGC Detection
- What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards
- TAPVid-360: Tracking Any Point in 360 from Narrow Field of View Video
- AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
- DisMo: Disentangled Motion Representations for Open-World Motion Transfer
- Fast Multi-view Consistent 3D Editing with Video Priors
- DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
- One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer
- Robust Image Self-Recovery against Tampering using Watermark Generation with Pixel Shuffling
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization
- Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices
- AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
- TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models
- Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
- PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding
- Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
- UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
- 3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation
- Learning Plug-and-play Memory for Guiding Video Diffusion Models
- View-Consistent Diffusion Representations for 3D-Consistent Video Generation
- One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
- Zero-Shot Video Deraining with Video Diffusion Models
- Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
- EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
- Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
- FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning
- Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- EvDiff: High Quality Video with an Event Camera
- PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- Loomis Painter: Reconstructing the Painting Process
- Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
- First Frame Is the Place to Go for Video Content Customization
- Neo: Real-Time On-Device 3D Gaussian Splatting with Reuse-and-Update Sorting Acceleration
- Generative Photographic Control for Scene-Consistent Video Cinematic Editing
- Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
- Gaussian See, Gaussian Do: Semantic 3D Motion Transfer from Multiview Video
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
- Free-Form Scene Editor: Enabling Multi-Round Object Manipulation like in a 3D Engine
- Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos
- DriveLiDAR4D: Sequential and Controllable LiDAR Scene Generation for Autonomous Driving
- Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
- SAGA: Source Attribution of Generative AI Videos
- Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
- LiDAR-GS++:Improving LiDAR Gaussian Reconstruction via Diffusion Priors
- From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
- Efficient Image-Goal Navigation with Representative Latent World Model
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation
- SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
- RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
- ViPRA: Video Prediction for Robot Actions
- MotionStream: Real-Time Video Generation with Interactive Motion Controls
- DIMO: Diverse 3D Motion Generation for Arbitrary Objects
- 4DSTR: Advancing Generative 4D Gaussians with Spatial-Temporal Rectification for High-Quality and Consistent 4D Generation
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance
- RelightMaster: Precise Video Relighting with Multi-plane Light Images
- Neodragon: Mobile Video Generation using Diffusion Transformer
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection
- Driving scenario generation and evaluation using a structured layer representation and foundational models
- Towards One-step Causal Video Generation via Adversarial Self-Distillation
- Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models
- HumanCrafter: Synergizing Generalizable Human Reconstruction and Semantic 3D Segmentation
- DANCER: Dance ANimation via Condition Enhancement and Rendering with diffusion model
- Detail Enhanced Gaussian Splatting for Large-Scale Volumetric Capture
- Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
- SEE4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting
- Co-Evolving Latent Action World Models
- 4-Doodle: Text to 3D Sketches that Move!
- TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models
- Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement
- Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence
- NOVA3R: Non-pixel-aligned Visual Transformer for Amodal 3D Reconstruction
- Walk through Paintings: Egocentric World Models from Internet Priors
- SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
- Rethinking Visual Intelligence: Insights from Video Pretraining
- Advancing Off-Road Autonomous Driving: The Large-Scale ORAD-3D Dataset and Comprehensive Benchmarks
- Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- DynaPose4D: High-Quality 4D Dynamic Content Generation via Pose Alignment Loss
- DiffusionLane: Diffusion Model for Lane Detection
- BachVid: Training-Free Video Generation with Consistent Background and Character
- WorldGrow: Generating Infinite 3D World
- Improved Training Technique for Shortcut Models
- World Models Should Prioritize the Unification of Physical and Social Dynamics
- Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
- Epipolar Geometry Improves Video Generation Models
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- Exploring Conditions for Diffusion models in Robotic Control
- Improving the Physics of Video Generation with VJEPA-2 Reward Signal
- Advances in 4D Representation: Geometry, Motion, and Interaction
- Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning
- MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
- UltraGen: High-Resolution Video Generation with Hierarchical Attention
- World-in-World: World Models in a Closed-Loop World
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- Adaptive Discretization for Consistency Models
- From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display
- ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
- Terra: Explorable Native 3D World Model with Point Latents
- RealDPO: Real or Not Real, that is the Preference
- 3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding
- Virtually Being: Customizing Camera-Controllable Video Diffusion Models with Multi-View Performance Captures
- TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- VIST3A: Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy
- FlashWorld: High-quality 3D Scene Generation within Seconds
- FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution
- G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior
- MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars
- Point Prompting: Counterfactual Tracking with Video Diffusion Models
- Self-Forcing++: Towards Minute-Scale High-Quality Video Generation
- MoMaps: Semantics-Aware Scene Motion Generation with Motion Maps
- Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
- UniCoD: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning
- Sketch Animation: State-of-the-art Report
- Color3D: Controllable and Consistent 3D Colorization with Personalized Colorizer
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- FreeViS: Training-free Video Stylization with Inconsistent References
- Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
- Online Video Depth Anything: Temporally-Consistent Depth Prediction with Low Memory Consumption
- UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction
- NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
- MultiCOIN: Multi-Modal COntrollable Video INbetweening
- X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering
- FreqCa: Accelerating Diffusion Models via Frequency-Aware Caching
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- SViM3D: Stable Video Material Diffusion for Single Image 3D Generation
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- Real-Time Motion-Controllable Autoregressive Video Diffusion
- Trajectory Conditioned Cross-embodiment Skill Transfer
- SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
- Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
- FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control
- VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
- LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
- DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
- MATRIX: Mask Track Alignment for Interaction-aware Video Generation
- MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation
- Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model
- Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
- ShapeGen4D: Towards High Quality 4D Shape Generation from Videos
- VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
- Diffusion2: Turning 3D Environments into Radio Frequency Heatmaps
- Learning to Generate Rigid Body Interactions with Video Diffusion Models
- LightCache: Memory-Efficient, Training-Free Acceleration for Video Generation
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- Scaling Sequence-to-Sequence Generative Neural Rendering
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator
- World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge
- When and Where do Events Switch in Multi-Event Video Generation?
- LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration
- EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
- Arbitrary Generative Video Interpolation
- Can World Models Benefit VLMs for World Dynamics?
- InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
- Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation
- MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
- DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
- Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
- Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
- Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
- RapidMV: Leveraging Spatio-Angular Representations for Efficient and Consistent Text-to-Multi-View Synthesis
- UniVid: The Open-Source Unified Video Model
- Asymmetric VAE for One-Step Video Super-Resolution Acceleration
- World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
- PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion
- UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
- SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
- FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation
- ReLumix: Extending Image Relighting to Video via Video Diffusion Models
- Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers
- Drag4D: Align Your Motion with Text-Driven 3D Scene Generation
- MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- What Happens Next? Anticipating Future Motion by Generating Point Trajectories
- X-Streamer: Unified Human World Modeling with Audiovisual Interaction
- NewtonGen: Physics-Consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics
- MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation
- PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
- Frame-based Equivariant Diffusion Models for 3D Molecular Generation
- 4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans
- ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate
- MAD: Motion Appearance Decoupling for efficient Driving World Models
- Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer
- DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
- Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion
- LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
- OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
- RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
- SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling
- Lynx: Towards High-Fidelity Personalized Video Generation
- WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- Inverse Design of Amorphous Materials with Targeted Properties
- DiCache: Let Diffusion Model Determine Its Own Cache
- BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching
- Investigating ReLoRA: Effects on the Learning Dynamics of Small Language Models
- OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
- SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
- Every Camera Effect, Every Time, All at Once: 4D Gaussian Ray Tracing for Physics-based Camera Effect Data Generation
- Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation
- Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
- Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
- Diffusion-Based Action Recognition Generalizes to Untrained Domains
- RewardDance: Reward Scaling in Visual Generation
- LINR Bridge: Vector Graphic Animation via Neural Implicits and Video Diffusion Priors
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- A Generalisable Generative Model for Multi-Detector Calorimeter Simulation
- Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training
- From Rigging to Waving: 3D-Guided Diffusion for Natural Animation of Hand-Drawn Characters
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- STADI: Fine-Grained Step-Patch Diffusion Parallelism for Heterogeneous GPUs
- Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
- Human Motion Video Generation: A Survey
- TeRA: Rethinking Text-guided Realistic 3D Avatar Generation
- ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory
- Dress&Dance: Dress up and Dance as You Like It - Technical Preview
- CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
- Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation
- Waver: Wave Your Way to Lifelike Video Generation
- Phased One-Step Adversarial Equilibrium for Video Diffusion Models
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- Ego-centric Predictive Model Conditioned on Hand Trajectories
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
- Collaborative Multi-Modal Coding for High-Quality 3D Generation
- MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
- Scaling Group Inference for Diverse and High-Quality Generation
- Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MoVieDrive: Multi-Modal Multi-View Urban Scene Video Generation
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- AnchorSync: Global Consistency Optimization for Long Video Editing
- InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing
- GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis
- Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models
- EgoTwin: Dreaming Body and View in First Person
- Matrix-game 2.0: An open-source real-time and streaming interactive world model
- ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving
- CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
- ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing
- AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences
- A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
- PERSONA: Personalized Whole-Body 3D Avatar with Pose-Driven Deformations from a Single Image
- GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors
- Turbo-VAED: Fast and Stable Transfer of Video-VAEs to Mobile Devices
- RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space
- Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos
- CObL: Toward Zero-Shot Ordinal Layering without User Prompting
- Learning an Implicit Physics Model for Image-based Fluid Simulation
- Cut2Next: Generating Next Shot via In-Context Tuning
- Splat4D: Diffusion-Enhanced 4D Gaussian Splatting for Temporally and Spatially Consistent Content Creation
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- Matrix-3D: Omnidirectional Explorable 3D World Generation
- Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
- SketchAnimator: Animate Sketch via Motion Customization of Text-to-Video Diffusion Models
- SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
- ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors
- DreamVE: Unified Instruction-based Image and Video Editing
- Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
- When Deepfake Detection Meets Graph Neural Network:a Unified and Lightweight Learning Framework
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
- MetaDiT: Enabling Fine-grained Constraints in High-degree-of Freedom Metasurface Design
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- QuantVSR: Low-Bit Post-Training Quantization for Real-World Video Super-Resolution
- READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
- V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
- Multi-human Interactive Talking Dataset
- DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework
- Forecasting When to Forecast: Accelerating Diffusion Models with Confidence-Gated Taylor
- QuaDreamer: Controllable Panoramic Video Generation for Quadruped Robots
- VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling
- Versatile Transition Generation with Image-to-Video Diffusion
- DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
- Physically-based Lighting Generation for Robotic Manipulation
- Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models
- DreamSat-2.0: Towards a General Single-View Asteroid 3D Reconstruction
- Unraveling Hidden Representations: A Multi-Modal Layer Analysis for Better Synthetic Content Forensics
- SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
- D3: Training-Free AI-Generated Video Detection Using Second-Order Features
- Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
- Video Generators are Robot Policies
- Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
- DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
- GVD: Guiding Video Diffusion Model for Scalable Video Distillation
- HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
- DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
- Reconstructing 4D Spatial Intelligence: A Survey
- JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1
- MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
- AnimeColor: Reference-based Animation Colorization with Diffusion Transformers
- TransFlow: Motion Knowledge Transfer from Video Diffusion Models to Video Salient Object Detection
- ScenePainter: Semantically Consistent Perpetual 3D Scene Generation with Concept Relation Alignment
- MVG4D: Image Matrix-Based Multi-View and Motion Generation for 4D Content Creation from a Single Image
- Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA
Related