Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
2024/05/27 by Shenyuan Gao, Gao, Shenyuan, Jiazhi Yang +13 · 75 citations
Engineering · Decision Sciences · #Autonomous Vehicle Technology and Safety #Simulation Techniques and Applications
paper · pdf · doi:10.48550/arxiv.2405.17398
Abstract
World models can foresee the outcomes of different actions, which is of paramount importance for autonomous driving. Nevertheless, existing driving world models still have limitations in generalization to unseen environments, prediction fidelity of critical details, and action controllability for flexible application. In this paper, we present Vista, a generalizable driving world model with high fidelity and versatile controllability. Based on a systematic diagnosis of existing methods, we introduce several key ingredients to address these limitations. To accurately predict real-world dynamics at high resolution, we propose two novel losses to promote the learning of moving instances and structural information. We also devise an effective latent replacement approach to inject historical frames as priors for coherent long-horizon rollouts. For action controllability, we incorporate a versatile set of controls from high-level intentions (command, goal point) to low-level maneuvers (trajectory, angle, and speed) through an efficient learning strategy. After large-scale training, the capabilities of Vista can seamlessly generalize to different scenarios. Extensive experiments on multiple datasets show that Vista outperforms the most advanced general-purpose video generator in over 70% of comparisons and surpasses the best-performing driving world model by 55% in FID and 27% in FVD. Moreover, for the first time, we utilize the capacity of Vista itself to establish a generalizable reward for real-world action evaluation without accessing the ground truth actions.
Cited by
- World Engine: Towards the Era of Post-Training for Autonomous Driving
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving
- AutoWorld: Learning Multi-Agent Traffic Simulation with Self-Supervised World Models
- DVGT: Driving Visual Geometry Transformer
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
- Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform
- Spatial Retrieval Augmented Autonomous Driving
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- AdaPower: Specializing World Foundation Models for Predictive Manipulation
- Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
- Flux4D: Flow-based Unsupervised 4D Reconstruction
- U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
- HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
- GigaWorld-0: World Models as Data Engine to Empower Embodied AI
- 4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models
- WPT: World-to-Policy Transfer via Online World Model Distillation
- Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization
- EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
- RAISECity: A Multimodal Agent Framework for Reality-Aligned 3D World Generation at City-Scale
- Counterfactual World Models via Digital Twin-conditioned Video Diffusion
- Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos
- Decoupling Scene Perception and Ego Status: A Multi-Context Fusion Approach for Enhanced Generalization in End-to-End Autonomous Driving
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World
- MotionStream: Real-Time Video Generation with Interactive Motion Controls
- Driving scenario generation and evaluation using a structured layer representation and foundational models
- Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges
- Semantic Communications with World Models
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
- AutoMT: A Multi-Agent LLM Framework for Automated Metamorphic Testing of Autonomous Driving Systems
- GigaBrain-0: A World Model-Powered Vision-Language-Action Model
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- OmniNWM: Omniscient Driving Navigation World Models
- World-in-World: World Models in a Closed-Loop World
- SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
- A Comprehensive Survey on World Models for Embodied AI
- DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
- CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving
- BIGFix: Bidirectional Image Generation with Token Fixing
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- The Safety Challenge of World Models for Embodied AI Agents: A Review
- Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
- Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
- EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
- WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
- Orientation-anchored Hyper-Gaussian for 4D Reconstruction from Casual Videos
- Context and Diversity Matter: The Emergence of In-Context Learning in World Models
- 4D Driving Scene Generation With Stereo Forcing
- ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
- Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation
- MAD: Motion Appearance Decoupling for efficient Driving World Models
- DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising
- Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
- OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction
- Planning with Reasoning using Vision Language World Model
- 2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion
- WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception
- MoVieDrive: Multi-Modal Multi-View Urban Scene Video Generation
- Precise Action-to-Video Generation Through Visual Action Prompts
- ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving
- Edge General Intelligence Through World Models and Agentic AI: Fundamentals, Solutions, and Challenges
- Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence
- I2V-GS: Infrastructure-to-Vehicle View Transformation with Gaussian Splatting for Autonomous Driving Data Generation
Related