nuScenes: A multimodal dataset for autonomous driving
2019/03/26 by Caesar, Holger, Bankiti, Varun, Lang, Alex H. +7 · 520 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Robotics (cs.RO)
paper · doi:10.48550/arxiv.1903.11027
Abstract
Robust detection and tracking of objects is crucial for the deployment of autonomous vehicle technology. Image based benchmark datasets have driven development in computer vision tasks such as object detection, tracking and segmentation of agents in the environment. Most autonomous vehicles, however, carry a combination of cameras and range sensors such as lidar and radar. As machine learning based methods for detection and tracking become more prevalent, there is a need to train and evaluate such methods on datasets containing range sensor data along with images. In this work we present nuTonomy scenes (nuScenes), the first dataset to carry the full autonomous vehicle sensor suite: 6 cameras, 5 radars and 1 lidar, all with full 360 degree field of view. nuScenes comprises 1000 scenes, each 20s long and fully annotated with 3D bounding boxes for 23 classes and 8 attributes. It has 7x as many annotations and 100x as many images as the pioneering KITTI dataset. We define novel 3D detection and tracking metrics. We also provide careful dataset analysis as well as baselines for lidar and image based detection and tracking. Data, development kit and more information are available online.
Cited by
- InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- SCAFusion: A Multimodal 3D Detection Framework for Small Object Detection in Lunar Surface Exploration
- SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception
- Neuromorphic Object Detection: An In-Depth Study and Future Directions
- DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification
- RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction
- MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving
- Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding
- CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking
- Learning Association via Track-Detection Matching for Multi-Object Tracking
- FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog
- Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning
- T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- MINT-V2X: A Mobility-Integrated Network Trajectory Dataset for Predictive Resource Management
- Sky2Ground: A Benchmark for Site Modeling under Varying Altitude
- SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration
- OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective
- Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
- KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- UrbanV2X: A Multisensory Vehicle-Infrastructure Dataset for Cooperative Navigation in Urban Areas
- LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation
- From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
- AMap: Distilling Future Priors for Ahead-Aware Online HD Map Construction
- HyGE-Occ: Hybrid View-Transformation with 3D Gaussian and Edge Priors for 3D Panoptic Occupancy Prediction
- LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
- Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments
- Systematic Benchmarking of SUMO Against Data-Driven Traffic Simulators
- UniMPR: A Unified Framework for Multimodal Place Recognition with Heterogeneous Sensor Configurations
- ALIGN: Advanced Query Initialization with LiDAR-Image Guidance for Occlusion-Robust 3D Object Detection
- RadarGen: Automotive Radar Point Cloud Generation from Cameras
- SAVeD: A First-Person Social Media Video Dataset for ADAS-equipped vehicle Near-Miss and Crash Event Analyses
- StereoMV2D: A Sparse Temporal Stereo-Enhanced Framework for Robust Multi-View 3D Object Detection
- MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
- DVGT: Driving Visual Geometry Transformer
- DenseBEV: Transforming BEV Grid Cells into 3D Objects
- N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
- Privacy-Aware Sharing of Raw Spatial Sensor Data for Cooperative Perception
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- From Theory to Throughput: CUDA-Optimized APML for Large-Batch 3D Learning
- R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
- SemanticBridge - A Dataset for 3D Semantic Segmentation of Bridges and Domain Gap Analysis
- KD360-VoxelBEV: LiDAR and 360-degree Camera Cross Modality Knowledge Distillation for Bird's-Eye-View Segmentation
- DASP: Self-supervised Nighttime Monocular Depth Estimation with Domain Adaptation of Spatiotemporal Priors
- 4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- FocalComm: Hard Instance-Aware Multi-Agent Perception
- Quadratic Kalman Filter for Elliptical Extended Object Tracking based on Decoupling State Components
- LitePT: Lighter Yet Stronger Point Transformer
- Cross-Level Sensor Fusion with Object Lists via Transformer for 3D Object Detection
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- From Human Intention to Action Prediction: A Comprehensive Benchmark for Intention-driven End-to-End Autonomous Driving
- Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus
- FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model
- TransBridge: Boost 3D Object Detection by Scene-Level Completion with Transformer Decoder
- SATMapTR: Satellite Image Enhanced Online HD Map Construction
- FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
- SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
- Latent Chain-of-Thought World Modeling for End-to-End Driving
- Closing the Navigation Compliance Gap in End-to-end Autonomous Driving
- UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
- Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration
- Astra: General Interactive World Model with Autoregressive Denoising
- Scale-invariant and View-relational Representation Learning for Full Surround Monocular Depth
- From Segments to Scenes: Temporal Understanding in Autonomous Driving via Vision-Language Model
- RLCNet: An end-to-end deep learning framework for simultaneous online calibration of LiDAR, RADAR, and Camera
- LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception
- TrajMoE: Scene-Adaptive Trajectory Planning with Mixture of Experts and Reinforcement Learning
- Optimization-Guided Diffusion for Interactive Scene Generation
- Hierarchical Image-Guided 3D Point Cloud Segmentation in Industrial Scenes via Multi-View Bayesian Fusion
- Spatial Retrieval Augmented Autonomous Driving
- SparseCoop: Cooperative Perception with Kinematic-Grounded Queries
- JOCA: Task-Driven Joint Optimisation of Camera Hardware and Adaptive Camera Control Algorithms
- WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving
- Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection
- Concept-based Explainable Data Mining with VLM for 3D Detection
- SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
- E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
- dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
- Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
- What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models
- ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding
- NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction
- U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
- BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection
- CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
- nuScenes Revisited: Progress and Challenges in Autonomous Driving
- Quantum Vanguard: Server Optimized Privacy Fortified Federated Intelligence for Future Vehicles
- AirSim360: A Panoramic Simulation Platform within Drone View
- MV-TAP: Tracking Any Point in Multi-View Videos
- Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
- OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
- OpenBox: Annotate Any Bounding Boxes in 3D
- Estimation of Kinematic Motion from Dashcam Footage
- Cooperative Safety Intelligence in V2X-Enabled Transportation: A Survey
- PointCNN++: Performant Convolution on Native Points
- VG3T: Visual Geometry Grounded Gaussian Transformer
- SUPER-AD: Semantic Uncertainty-aware Planning for End-to-End Robust Autonomous Driving
- Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
- Combining Projected Uncertainty for Self-Supervised Visual Odometry: From Two-Frame to Multi-Frame
- UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data
- HandyLabel: Towards Post-Processing to Real-Time Annotation Using Skeleton Based Hand Gesture Recognition
- DriveVGGT: Visual Geometry Transformer for Autonomous Driving
- HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
- Controllable risk scenario generation from human crash data for autonomous vehicle testing
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- LaGen: Towards Autoregressive LiDAR Scene Generation
- Estimating Fog Parameters from a Sequence of Stereo Images
- LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
- BRIC: Bridging Kinematic Plans and Physical Control at Test Time
- AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
- SAFE-IMM: Robust and Lightweight Radar-Based Object Tracking on Mobile Platforms
- Advancing Image Classification with Discrete Diffusion Classification Modeling
- Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving
- Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge
- Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
- CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
- Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
- WPT: World-to-Policy Transfer via Online World Model Distillation
- Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
- MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes
- A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- MapRF: Weakly Supervised Online HD Map Construction via NeRF-Guided Self-Training
- DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video
- From Features to Reference Points: Lightweight and Adaptive Fusion for Cooperative Autonomous Driving
- Thinking Ahead: Foresight Intelligence in MLLMs and World Models
- DriveFlow: Rectified Flow Adaptation for Robust 3D Object Detection in Autonomous Driving
- LAA3D: A Benchmark of Detecting and Tracking Low-Altitude Aircraft in 3D Space
- GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
- REXO: Indoor Multi-View Radar Object Detection via 3D Bounding Box Diffusion
- Radar2Shape: 3D Shape Reconstruction from High-Frequency Radar using Multiresolution Signed Distance Functions
- Improving Multimodal Distillation for 3D Semantic Segmentation under Domain Shift
- SuperQuadricOcc: Real-Time Self-Supervised Semantic Occupancy Estimation with Superquadric Volume Rendering
- Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing
- QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy
- MobileOcc: A Human-Aware Semantic Occupancy Dataset for Mobile Robots
- CubeletWorld: A New Abstraction for Scalable 3D Modeling
- LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving
- CylinderDepth: Cylindrical Spatial Attention for Multi-View Consistent Self-Supervised Surround Depth Estimation
- CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking
- ShelfOcc: Native 3D Supervision beyond LiDAR for Vision-Based Occupancy Estimation
- Graph Query Networks for Object Detection with Automotive Radar
- SceneEdited: A City-Scale Benchmark for 3D HD Map Updating via Image-Guided Change Detection
- MambaTrack3D: A State Space Model Framework for LiDAR-Based Object Tracking under High Temporal Variation
- RoMa v2: Harder Better Faster Denser Feature Matching
- AVS: A Computational and Hierarchical Storage System for Autonomous Vehicles
- Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
- PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
- FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI
- Descriptor: Distance-Annotated Traffic Perception Question Answering (DTPQA)
- DriveLiDAR4D: Sequential and Controllable LiDAR Scene Generation for Autonomous Driving
- DAP: A Discrete-token Autoregressive Planner for Autonomous Driving
- CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving
- Decoupling Scene Perception and Ego Status: A Multi-Context Fusion Approach for Enhanced Generalization in End-to-End Autonomous Driving
- Discriminately Treating Motion Components Evolves Joint Depth and Ego-Motion Learning
- CaRLi-V: Camera-RADAR-LiDAR Point-Wise 3D Velocity Estimation
- Scalable Hierarchical AI-Blockchain Framework for Real-Time Anomaly Detection in Large-Scale Autonomous Vehicle Networks
- Fine-Grained Representation for Lane Topology Reasoning
- DoReMi: A Domain-Representation Mixture Framework for Generalizable 3D Understanding
- Reverberation: Learning the Latencies Before Forecasting Trajectories
- GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving
- nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation
- ExpertAD: Enhancing Autonomous Driving Systems with Mixture of Experts
- DGFusion: Dual-guided Fusion for Robust Multi-Modal 3D Object Detection
- CADD: A Chinese Traffic Accident Dataset for Statute-Based Liability Attribution
- Embodied Cognition Augmented End2End Autonomous Driving
- Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance
- Invisible Triggers, Visible Threats! Road-Style Adversarial Creation Attack for Visual 3D Detection in Autonomous Driving
- HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving
- TrueCity: Real and Simulated Urban Data for Cross-Domain 3D Scene Understanding
- Relative Energy Learning for LiDAR Out-of-Distribution Detection
- A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving
- REOcc: Camera-Radar Fusion with Radar Feature Enrichment for 3D Occupancy Prediction
- Differentiable Semantic Meta-Learning Framework for Long-Tail Motion Forecasting in Autonomous Driving
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- MULTIBENCH++: A Unified and Comprehensive Multimodal Fusion Benchmarking Across Specialized Domains
- LaneDiffusion: Improving Centerline Graph Learning via Prior Injected BEV Feature Generation
- Runtime Safety Monitoring of Deep Neural Networks for Perception: A Survey
- Polymap: generating high definition map based on rasterized polygons
- How Many Tokens Do 3D Point Cloud Transformer Architectures Really Need?
- ReGen: Generative Robot Simulation via Inverse Design
- UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction
- Studying the Effect of Explicit Interaction Representations on Learning Scene-level Distributions of Human Trajectories
- Evaluating the Impact of Weather-Induced Sensor Occlusion on BEVFusion for 3D Object Detection
- UniLION: Towards Unified Autonomous Driving Model with Linear Group RNNs
- Driving scenario generation and evaluation using a structured layer representation and foundational models
- 3EED: Ground Everything Everywhere in 3D
- Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion
- Towards classification-based representation learning for place recognition on LiDAR scans
- OmniTrack++: Omnidirectional Multi-Object Tracking by Learning Large-FoV Trajectory Feedback
- Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges
- Dynamic Model Selection for Trajectory Prediction via Pairwise Ranking and Meta-Features
- MLPerf Automotive
- Benchmarking Tesla's Traffic Light and Stop Sign Control: Field Dataset and Behavior Insights
- Constructing the Umwelt: Cognitive Planning through Belief-Intent Co-Evolution
- Self-localization on a 3D map by fusing global and local features from a monocular camera
- WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- BikeScenes: Online LiDAR Semantic Segmentation for Bicycles
- Multi-Sensor Alignment for Weather Simulations
- Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving
- VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
- AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World
- Distill, Diffuse, Segment: Unsupervised 3D Semantic Segmentation for Autonomous Driving Based on Multi-Level Distillation and Graph Diffusion
- SynFlow: Scaling Up LiDAR Scene Flow Estimation with Synthetic Data
- Energy-Efficient Autonomous Driving with Adaptive Perception and Robust Decision
- MIC-BEV: Multi-Infrastructure Camera Bird's-Eye-View Transformer with Relation-Aware Fusion for 3D Object Detection
- Feature-Guided Analysis of Neural Networks: A Replication Study
- ZTRS: Zero-Imitation End-to-end Autonomous Driving with Trajectory Scoring
- SynAD: Enhancing Real-World End-to-End Autonomous Driving Models through Synthetic Data Integration
- Which LiDAR scanning pattern is better for roadside perception: Repetitive or Non-repetitive?
- Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
- UrbanIng-V2X: A Large-Scale Multi-Vehicle, Multi-Infrastructure Dataset Across Multiple Intersections for Cooperative Perception
- VR-Drive: Viewpoint-Robust End-to-End Driving with Feed-Forward 3D Gaussian Splatting
- DQ3D: Depth-guided Query for Transformer-Based 3D Object Detection in Traffic Scenarios
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- DAMap: Distance-aware MapNet for High Quality HD Map Construction
- LVD-GS: Gaussian Splatting SLAM for Dynamic Scenes via Hierarchical Explicit-Implicit Representation Collaboration Rendering
- 3D Roadway Scene Object Detection with LIDARs in Snowfall Conditions
- GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation
- Scalpel: Automotive Deep Learning Framework Testing via Assembling Model Components
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking
- VGD: Visual Geometry Gaussian Splatting for Feed-Forward Surround-view Driving Reconstruction
- From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
- Perfect Prediction or Plenty of Proposals? What Matters Most in Planning for Autonomous Driving
- Advances in 4D Representation: Geometry, Motion, and Interaction
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- OmniNWM: Omniscient Driving Navigation World Models
- BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- FreqPDE: Rethinking Positional Depth Embedding for Multi-View 3D Object Detection Transformers
- Towards 3D Objectness Learning in an Open World
- 4DSegStreamer: Streaming 4D Panoptic Segmentation via Dual Threads
- SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
- Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
- Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models
- A Comprehensive Survey on World Models for Embodied AI
- DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
- ObjectTransforms for Uncertainty Quantification and Reduction in Vision-Based Perception for Autonomous Vehicles
- CALM-Net: Curvature-Aware LiDAR Point Cloud-based Multi-Branch Neural Network for Vehicle Re-Identification
- UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
- DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
- ADPerf: Investigating and Testing Performance in Autonomous Driving Systems
- CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
- An Analytical Framework to Enhance Autonomous Vehicle Perception for Smart Cities
- XD-RCDepth: Lightweight Radar-Camera Depth Estimation with Explainability-Aligned and Distribution-Aware Distillation
- SimULi: Real-Time LiDAR and Camera Simulation with Unscented Transforms
- CAMNet: Leveraging Cooperative Awareness Messages for Vehicle Trajectory Prediction
- Detect Anything via Next Point Prediction
- CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving
- BIGFix: Bidirectional Image Generation with Token Fixing
- Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
- DrivingScene: A Multi-Task Online Feed-Forward 3D Gaussian Splatting Method for Dynamic Driving Scenes
- CrossRay3D: Geometry and Distribution Guidance for Efficient Multimodal 3D Detection
- CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
- IntersectioNDE: Learning Complex Urban Traffic Dynamics based on Interaction Decoupling Strategy
- rareboost3d: a synthetic lidar dataset with enhanced rare classes
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- Controllable Generative Trajectory Prediction via Weak Preference Alignment
- Stability Under Scrutiny: Benchmarking Representation Paradigms for Online HD Mapping
- MCE: Towards a General Framework for Handling Missing Modalities under Imbalanced Missing Rates
- Bridging Perspectives: Foundation Model Guided BEV Maps for 3D Object Detection and Tracking
- Beyond ADE and FDE: A Comprehensive Evaluation Framework for Safety-Critical Prediction in Multi-Agent Autonomous Driving Scenarios
- A Style-Based Profiling Framework for Quantifying the Synthetic-to-Real Gap in Autonomous Driving Datasets
- Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
- Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation
- Exploring Single Domain Generalization of LiDAR-based Semantic Segmentation under Imperfect Labels
- Scalable Offline Metrics for Autonomous Driving
- Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- Learning Global Representation from Queries for Vectorized HD Map Construction
- HARP-NeXt: High-Speed and Accurate Range-Point Fusion Network for 3D LiDAR Semantic Segmentation
- Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation
- LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval
- The Safety Challenge of World Models for Embodied AI Agents: A Review
- ALISE: Annotation-Free LiDAR Instance Segmentation for Autonomous Driving
- Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
- Diffusion2: Turning 3D Environments into Radio Frequency Heatmaps
- Latent Uncertainty Representations for Video-based Driver Action and Intention Recognition
- Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
- More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models
- Flexible and Efficient Spatio-Temporal Transformer for Sequential Visual Place Recognition
- Sequence-Preserving Dual-FoV Defense for Traffic Sign and Light Recognition in Autonomous Vehicles
- A Trajectory Generator for High-Density Traffic and Diverse Agent-Interaction Scenarios
- Semantic Visual Simultaneous Localization and Mapping: A Survey on State of the Art, Challenges, and Future Directions
- FIN: Fast Inference Network for Map Segmentation
- EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations
- CHAI: Command Hijacking against embodied AI
- EasyOcc: 3D Pseudo-Label Supervision for Fully Self-Supervised Semantic Occupancy Prediction Models
- NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving
- OceanGym: A Benchmark Environment for Underwater Embodied Agents
- Online Mapping for Autonomous Driving: Addressing Sensor Generalization and Dynamic Map Updates in Campus Environments
- LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models
- DepthLM: Metric Depth From Vision Language Models
- DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation
- From Static to Dynamic: a Survey of Topology-Aware Perception in Autonomous Driving
- BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
- WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
- Preventing Robotic Jailbreaking via Multimodal Domain Adaptation
- Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss
- BEV-VLM: Trajectory Planning via Unified BEV Abstraction
- Persistent Autoregressive Mapping with Traffic Rules for Autonomous Driving
- Residual Vector Quantization For Communication-Efficient Multi-Agent Perception
- Distant Object Localisation from Noisy Image Segmentation Sequences
- 4D Driving Scene Generation With Stereo Forcing
- Lidar-based Tracking of Traffic Participants with Sensor Nodes in Existing Urban Infrastructure
- OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
- Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints
- Driving on Registers
- RoSe: Robust Self-supervised Stereo Matching under Adverse Weather Conditions
- Pure Vision Language Action (VLA) Models: A Comprehensive Survey
- The Case for Negative Data: From Crash Reports to Counterfactuals for Reasonable Driving
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
- RCTDistill: Cross-Modal Knowledge Distillation Framework for Radar-Camera 3D Object Detection with Temporal Fusion
- MAESTRO: Task-Relevant Optimization via Adaptive Feature Enhancement and Suppression for Multi-task 3D Perception
- TinyBEV: Cross Modal Knowledge Distillation for Efficient Multi Task Bird's Eye View Perception and Planning
- RadarSFD: Single-Frame Diffusion with Pretrained Priors for Radar Point Clouds
- Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
- ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting
- RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
- SQS: Enhancing Sparse Perception Models via Query-based Splatting in Autonomous Driving
- Neural Atlas Graphs for Dynamic Scene Decomposition and Editing
- PAN: Pillars-Attention-Based Network for 3D Object Detection
- GPU Temperature Simulation-Based Testing for In-Vehicle Deep Learning Frameworks
- Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
- KoopCast: Trajectory Forecasting via Koopman Operators
- Self-Supervised Cross-Modal Learning for Image-to-Point Cloud Registration
- RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation
- Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception
- STEP: Structured Training and Evaluation Platform for benchmarking trajectory prediction models
- DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising
- SimCoachCorpus: A naturalistic dataset with language and trajectories for embodied teaching
- BEVUDA++: Geometric-aware Unsupervised Domain Adaptation for Multi-View 3D Object Detection
- Ensemble of Pre-Trained Models for Long-Tailed Trajectory Prediction
- TreeIRL: Safe Urban Driving with Tree Search and Inverse Reinforcement Learning
- Dynamic Aware: Adaptive Multi-Mode Out-of-Distribution Detection for Trajectory Prediction in Autonomous Vehicles
- Weakly and Self-Supervised Class-Agnostic Motion Prediction for Autonomous Driving
- MATTER: Multiscale Attention for Registration Error Regression
- Maps for Autonomous Driving: Full-process Survey and Frontiers
- TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving
- 4DRadar-GS: Self-Supervised Dynamic Driving Scene Reconstruction with 4D Radar
- Towards Foundational Models for Single-Chip Radar
- Embodied Navigation Foundation Model
- Learning to Generate 4D LiDAR Sequences
- WeatherBench: A Real-World Benchmark Dataset for All-in-One Adverse Weather Image Restoration
- DeltaFlow: An Efficient Multi-frame Scene Flow Estimation Method
- 3DAeroRelief: The first 3D Benchmark UAV Dataset for Post-Disaster Assessment
- Beyond Frame-wise Tracking: A Trajectory-based Paradigm for Efficient Point Cloud Tracking
- SoK: How Sensor Attacks Disrupt Autonomous Vehicles: An End-to-end Analysis, Challenges, and Missed Threats
- The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
- CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion
- BEVTraj: Map-Free End-to-End Trajectory Prediction in Bird's-Eye View with Deformable Attention and Sparse Goal Proposals
- Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey
- Model-Agnostic Open-Set Air-to-Air Visual Object Detection for Reliable UAV Perception
- WAVE-DETR Multi-Modal Visible and Acoustic Real-Life Drone Detector
- ArgoTweak: Towards Self-Updating HD Maps through Structured Priors
- Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes
- Semantic Causality-Aware Vision-Based 3D Occupancy Prediction
- InsFusion: Rethink Instance-level LiDAR-Camera Fusion for 3D Object Detection
- Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities
- CrowdQuery: Density-Guided Query Module for Enhanced 2D and 3D Detection in Crowded Scenes
- MVAT: Multi-View Aware Teacher for Weakly Supervised 3D Object Detection
- Aerial-ground Cross-modal Localization: Dataset, Ground-truth, and Benchmark
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Asymmetry Vulnerability and Physical Attacks on Online Map Construction for Autonomous Driving
- CRAB: Camera-Radar Fusion for Reducing Depth Ambiguity in Backward Projection based View Transformation
- 3DPillars: Pillar-based two-stage 3D object detection
- OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
- Enhancing 3D Point Cloud Classification with ModelNet-R and Point-SkipNet
- Towards Open World Detection: A Survey
- Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
- Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations
- SliceSemOcc: Vertical Slice Based Multimodal 3D Semantic Occupancy Representation
- OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction
- Domain Adaptation for Different Sensor Configurations in 3D Object Detection
- SAMFusion: Sensor-Adaptive Multimodal Fusion for 3D Object Detection in Adverse Weather
- Rashomon in the Streets: Explanation Ambiguity in Scene Understanding
- KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models
- UrbanTwin: Building High-Fidelity Digital Twins for Sim2Real LiDAR Perception and Evaluation
- High-Fidelity Digital Twins for Bridging the Sim2Real Gap in LiDAR-Based ITS Perception
- Learning from geometry-aware near-misses to real-time COR: A spatiotemporal grouped random GEV framework
- Towards Training-Free Underwater 3D Object Detection from Sonar Point Clouds: A Comparison of Traditional and Deep Learning Approaches
- Enabling Federated Object Detection for Connected Autonomous Vehicles: A Deployment-Oriented Evaluation
- Machine Learning in Micromobility: A Systematic Review of Datasets, Techniques, and Applications
- A Unified Voxel Diffusion Module for Point Cloud 3D Object Detection
- PointSlice: Accurate and Efficient Slice-Based Representation for 3D Object Detection from Point Clouds
- CoVeRaP: Cooperative Vehicular Perception through mmWave FMCW Radars
- ER-LoRA: Effective-Rank Guided Adaptation for Weather-Generalized Depth Estimation
- Domain Adaptation-Based Crossmodal Knowledge Distillation for 3D Semantic Segmentation
- DriveQA: Passing the Driving Knowledge Test
- VoCap: Video Object Captioning and Segmentation from Any Prompt
- Mapping like a Skeptic: Probabilistic BEV Projection for Online HD Mapping
- How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images
- DrivingGaussian++: Towards Realistic Reconstruction and Editable Simulation for Surrounding Dynamic Driving Scenes
- To New Beginnings: A Survey of Unified Perception in Autonomous Vehicle Software
- SKGE-SWIN: End-To-End Autonomous Vehicle Waypoint Prediction and Navigation Using Skip Stage Swin Transformer
- Enhancing Pseudo-Boxes via Data-Level LiDAR-Camera Fusion for Unsupervised 3D Object Detection
- GENNAV: Polygon Mask Generation for Generalized Referring Navigable Regions
- Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts
- MapKD: Unlocking Prior Knowledge with Cross-Modal Distillation for Efficient Online HD Map Construction
- Hyperspectral Sensors and Autonomous Driving: Technologies, Limitations, and Opportunities
- RATopo: Improving Lane Topology Reasoning via Redundancy Assignment
- FlowDet: Overcoming Perspective and Scale Challenges in Real-Time End-to-End Traffic Detection
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- PseudoMapTrainer: Learning Online Mapping without HD Maps
- DoGFlow: Self-Supervised LiDAR Scene Flow via Cross-Modal Doppler Guidance
- Why Relational Graphs Will Save the Next Generation of Vision Foundation Models?
- RCDINO: Enhancing Radar-Camera 3D Object Detection with DINOv2 Semantic Features
- BasketLiDAR: The First LiDAR-Camera Multimodal Dataset for Professional Basketball MOT
- Incremental Object Detection with Prompt-based Methods
- Adversarial Generation and Collaborative Evolution of Safety-Critical Scenarios for Autonomous Vehicles
- MoVieDrive: Multi-Modal Multi-View Urban Scene Video Generation
- GALA: Guided Attention with Language Alignment for Open Vocabulary Gaussian Splatting
- AutoScale: Linear Scalarization Guided by Multi-Task Optimization Metrics
- Multimodal Data Storage and Retrieval for Embodied AI: A Survey
- ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving
- RICO: Two Realistic Benchmarks and an In-Depth Analysis for Incremental Learning in Object Detection
- 2COOOL: 2nd Workshop on the Challenge Of Out-Of-Label Hazards in Autonomous Driving
- Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
- CMF-IoU: Multi-Stage Cross-Modal Fusion 3D Object Detection with IoU Joint Prediction
- Neural Rendering for Sensor Adaptation in 3D Object Detection
- edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer
- ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
- DoppDrive: Doppler-Driven Temporal Aggregation for Improved Radar Object Detection
- LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
- EvoPSF: Online Evolution of Autonomous Driving Models via Planning-State Feedback
- ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving
- Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking
- CHARM3R: Towards Unseen Camera Height Robust Monocular 3D Detector
- Towards Powerful and Practical Patch Attacks for 2D Object Detection in Autonomous Driving
- SpaRC-AD: A Baseline for Radar-Camera Fusion in End-to-End Autonomous Driving
- PTQAT: A Hybrid Parameter-Efficient Quantization Algorithm for 3D Perception Tasks
- BridgeTA: Bridging the Representation Gap in Knowledge Distillation via Teacher Assistant for Bird's Eye View Map Segmentation
- CitySeg: A 3D Open Vocabulary Semantic Segmentation Foundation Model in City-scale Scenarios
- HQ-OV3D: A High Box Quality Open-World 3D Detection Framework based on Diffision Model
- TRIDE: A Text-assisted Radar-Image weather-aware fusion network for Depth Estimation
- Decoupled Functional Evaluation of Autonomous Driving Models via Feature Map Quality Scoring
- Noise-Aware Generative Microscopic Traffic Simulation
- ForeSight: Multi-View Streaming Joint Object Detection and Trajectory Forecasting
- ETA: Energy-based Test-time Adaptation for Depth Completion
- DistillDrive: End-to-End Multi-Mode Autonomous Driving Distillation by Isomorphic Hetero-Source Planning Model
- B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding
- Occupancy Learning with Spatiotemporal Memory
- BEVCon: Advancing Bird's Eye View Perception with Contrastive Learning
- RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case
- LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences
- La La LiDAR: Large-Scale Layout Generation from LiDAR Data
- Veila: Panoramic LiDAR Generation from a Monocular RGB Image
- Robust Single-Stage Fully Sparse 3D Object Detection via Detachable Latent Diffusion
- MIDAR: Mimicking LiDAR Detection for Traffic Applications with a Lightweight Plug-and-Play Model
- On-the-Fly Object-aware Representative Point Selection in Point Cloud
- Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving
- AID4AD: Aerial Image Data for Automated Driving Perception
- LT-Gaussian: Long-Term Map Update Using 3D Gaussian Splatting for Autonomous Driving
- Adaptive LiDAR Scanning: Harnessing Temporal Cues for Efficient 3D Object Detection via Multi-Modal Fusion
- DiffSemanticFusion: Semantic Raster BEV Fusion for Autonomous Driving via Online HD Map Diffusion
- HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation
- A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
- Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving
- CoProU-VO: Combining Projected Uncertainty for End-to-End Unsupervised Monocular Visual Odometry
- Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
- Stable at Any Speed: Speed-Driven Multi-Object Tracking with Learnable Kalman Filtering
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence
- I2V-GS: Infrastructure-to-Vehicle View Transformation with Gaussian Splatting for Autonomous Driving Data Generation
- OmniTraj: Pre-Training on Heterogeneous Data for Adaptive and Zero-Shot Human Trajectory Prediction
- DA-Occ: Direction-Aware 2D Convolution for Efficient and Geometry-Preserving 3D Occupancy Prediction
- 3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection
- A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving
- MagicRoad: Semantic-Aware 3D Road Surface Reconstruction via Obstacle Inpainting
- FASTopoWM: Fast-Slow Lane Segment Topology Reasoning with Latent World Models
- PriorFusion: Unified Integration of Priors for Robust Road Perception in Autonomous Driving
- FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
- Generative Active Learning for Long-tail Trajectory Prediction via Controllable Diffusion Model
- UAVScenes: A Multi-Modal Dataset for UAVs
- Safety Evaluation of Motion Plans Using Trajectory Predictors as Forward Reachable Set Estimators
- Object Recognition Datasets and Challenges: A Review
- Goal-Based Vision-Language Driving
- Vision-Language Cross-Attention for Real-Time Autonomous Driving
- Interactive Adversarial Testing of Autonomous Vehicles with Adjustable Confrontation Intensity
- Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition
- RelMap: Enhancing Online Map Construction with Class-Aware Spatial Relation and Semantic Priors
- MapDiffusion: Generative Diffusion for Vectorized Online HD Map Construction and Uncertainty Estimation in Autonomous Driving
- Collaborative Perceiver: Elevating Vision-based 3D Object Detection via Local Density-Aware Spatial Occupancy
- GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction
- Teleoperating Autonomous Vehicles over Commercial 5G Networks: Are We There Yet?
- Humanoid Occupancy: Enabling A Generalized Multimodal Occupancy Perception System on Humanoid Robots
- VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving
- DriveIndia: An Object Detection Dataset for Diverse Indian Traffic Scenes
- TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking
- GS-Occ3D: Scaling Vision-only Occupancy Reconstruction with Gaussian Splatting
- BEV-LLM: Leveraging Multimodal BEV Maps for Scene Captioning in Autonomous Driving
- Multistream Network for LiDAR and Camera-based 3D Object Detection in Outdoor Scenes
- CoopTrack: Exploring End-to-End Learning for Efficient Cooperative Sequential Perception
- Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
- SmartPNT-MSF: A Multi-Sensor Fusion Dataset for Positioning and Navigation Research
- Delving into Mapping Uncertainty for Mapless Trajectory Prediction
- Goal-based Trajectory Prediction for improved Cross-Dataset Generalization
- HybridTM: Combining Transformer and Mamba for 3D Semantic Segmentation
- GaussianFusionOcc: A Seamless Sensor Fusion Approach for 3D Occupancy Prediction Using 3D Gaussians
- Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving
- Image Generators are Generalist Vision Learners
Related