nuScenes: A multimodal dataset for autonomous driving
2019/03/26 by Holger Caesar, Caesar, Holger, Varun Bankiti +17 · 908 citations
Computer Science · Mathematics · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Robotics (cs.RO) #cs.CV #cs.LG #cs.RO #stat.ML
paper · pdf · doi:10.48550/arxiv.1903.11027
CVPR 2020 camera ready incl. supplementary material
arxiv created 2020/05/05 · arxiv updated 2020/05/06
Abstract
Robust detection and tracking of objects is crucial for the deployment of autonomous vehicle technology. Image based benchmark datasets have driven development in computer vision tasks such as object detection, tracking and segmentation of agents in the environment. Most autonomous vehicles, however, carry a combination of cameras and range sensors such as lidar and radar. As machine learning based methods for detection and tracking become more prevalent, there is a need to train and evaluate such methods on datasets containing range sensor data along with images. In this work we present nuTonomy scenes (nuScenes), the first dataset to carry the full autonomous vehicle sensor suite: 6 cameras, 5 radars and 1 lidar, all with full 360 degree field of view. nuScenes comprises 1000 scenes, each 20s long and fully annotated with 3D bounding boxes for 23 classes and 8 attributes. It has 7x as many annotations and 100x as many images as the pioneering KITTI dataset. We define novel 3D detection and tracking metrics. We also provide careful dataset analysis as well as baselines for lidar and image based detection and tracking. Data, development kit and more information are available online.
Cited by
- Adv-BMT: Bidirectional Motion Transformer for Safety-Critical Traffic Scenario Generation
- InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- SCAFusion: A Multimodal 3D Detection Framework for Small Object Detection in Lunar Surface Exploration
- SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception
- Neuromorphic Object Detection: An In-Depth Study and Future Directions
- DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification
- RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction
- MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving
- Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding
- CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking
- Learning Association via Track-Detection Matching for Multi-Object Tracking
- FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog
- Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning
- T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- MINT-V2X: A Mobility-Integrated Network Trajectory Dataset for Predictive Resource Management
- Sky2Ground: A Benchmark for Site Modeling under Varying Altitude
- SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration
- OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective
- Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
- KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System
- LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs
- UrbanV2X: A Multisensory Vehicle-Infrastructure Dataset for Cooperative Navigation in Urban Areas
- LiteFusion: Taming 3D Object Detectors from Vision-Based to Multi-Modal with Minimal Adaptation
- From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
- AMap: Distilling Future Priors for Ahead-Aware Online HD Map Construction
- HyGE-Occ: Hybrid View-Transformation with 3D Gaussian and Edge Priors for 3D Panoptic Occupancy Prediction
- LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
- Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments
- Systematic Benchmarking of SUMO Against Data-Driven Traffic Simulators
- UniMPR: A Unified Framework for Multimodal Place Recognition with Heterogeneous Sensor Configurations
- ALIGN: Advanced Query Initialization with LiDAR-Image Guidance for Occlusion-Robust 3D Object Detection
- RadarGen: Automotive Radar Point Cloud Generation from Cameras
- SAVeD: A First-Person Social Media Video Dataset for ADAS-equipped vehicle Near-Miss and Crash Event Analyses
- StereoMV2D: A Sparse Temporal Stereo-Enhanced Framework for Robust Multi-View 3D Object Detection
- MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
- DVGT: Driving Visual Geometry Transformer
- DenseBEV: Transforming BEV Grid Cells into 3D Objects
- N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
- Privacy-Aware Sharing of Raw Spatial Sensor Data for Cooperative Perception
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- From Theory to Throughput: CUDA-Optimized APML for Large-Batch 3D Learning
- R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
- SemanticBridge - A Dataset for 3D Semantic Segmentation of Bridges and Domain Gap Analysis
- KD360-VoxelBEV: LiDAR and 360-degree Camera Cross Modality Knowledge Distillation for Bird's-Eye-View Segmentation
- DASP: Self-supervised Nighttime Monocular Depth Estimation with Domain Adaptation of Spatiotemporal Priors
- 4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation
- OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
- FocalComm: Hard Instance-Aware Multi-Agent Perception
- Quadratic Kalman Filter for Elliptical Extended Object Tracking based on Decoupling State Components
- LitePT: Lighter Yet Stronger Point Transformer
- Cross-Level Sensor Fusion with Object Lists via Transformer for 3D Object Detection
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving
- Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus
- FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model
- TransBridge: Boost 3D Object Detection by Scene-Level Completion with Transformer Decoder
- SATMapTR: Satellite Image Enhanced Online HD Map Construction
- FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
- SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
- Latent Chain-of-Thought World Modeling for End-to-End Driving
- Closing the Navigation Compliance Gap in End-to-end Autonomous Driving
- UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
- Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration
- Astra: General Interactive World Model with Autoregressive Denoising
- Scale-invariant and View-relational Representation Learning for Full Surround Monocular Depth
- From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models
- RLCNet: An end-to-end deep learning framework for simultaneous online calibration of LiDAR, RADAR, and Camera
- LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception
- TrajMoE: Scene-Adaptive Trajectory Planning with Mixture of Experts and Reinforcement Learning
- Optimization-Guided Diffusion for Interactive Scene Generation
- Hierarchical Image-Guided 3D Point Cloud Segmentation in Industrial Scenes via Multi-View Bayesian Fusion
- Spatial Retrieval Augmented Autonomous Driving
- SparseCoop: Cooperative Perception with Kinematic-Grounded Queries
- JOCA: Task-Driven Joint Optimisation of Camera Hardware and Adaptive Camera Control Algorithms
- WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving
- Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection
- Concept-based Explainable Data Mining with VLM for 3D Detection
- SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
- E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
- dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
- ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories
- CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
- Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
- What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models
- ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding
- NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction
- U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
- BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection
- CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
- nuScenes Revisited: Progress and Challenges in Autonomous Driving
- Quantum Vanguard: Server Optimized Privacy Fortified Federated Intelligence for Future Vehicles
- AirSim360: A Panoramic Simulation Platform within Drone View
- MV-TAP: Tracking Any Point in Multi-View Videos
- Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
- OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
- OpenBox: Annotate Any Bounding Boxes in 3D
- Estimation of Kinematic Motion from Dashcam Footage
- Cooperative Safety Intelligence in V2X-Enabled Transportation: A Survey
- PointCNN++: Performant Convolution on Native Points
- VG3T: Visual Geometry Grounded Gaussian Transformer
- SUPER-AD: Semantic Uncertainty-aware Planning for End-to-End Robust Autonomous Driving
- Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
- Combining Projected Uncertainty for Self-Supervised Visual Odometry: From Two-Frame to Multi-Frame
- UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data
- HandyLabel: Towards Post-Processing to Real-Time Annotation Using Skeleton Based Hand Gesture Recognition
- DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
- HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
- Controllable risk scenario generation from human crash data for autonomous vehicle testing
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- LaGen: Towards Autoregressive LiDAR Scene Generation
- Estimating Fog Parameters from a Sequence of Stereo Images
- LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
- BRIC: Bridging Kinematic Plans and Physical Control at Test Time
- AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
- SAFE-IMM: Robust and Lightweight Radar-Based Object Tracking on Mobile Platforms
- Advancing Image Classification with Discrete Diffusion Classification Modeling
- Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving
- Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge
- Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
- CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
- Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
- WPT: World-to-Policy Transfer via Online World Model Distillation
- Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
- MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes
- A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- MapRF: Weakly Supervised Online HD Map Construction via NeRF-Guided Self-Training
- DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video
- From Features to Reference Points: Lightweight and Adaptive Fusion for Cooperative Autonomous Driving
- Thinking Ahead: Foresight Intelligence in MLLMs and World Models
- DriveFlow: Rectified Flow Adaptation for Robust 3D Object Detection in Autonomous Driving
- LAA3D: A Benchmark of Detecting and Tracking Low-Altitude Aircraft in 3D Space
- GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
- REXO: Indoor Multi-View Radar Object Detection via 3D Bounding Box Diffusion
- Radar2Shape: 3D Shape Reconstruction from High-Frequency Radar using Multiresolution Signed Distance Functions
- Improving Multimodal Distillation for 3D Semantic Segmentation under Domain Shift
- SuperQuadricOcc: Real-Time Self-Supervised Semantic Occupancy Estimation with Superquadric Volume Rendering
- Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing
- QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy
- MobileOcc: A Human-Aware Semantic Occupancy Dataset for Mobile Robots
- CubeletWorld: A New Abstraction for Scalable 3D Modeling
- LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving
- CylinderDepth: Cylindrical Spatial Attention for Multi-View Consistent Self-Supervised Surround Depth Estimation
- CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking
- ShelfOcc: Native 3D Supervision beyond LiDAR for Vision-Based Occupancy Estimation
- Graph Query Networks for Object Detection with Automotive Radar
- SceneEdited: A City-Scale Benchmark for 3D HD Map Updating via Image-Guided Change Detection
- MambaTrack3D: A State Space Model Framework for LiDAR-Based Object Tracking under High Temporal Variation
- RoMa v2: Harder Better Faster Denser Feature Matching
- AVS: A Computational and Hierarchical Storage System for Autonomous Vehicles
- Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
- PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
- FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI
- Descriptor: Distance-Annotated Traffic Perception Question Answering (DTPQA)
- DriveLiDAR4D: Sequential and Controllable LiDAR Scene Generation for Autonomous Driving
- DAP: A Discrete-token Autoregressive Planner for Autonomous Driving
- CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving
- Decoupling Scene Perception and Ego Status: A Multi-Context Fusion Approach for Enhanced Generalization in End-to-End Autonomous Driving
- Discriminately Treating Motion Components Evolves Joint Depth and Ego-Motion Learning
- CaRLi-V: Camera-RADAR-LiDAR Point-Wise 3D Velocity Estimation
- Scalable Hierarchical AI-Blockchain Framework for Real-Time Anomaly Detection in Large-Scale Autonomous Vehicle Networks
- Fine-Grained Representation for Lane Topology Reasoning
- DoReMi: Bridging 3D Domains via Topology-Aware Domain-Representation Mixture of Experts
- Reverberation: Learning the Latencies Before Forecasting Trajectories
- GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving
- nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation
- ExpertAD: Enhancing Autonomous Driving Systems with Mixture of Experts
- DGFusion: Dual-guided Fusion for Robust Multi-Modal 3D Object Detection
- CADD: A Chinese Traffic Accident Dataset for Statute-Based Liability Attribution
- Embodied Cognition Augmented End2End Autonomous Driving
- Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance
- Invisible Triggers, Visible Threats! Road-Style Adversarial Creation Attack for Visual 3D Detection in Autonomous Driving
- HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving
- TrueCity: Real and Simulated Urban Data for Cross-Domain 3D Scene Understanding
- Relative Energy Learning for LiDAR Out-of-Distribution Detection
- A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving
- REOcc: Camera-Radar Fusion with Radar Feature Enrichment for 3D Occupancy Prediction
- Differentiable Semantic Meta-Learning Framework for Long-Tail Motion Forecasting in Autonomous Driving
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- MULTIBENCH++: A Unified and Comprehensive Multimodal Fusion Benchmarking Across Specialized Domains
- LaneDiffusion: Improving Centerline Graph Learning via Prior Injected BEV Feature Generation
- Runtime Safety Monitoring of Deep Neural Networks for Perception: A Survey
- Polymap: generating high definition map based on rasterized polygons
- How Many Tokens Do 3D Point Cloud Transformer Architectures Really Need?
- ODG: Occupancy Prediction Using Dual Gaussians
- ReGen: Generative Robot Simulation via Inverse Design
- UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction
- Studying the Effect of Explicit Interaction Representations on Learning Scene-level Distributions of Human Trajectories
- Evaluating the Impact of Weather-Induced Sensor Occlusion on BEVFusion for 3D Object Detection
- UniLION: Towards Unified Autonomous Driving Model with Linear Group RNNs
- Driving scenario generation and evaluation using a structured layer representation and foundational models
- 3EED: Ground Everything Everywhere in 3D
- Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion
- Towards classification-based representation learning for place recognition on LiDAR scans
- OmniTrack++: Omnidirectional Multi-Object Tracking by Learning Large-FoV Trajectory Feedback
- Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges
- Dynamic Model Selection for Trajectory Prediction via Pairwise Ranking and Meta-Features
- MLPerf Automotive
- Benchmarking Tesla's Traffic Light and Stop Sign Control: Field Dataset and Behavior Insights
- Constructing the Umwelt: Cognitive Planning through Belief-Intent Co-Evolution
- Self-localization on a 3D map by fusing global and local features from a monocular camera
- WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- BikeScenes: Online LiDAR Semantic Segmentation for Bicycles
- Multi-Sensor Alignment for Weather Simulations
- Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving
- VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
- AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World
- RoCA: Robust Cross-Domain End-to-End Autonomous Driving
- Distill, Diffuse, Segment: Unsupervised 3D Semantic Segmentation for Autonomous Driving Based on Multi-Level Distillation and Graph Diffusion
- SynFlow: Scaling Up LiDAR Scene Flow Estimation with Synthetic Data
- Energy-Efficient Autonomous Driving with Adaptive Perception and Robust Decision
- MIC-BEV: Multi-Infrastructure Camera Bird's-Eye-View Transformer with Relation-Aware Fusion for 3D Object Detection
- Feature-Guided Analysis of Neural Networks: A Replication Study
- ZTRS: Zero-Imitation End-to-end Autonomous Driving with Trajectory Scoring
- SynAD: Enhancing Real-World End-to-End Autonomous Driving Models through Synthetic Data Integration
- Which LiDAR scanning pattern is better for roadside perception: Repetitive or Non-repetitive?
- Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
- UrbanIng-V2X: A Large-Scale Multi-Vehicle, Multi-Infrastructure Dataset Across Multiple Intersections for Cooperative Perception
- VR-Drive: Viewpoint-Robust End-to-End Driving with Feed-Forward 3D Gaussian Splatting
- DQ3D: Depth-guided Query for Transformer-Based 3D Object Detection in Traffic Scenarios
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- DAMap: Distance-aware MapNet for High Quality HD Map Construction
- LVD-GS: Gaussian Splatting SLAM for Dynamic Scenes via Hierarchical Explicit-Implicit Representation Collaboration Rendering
- 3D Roadway Scene Object Detection with LIDARs in Snowfall Conditions
- GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation
- Scalpel: Automotive Deep Learning Framework Testing via Assembling Model Components
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- AutoScape: Geometry-Consistent Long-Horizon Scene Generation
- FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking
- VGD: Visual Geometry Gaussian Splatting for Feed-Forward Surround-view Driving Reconstruction
- From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
- Perfect Prediction or Plenty of Proposals? What Matters Most in Planning for Autonomous Driving
- Advances in 4D Representation: Geometry, Motion, and Interaction
- Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- OmniNWM: Omniscient Driving Navigation World Models
- BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining
- Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis
- FreqPDE: Rethinking Positional Depth Embedding for Multi-View 3D Object Detection Transformers
- Towards 3D Objectness Learning in an Open World
- 4DSegStreamer: Streaming 4D Panoptic Segmentation via Dual Threads
- SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
- Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
- Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models
- A Comprehensive Survey on World Models for Embodied AI
- DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
- ObjectTransforms for Uncertainty Quantification and Reduction in Vision-Based Perception for Autonomous Vehicles
- CALM-Net: Curvature-Aware LiDAR Point Cloud-based Multi-Branch Neural Network for Vehicle Re-Identification
- UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
- DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
- ADPerf: Investigating and Testing Performance in Autonomous Driving Systems
- CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
- An Analytical Framework to Enhance Autonomous Vehicle Perception for Smart Cities
- XD-RCDepth: Lightweight Radar-Camera Depth Estimation with Explainability-Aligned and Distribution-Aware Distillation
- SimULi: Real-Time LiDAR and Camera Simulation with Unscented Transforms
- CAMNet: Leveraging Cooperative Awareness Messages for Vehicle Trajectory Prediction
- Detect Anything via Next Point Prediction
- CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving
- BIGFix: Bidirectional Image Generation with Token Fixing
- Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
- DrivingScene: A Multi-Task Online Feed-Forward 3D Gaussian Splatting Method for Dynamic Driving Scenes
- CrossRay3D: Geometry and Distribution Guidance for Efficient Multimodal 3D Detection
- CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
- IntersectioNDE: Learning Complex Urban Traffic Dynamics based on Interaction Decoupling Strategy
- rareboost3d: a synthetic lidar dataset with enhanced rare classes
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- Controllable Generative Trajectory Prediction via Weak Preference Alignment
- Stability Under Scrutiny: Benchmarking Representation Paradigms for Online HD Mapping
- MCE: Towards a General Framework for Handling Missing Modalities under Imbalanced Missing Rates
- Bridging Perspectives: Foundation Model Guided BEV Maps for 3D Object Detection and Tracking
- Beyond ADE and FDE: A Comprehensive Evaluation Framework for Safety-Critical Prediction in Multi-Agent Autonomous Driving Scenarios
- A Style-Based Profiling Framework for Quantifying the Synthetic-to-Real Gap in Autonomous Driving Datasets
- Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
- Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation
- Exploring Single Domain Generalization of LiDAR-based Semantic Segmentation under Imperfect Labels
- Scalable Offline Metrics for Autonomous Driving
- Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- Learning Global Representation from Queries for Vectorized HD Map Construction
- HARP-NeXt: High-Speed and Accurate Range-Point Fusion Network for 3D LiDAR Semantic Segmentation
- Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation
- LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval
- The Safety Challenge of World Models for Embodied AI Agents: A Review
- ALISE: Annotation-Free LiDAR Instance Segmentation for Autonomous Driving
- Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models
- Diffusion2: Turning 3D Environments into Radio Frequency Heatmaps
- Latent Uncertainty Representations for Video-based Driver Action and Intention Recognition
- Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
- More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models
- Flexible and Efficient Spatio-Temporal Transformer for Sequential Visual Place Recognition
- Sequence-Preserving Dual-FoV Defense for Traffic Sign and Light Recognition in Autonomous Vehicles
- A Trajectory Generator for High-Density Traffic and Diverse Agent-Interaction Scenarios
- Semantic Visual Simultaneous Localization and Mapping: A Survey on State of the Art, Challenges, and Future Directions
- FIN: Fast Inference Network for Map Segmentation
- EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations
- CHAI: Command Hijacking against embodied AI
- EasyOcc: 3D Pseudo-Label Supervision for Fully Self-Supervised Semantic Occupancy Prediction Models
- NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving
- OceanGym: A Benchmark Environment for Underwater Embodied Agents
- Online Mapping for Autonomous Driving: Addressing Sensor Generalization and Dynamic Map Updates in Campus Environments
- LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models
- DepthLM: Metric Depth From Vision Language Models
- DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation
- From Static to Dynamic: a Survey of Topology-Aware Perception in Autonomous Driving
- BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
- WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
- Preventing Robotic Jailbreaking via Multimodal Domain Adaptation
- Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss
- BEV-VLM: Trajectory Planning via Unified BEV Abstraction
- Persistent Autoregressive Mapping with Traffic Rules for Autonomous Driving
- Residual Vector Quantization For Communication-Efficient Multi-Agent Perception
- Distant Object Localisation from Noisy Image Segmentation Sequences
- 4D Driving Scene Generation With Stereo Forcing
- Lidar-based Tracking of Traffic Participants with Sensor Nodes in Existing Urban Infrastructure
- OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
- Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints
- Driving on Registers
- RoSe: Robust Self-supervised Stereo Matching under Adverse Weather Conditions
- Pure Vision Language Action (VLA) Models: A Comprehensive Survey
- The Case for Negative Data: From Crash Reports to Counterfactuals for Reasonable Driving
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
- RCTDistill: Cross-Modal Knowledge Distillation Framework for Radar-Camera 3D Object Detection with Temporal Fusion
- MAESTRO: Task-Relevant Optimization via Adaptive Feature Enhancement and Suppression for Multi-task 3D Perception
- TinyBEV: Cross Modal Knowledge Distillation for Efficient Multi Task Bird's Eye View Perception and Planning
- RadarSFD: Single-Frame Diffusion with Pretrained Priors for Radar Point Clouds
- Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
- ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting
- RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation
- SQS: Enhancing Sparse Perception Models via Query-based Splatting in Autonomous Driving
- Neural Atlas Graphs for Dynamic Scene Decomposition and Editing
- PAN: Pillars-Attention-Based Network for 3D Object Detection
- GPU Temperature Simulation-Based Testing for In-Vehicle Deep Learning Frameworks
- Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
- KoopCast: Trajectory Forecasting via Koopman Operators
- Self-Supervised Cross-Modal Learning for Image-to-Point Cloud Registration
- RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation
- Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception
- STEP: Structured Training and Evaluation Platform for benchmarking trajectory prediction models
- DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising
- SimCoachCorpus: A naturalistic dataset with language and trajectories for embodied teaching
- BEVUDA++: Geometric-aware Unsupervised Domain Adaptation for Multi-View 3D Object Detection
- Ensemble of Pre-Trained Models for Long-Tailed Trajectory Prediction
- TreeIRL: Safe Urban Driving with Tree Search and Inverse Reinforcement Learning
- Dynamic Aware: Adaptive Multi-Mode Out-of-Distribution Detection for Trajectory Prediction in Autonomous Vehicles
- Weakly and Self-Supervised Class-Agnostic Motion Prediction for Autonomous Driving
- MATTER: Multiscale Attention for Registration Error Regression
- Maps for Autonomous Driving: Full-process Survey and Frontiers
- TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving
- 4DRadar-GS: Self-Supervised Dynamic Driving Scene Reconstruction with 4D Radar
- Towards Foundational Models for Single-Chip Radar
- Embodied Navigation Foundation Model
- Learning to Generate 4D LiDAR Sequences
- WeatherBench: A Real-World Benchmark Dataset for All-in-One Adverse Weather Image Restoration
- DeltaFlow: An Efficient Multi-frame Scene Flow Estimation Method
- 3DAeroRelief: The first 3D Benchmark UAV Dataset for Post-Disaster Assessment
- Beyond Frame-wise Tracking: A Trajectory-based Paradigm for Efficient Point Cloud Tracking
- SoK: How Sensor Attacks Disrupt Autonomous Vehicles: An End-to-end Analysis, Challenges, and Missed Threats
- The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
- CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion
- BEVTraj: Map-Free End-to-End Trajectory Prediction in Bird's-Eye View with Deformable Attention and Sparse Goal Proposals
- Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey
- Model-Agnostic Open-Set Air-to-Air Visual Object Detection for Reliable UAV Perception
- WAVE-DETR Multi-Modal Visible and Acoustic Real-Life Drone Detector
- ArgoTweak: Towards Self-Updating HD Maps through Structured Priors
- Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes
- Semantic Causality-Aware Vision-Based 3D Occupancy Prediction
- InsFusion: Rethink Instance-level LiDAR-Camera Fusion for 3D Object Detection
- Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities
- CrowdQuery: Density-Guided Query Module for Enhanced 2D and 3D Detection in Crowded Scenes
- MVAT: Multi-View Aware Teacher for Weakly Supervised 3D Object Detection
- Aerial-ground Cross-modal Localization: Dataset, Ground-truth, and Benchmark
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Asymmetry Vulnerability and Physical Attacks on Online Map Construction for Autonomous Driving
- CRAB: Camera-Radar Fusion for Reducing Depth Ambiguity in Backward Projection based View Transformation
- 3DPillars: Pillar-based two-stage 3D object detection
- OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
- Enhancing 3D Point Cloud Classification with ModelNet-R and Point-SkipNet
- Towards Open World Detection: A Survey
- Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
- Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations
- SliceSemOcc: Vertical Slice Based Multimodal 3D Semantic Occupancy Representation
- OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction
- Domain Adaptation for Different Sensor Configurations in 3D Object Detection
- SAMFusion: Sensor-Adaptive Multimodal Fusion for 3D Object Detection in Adverse Weather
- Rashomon in the Streets: Explanation Ambiguity in Scene Understanding
- KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models
- UrbanTwin: Building High-Fidelity Digital Twins for Sim2Real LiDAR Perception and Evaluation
- High-Fidelity Digital Twins for Bridging the Sim2Real Gap in LiDAR-Based ITS Perception
- Learning from geometry-aware near-misses to real-time COR: A spatiotemporal grouped random GEV framework
- Towards Training-Free Underwater 3D Object Detection from Sonar Point Clouds: A Comparison of Traditional and Deep Learning Approaches
- Enabling Federated Object Detection for Connected Autonomous Vehicles: A Deployment-Oriented Evaluation
- Machine Learning in Micromobility: A Systematic Review of Datasets, Techniques, and Applications
- A Unified Voxel Diffusion Module for Point Cloud 3D Object Detection
- PointSlice: Accurate and Efficient Slice-Based Representation for 3D Object Detection from Point Clouds
- CoVeRaP: Cooperative Vehicular Perception through mmWave FMCW Radars
- ER-LoRA: Effective-Rank Guided Adaptation for Weather-Generalized Depth Estimation
- Domain Adaptation-Based Crossmodal Knowledge Distillation for 3D Semantic Segmentation
- DriveQA: Passing the Driving Knowledge Test
- VoCap: Video Object Captioning and Segmentation from Any Prompt
- Mapping like a Skeptic: Probabilistic BEV Projection for Online HD Mapping
- How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images
- DrivingGaussian++: Towards Realistic Reconstruction and Editable Simulation for Surrounding Dynamic Driving Scenes
- To New Beginnings: A Survey of Unified Perception in Autonomous Vehicle Software
- SKGE-SWIN: End-To-End Autonomous Vehicle Waypoint Prediction and Navigation Using Skip Stage Swin Transformer
- Enhancing Pseudo-Boxes via Data-Level LiDAR-Camera Fusion for Unsupervised 3D Object Detection
- GENNAV: Polygon Mask Generation for Generalized Referring Navigable Regions
- Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts
- MapKD: Unlocking Prior Knowledge with Cross-Modal Distillation for Efficient Online HD Map Construction
- Hyperspectral Sensors and Autonomous Driving: Technologies, Limitations, and Opportunities
- RATopo: Improving Lane Topology Reasoning via Redundancy Assignment
- FlowDet: Overcoming Perspective and Scale Challenges in Real-Time End-to-End Traffic Detection
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- PseudoMapTrainer: Learning Online Mapping without HD Maps
- DoGFlow: Self-Supervised LiDAR Scene Flow via Cross-Modal Doppler Guidance
- Why Relational Graphs Will Save the Next Generation of Vision Foundation Models?
- RCDINO: Enhancing Radar-Camera 3D Object Detection with DINOv2 Semantic Features
- BasketLiDAR: The First LiDAR-Camera Multimodal Dataset for Professional Basketball MOT
- Incremental Object Detection with Prompt-based Methods
- Adversarial Generation and Collaborative Evolution of Safety-Critical Scenarios for Autonomous Vehicles
- MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
- GALA: Guided Attention with Language Alignment for Open Vocabulary Gaussian Splatting
- AutoScale: Linear Scalarization Guided by Multi-Task Optimization Metrics
- Multimodal Data Storage and Retrieval for Embodied AI: A Survey
- ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving
- RICO: Two Realistic Benchmarks and an In-Depth Analysis for Incremental Learning in Object Detection
- 2COOOL: 2nd Workshop on the Challenge Of Out-Of-Label Hazards in Autonomous Driving
- Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
- CMF-IoU: Multi-Stage Cross-Modal Fusion 3D Object Detection with IoU Joint Prediction
- Neural Rendering for Sensor Adaptation in 3D Object Detection
- edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer
- ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
- DoppDrive: Doppler-Driven Temporal Aggregation for Improved Radar Object Detection
- LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
- EvoPSF: Online Evolution of Autonomous Driving Models via Planning-State Feedback
- ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving
- Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking
- CHARM3R: Towards Unseen Camera Height Robust Monocular 3D Detector
- Towards Powerful and Practical Patch Attacks for 2D Object Detection in Autonomous Driving
- SpaRC-AD: A Baseline for Radar-Camera Fusion in End-to-End Autonomous Driving
- PTQAT: A Hybrid Parameter-Efficient Quantization Algorithm for 3D Perception Tasks
- BridgeTA: Bridging the Representation Gap in Knowledge Distillation via Teacher Assistant for Bird's Eye View Map Segmentation
- CitySeg: A 3D Open Vocabulary Semantic Segmentation Foundation Model in City-scale Scenarios
- HQ-OV3D: A High Box Quality Open-World 3D Detection Framework based on Diffision Model
- TRIDE: A Text-assisted Radar-Image weather-aware fusion network for Depth Estimation
- Decoupled Functional Evaluation of Autonomous Driving Models via Feature Map Quality Scoring
- Noise-Aware Generative Microscopic Traffic Simulation
- ForeSight: Multi-View Streaming Joint Object Detection and Trajectory Forecasting
- ETA: Energy-based Test-time Adaptation for Depth Completion
- DistillDrive: End-to-End Multi-Mode Autonomous Driving Distillation by Isomorphic Hetero-Source Planning Model
- B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding
- Towards Railway Domain Adaptation for LiDAR-based 3D Detection: Road-to-Rail and Sim-to-Real via SynDRA-BBox
- ReSim: Reliable World Simulation for Autonomous Driving
- Occupancy Learning with Spatiotemporal Memory
- BEVCon: Advancing Bird's Eye View Perception with Contrastive Learning
- RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case
- LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences
- La La LiDAR: Large-Scale Layout Generation from LiDAR Data
- Veila: Panoramic LiDAR Generation from a Monocular RGB Image
- Robust Single-Stage Fully Sparse 3D Object Detection via Detachable Latent Diffusion
- MIDAR: Mimicking LiDAR Detection for Traffic Applications with a Lightweight Plug-and-Play Model
- On-the-Fly Object-aware Representative Point Selection in Point Cloud
- Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving
- AID4AD: Aerial Image Data for Automated Driving Perception
- LT-Gaussian: Long-Term Map Update Using 3D Gaussian Splatting for Autonomous Driving
- Adaptive LiDAR Scanning: Harnessing Temporal Cues for Efficient 3D Object Detection via Multi-Modal Fusion
- DiffSemanticFusion: Semantic Raster BEV Fusion for Autonomous Driving via Online HD Map Diffusion
- HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation
- A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
- Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving
- CoProU-VO: Combining Projected Uncertainty for End-to-End Unsupervised Monocular Visual Odometry
- Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
- Stable at Any Speed: Speed-Driven Multi-Object Tracking with Learnable Kalman Filtering
- Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence
- I2V-GS: Infrastructure-to-Vehicle View Transformation with Gaussian Splatting for Autonomous Driving Data Generation
- OmniTraj: Pre-Training on Heterogeneous Data for Adaptive and Zero-Shot Human Trajectory Prediction
- DA-Occ: Direction-Aware 2D Convolution for Efficient and Geometry-Preserving 3D Occupancy Prediction
- 3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection
- A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving
- MagicRoad: Semantic-Aware 3D Road Surface Reconstruction via Obstacle Inpainting
- FASTopoWM: Fast-Slow Lane Segment Topology Reasoning with Latent World Models
- PriorFusion: Unified Integration of Priors for Robust Road Perception in Autonomous Driving
- FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
- Generative Active Learning for Long-tail Trajectory Prediction via Controllable Diffusion Model
- UAVScenes: A Multi-Modal Dataset for UAVs
- Safety Evaluation of Motion Plans Using Trajectory Predictors as Forward Reachable Set Estimators
- Object Recognition Datasets and Challenges: A Review
- Goal-Based Vision-Language Driving
- Vision-Language Cross-Attention for Real-Time Autonomous Driving
- Interactive Adversarial Testing of Autonomous Vehicles with Adjustable Confrontation Intensity
- Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition
- RelMap: Enhancing Online Map Construction with Class-Aware Spatial Relation and Semantic Priors
- MapDiffusion: Generative Diffusion for Vectorized Online HD Map Construction and Uncertainty Estimation in Autonomous Driving
- Collaborative Perceiver: Elevating Vision-based 3D Object Detection via Local Density-Aware Spatial Occupancy
- GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction
- Teleoperating Autonomous Vehicles over Commercial 5G Networks: Are We There Yet?
- Humanoid Occupancy: Enabling A Generalized Multimodal Occupancy Perception System on Humanoid Robots
- VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving
- DriveIndia: An Object Detection Dataset for Diverse Indian Traffic Scenes
- TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking
- GS-Occ3D: Scaling Vision-only Occupancy Reconstruction with Gaussian Splatting
- BEV-LLM: Leveraging Multimodal BEV Maps for Scene Captioning in Autonomous Driving
- Multistream Network for LiDAR and Camera-based 3D Object Detection in Outdoor Scenes
- CoopTrack: Exploring End-to-End Learning for Efficient Cooperative Sequential Perception
- Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
- SmartPNT-MSF: A Multi-Sensor Fusion Dataset for Positioning and Navigation Research
- Orbis: Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- Delving into Mapping Uncertainty for Mapless Trajectory Prediction
- Goal-based Trajectory Prediction for improved Cross-Dataset Generalization
- HybridTM: Combining Transformer and Mamba for 3D Semantic Segmentation
- GaussianFusionOcc: A Seamless Sensor Fusion Approach for 3D Occupancy Prediction Using 3D Gaussians
- Diffusion-FS: Multimodal Free-Space Prediction via Diffusion for Autonomous Driving
- Image Generators are Generalist Vision Learners
- GOSPA and T-GOSPA quasi-metrics for evaluation of multi-object tracking algorithms
- Perspective-Invariant 3D Object Detection
- PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving
- Testing Autonomous Driving Systems -- What Really Matters and What Doesn't
- LDRFusion: A LiDAR-Dominant multimodal refinement framework for 3D object detection
- Controllable Video Generation: A Survey
- AD2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
- City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning
- World Model-Based End-to-End Scene Generation for Accident Anticipation in Autonomous Driving
- AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models
- AD-GS: Object-Aware B-Spline Gaussian Splatting for Self-Supervised Autonomous Driving
- Foresight in Motion: Reinforcing Trajectory Prediction with Reward Heuristics
- Towards Autonomous Riding: A Review of Perception, Planning, and Control in Intelligent Two-Wheelers
- ReAL-AD: Towards Human-Like Reasoning in End-to-End Autonomous Driving
- From Binary to Semantic: Utilizing Large-Scale Binary Occupancy Data for 3D Semantic Occupancy Prediction
- LidarPainter: One-Step Away From Any Lidar View To Novel Guidance
- MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding
- SDTagNet: Leveraging Text-Annotated Navigation Maps for Online HD Map Construction
- Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
- Towards Generalized Range-View LiDAR Segmentation in Adverse Weather
- RCG: Safety-Critical Scenario Generation for Robust Autonomous Driving via Real-World Crash Grounding
- A Generalizable Physics-Enhanced State Space Model for Long-Term Dynamics Forecasting in Complex Environments
- TruckV2X: A Truck-Centered Perception Dataset
- Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive
- I2-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting
- Temporal Misalignment Attacks against Multimodal Perception in Autonomous Driving
- OnlineBEV: Recurrent Temporal Fusion in Bird's Eye View Representations for Multi-Camera 3D Perception
- LiDAR, GNSS and IMU Sensor Alignment through Dynamic Time Warping to Construct 3D City Maps
- Raptor: Scalable Train-Free Embeddings for 3D Medical Volumes Leveraging Pretrained 2D Foundation Models
- Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency
- AirScape: An Aerial Generative World Model with Motion Controllability
- MoSE: Skill-by-Skill Mixture-of-Experts Learning for Embodied Autonomous Machines
- LOSC: LiDAR Open-voc Segmentation Consolidator
- AI Should Sense Better, Not Just Scale Bigger: Adaptive Sensing as a Paradigm Shift
- Online Navigation Refinement: Achieving Lane-Level Guidance by Associating Standard-Definition and Online Perception Maps
- What Demands Attention in Urban Street Scenes? From Scene Understanding towards Road Safety: A Survey of Vision-driven Datasets and Studies
- Solar Altitude Guided Scene Illumination
- YOLO-APD: Enhancing YOLOv8 for Robust Pedestrian Detection on Complex Road Geometries
- CorrelationFlow: A Training-Free Geometric Approach for LiDAR Scene Flow Estimation
- Beyond One Shot, Beyond One Perspective: Cross-View and Long-Horizon Distillation for Better LiDAR Representations
- SeqGrowGraph: Learning Lane Topology as a Chain of Graph Expansions
- NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving
- U-ViLAR: Uncertainty-Aware Visual Localization for Autonomous Driving via Differentiable Association and Registration
- MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
- Just Add Geometry: Gradient-Free Open-Vocabulary 3D Detection Without Human-in-the-Loop
- Towards Accurate and Efficient 3D Object Detection for Autonomous Driving: A Mixture of Experts Computing System on Edge
- Breaking Imitation Bottlenecks: Reinforced Diffusion Powers Diverse Trajectory Generation
- NRSeg: Noise-Resilient Learning for BEV Semantic Segmentation via Driving World Models
- VISC: mmWave Radar Scene Flow Estimation using Pervasive Visual-Inertial Supervision
- 2.5D Object Detection for Intelligent Roadside Infrastructure
- Evaluation of an Uncertainty-Aware Late Fusion Algorithm for Multi-Source Bird's Eye View Detections Under Controlled Noise
- A Late Collaborative Perception Framework for 3D Multi-Object and Multi-Source Association and Fusion
- PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection
- LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
- Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges
- AMD: Adaptive Momentum and Decoupled Contrastive Learning Framework for Robust Long-Tail Trajectory Prediction
- Depth Anything at Any Condition
- OoDDINO:A Multi-level Framework for Anomaly Segmentation on Complex Road Scenes
- Coherent Online Road Topology Estimation and Reasoning with Standard-Definition Maps
- VLAD: A VLM-Augmented Autonomous Driving Framework with Hierarchical Planning and Interpretable Decision Process
- ECCV 2024 W-CODA: 1st Workshop on Multimodal Perception and Comprehension of Corner Cases in Autonomous Driving
- What Really Matters for Robust Multi-Sensor HD Map Construction?
- RTMap: Real-Time Recursive Mapping with Change Detection and Localization
- World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model
- Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving
- Learning Dense Feature Matching via Lifting Single 2D Image to 3D Space
- A Survey: Learning Embodied Intelligence from Physical Simulators and World Models
- SafeMap: Robust HD Map Construction from Incomplete Observations
- Epona: Autoregressive Diffusion World Model for Autonomous Driving
- StyleDrive: Towards Driving-Style Aware Benchmarking of End-To-End Autonomous Driving
- Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Rule
- Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?
- SG-LDM: Semantic-Guided LiDAR Generation via Latent-Aligned Diffusion
- OcRFDet: Object-Centric Radiance Fields for Multi-View 3D Object Detection in Autonomous Driving
- Towards foundational LiDAR world models with efficient latent flow matching
- Risk-Based Filtering of Valuable Driving Situations in the Waymo Open Motion Dataset
- A Survey on Vision-Language-Action Models for Autonomous Driving
- Rethink 3D Object Detection from Physical World
- Dreamland: Controllable World Creation with Simulator and Generative Models
- Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis
- High-quality Pseudo-labeling for Point Cloud Segmentation with Scene-level Annotation
- Mode Collapse Happens: Evaluating Critical Interactions in Joint Trajectory Prediction Models
- Detecting What Matters: A Novel Approach for Out-of-Distribution 3D Object Detection in Autonomous Vehicles
- LogoSP: Local-global Grouping of Superpoints for Unsupervised Semantic Segmentation of 3D Point Clouds
- DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction
- Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching
- SAM2Auto: Auto Annotation Using FLASH
- Exploiting Vision Language Model for Training-Free 3D Point Cloud OOD Detection via Graph Score Propagation
- Pedestrian Intention and Trajectory Prediction in Unstructured Traffic Using IDD-PeD
- Learning-Based Hybrid Neural Receiver for 6G-V2X Communications
- SceneDiffuser++: City-Scale Traffic Simulation via a Generative World Model
- Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles
- Query as Test: An Intelligent Driving Test and Data Storage Method for Integrated Cockpit-Vehicle-Road Scenarios
- SAM4D: Segment Anything in Camera and LiDAR Streams
- MADrive: Memory-Augmented Driving Scene Modeling
- Fractional Collisions: A Framework for Risk Estimation of Counterfactual Conflicts using Autonomous Driving Behavior Simulations
- Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
- FreeDNA: Endowing Domain Adaptation of Diffusion-Based Dense Prediction with Training-Free Domain Noise Alignment
- Controllable 3D Placement of Objects with Scene-Aware Diffusion Models
- GoIRL: Graph-Oriented Inverse Reinforcement Learning for Multimodal Trajectory Prediction
- Sim2Val: Leveraging Correlation Across Test Platforms for Variance-Reduced Metric Estimation
- LiteVLM: A Low-Latency Vision-Language Model Inference Pipeline for Resource-Constrained Environments
- From Ideal to Real: Unified and Data-Efficient Dense Prediction for Real-World Scenarios
- WonderFree: Enhancing Novel View Quality and Cross-View Consistency for 3D Scene Exploration
- AdaDeDup: Adaptive Hybrid Data Pruning for Efficient Large-Scale Object Detection Training
- ZeroVO: Visual Odometry with Minimal Assumptions
- Trajectory Prediction in Dynamic Object Tracking: A Critical Study
- TOMD: A Trail-based Off-road Multimodal Dataset for Traversable Pathway Segmentation under Challenging Illumination Conditions
- A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects
- Flow-Anything: Learning Real-World Optical Flow Estimation from Large-Scale Single-view Images
- PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes
- R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation
- Multi-Scale Spectral Attention Module-based Hyperspectral Segmentation in Autonomous Driving Scenarios
- YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos
- Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
- MCN-SLAM: Multi-Agent Collaborative Neural SLAM with Hybrid Implicit Neural Scene Representation
- Learning to Generate Vectorized Maps at Intersections with Multiple Roadside Cameras
- Bayesian Multiobject Tracking With Neural-Enhanced Motion and Measurement Models
- DRAMA-X: A Fine-grained Intent Prediction and Risk Reasoning Benchmark For Driving
- When Every Millisecond Counts: Real-Time Anomaly Detection via the Multimodal Asynchronous Hybrid Network
- Multi-label Scene Classification for Autonomous Vehicles: Acquiring and Accumulating Knowledge from Diverse Datasets
- A Synthetic Benchmark for Collaborative 3D Semantic Occupancy Prediction in V2X-Enabled Autonomous Driving
- ForestFormer3D: A Unified Framework for End-to-End Segmentation of Forest LiDAR 3D Point Clouds
- A Novel Multi-layer Task-centric and Data Quality Framework for Autonomous Driving
- Quantum Artificial Intelligence for Secure Autonomous Vehicle Navigation: An Architectural Proposal
- Heterogeneous-Modal Unsupervised Domain Adaptation via Latent Space Bridging
- Implicit 3D scene reconstruction using deep learning towards efficient collision understanding in autonomous driving
- RaCalNet: Radar Calibration Network for Sparse-Supervised Metric Depth Estimation
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- MapFM: Foundation Model-Driven HD Mapping with Multi-Task Contextual Learning
- NetRoller: Interfacing General and Specialized Models for End-to-End Autonomous Driving
- Image Segmentation with Large Language Models: A Survey with Perspectives for Intelligent Transportation Systems
- X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability
- Deep Learning-Based Multi-Object Tracking: A Comprehensive Survey from Foundations to State-of-the-Art
- COME: Adding Scene-Centric Forecasting Control to Occupancy World Model
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- Technical Report for ICRA 2025 GOOSE 3D Semantic Segmentation Challenge: Adaptive Point Cloud Understanding for Heterogeneous Robotic Systems
- Improving Traffic Signal Data Quality for the Waymo Open Motion Dataset
- BePo: Dual Representation for 3D Occupancy Prediction
- Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis
- FocalAD: Local Motion Planning for End-to-End Autonomous Driving
- Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
- Polar Hierarchical Mamba: Towards Streaming LiDAR Object Detection with Point Clouds as Egocentric Sequences
- Using Language and Road Manuals to Inform Map Reconstruction for Autonomous Driving
- QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction
- GenWorld: Towards Detecting AI-generated Real-world Simulation Videos
- TARDIS STRIDE: A Spatio-Temporal Road Image Dataset and World Model for Autonomy
- Poutine: Vision-Language-Trajectory Pre-Training and Reinforcement Learning Post-Training Enable Robust End-to-End Autonomous Driving
- DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
- DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models
- STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving
- VoxelSplat: Dynamic Gaussian Splatting as an Effective Loss for Occupancy and Flow Prediction
- S2GO: Streaming Sparse Gaussian Occupancy Prediction
- VideoMolmo: Spatio-Temporal Grounding Meets Pointing
- Unifying Appearance Codes and Bilateral Grids for Driving Scene Gaussian Splatting
- Bridging Annotation Gaps: Transferring Labels to Align Object Detection Datasets
- PillarMamba: Learning Local-Global Context for Roadside Point Cloud via Hybrid State Space Model
- DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
- Structure-Aware Radar-Camera Depth Estimation
- Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
- FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices
- MFSeg: Efficient Multi-frame 3D Semantic Segmentation
- Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection
- SELECT: A Submodular Approach for Active LiDAR Semantic Segmentation
- RobotxR1: Enabling Embodied Robotic Intelligence on Large Language Models through Closed-Loop Reinforcement Learning
- CaRaFFusion: Improving 2D Semantic Segmentation with Camera-Radar Point Cloud Fusion and Zero-Shot Image Inpainting
- You Only Train Once
- FSHNet: Fully Sparse Hybrid Network for 3D Object Detection
- BEVCALIB: LiDAR-Camera Calibration via Geometry-Guided Bird's-Eye View Representations
- HiLO: High-Level Object Fusion for Autonomous Driving using Transformers
- Towards In-the-wild 3D Plane Reconstruction from a Single Image
- Controllable Radar Simulation with Waveform Parameter Embedding
- Auto-Annotation with Expert-Crafted Guidelines: A Study through 3D LiDAR Detection Benchmark
- Trajectory Prediction Meets Large Language Models: A Survey
- Rig3R: Rig-Aware Conditioning for Learned 3D Reconstruction
- LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model
- SynSHRP2: A Synthetic Multimodal Benchmark for Driving Safety-critical Events Derived from Real-world Driving Data
- RealDrive: Retrieval-Augmented Driving with Diffusion Models
- NUC-Net: Non-uniform Cylindrical Partition Network for Efficient LiDAR Semantic Segmentation
- S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation
- Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes
- TPDNet: Triple phenotype deepen networks for monocular 3D object detection of melons and fruits in fields
- UrbanCraft: Urban View Extrapolation via Hierarchical Sem-Geometric Priors
- WTEFNet: Real-Time Low-Light Object Detection for Advanced Driver Assistance Systems
- VISLIX: An XAI Framework for Validating Vision Models with Slice Discovery and Analysis
- RISEE: A Highly Interactive Naturalistic Driving Trajectories Dataset with Human Subjective Risk Perception and Eye-tracking Information
- MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
- Point-MoE: Large-Scale Multi-Dataset Training with Mixture-of-Experts for 3D Semantic Segmentation
- Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
- GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
- LiDARDustX: A LiDAR Dataset for Dusty Unstructured Road Environments
- RC-AutoCalib: An End-to-End Radar-Camera Automatic Calibration Network
- SPIRAL: Semantic-Aware Progressive LiDAR Scene Generation and Understanding
- PS4PRO: Pixel-to-pixel Supervision for Photorealistic Rendering and Optimization
- SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors
- A Survey on Training-free Open-Vocabulary Semantic Segmentation
- CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving
- DSOcc: Leveraging Depth Awareness and Semantic Aid to Boost Camera-Based 3D Semantic Occupancy Prediction
- See through the Dark: Learning Illumination-affined Representations for Nighttime Occupancy Prediction
- Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
- DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
- Object Concepts Emerge from Motion
- Assured Autonomy with Neuro-Symbolic Perception
- RefAV: Towards Planning-Centric Scenario Mining
- Simulating the Unseen: Crash Prediction Must Learn from What Did Not Happen
- WeatherEdit: Controllable Weather Editing with 4D Gaussian Field
- Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects
- LPCM: Learning-based Predictive Coding for LiDAR Point Cloud Compression
- DriveCamSim: Generalizable Camera Simulation via Explicit Camera Modeling for Autonomous Driving
- DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving
- VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion
- How Do Images Align and Complement LiDAR? Towards a Harmonized Multi-modal 3D Panoptic Segmentation
- Echo Planning for Autonomous Driving: From Current Observations to Future Trajectories and Back
- Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization
- Rethinking Causal Mask Attention for Vision-Language Inference
- S2R-Bench: A Sim-to-Real Evaluation Benchmark for Autonomous Driving
- Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
- DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing
- CoopReflect: Towards Natural Language Communication for Cooperative Autonomous Driving via Multi-Agent Learning
- CalibBEV: LiDAR-Camera Calibration via BEV Alignment
- TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks
- TopoPoint: Enhance Topology Reasoning via Endpoint Detection in Autonomous Driving
- RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection
- SafeMVDrive: Multi-view Safety-Critical Driving Video Synthesis in the Real World Domain
- FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
- CrashAgent: Crash Scenario Generation via Multi-modal Reasoning
- Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation
- RealEngine: Simulating Autonomous Driving in Realistic Context
- Temporal Object Captioning for Street Scene Videos from LiDAR Tracks
- AdvReal: Physical Adversarial Patch Generation Framework for Security Evaluation of Object Detection Systems
- SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
- CodeMerge: Codebook-Guided Model Merging for Robust Test-Time Adaptation in Autonomous Driving
- A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems
- MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving
- How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
- Challenger: Affordable Adversarial Driving Video Generation
- Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition
- ALN-P3: Unified Language Alignment for Perception, Prediction, and Planning in Autonomous Driving
- RadarRGBD A Multi-Sensor Fusion Dataset for Perception with RGB-D and mmWave Radar
- VERDI: VLM-Embedded Reasoning for Autonomous Driving
- Learning better representations for crowded pedestrians in offboard LiDAR-camera 3D tracking-by-detection
- Multi-View Projection for Unsupervised Domain Adaptation in 3D Semantic Segmentation
- iPad: Iterative Proposal-centric End-to-End Autonomous Driving
- TALSC: Timeliness-Aware Large-Small VLM Collaboration for Infrastructure-Assisted Autonomous Driving
- Generative AI for Autonomous Driving: A Review
- Multi-modal Traffic Scenario Generation for Autonomous Driving System Testing
- SuperMapNet for Long-Range and High-Accuracy Vectorized HD Map Construction
- Safety2Drive: Safety-Critical Scenario Benchmark for the Evaluation of Autonomous Driving
- LiDAR MOT-DETR: A LiDAR-based Two-Stage Transformer for 3D Multiple Object Tracking
- Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review
- AGI-Elo: How Far Are We From Mastering A Task?
- TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy
- STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision
- PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning
- Road Segmentation for ADAS/AD Applications
- Always Clear Depth: Robust Monocular Depth Estimation under Adverse Weather
- Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data
- Driver2Map: Imitating Human Driving for Online High-Definition Map Construction
- LD-Scene: LLM-Guided Diffusion for Controllable Generation of Adversarial Safety-Critical Driving Scenarios
- TartanGround: A Large-Scale Dataset for Ground Robot Perception and Navigation
- Inferring Driving Maps by Deep Learning-based Trail Map Extraction
- GaussianFormer3D: Multi-Modal Gaussian-based Semantic Occupancy Prediction with 3D Deformable Attention
- Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
- SafePath: Conformal Prediction for Safe LLM-Based Autonomous Navigation
- Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving
- OpenLKA: An Open Dataset of Lane Keeping Assist from Recent Car Models under Real-world Driving Conditions
- Efficient LiDAR Reflectance Compression via Scanning Serialization
- Camera-Only 3D Panoptic Scene Completion for Autonomous Driving through Differentiable Object Shapes
- Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
- Explaining Autonomous Vehicles with Intention-aware Policy Graphs
- EnvShip: A Unified Framework for Context-Aware and Cross-Region Vessel Trajectory Forecasting
- BETTY Dataset: A Multi-modal Dataset for Full-Stack Autonomy
- DepthFusion: Depth-Aware Hybrid Feature Fusion for LiDAR-Camera 3D Object Detection
- VALISENS: A Validated Innovative Multi-Sensor System for Cooperative Automated Driving
- M3CAD: Towards Generic Cooperative Autonomous Driving Benchmark
- V2VCrafter: Consistent Street-View Image Generation Across Vehicles
- Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach
- RESAR-BEV: An Explainable Progressive Residual Autoregressive Approach for Camera-Radar Fusion in BEV Segmentation
- Camera-Only Bird's Eye View Perception: A Neural Approach to LiDAR-Free Environmental Mapping for Autonomous Vehicles
- A Vehicle System for Navigating Among Vulnerable Road Users Including Remote Operation
- Spotting the Unexpected (STU): A 3D LiDAR Dataset for Anomaly Segmentation in Autonomous Driving
- DualDiff: Dual-branch Diffusion Model for Autonomous Driving with Semantic Fusion
- UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
- PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth
- PhysNav-DG: A Novel Adaptive Framework for Robust VLM-Sensor Fusion in Navigation Applications
- Fusion-Poly: A Polyhedral Framework Based on Spatial-Temporal Fusion for 3D Multi-Object Tracking
- Synthesizing and Identifying Noise Levels in Autonomous Vehicle Camera Radar Datasets
- DRIV-EX: Counterfactual Explanations for Driving LLMs
- Safety-Critical Traffic Simulation with Guided Latent Diffusion Model
- LightEMMA: Lightweight End-to-End Multimodal Model for Autonomous Driving
- Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs
- Scaling Self-Play for End-to-End Driving
- M2-Occ: Resilient 3D Semantic Occupancy Prediction for Autonomous Driving with Incomplete Camera Inputs
- HeAL3D: Heuristical-enhanced Active Learning for 3D Object Detection
- UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving
- SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models
- Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving
- A Survey of Interactive Generative Video
- REHEARSE-3D: A Multi-modal Emulated Rain Dataset for 3D Point Cloud De-raining
- ImaginateAR: AI-Assisted In-Situ Authoring in Augmented Reality
- FusionSense: Tri-Stage Near-Sensor Learning for Runtime-Adaptive Multimodal Edge Intelligence
- STELLAR: Scaling 3D Perception Large Models for Autonomous Driving
- Syn4D: A Multiview Synthetic 4D Dataset
- Floating Car Observers in Intelligent Transportation Systems: Detection Modeling and Temporal Insights
- DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
- OccAny: Generalized Unconstrained Urban 3D Occupancy
- Disengagement Analysis and Field Tests of a Prototypical Open-Source Level 4 Autonomous Driving System
- HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps
- Mixture of Experts for Decentralized Generative AI and Reinforcement Learning in Wireless Networks: A Comprehensive Survey
- STCOcc: Sparse Spatial-Temporal Cascade Renovation for 3D Occupancy and Scene Flow Prediction
- LRFusionPR: A Polar BEV-Based LiDAR-Radar Fusion Network for Place Recognition
- Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
- Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
- Depth as Points: Center Point-based Depth Estimation
- Examining the Impact of Optical Aberrations to Image Classification and Object Detection Models
- Boxi: Design Decisions in the Context of Algorithmic Performance for Robotics
- NoiseController: Towards Consistent Multi-view Video Generation via Noise Decomposition and Collaboration
- Toward Fully Autonomous Driving: AI, Challenges, Opportunities, and Needs
- R3DPA: Leveraging 3D Representation Alignment and RGB Pretrained Priors for LiDAR Scene Generation
- NCGR: Noise-Conditional Gated Rectification for Camera Extrinsic Perturbations in BEV 3D Object Detection
- Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation
- LiDAR-Guided Monocular 3D Object Detection for Long-Range Railway Monitoring
- RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models
- Highly Accurate and Diverse Traffic Data: The DeepScenario Open 3D Dataset
- An active-learning framework for real-time depth perception from monocular vision streams
- NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment
- Inverse++: Vision-Centric 3D Semantic Occupancy Prediction Assisted with 3D Object Detection
- Marginalized Generalized IoU (MGIoU): A Unified Objective Function for Optimizing Any Convex Parametric Shapes
- SILM: A Subjective Intent Based Low-Latency Framework for Multiple Traffic Participants Joint Trajectory Prediction
- Revisiting Radar Camera Alignment by Contrastive Learning for 3D Object Detection
- Systematic Literature Review on Vehicular Collaborative Perception -- A Computer Vision Perspective
- Gaussian Splatting is an Effective Data Generator for 3D Object Detection
- Scene-Aware Location Modeling for Data Augmentation in Automotive Object Detection
- MS-Occ: Multi-Stage LiDAR-Camera Fusion for 3D Semantic Occupancy Prediction
- Data Scaling Laws for End-to-End Autonomous Driving
- OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
- SocialMOIF: Multi-Order Intention Fusion for Pedestrian Trajectory Prediction
- DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment
- Pose Optimization for Autonomous Driving Datasets using Neural Rendering Models
- DataS3: Dataset Subset Selection for Specialization
- ZFusion: An Effective Fuser of Camera and 4D Radar for 3D Object Perception in Autonomous Driving
- Exploring Modality Guidance to Enhance VFM-based Feature Fusion for UDA in 3D Semantic Segmentation
- Learning Through Retrospection: Improving Trajectory Prediction for Automated Driving with Error Feedback
- Lightweight LiDAR-Camera 3D Dynamic Object Detection and Multi-Class Trajectory Prediction
- LMPOcc: 3D Semantic Occupancy Prediction Utilizing Long-Term Memory Prior from Historical Traversals
- Towards a Multi-Agent Vision-Language System for Zero-Shot Novel Hazardous Object Detection for Autonomous Driving Safety
- Weak Cube R-CNN: Weakly Supervised 3D Detection using only 2D Bounding Boxes
- Uncertainty-Aware Trajectory Prediction via Rule-Regularized Heteroscedastic Deep Classification
- Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction
- Approaching Current Challenges in Developing a Software Stack for Fully Autonomous Driving
- Collaborative Perception Datasets for Autonomous Driving: A Review
- UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty
- Explainable Scene Understanding with Qualitative Representations and Graph Neural Networks
- Fully Unified Motion Planning for End-to-End Autonomous Driving
- JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration
- TacoDepth: Towards Efficient Radar-Camera Depth Estimation with One-stage Fusion
- Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features
- Hybrid Probabilistic Zonotopes for Identifiable and Refinable Predictive Uncertainty
- LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection
- MapTCL: Temporal Consistency Learning via Bidirectional Alignment for Vectorized HD Map Construction
- VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models
- GC-GAT: Multimodal Vehicular Trajectory Prediction using Graph Goal Conditioning and Cross-context Attention
- E2E Parking Dataset: An Open Benchmark for End-to-End Autonomous Parking
- Enhancing Autonomous Driving Systems with On-Board Deployed Large Language Models
- GATE3D: Generalized Attention-based Task-synergized Estimation in 3D*
- Decoupled Diffusion Sparks Adaptive Scene Generation
- LMFormer: Lane based Motion Prediction Transformer
- AGO: Adaptive Grounding for Open World 3D Occupancy Prediction
- SIO-Mapper: A Framework for Lane-Level HD Map Construction Using Satellite Images and OpenStreetMap with No On-Site Visits
- ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
- ADDT -- A Digital Twin Framework for Proactive Safety Validation in Autonomous Driving Systems
- RICCARDO: Radar Hit Prediction and Convolution for Camera-Radar 3D Object Detection
- Offline Reinforcement Learning using Human-Aligned Reward Labeling for Autonomous Emergency Braking in Occluded Pedestrian Crossing
- Datasets for Lane Detection in Autonomous Driving: A Comprehensive Review
- InSPE: Rapid Evaluation of Heterogeneous Multi-Modal Infrastructure Sensor Placement
- TinyCenterSpeed: Efficient Center-Based Object Detection for Autonomous Racing
- Adversarial Examples in Environment Perception for Automated Driving (Review)
- Detect Anything 3D in the Wild
- RASMD: RGB And SWIR Multispectral Driving Dataset for Robust Perception in Adverse Conditions
- Drive in Corridors: Enhancing the Safety of End-to-end Autonomous Driving via Corridor Learning and Planning
- FACT: Multinomial Misalignment Classification for Point Cloud Registration
Related