Scalability in Perception for Autonomous Driving: Waymo Open Dataset
2019/12/10 by Pei Sun, Henrik Kretzschmar, Sun, Pei +47 · 329 citations
Computer Science · Engineering · #Advanced Neural Network Applications #Autonomous Vehicle Technology and Safety #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Video Surveillance and Tracking Methods
paper · pdf · doi:10.48550/arxiv.1912.04838
openalex publication_date 2019/12/10 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
The research community has increasing interest in autonomous driving research, despite the resource intensity of obtaining representative real world data. Existing self-driving datasets are limited in the scale and variation of the environments they capture, even though generalization within and between operating regions is crucial to the overall viability of the technology. In an effort to help align the research community's contributions with real-world self-driving problems, we introduce a new large scale, high quality, diverse dataset. Our new dataset consists of 1150 scenes that each span 20 seconds, consisting of well synchronized and calibrated high quality LiDAR and camera data captured across a range of urban and suburban geographies. It is 15x more diverse than the largest camera+LiDAR dataset available based on our proposed diversity metric. We exhaustively annotated this data with 2D (camera image) and 3D (LiDAR) bounding boxes, with consistent identifiers across frames. Finally, we provide strong baselines for 2D as well as 3D detection and tracking tasks. We further study the effects of dataset size and generalization across geographies on 3D detection methods. Find data, code and more up-to-date information at http://www.waymo.com/open.
Citations
Cited by
- SpatialMosaic: A Multiview VLM Dataset for Partial Visibility
- GeoTeacher: Geometry-Guided Semi-Supervised 3D Object Detection
- Split4D: Decomposed 4D Scene Reconstruction Without Video Segmentation
- SCPainter: A Unified Framework for Realistic 3D Asset Insertion and Novel View Synthesis
- SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception
- DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification
- RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction
- FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog
- Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning
- Geometric Context Transformer for Streaming 3D Reconstruction
- AutoWorld: Learning Multi-Agent Traffic Simulation with Self-Supervised World Models
- ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training
- UP-Fuse: Uncertainty-guided LiDAR-Camera Fusion for 3D Panoptic Segmentation
- Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow
- SymDrive: Realistic and Controllable Driving Simulator via Symmetric Auto-regressive Online Restoration
- OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective
- Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
- From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
- HyGE-Occ: Hybrid View-Transformation with 3D Gaussian and Edge Priors for 3D Panoptic Occupancy Prediction
- LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
- Spectral Discrepancy and Cross-modal Semantic Consistency Learning for Object Detection in Hyperspectral Image
- MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation
- G3Splat: Geometrically Consistent Generalizable Gaussian Splatting
- LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents
- DVGT: Driving Visual Geometry Transformer
- DenseBEV: Transforming BEV Grid Cells into 3D Objects
- R3ST: A Synthetic 3D Dataset With Realistic Trajectories
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- SemanticBridge - A Dataset for 3D Semantic Segmentation of Bridges and Domain Gap Analysis
- EPSM: A Novel Metric to Evaluate the Safety of Environmental Perception in Autonomous Driving
- CLAIM: Camera-LiDAR Alignment with Intensity and Monodepth
- FocalComm: Hard Instance-Aware Multi-Agent Perception
- LitePT: Lighter Yet Stronger Point Transformer
- Recurrent Video Masked Autoencoders
- LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstruction
- Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
- Measuring What Matters: Scenario-Driven Evaluation for Trajectory Predictors in Autonomous Driving
- DOS: Distilling Observable Softmaps of Zipfian Prototypes for Self-Supervised Point Representation
- TransBridge: Boost 3D Object Detection by Scene-Level Completion with Transformer Decoder
- MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
- V-OCBF: Learning Safety Filters from Offline Data via Value-Guided Offline Control Barrier Functions
- Video Depth Propagation
- UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
- Geometry-to-Image Synthesis-Driven Generative Point Cloud Registration
- Intelligent Resilience Testing for Decision-Making Agents with Dual-Mode Surrogate Adaptation
- SSCATeR: Sparse Scatter-Based Convolution Algorithm with Temporal Data Recycling for Real-Time 3D Object Detection in LiDAR Point Clouds
- Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
- On-the-fly Large-scale 3D Reconstruction from Multi-Camera Rigs
- Advancing Autonomous Driving System Testing: Demands, Challenges, and Future Directions
- SOP2: Transfer Learning with Scene-Oriented Prompt Pool on 3D Object Detection
- Characterizing Lane-Changing Behavior in Mixed Traffic
- Hierarchical Image-Guided 3D Point Cloud Segmentation in Industrial Scenes via Multi-View Bayesian Fusion
- JOCA: Task-Driven Joint Optimisation of Camera Hardware and Adaptive Camera Control Algorithms
- Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework
- OWL: Unsupervised 3D Object Detection by Occupancy Guided Warm-up and Large Model Priors Reasoning
- LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- ReCamDriving: LiDAR-Free Camera-Controlled Novel Trajectory Video Generation
- What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models
- Flux4D: Flow-based Unsupervised 4D Reconstruction
- DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling
- BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection
- CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
- nuScenes Revisited: Progress and Challenges in Autonomous Driving
- Quantum Vanguard: Server Optimized Privacy Fortified Federated Intelligence for Future Vehicles
- New Spiking Architecture for Multi-Modal Decision-Making in Autonomous Vehicles
- Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
- OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
- OpenBox: Annotate Any Bounding Boxes in 3D
- InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
- Estimation of Kinematic Motion from Dashcam Footage
- MTR-VP: Towards End-to-End Trajectory Planning through Context-Driven Image Encoding and Multiple Trajectory Prediction
- Cooperative Safety Intelligence in V2X-Enabled Transportation: A Survey
- TAPVid-360: Tracking Any Point in 360 from Narrow Field of View Video
- Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
- Combining Projected Uncertainty for Self-Supervised Visual Odometry: From Two-Frame to Multi-Frame
- UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data
- HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
- FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain
- Estimating Fog Parameters from a Sequence of Stereo Images
- Spira: Exploiting Voxel Data Structural Properties for Efficient Sparse Convolution in Point Cloud Networks
- AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
- Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge
- Foundry: Distilling 3D Foundation Models for the Edge
- Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
- DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving
- Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
- DOGE: Differentiable Bezier Graph Optimization for Road Network Extraction
- AMB3R: Accurate Feed-forward Metric-scale 3D Reconstruction with Backend
- IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving Scenes
- Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
- DriveFlow: Rectified Flow Adaptation for Robust 3D Object Detection in Autonomous Driving
- Exploring Surround-View Fisheye Camera 3D Object Detection
- IDEAL-M3D: Instance Diversity-Enriched Active Learning for Monocular 3D Detection
- LAA3D: A Benchmark of Detecting and Tracking Low-Altitude Aircraft in 3D Space
- SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
- UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
- Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
- SPIDER: Spatial Image CorresponDence Estimator for Robust Calibration
- MobileOcc: A Human-Aware Semantic Occupancy Dataset for Mobile Robots
- CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking
- SceneEdited: A City-Scale Benchmark for 3D HD Map Updating via Image-Guided Change Detection
- AVS: A Computational and Hierarchical Storage System for Autonomous Vehicles
- PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
- Monocular 3D Lane Detection via Structure Uncertainty-Aware Network with Curve-Point Queries
- LiDAR-GS++:Improving LiDAR Gaussian Reconstruction via Diffusion Priors
- Depth-Consistent 3D Gaussian Splatting via Physical Defocus Modeling and Multi-View Geometric Supervision
- DoReMi: Bridging 3D Domains via Topology-Aware Domain-Representation Mixture of Experts
- DGFusion: Dual-guided Fusion for Robust Multi-Modal 3D Object Detection
- Embodied Cognition Augmented End2End Autonomous Driving
- Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance
- Multi-Modal Assistance for Unsupervised Domain Adaptation on Point Cloud 3D Object Detection
- MonoCLUE : Object-Aware Clustering Enhances Monocular 3D Object Detection
- Pandar128 dataset for lane line detection
- How Many Tokens Do 3D Point Cloud Transformer Architectures Really Need?
- No Pose Estimation? No Problem: Pose-Agnostic and Instance-Aware Test-Time Adaptation for Monocular Depth Estimation
- UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction
- Evaluating the Impact of Weather-Induced Sensor Occlusion on BEVFusion for 3D Object Detection
- Dynamic Reflections: Probing Video Representations with Text Alignment
- 3EED: Ground Everything Everywhere in 3D
- Towards classification-based representation learning for place recognition on LiDAR scans
- Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges
- MLPerf Automotive
- Benchmarking Tesla's Traffic Light and Stop Sign Control: Field Dataset and Behavior Insights
- WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios
- BikeScenes: Online LiDAR Semantic Segmentation for Bicycles
- Robust 4D Driving Scene Reconstruction from Imperfect Visual Priors
- VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
- AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World
- Scene-Centric Unsupervised Video Panoptic Segmentation
- SynFlow: Scaling Up LiDAR Scene Flow Estimation with Synthetic Data
- D2GS: Dense Depth Regularization for LiDAR-free Urban Scene Reconstruction
- MIC-BEV: Multi-Infrastructure Camera Bird's-Eye-View Transformer with Relation-Aware Fusion for 3D Object Detection
- UniPlanner: A Unified Motion Planning Framework for Autonomous Vehicle Decision-Making Systems via Multi-Dataset Integration
- ZTRS: Zero-Imitation End-to-end Autonomous Driving with Trajectory Scoring
- Neural USD: An object-centric framework for iterative editing and control
- Which LiDAR scanning pattern is better for roadside perception: Repetitive or Non-repetitive?
- Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
- UrbanIng-V2X: A Large-Scale Multi-Vehicle, Multi-Infrastructure Dataset Across Multiple Intersections for Cooperative Perception
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Monocular Visual 8D Pose Estimation for Articulated Bicycles and Cyclists
- Advances in 4D Representation: Geometry, Motion, and Interaction
- X-Ego: Acquiring Team-Level Tactical Situational Awareness via Cross-Egocentric Contrastive Video Representation Learning
- OmniNWM: Omniscient Driving Navigation World Models
- A Comprehensive Survey on World Models for Embodied AI
- CALM-Net: Curvature-Aware LiDAR Point Cloud-based Multi-Branch Neural Network for Vehicle Re-Identification
- David vs. Goliath: A comparative study of different-sized LLMs for code generation in the domain of automotive scenario generation
- Leveraging 2D Priors and SDF Guidance for Dynamic Urban Scene Rendering
- DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
- An Analytical Framework to Enhance Autonomous Vehicle Perception for Smart Cities
- SimULi: Real-Time LiDAR and Camera Simulation with Unscented Transforms
- SIMSplat: Predictive Driving Scene Editing with Language-aligned 4D Gaussian Splatting
- DrivingScene: A Multi-Task Online Feed-Forward 3D Gaussian Splatting Method for Dynamic Driving Scenes
- SNAP: Towards Segmenting Anything in Any Point Cloud
- Full segmentation annotations of 3D time-lapse microscopy images of MDA231 cells
- EC3R-SLAM: Efficient and Consistent Monocular Dense SLAM with Feed-Forward 3D Reconstruction
- Explainable Human-in-the-Loop Segmentation via Critic Feedback Signals
- Calibrating the Full Predictive Class Distribution of 3D Object Detectors for Autonomous Driving
- Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving
- Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
- Exploring Single Domain Generalization of LiDAR-based Semantic Segmentation under Imperfect Labels
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- XYZCylinder: Towards Compatible Feed-Forward 3D Gaussian Splatting for Driving Scenes via Unified Cylinder Lifting Method
- ARTDECO: Towards Efficient and High-Fidelity On-the-Fly 3D Reconstruction with Structured Scene Representation
- Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation
- LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval
- The Safety Challenge of World Models for Embodied AI Agents: A Review
- ALISE: Annotation-Free LiDAR Instance Segmentation for Autonomous Driving
- Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
- Progressive Gaussian Transformer with Anisotropy-aware Sampling for Open Vocabulary Occupancy Prediction
- AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks
- Learning Adaptive Pseudo-Label Selection for Semi-Supervised 3D Object Detection
- From Static to Dynamic: a Survey of Topology-Aware Perception in Autonomous Driving
- GeLoc3r: Enhancing Relative Camera Pose Regression with Geometric Consistency Regularization
- Self-driving cars: Are we there yet?
- Residual Vector Quantization For Communication-Efficient Multi-Agent Perception
- 4D Driving Scene Generation With Stereo Forcing
- MAD: Motion Appearance Decoupling for efficient Driving World Models
- TESO: Online Tracking of Essential Matrix by Stochastic Optimization
- Driving on Registers
- DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation
- Exploiting Playbacks in Unsupervised Domain Adaptation for 3D Object Detection
- Pure Vision Language Action (VLA) Models: A Comprehensive Survey
- MAESTRO: Task-Relevant Optimization via Adaptive Feature Enhancement and Suppression for Multi-task 3D Perception
- PV-RCNN: Point-Voxel Feature Set Abstraction for 3D Object Detection
- Neural Atlas Graphs for Dynamic Scene Decomposition and Editing
- See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
- Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
- Self-Supervised Cross-Modal Learning for Image-to-Point Cloud Registration
- RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation
- How many classes do we need to see for novel class discovery?
- STEP: Structured Training and Evaluation Platform for benchmarking trajectory prediction models
- SimCoachCorpus: A naturalistic dataset with language and trajectories for embodied teaching
- MCGS-SLAM: A Multi-Camera SLAM Framework Using Gaussian Splatting for High-Fidelity Mapping
- BEVUDA++: Geometric-aware Unsupervised Domain Adaptation for Multi-View 3D Object Detection
- Weakly and Self-Supervised Class-Agnostic Motion Prediction for Autonomous Driving
- TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving
- 4DRadar-GS: Self-Supervised Dynamic Driving Scene Reconstruction with 4D Radar
- OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
- DeltaFlow: An Efficient Multi-frame Scene Flow Estimation Method
- 3DAeroRelief: The first 3D Benchmark UAV Dataset for Post-Disaster Assessment
- Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey
- Diffusion-Based Action Recognition Generalizes to Untrained Domains
- Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes
- Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- 3DPillars: Pillar-based two-stage 3D object detection
- Visibility-Aware Language Aggregation for Open-Vocabulary Segmentation in 3D Gaussian Splatting
- Guideline-Consistent Segmentation via Multi-Agent Refinement
- OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction
- Domain Adaptation for Different Sensor Configurations in 3D Object Detection
- Differentiable Entropy Regularization: A Complexity-Aware Approach for Neural Optimization
- UrbanTwin: Building High-Fidelity Digital Twins for Sim2Real LiDAR Perception and Evaluation
- WILDS: A Benchmark of in-the-Wild Distribution Shifts
- High-Fidelity Digital Twins for Bridging the Sim2Real Gap in LiDAR-Based ITS Perception
- Machine Learning in Micromobility: A Systematic Review of Datasets, Techniques, and Applications
- A Unified Voxel Diffusion Module for Point Cloud 3D Object Detection
- PointSlice: Accurate and Efficient Slice-Based Representation for 3D Object Detection from Point Clouds
- CoVeRaP: Cooperative Vehicular Perception through mmWave FMCW Radars
- FLUID: A Fine-Grained Lightweight Urban Signalized-Intersection Dataset of Dense Conflict Trajectories
- Domain Adaptation-Based Crossmodal Knowledge Distillation for 3D Semantic Segmentation
- What-If Motion Prediction for Autonomous Driving
- DriveQA: Passing the Driving Knowledge Test
- VoCap: Video Object Captioning and Segmentation from Any Prompt
- To New Beginnings: A Survey of Unified Perception in Autonomous Vehicle Software
- Enhancing Pseudo-Boxes via Data-Level LiDAR-Camera Fusion for Unsupervised 3D Object Detection
- Realistic and Controllable 3D Gaussian-Guided Object Editing for Driving Video Generation
- Data-Efficient Point Cloud Semantic Segmentation Pipeline for Unimproved Roads
- LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
- DriveSplat: Decoupled Driving Scene Reconstruction with Geometry-enhanced Partitioned Neural Gaussians
- BasketLiDAR: The First LiDAR-Camera Multimodal Dataset for Professional Basketball MOT
- LookOut: Real-World Humanoid Egocentric Navigation
- FastTracker: Real-Time and Accurate Visual Tracking
- MoVieDrive: Multi-Modal Multi-View Urban Scene Video Generation
- Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object Detection
- Self-Supervised Sparse Sensor Fusion for Long Range Perception
- Multimodal Data Storage and Retrieval for Embodied AI: A Survey
- ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving
- Complete & Label: A Domain Adaptation Approach to Semantic Segmentation of LiDAR Point Clouds
- CMF-IoU: Multi-Stage Cross-Modal Fusion 3D Object Detection with IoU Joint Prediction
- Neural Rendering for Sensor Adaptation in 3D Object Detection
- DROMO: Distributionally Robust Offline Model-based Policy Optimization
- CenterAtt: Fast 2-stage Center Attention Network
- Transferable Class Statistics and Multi-scale Feature Approximation for 3D Object Detection
- G-CUT3R: Guided 3D Reconstruction with Camera and Depth Prior Integration
- Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking
- AGENTS-LLM: Augmentative GENeration of Challenging Traffic Scenarios with an Agentic LLM Framework
- STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer
- From Micro to Macro Flow Modeling: Characterizing Heterogeneity of Mixed-Autonomy Traffic
- ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction
- GRASPTrack: Geometry-Reasoned Association via Segmentation and Projection for Multi-Object Tracking
- ForeSight: Multi-View Streaming Joint Object Detection and Trajectory Forecasting
- ETA: Energy-based Test-time Adaptation for Depth Completion
- B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding
- Towards Railway Domain Adaptation for LiDAR-based 3D Detection: Road-to-Rail and Sim-to-Real via SynDRA-BBox
- CSRAP: Enhanced Canvas Attention Scheduling for Real-Time Mission Critical Perception
- Perceive-Sample-Compress: Towards Real-Time 3D Gaussian Splatting
- Extending Foundational Monocular Depth Estimators to Fisheye Cameras with Calibration Tokens
- BEVCon: Advancing Bird's Eye View Perception with Contrastive Learning
- RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case
- Prediction-Oriented Subsampling from Data Streams
- La La LiDAR: Large-Scale Layout Generation from LiDAR Data
- Veila: Panoramic LiDAR Generation from a Monocular RGB Image
- Robust Single-Stage Fully Sparse 3D Object Detection via Detachable Latent Diffusion
- MIDAR: Mimicking LiDAR Detection for Traffic Applications with a Lightweight Plug-and-Play Model
- Dream-to-Recon: Monocular 3D Reconstruction with Diffusion-Depth Distillation from Single Images
- On-the-Fly Object-aware Representative Point Selection in Point Cloud
- VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling
- Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving
- AID4AD: Aerial Image Data for Automated Driving Perception
- ModelNet40-E: An Uncertainty-Aware Benchmark for Point Cloud Classification
- RoadMamba: A Dual Branch Visual State Space Model for Road Surface Classification
- Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving
- Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
- I2V-GS: Infrastructure-to-Vehicle View Transformation with Gaussian Splatting for Autonomous Driving Data Generation
- OmniTraj: Pre-Training on Heterogeneous Data for Adaptive and Zero-Shot Human Trajectory Prediction
- UAVScenes: A Multi-Modal Dataset for UAVs
- Object Recognition Datasets and Challenges: A Review
- Goal-Based Vision-Language Driving
- Vision-Language Cross-Attention for Real-Time Autonomous Driving
- Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition
- TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking
- Co-Win: Joint Object Detection and Instance Segmentation in LiDAR Point Clouds via Collaborative Window Processing
- GS-Occ3D: Scaling Vision-only Occupancy Reconstruction with Gaussian Splatting
- Orbis: Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- Delving into Mapping Uncertainty for Mapless Trajectory Prediction
- Unposed 3DGS Reconstruction with Probabilistic Procrustes Mapping
- Synthetic-to-Real Domain Adaptation for Lane Detection
- Generalist Forecasting with Frozen Video Models via Latent Diffusion
- Depth3DLane: Fusing Monocular 3D Lane Detection with Self-Supervised Monocular Depth Estimation
- Perspective-Invariant 3D Object Detection
- PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving
- InvRGB+L: Inverse Rendering of Complex Scenes with Unified Color and LiDAR Reflectance Modeling
- Testing Autonomous Driving Systems -- What Really Matters and What Doesn't
- VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences
- AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models
- AD-GS: Object-Aware B-Spline Gaussian Splatting for Self-Supervised Autonomous Driving
- Towards Autonomous Riding: A Review of Perception, Planning, and Control in Intelligent Two-Wheelers
- From Binary to Semantic: Utilizing Large-Scale Binary Occupancy Data for 3D Semantic Occupancy Prediction
- LidarPainter: One-Step Away From Any Lidar View To Novel Guidance
- Wavelet-GS: 3D Gaussian Splatting with Wavelet Decomposition
- MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding
- Real-Time Anchor-Free Single-Stage 3D Detection with IoU-Awareness
- An LSTM Approach to Temporal 3D Object Detection in LiDAR Point Clouds
- Stereo Correspondence and Reconstruction of Endoscopic Data Challenge
- Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
- Streaming 4D Visual Geometry Transformer
- RCG: Safety-Critical Scenario Generation for Robust Autonomous Driving via Real-World Crash Grounding
- TruckV2X: A Truck-Centered Perception Dataset
- I2-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting
- Review of Feed-forward 3D Reconstruction: From DUSt3R to VGGT
- StixelNExT++: Lightweight Monocular Scene Segmentation and Representation for Collective Perception
- What Demands Attention in Urban Street Scenes? From Scene Understanding towards Road Safety: A Survey of Vision-driven Datasets and Studies
- AnthroTAP: Learning Point Tracking with Real-World Motion
- Geo-Registration of Terrestrial LiDAR Point Clouds with Satellite Images without GNSS
- Beyond One Shot, Beyond One Perspective: Cross-View and Long-Horizon Distillation for Better LiDAR Representations
- MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
- Just Add Geometry: Gradient-Free Open-Vocabulary 3D Detection Without Human-in-the-Loop
- ArmGS: Composite Gaussian Appearance Refinement for Modeling Dynamic Urban Environments
- 2.5D Object Detection for Intelligent Roadside Infrastructure
- Outdoor Monocular SLAM with Global Scale-Consistent 3D Gaussian Pointmaps
- One Thousand and One Hours: Self-driving Motion Prediction Dataset
- Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
- MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details
- CrowdTrack: A Benchmark for Difficult Multiple Pedestrian Tracking in Real Scenarios
- PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection
- Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving
- A Survey: Learning Embodied Intelligence from Physical Simulators and World Models
Related