Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
2025/12/01 by Yue Pan, Tao Sun, Pan, Yue +11
Engineering · #Robotics and Sensor-Based Localization #3D Shape Modeling and Analysis #Robot Manipulation and Learning
paper · pdf · doi:10.48550/arxiv.2512.01850
Abstract
Point cloud registration aligns multiple unposed point clouds into a common reference frame and is a core step for 3D reconstruction and robot localization without initial guess. In this work, we cast registration as conditional generation: a learned, continuous point-wise velocity field transports noisy points to a registered scene, from which the pose of each view is recovered. Unlike prior methods that perform correspondence matching to estimate pairwise transformations and then optimize a pose graph for multi-view registration, our model directly generates the registered point cloud, yielding both efficiency and point-level global consistency. By scaling the training data and conducting test-time rigidity enforcement, our approach achieves state-of-the-art results on existing pairwise registration benchmarks and on our proposed cross-domain multi-view registration benchmark. The superior zero-shot performance on this benchmark shows that our method generalizes across view counts, scene scales, and sensor modalities even with low overlap. Source code available at: https://github.com/PRBonn/RAP.
Citations
- Utonia: Toward One Encoder for All Point Clouds
- FUSER: Feed-Forward MUltiview 3D Registration Transformer and SE(3)N Diffusion Refinement
- VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences
- Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
- Rectified Point Flow: Generic Point Cloud Pose Estimation
- VGGT-SLAM: Dense RGB SLAM Optimized on the SL(4) Manifold
- GARF: Learning Generalizable 3D Reassembly for Real-World Fractures
- Towards Generating Realistic 3D Semantic Training Data for Autonomous Driving
- Sonata: Self-Supervised Learning of Reliable Point Representations
- SuperPC: A Single Diffusion Model for Point Cloud Completion, Upsampling, Denoising, and Colorization
- VGGT: Visual Geometry Grounded Transformer
- BUFFER-X: Towards Zero-Shot Point Cloud Registration in Diverse Scenes
- Muon is Scalable for LLM Training
- Continuous 3D Perception Model with Persistent State
- Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion
- The Oxford Spires Dataset: Benchmarking Large-Scale LiDAR-Visual Localisation, Reconstruction and Radiance Field Methods
- DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes
- KISS-Matcher: Fast and Robust Point Cloud Registration Revisited
- MS-Mapping: An Uncertainty-Aware Large-Scale Multi-Session LiDAR Mapping System
- A Dataset and Benchmark for Shape Completion of Fruits for Agricultural Robotics
- PARE-Net: Position-Aware Rotation-Equivariant Networks for Robust Point Cloud Registration
- MAN TruckScenes: A multimodal dataset for autonomous trucking in diverse conditions
- Grounding Image Matching in 3D with MASt3R
- PuzzleFusion++: Auto-agglomerative 3D Fracture Assembly by Denoise and Verify
- Improving the Training of Rectified Flows
- VBR: A Vision Benchmark in Rome
- FusionPortableV2: A Unified Multi-Sensor Dataset for Generalized SLAM Across Diverse Platforms and Scalable Environments
- FusionPortableV2: A unified multi-sensor dataset for generalized SLAM across diverse platforms and scalable environments
- Multiway Point Cloud Mosaicking with Diffusion and Global Optimization
- Scaling Diffusion Models to Real-World 3D LiDAR Scene Completion
- MCD: Diverse Large-Scale Multi-Campus Dataset for Robot Perception
- Extend Your Own Correspondences: Unsupervised Distant Point Cloud Registration by Progressive Distance Extension
- DUSt3R: Geometric 3D Vision Made Easy
- Paint3D: Paint Anything 3D with Lighting-Less Texture Diffusion Models
- Point Transformer V3: Simpler, Faster, Stronger
- XCube: Large-Scale 3D Generative Modeling using Sparse Voxel Hierarchies
- Nothing Stands Still: A Spatiotemporal Benchmark on 3D Point Cloud Registration Under Large Geometric and Temporal Change
- Quatro++: Robust Global Registration Exploiting Ground Segmentation for Loop Closing in LiDAR SLAM
- SE(3) Diffusion Model-based Point Cloud Registration for Robust 6D Object Pose Estimation
- HeLiPR: Heterogeneous LiDAR Dataset for inter-LiDAR Place Recognition under Spatiotemporal Variations
- ScanNet++: A High-Fidelity Dataset of 3D Indoor Scenes
- Zenseact Open Dataset: A large-scale and diverse multimodal dataset for autonomous driving
- Resilient and Distributed Multi-Robot Visual SLAM: Datasets, Experiments, and Lessons Learned
- Robust Multiview Point Cloud Registration with Reliable Pose Graph Initialization and History Reweighting
- Rotation-Invariant Transformer for Point Cloud Matching
- Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting
- Dream3D: Zero-Shot Text-to-3D Synthesis Using 3D Shape Prior and Text-to-Image Diffusion Models
- Scalable Diffusion Models with Transformers
- CLIP-Sculptor: Zero-Shot Generation of High-Fidelity and Diverse Shapes from Natural Language
- Flow Matching for Generative Modeling
- A Benchmark for Multi-Modal Lidar SLAM with Ground Truth in GNSS-Denied Environments
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- Dynamic 3D Scene Analysis by Point Cloud Accumulation
- ALITA: A Large-scale Incremental Dataset for Long-term Autonomy
- Boreas: A Multi-Season Autonomous Driving Dataset
- A Single Correspondence Is Enough: Robust Global Registration to Avoid\n Degeneracy in Urban Environments
- Geometric Transformer for Fast and Robust Point Cloud Registration
- Lepard: Learning partial point cloud matching in rigid and deformable scenes
- CoFiNet: Reliable Coarse-to-fine Correspondences for Robust Point Cloud Registration
- KITTI-360: A Novel Dataset and Benchmarks for Urban Scene Understanding in 2D and 3D
- PandaSet: Advanced Sensor Suite Dataset for Autonomous Driving
- R3LIVE: A Robust, Real-time, RGB-colored, LiDAR-Inertial-Visual tightly-coupled state Estimation and mapping package
- You Only Hypothesize Once: Point Cloud Registration with Rotation-equivariant Descriptors
- DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras
- KITTI-CARLA: a KITTI-like dataset generated by CARLA Simulator
- On Bundle Adjustment for Multiview PointCloud Registration
- FAST-LIO2: Fast Direct LiDAR-inertial Odometry
- PointDSC: Robust Point Cloud Registration using Deep Spatial Consistency
- A comprehensive survey on point cloud registration
- MULLS: Versatile LiDAR SLAM via Multi-metric Linear Least Square
- PREDATOR: Registration of 3D Point Clouds with Low Overlap
- SpinNet: Learning a General Surface Descriptor for 3D Point Cloud Registration
- Deep Global Registration
- D3Feat: Joint Learning of Dense Detection and Description of 3D Local Features
- Learning multiview 3D point cloud registration
- Scalability in Perception for Autonomous Driving: Waymo Open Dataset
- PRNet: Self-Supervised Learning for Partial-to-Partial Registration
- Deep Closest Point: Learning Representations for Point Cloud Registration
- ReFusion: 3D Reconstruction in Dynamic Environments for RGB-D Cameras\n Exploiting Residuals
- 3D Local Features for Direct Pairwise Registration
- nuScenes: A multimodal dataset for autonomous driving
- PointNetLK: Robust & Efficient Point Cloud Registration using PointNet
- The Perfect Match: 3D Point Cloud Matching with Smoothed Densities
- Analysis of Robust Functions for Registration Algorithms
- Open3D: A Modern Library for 3D Data Processing
- Matterport3D: Learning from RGB-D Data in Indoor Environments
- Semantic3D.net: A new Large-scale Point Cloud Classification Benchmark
- ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes
- University of Michigan North Campus long-term vision and lidar dataset
- 3DMatch: Learning Local Geometric Descriptors from RGB-D Reconstructions
- Adam: A Method for Stochastic Optimization
- Vision meets robotics: The KITTI dataset
- Random sample consensus
- π3: Permutation-Equivariant Visual Geometry Learning
Related