Diffusion policy: Visuomotor policy learning via action diffusion
2024/10/11 by Cheng Chi, Zhenjia Xu, Siyuan Feng +5 · 633 citations
Computer Science · #Reinforcement Learning in Robotics
paper · doi:10.1177/02783649241273668
Abstract
This paper introduces Diffusion Policy, a new way of generating robot behavior by representing a robot’s visuomotor policy as a conditional denoising diffusion process. We benchmark Diffusion Policy across 15 different tasks from 4 different robot manipulation benchmarks and find that it consistently outperforms existing state-of-the-art robot learning methods with an average improvement of 46.9%. Diffusion Policy learns the gradient of the action-distribution score function and iteratively optimizes with respect to this gradient field during inference via a series of stochastic Langevin dynamics steps. We find that the diffusion formulation yields powerful advantages when used for robot policies, including gracefully handling multimodal action distributions, being suitable for high-dimensional action spaces, and exhibiting impressive training stability. To fully unlock the potential of diffusion models for visuomotor policy learning on physical robots, this paper presents a set of key technical contributions including the incorporation of receding horizon control, visual conditioning, and the time-series diffusion transformer. We hope this work will help motivate a new generation of policy learning techniques that are able to leverage the powerful generative modeling capabilities of diffusion models. Code, data, and training details are available (diffusion-policy.cs.columbia.edu).
Cited by
- τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision
- Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
- Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation
- WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
- PRISM: Polynomial Representations for Interaction-Structured Motor Control
- Being-H0.7: A Latent World-Action Model from Egocentric Videos
- Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models
- N0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
- PAC-DP: PAC-Bayesian Diffusion Policy Learning
- DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning
- The Curse of Precision: A Data Scaling Law for High-Precision Robotic Manipulation
- Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
- Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations
- Teaching Tiny VLA Models Where to Look and How to Move
- MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
- Cortex: Compact Behavior Cloning for Quake with Frozen Visual Features
- Compositional Motion Generation from Demonstration with Object-Centric Neural Fields
- A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning
- Imitation Learning for Robot Assistance in Open Surgery: A Multi-Policy Evaluation on Suture Following
- Concurrent Prehensile and Nonprehensile Manipulation: A Practical Approach to Multi-Stage Dexterous Tasks
- Flexible Multitask Learning with Factorized Diffusion Policy
- UniStateDLO: Unified Generative State Estimation and Tracking of Deformable Linear Objects Under Occlusion for Constrained Manipulation
- Generative Actor Critic
- RoboCade: Gamifying Robot Data Collection
- UniTacHand: Unified Spatio-Tactile Representation for Human to Robotic Hand Skill Transfer
- Enhancing diffusion models with Gaussianization preprocessing
- EVE: A Generator-Verifier System for Generative Policies
- Learning Skills from Action-Free Videos
- LoLA: Long Horizon Latent Action Learning for General Robot Manipulation
- MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation
- Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface
- TwinAligner: Visual-Dynamic Alignment Empowers Physics-aware Real2Sim2Real for Robotic Manipulation
- OMP: One-step Meanflow Policy with Directional Alignment
- A Flexible Field-Based Policy Learning Framework for Diverse Robotic Systems and Sensors
- VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
- Point What You Mean: Visually Grounded Instruction Policy
- Is Your Conditional Diffusion Model Actually Denoising?
- STORM: Search-Guided Generative World Models for Robotic Manipulation
- Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation
- Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
- Unifying Deep Predicate Invention with Pre-trained Foundation Models
- Planning as Descent: Goal-Conditioned Latent Trajectory Synthesis in Learned Energy Landscapes
- Vidarc: Embodied Video Diffusion Model for Closed-loop Control
- Kinematics-Aware Diffusion Policy with Consistent 3D Observation and Action Space for Whole-Arm Robotic Manipulation
- Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
- ReinforceGen: Hybrid Skill Policies with Automated Data Generation and Reinforcement Learning
- GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
- mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
- VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
- LADY: Linear Attention for Autonomous Driving Efficiency without Transformers
- ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision
- CaFe-TeleVision: A Coarse-to-Fine Teleoperation System with Immersive Situated Visualization for Enhanced Ergonomics
- DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos
- AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis
- Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model
- World Models Can Leverage Human Videos for Dexterous Manipulation
- OXE-AugE: A Large-Scale Robot Augmentation of OXE for Scaling Cross-Embodiment Policy Learning
- Multi-Robot Motion Planning from Vision and Language using Heat-Inspired Diffusion
- SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
- Towards Logic-Aware Manipulation: A Knowledge Primitive for VLM-Based Assistants in Smart Manufacturing
- Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
- An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
- Symmetry-Aware Steering of Equivariant Diffusion Policies: Benefits and Limits
- AERMANI-Diffusion: Regime-Conditioned Diffusion for Dynamics Learning in Aerial Manipulators
- Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation
- Closing the Train-Test Gap in World Models for Gradient-Based Planning
- Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
- GLaD: Geometric Latent Distillation for Vision-Language-Action Models
- Masked Generative Policy for Robotic Control
- Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making
- OSMO: Open-Source Tactile Glove for Human-to-Robot Skill Transfer
- Bridging Scale Discrepancies in Robotic Control via Language-Based Action Representations
- Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior
- Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
- Delay-Aware Diffusion Policy: Bridging the Observation-Execution Gap in Dynamic Tasks
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning
- Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation
- See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations
- DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
- Optimization-Guided Diffusion for Interactive Scene Generation
- CERNet: Class-Embedding Predictive-Coding RNN for Unified Robot Motion, Recognition, and Confidence Estimation
- A Hetero-Associative Sequential Memory Model Utilizing Neuromorphic Signals: Validated on a Mobile Manipulator
- Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge
- Invariance Co-training for Robot Visual Generalization
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning
- HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation
- Object Reconstruction under Occlusion with Generative Priors and Contact-induced Constraints
- Hybrid-Diffusion Models: Combining Open-loop Routines with Visuomotor Diffusion Policies
- FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
- MOVE: A Simple Motion-Based Data Collection Paradigm for Spatial Generalization in Robotic Manipulation
- LAWS: Learning from Actual Workloads Symbolically -- A Self-Certifying Parametrized Cache Architecture for Neural Inference, Robotics, and Edge Deployment
- Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation
- Coordinated Humanoid Manipulation with Choice Policies
- Embodied Co-Design for Rapidly Evolving Agents: Taxonomy, Frontiers, and Challenges
- Bridging Simulation and Reality: Cross-Domain Transfer with Semantic 2D Gaussian Splatting
- FALCON: Actively Decoupled Visuomotor Policies for Loco-Manipulation with Foundation-Model-Based Coordination
- Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
- PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention
- VAT: Vision Action Transformer by Unlocking Full Representation of ViT
- GrOMP: Grasped Object Manifold Projection for Multimodal Imitation Learning of Manipulation
- PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers
- Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
- SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control
- Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols
- AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning
- SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction
- EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI
- Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning
- ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
- Learning Dexterous Manipulation Skills from Imperfect Simulations
- Real-World Robot Control by Deep Active Inference With a Temporally Hierarchical World Model
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation
- DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
- PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications
- Modality-Augmented Fine-Tuning of Foundation Robot Policies for Cross-Embodiment Manipulation on GR1 and G1
- IGen: Scalable Data Generation for Robot Learning from Open-World Images
- M3A Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering
- CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception and Understanding
- TrajDiff: End-to-end Autonomous Driving without Perception Annotation
- LAP: Fast LAtent Diffusion Planner for Autonomous Driving
- MILE: A Mechanically Isomorphic Exoskeleton Data Collection System with Fingertip Visuotactile Sensing for Dexterous Manipulation
- SimScale: Learning to Drive via Real-World Simulation at Scale
- RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video
- Switching control of underactuated multi-channel systems with input constraints for cooperative manipulation
- LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models
- CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance
- Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning
- DIPOLE: Fusing Vision and Geometry for Robust Visuomotor Generalization
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Continuized Discrete Diffusion
- Transformer Driven Visual Servoing for Fabric Texture Matching Using Dual-Arm Manipulator
- Efficient Diffusion Planning with Temporal Diffusion
- Dataset Poisoning Attacks on Behavioral Cloning Policies
- Dynamic Test-Time Compute Scaling in Control Policy: Difficulty-Aware Stochastic Interpolant Policy
- HumanoidExo: Scalable Whole-Body Humanoid Manipulation via Wearable Exoskeleton
- FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
- ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation
- ShapeForce: Low-Cost Soft Robotic Wrist for Contact-Rich Manipulation
- Learning Massively Multitask World Models for Continuous Control
- SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning
- Mixture of Horizons in Action Chunking
- How to Train Your Latent Control Barrier Function: Smooth Safety Filtering Under Hard-to-Model Constraints
- Object-centric Task Representation and Transfer using Diffused Orientation Fields
- Observer-Actor: Active Vision Imitation Learning with Sparse-View Gaussian Splatting
- EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
- L1 Sample Flow for Efficient Visuomotor Learning
- RynnVLA-002: A Unified Vision-Language-Action and World Model
- RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation
- DynaMimicGen: A Data Generation Framework for Robot Learning of Dynamic Tasks
- VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation
- H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation
- Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
- When Motion Learns to Listen: Diffusion-Prior Lyapunov Actor-Critic Framework with LLM Guidance for Stable and Robust AUV Control in Underwater Tasks
- When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
- Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
- Bi-AQUA: Bilateral Control-Based Imitation Learning for Underwater Robot Arms via Lighting-Aware Action Chunking with Transformers
- PushingBots: Collaborative Pushing via Neural Accelerated Combinatorial Hybrid Optimization
- In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
- DiffuDepGrasp: Diffusion-based Depth Noise Modeling Empowers Sim2Real Robotic Grasping
- Theoretical Closed-loop Stability Bounds for Dynamical System Coupled with Diffusion Policies
- IPR-1: Interactive Physical Reasoner
- An Alignment-Based Approach to Learning Motions from Demonstrations
- UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware Diffusion Policy
- HMC: Learning Heterogeneous Meta-Control for Contact-Rich Loco-Manipulation
- CFG-EC: Error Correction Classifier-Free Guidance
- AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
- FlexiCup: Wireless Multimodal Suction Cup with Dual-Zone Vision-Tactile Sensing
- Coffee: Controllable Diffusion Fine-tuning
- Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views
- EL3DD: Extended Latent 3D Diffusion for Language Conditioned Multitask Manipulation
- DiffFP: Learning Behaviors from Scratch via Diffusion-based Fictitious Play
- Structured Imitation Learning of Interactive Policies through Inverse Games
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- Floor Plan-Guided Visual Navigation Incorporating Depth and Directional Cues
- Decoupled Action Head: Confining Task Knowledge to Conditioning Layers
- MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy
- Scalable Policy Evaluation with Video World Models
- Collaborative Multi-Robot Non-Prehensile Manipulation via Flow-Matching Co-Generation
- Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues
- Intuitive Programming, Adaptive Task Planning, and Dynamic Role Allocation in Human-Robot Collaboration
- SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment
- HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- ViPRA: Video Prediction for Robot Actions
- Unified Humanoid Fall-Safety Policy from a Few Demonstrations
- From Demonstrations to Safe Deployment: Path-Consistent Safety Filtering for Diffusion Policies
- 10 Open Challenges Steering the Future of Vision-Language-Action Models
- ViTaMIn-B: A Reliable and Efficient Visuo-Tactile Bimanual Manipulation Interface
- Gentle Manipulation Policy Learning via Demonstrations from VLM Planned Atomic Skills
- VLM-driven Skill Selection for Robotic Assembly Tasks
- EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation
- SAD-Flower: Flow Matching for Safe, Admissible, and Dynamically Consistent Planning
- TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
- Let Me Show You: Learning by Retrieving from Egocentric Video for Robotic Manipulation
- Decomposed Object Manipulation via Dual-Actor Policy
- MoE-DP: An MoE-Enhanced Diffusion Policy for Robust Long-Horizon Robotic Manipulation with Skill Decomposition and Failure Recovery
- Multi-agent Coordination via Flow Matching
- Multimodal Diffusion Forcing for Forceful Manipulation
- X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations
- Real-to-Sim Robot Policy Evaluation with Gaussian Splatting Simulation of Soft-Body Interactions
- Embodiment Transfer Learning for Vision-Language-Action Models
- Temporal Action Selection for Action Chunking
- Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
- GUIDES: Guidance Using Instructor-Distilled Embeddings for Pre-trained Robot Policy Enhancement
- Learning-based Cooperative Robotic Paper Wrapping: A Unified Control Policy with Residual Force Control
- Scaling Multi-Agent Environment Co-Design with Diffusion Models
- WorldPlanner: Monte Carlo Tree Search and MPC with Action-Conditioned Visual World Models
- TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System
- XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations
- LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- Dexterous Robotic Piano Playing at Scale
- Lightweight Learning from Actuation-Space Demonstrations via Flow Matching for Whole-Body Soft Robotic Grasping
- XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges
- GauDP: Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies
- Breaking the Latency Barrier: Synergistic Perception and Control for High-Frequency 3D Ultrasound Servoing
- Improving Robustness to Out-of-Distribution States in Imitation Learning via Deep Koopman-Boosted Diffusion Policy
- Learning Generalizable Visuomotor Policy through Dynamics-Alignment
- Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
- EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities
- DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
- Hybrid Consistency Policy: Decoupling Multi-Modal Diversity and Real-Time Efficiency in Robotic Manipulation
- RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration
- Human-in-the-loop Online Rejection Sampling for Robotic Manipulation
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- π_
RL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models - When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning
- SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models
- HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- Mixture-of-experts action chunking transformers for high-precision robot imitation learning
- Tri-Manual Visuomotor Imitation Learning of Robot Policies
- MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
- Flow with the Force Field: Learning 3D Compliant Flow Matching Policies from Force and Demonstration-Guided Simulation Data
- RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization
- D2 Actor Critic: Diffusion Actor Meets Distributional Critic
- Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method
- InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation
- Nautilus: From One Prompt to Plug-and-Play Robot Learning
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- Generative Modeling via Drifting
- CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
- What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?
- Blindfolded Experts Generalize Better: Insights from Robotic Manipulation and Videogames
- UniPlanner: A Unified Motion Planning Framework for Autonomous Vehicle Decision-Making Systems via Multi-Dataset Integration
- BLM1: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning
- Language-Conditioned Representations and Mixture-of-Experts Policy for Robust Multi-Task Robotic Manipulation
- World Simulation with Video Foundation Models for Physical AI
- A Survey on Efficient Vision-Language-Action Models
- RobotArena ∞: Scalable Robot Benchmarking via Real-to-Sim Translation
- NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
- DeGrip: A Compact Cable-driven Robotic Gripper for Desktop Disassembly
- Deep Active Inference with Diffusion Policy and Multiple Timescale World Model for Real-World Exploration and Navigation
- Reliable Robotic Task Execution in the Face of Anomalies
- ManiDP: Manipulability-Aware Diffusion Policy for Posture-Dependent Bimanual Manipulation
- Transitive RL: Value Learning via Divide and Conquer
- ACG: Action Coherence Guidance for Flow-based VLA models
- Two-Steps Diffusion Policy for Robotic Manipulation via Genetic Denoising
- Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
- HRT1: One-Shot Human-to-Robot Trajectory Transfer for Mobile Manipulation
- Robust Point Cloud Reinforcement Learning via PCA-Based Canonicalization
- FieldGen: From Teleoperated Pre-Manipulation Trajectories to Field-Guided Data Generation
- PointMapPolicy: Structured Point Cloud Processing for Multi-Modal Imitation Learning
- PathFormer: A Transformer with 3D Grid Constraints for Digital Twin Robot-Arm Trajectory Generation
- SutureBot: A Precision Framework & Benchmark For Autonomous End-to-End Suturing
- Dino-Diffusion Modular Designs Bridge the Cross-Domain Gap in Autonomous Parking
- Push Anything: Single- and Multi-Object Pushing From First Sight with Contact-Implicit MPC
- Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning
- Semantic World Models
- Using Temperature Sampling to Effectively Train Robot Learning Policies on Imbalanced Datasets
- Imitation Learning Policy based on Multi-Step Consistent Integration Shortcut Model
- A Cross-Environment and Cross-Embodiment Path Planning Framework via a Conditional Diffusion Model
- VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
- MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning
- Towards Robust Zero-Shot Reinforcement Learning
- RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation
- Implicit State Estimation via Video Replanning
- SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving
- Consistent Zero-Shot Imitation with Contrastive Goal Inference
- Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
- End-to-end Listen, Look, Speak and Act
- RAPID Hand Prototype: Design of an Affordable, Fully-Actuated Biomimetic Hand for Dexterous Teleoperation
- VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation
- VT-Refine: Learning Bimanual Assembly with Visuo-Tactile Feedback via Simulation Fine-Tuning
- QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
- RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
- Spatially anchored Tactile Awareness for Robust Dexterous Manipulation
- Generative Models From and For Sampling-Based MPC: A Bootstrapped Approach For Adaptive Contact-Rich Manipulation
- Restoring Noisy Demonstration for Imitation Learning With Diffusion Models
- A Recipe for Efficient Sim-to-Real Transfer in Manipulation with Online Imitation-Pretrained World Models
- U-LAG: Uncertainty-Aware, Lag-Adaptive Goal Retargeting for Robotic Manipulation
- A Diffusion-Refined Planner with Reinforcement Learning Priors for Confined-Space Parking
- DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
- Tactile-Conditioned Diffusion Policy for Force-Aware Robotic Manipulation
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- VLA-0: Building State-of-the-Art VLAs with Zero Modification
- Reflection-Based Task Adaptation for Self-Improving VLA
- Fast Visuomotor Policy for Robotic Manipulation
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Controlling Intent Expressiveness in Robot Motion with Diffusion Models
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- ARMADA: Autonomous Online Failure Detection and Human Shared Control Empower Scalable Real-world Deployment and Adaptation
- Phys2Real: Fusing VLM Priors with Interactive Online Adaptation for Uncertainty-Aware Sim-to-Real Manipulation
- SCOOP'D: Learning Mixed-Liquid-Solid Scooping via Sim2Real Generative Policy
- Offline Reinforcement Learning with Generative Trajectory Policies
- HiMaCon: Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data
- DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
- MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models
- High-Fidelity Simulated Data Generation for Real-World Zero-Shot Robotic Manipulation Learning with Gaussian Splatting
- Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- UF-RNN: Real-Time Adaptive Motion Generation Using Uncertainty-Driven Foresight Prediction
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
- AFFORD2ACT: Affordance-Guided Automatic Keypoint Selection for Generalizable and Lightweight Robotic Manipulation
- How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
- Enhancing Diffusion Policy with Classifier-Free Guidance for Temporal Robotic Tasks
- Near-Optimal Second-Order Guarantees for Model-Based Adversarial Imitation Learning
- Failure Prediction at Runtime for Generative Robot Policies
- HANDO: Hierarchical Autonomous Navigation and Dexterous Omni-loco-manipulation
- RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation
- Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects
- Toward Autonomous Soft Robotic Endovascular Navigation via Imitation Learning
- Symskill: Symbol and Skill Co-Invention for Data-Efficient and Real-Time Long-Horizon Manipulation
- Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation
- NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
- ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving
- R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation
- DM1: MeanFlow with Dispersive Regularization for 1-Step Robotic Manipulation
- Trajectory Conditioned Cross-embodiment Skill Transfer
- DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
- EB-MBD: Emerging-Barrier Model-Based Diffusion for Safe Trajectory Optimization in Highly Constrained Environments
- Beyond hospital reach: Autonomous lightweight ultrasound robot for liver sonography
- Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning
- Geometry-aware Policy Imitation
- EBGAN-MDN: An Energy-Based Adversarial Framework for Multi-Modal Behavior Cloning
- FLEET: Formal Language-Grounded Scheduling for Heterogeneous Robot Teams
- ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- MiniBEE: A New Form Factor for Compact Bimanual Dexterity
- Predictive Preference Learning from Human Interventions
- FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models
- Avi: Action from Volumetric Inference
- What You Don't Know Can Hurt You: How Well do Latent Safety Filters Understand Partially Observable Safety Constraints?
- VCoT-Grasp: Grasp Foundation Models with Visual Chain-of-Thought Reasoning for Language-driven Grasp Generation
- MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption
- FORGE-Tree: Diffusion-Forcing Tree Search for Long-Horizon Robot Manipulation
- ActiveUMI: Robotic Manipulation with Active Perception from Robot-Free Human Demonstrations
- Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning
- StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
- Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
- HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
- MobRT: A Digital Twin-Based Framework for Scalable Learning in Mobile Manipulation
- MultiModal Action Conditioned Video Generation
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization
- VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing
- Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators
- Flexible Locomotion Learning with Diffusion Model Predictive Control
- ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
- Seeing the Bigger Picture: 3D Latent Mapping for Mobile Manipulation Policy Learning
- NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces
- GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert
- SketchPlan: Diffusion Based Drone Planning From Human Sketches
- 3D-CovDiffusion: 3D-Aware Diffusion Policy for Coverage Path Planning
- CroSTAta: Cross-State Transition Attention Transformer for Robotic Manipulation
- HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
- GRITS: A Spillage-Aware Guided Diffusion Policy for Robot Food Scooping Tasks
- Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer
- Diffusion Alignment as Variational Expectation-Maximization
- VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
- MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
- Anomaly detection for generic failure monitoring in robotic assembly, screwing and manipulation
- Seeing Space and Motion: Enhancing Latent Actions with Spatial and Dynamic Awareness for VLA
- Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation
- Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies
- SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
- Best of Sim and Real: Decoupled Visuomotor Manipulation via Learning Control in Simulation and Perception in Real
- Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
- Hierarchical Diffusion Motion Planning with Task-Conditioned Uncertainty-Aware Priors
- dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
- Noise-Guided Transport for Imitation Learning
- SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation
- SRMP: Search-Based Robot Motion Planning Library
- Annotation-Free One-Shot Imitation Learning for Multi-Step Manipulation Tasks
- MSG: Multi-Stream Generative Policies for Sample-Efficient Robotic Manipulation
- From Code to Action: Hierarchical Learning of Diffusion-VLM Policies
- U-DiT Policy: U-shaped Diffusion Transformers for Robotic Manipulation
- World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
- Fidelity-Aware Data Composition for Robust Robot Generalization
- PhysiAgent: An Embodied Agent Framework in Physical World
- PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- Sequential Diffusion Language Models
- Adversarial Diffusion for Robust Reinforcement Learning
- Control Your Robot: A Unified System for Robot Control and Policy Deployment
- Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models
- DexFlyWheel: A Scalable and Self-improving Data Generation Framework for Dexterous Manipulation
- Multi-Modal Manipulation via Multi-Modal Policy Consensus
- Leave No Observation Behind: Real-time Correction for VLA Action Chunks
- GLUE: Global-Local Unified Encoding for Imitation Learning via Key-Patch Tracking
- CE-Nav: Flow-Guided Reinforcement Refinement for Cross-Embodiment Local Navigation
- UniPrototype: Humn-Robot Skill Learning with Uniform Prototypes
- FTACT: Force Torque aware Action Chunking Transformer for Pick-and-Reorient Bottle Task
- Robot Learning from Any Images
- Pixel Motion Diffusion is What We Need for Robot Control
- VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
- WoW: Towards a World omniscient World model Through Embodied Interaction
- EgoDemoGen: Novel Egocentric Demonstration Generation Enables Viewpoint-Robust Manipulation
- ReLAM: Learning Anticipation Model for Rewarding Visual Robotic Manipulation
- RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation
- DemoGrasp: Universal Dexterous Grasping from a Single Demonstration
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning
- SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks
- MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation
- VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- ARMimic: Learning Robotic Manipulation from Passive Human Demonstrations in Augmented Reality
- RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models
- ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation
- Normalizing Flows are Capable Models for Bi-manual Visuomotor Policy
- Large Pre-Trained Models for Bimanual Manipulation in 3D
- mindmap: Spatial Memory in Deep Feature Maps for 3D Action Policies
- Parse-Augment-Distill: Learning Generalizable Bimanual Visuomotor Policies from Single Human Video
- Beyond Human Demonstrations: Diffusion-Based Reinforcement Learning to Generate Data for VLA Training
- FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
- SAGE:State-Aware Guided End-to-End Policy for Multi-Stage Sequential Tasks via Hidden Markov Decision Process
- DynaFlow: Dynamics-embedded Flow Matching for Physically Consistent Motion Generation from State-only Demonstrations
- TopoCut: Learning Multi-Step Cutting with Spectral Rewards and Discrete Diffusion Policies
- Diffusion-Based Impedance Learning for Contact-Rich Manipulation Tasks
- Memory-Augmented Potential Field Theory: A Framework for Adaptive Control in Non-Convex Domains
- EgoBridge: Domain Adaptation for Generalizable Imitation from Egocentric Human Data
- The Geometric Nature and a Free Proxy for Flow-Matching Uncertainty
- World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models
- Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation
- QuantWAMs: Calibrating at the Right Granularity for World Action Models
- Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
- SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation
- REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning
- MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
- Temporal Straightening for Latent Planning
- Self-evolved Imitation Learning in Simulated World
- ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation
- SOE: Sample-Efficient Robot Policy Self-Improvement via On-Manifold Exploration
- World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation
- ManipForce: Force-Guided Policy Learning with Frequency-Aware Representation for Contact-Rich Manipulation
- Pure Vision Language Action (VLA) Models: A Comprehensive Survey
- DexSkin: High-Coverage Conformable Robotic Skin for Learning Contact-Rich Manipulation
- MV-UMI: A Scalable Multi-View Interface for Cross-Embodiment Learning
- N2M: Bridging Navigation and Manipulation by Learning Pose Preference from Rollout
- Do You Need Proprioceptive States in Visuomotor Policies?
- Generalizable Domain Adaptation for Sim-and-Real Policy Co-Training
- VGGT-DP: Generalizable Robot Control via Vision Foundation Models
- Residual Off-Policy RL for Finetuning Behavior Cloning Policies
- SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones
- FUNCanon: Learning Pose-Aware Action Primitives via Functional Object Canonicalization for Generalizable Robotic Manipulation
- 3D Flow Diffusion Policy: Visuomotor Policy Learning via Generating Flow in 3D Space
- Query-Centric Diffusion Policy for Generalizable Robotic Assembly
- Learning Geometry-Aware Nonprehensile Pushing and Pulling with Dexterous Hands
- Latent Action Pretraining Through World Modeling
- ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
- Learning Dexterous Manipulation with Quantized Hand State
- 3D Printable Soft Liquid Metal Sensors for Delicate Manipulation Tasks
- DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning
- FinFlowRL: An Imitation-Reinforcement Learning Framework for Adaptive Stochastic Control in Finance
- Prepare Before You Act: Learning From Humans to Rearrange Initial States
- Ratatouille: Imitation Learning Ingredients for Real-world Social Robot Navigation
- RoboManipBaselines: A Unified Framework for Imitation Learning in Robotic Manipulation across Real and Simulated Environments
- Scalable Multi Agent Diffusion Policies for Coverage Control
- FILIC: Dual-Loop Force-Guided Imitation Learning with Impedance Torque Control for Contact-Rich Manipulation Tasks
- History-Aware Visuomotor Policy Learning via Point Tracking
- GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
- ReSeFlow: Rectifying SE(3)-Equivariant Policy Learning Flows
- TranTac: Leveraging Transient Tactile Signals for Contact-Rich Robotic Manipulation
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Dynamic Objects Relocalization in Changing Environments with Flow Matching
- Right-Side-Out: Learning Zero-Shot Sim-to-Real Garment Reversal
- A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
- GP3: A 3D Geometry-Aware Policy with Multi-View Images for Robotic Manipulation
- LodeStar: Long-horizon Dexterity via Synthetic Data Augmentation from Human Demonstrations
- Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference
- Compose by Focus: Scene Graph-based Atomic Skills
- Self-Improving Embodied Foundation Models
- Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
- M4Diffuser: Multi-View Diffusion Policy with Manipulability-Aware Control for Robust Mobile Manipulation
- A Novel Task-Driven Diffusion-Based Policy with Affordance Learning for Generalizable Manipulation of Articulated Objects
- Variational Shape Inference for Grasp Diffusion on SE(3)
- COMPASS: Confined-space Manipulation Planning with Active Sensing Strategy
- exUMI: Extensible Robot Teaching System with Action-aware Task-agnostic Tactile Representation
- RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
- Toward Embodiment Equivariant Vision-Language-Action Policy
- DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising
- Learning to Pick: A Visuomotor Policy for Clustered Strawberry Picking
- DreamControl: Human-Inspired Whole-Body Humanoid Control for Scene Interaction via Guided Diffusion
- MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies
- MetricNet: Recovering Metric Scale in Generative Navigation Policies
- Dual-Actor Fine-Tuning of VLA Models: A Talk-and-Tweak Human-in-the-Loop Approach
- Hand Tracking Streamer
- Prompt2Auto: From Motion Prompt to Automated Control via Geometry-Invariant One-Shot Gaussian Process Learning
- GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
- PhysicalAgent: Towards General Cognitive Robotics with Foundation World Models
- Dense-Jump Flow Matching with Non-Uniform Time Scheduling for Robotic Policies: Mitigating Multi-Step Inference Degradation
- Robust Online Residual Refinement via Koopman-Guided Dynamics Modeling
- 4D Visual Pre-training for Robot Learning
- Bridging Perception and Planning: Towards End-to-End Planning for Signal Temporal Logic Tasks
- Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges
- Igniting VLMs toward the Embodied Space
- VH-Diffuser: Variable Horizon Diffusion Planner for Time-Aware Goal-Conditioned Trajectory Planning
- Inference-stage Adaptation-projection Strategy Adapts Diffusion Policy to Cross-manipulators Scenarios
- Tenma: Robust Cross-Embodiment Robot Manipulation with Diffusion Transformer
- LaGarNet: Goal-Conditioned Recurrent State-Space Models for Pick-and-Place Garment Flattening
- ActivePose: Active 6D Object Pose Estimation and Tracking for Robotic Manipulation
- DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
- FEWT: Improving Humanoid Robot Perception with Frequency-Enhanced Wavelet-based Transformers
- OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
- ImMimic: Cross-Domain Imitation from Human Videos via Mapping and Interpolation
- HHI-Assist: A Dataset and Benchmark of Human-Human Interaction in Physical Assistance Scenario
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration
- Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
- SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
- Self-Augmented Robot Trajectory: Efficient Imitation Learning via Safe Self-augmentation with Demonstrator-annotated Precision
- Joint Model-based Model-free Diffusion for Planning with Constraints
- PegasusFlow: Parallel Rolling-Denoising Score Sampling for Robot Diffusion Planner Flow Matching
- RoboMatch: A Unified Mobile-Manipulation Teleoperation Platform with Auto-Matching Network Architecture for Long-Horizon Tasks
- Diffusion-Guided Multi-Arm Motion Planning
- RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction
- CRISP -- Compliant ROS2 Controllers for Learning-Based Manipulation Policies and Teleoperation
- F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
- Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)
- Grasp-MPC: Closed-Loop Visual Grasping via Value-Guided Model Predictive Control
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
- A Knowledge-Driven Diffusion Policy for End-to-End Autonomous Driving Based on Expert Routing
- Constraints-Guided Diffusion Reasoner for Neuro-Symbolic Learning
- EMMA: Scaling Mobile Manipulation via Egocentric Human Data
- Keypoint-based Diffusion for Robotic Motion Planning on the NICOL Robot
- ANNIE: Be Careful of Your Robots
- The Role of Embodiment in Intuitive Whole-Body Teleoperation for Mobile Manipulation
- DUViN: Diffusion-Based Underwater Visual Navigation via Knowledge-Transferred Depth Features
- Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- Articulated Object Estimation in the Wild
- Data Retrieval with Importance Weights for Few-Shot Imitation Learning
- MoTo: A Zero-shot Plug-in Interaction-aware Navigation for General Mobile Manipulation
- ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training
- Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation
- FinFlowRL: An Imitation-Reinforcement Learning Framework for Adaptive Stochastic Control in Finance
- LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
- Dynamics-Compliant Trajectory Diffusion for Super-Nominal Payload Manipulation
- Few-Shot Neuro-Symbolic Imitation Learning for Long-Horizon Planning and Acting
- EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
- Train-Once Plan-Anywhere Kinodynamic Motion Planning via Diffusion Trees
- Exploiting Policy Idling for Dexterous Manipulation
- Mind and Motion Aligned: A Joint Evaluation IsaacSim Benchmark for Task Planning and Low-Level Policies in Mobile Manipulation
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- Gentle Object Retraction in Dense Clutter Using Multimodal Force Sensing and Imitation Learning
- On Surjectivity of Neural Networks: Can you elicit any behavior from your model?
- Composition and Alignment of Diffusion Models using Constrained Learning
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation
- Survey of Vision-Language-Action Models for Embodied Manipulation
- Taming VR Teleoperation and Learning from Demonstration for Multi-Task Bimanual Table Service Manipulation
- FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy
- Offline Imitation Learning upon Arbitrary Demonstrations by Pre-Training Dynamics Representations
- xDiff: Online Diffusion Model for Collaborative Inter-Cell Interference Management in 5G O-RAN
- MimicFunc: Imitating Tool Manipulation from a Single Human Video via Functional Correspondence
- CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
- Sim-to-Real Dynamic Object Manipulation on Conveyor Systems via Optimization Path Shaping
- One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
- Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
- Self-Guided Action Diffusion
- Belief-Conditioned One-Step Diffusion: Real-Time Trajectory Planning with Just-Enough Sensing
- OmniD: Generalizable Robot Manipulation Policy via Image-Based BEV Representation
- Anticipatory and Adaptive Footstep Streaming for Teleoperated Bipedal Robots
- GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning
- 3D FlowMatch Actor: Unified 3D Policy for Single- and Dual-Arm Manipulation
- KDPE: A Kernel Density Estimation Strategy for Diffusion Policy Trajectory Selection
- MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
- MLM: Learning Multi-task Loco-Manipulation Whole-Body Control for Quadruped Robot with Arm
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion
- Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning
- Leveraging OS-Level Primitives for Robotic Action Management
- Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
- Immersive Teleoperation of Beyond-Human-Scale Robotic Manipulators: Challenges and Future Directions
- BEAVR: Bimanual, multi-Embodiment, Accessible, Virtual Reality Teleoperation System for Robots
- DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
- Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
- Masquerade: Learning from In-the-wild Human Videos using Data-Editing
- OmniVTLA: Vision-Tactile-Language-Action Model with Semantic-Aligned Tactile Sensing
- Towards Safe Imitation Learning via Potential Field-Guided Flow Matching
- AgentWorld: An Interactive Simulation Platform for Scene Construction and Mobile Robotic Manipulation
- BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion
- AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies
- DexFruit: Dexterous Manipulation and Gaussian Splatting Inspection of Fruit
- Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation
- OM2P: Offline Multi-Agent Mean-Flow Policy
- ADPro: a Test-time Adaptive Diffusion Policy via Manifold-constrained Denoising and Task-aware Initialization for Robotic Manipulation
- Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution
- Real-Time Iteration Scheme for Diffusion Policy
- Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation
- DDTracking: A Deep Generative Framework for Diffusion MRI Tractography with Streamline Local-Global Spatiotemporal Modeling
- Case Studies of Generative Machine Learning Models for Dynamical Systems
- Constraint-Preserving Data Generation for Visuomotor Policy Learning
- DiWA: Diffusion Policy Adaptation with World Models
- CollaBot: Vision-Language Guided Simultaneous Collaborative Manipulation
- CLASS: Contrastive Learning via Action Sequence Supervision for Robot Manipulation
- VFP: Variational Flow-Matching Policy for Multi-Modal Robot Manipulation
- RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems
- Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation
- COLLAGE: Adaptive Fusion-based Retrieval for Augmented Policy Learning
- Learning Pivoting Manipulation with Force and Vision Feedback Using Optimization-based Demonstrations
- On-Device Diffusion Transformer Policy for Efficient Robot Manipulation
- HannesImitation: Grasping with the Hannes Prosthetic Hand via Imitation Learning
- Video Generators are Robot Policies
- One-Step Flow Policy Mirror Descent
Related