What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
2021/08/06 by Ajay Mandlekar, Mandlekar, Ajay, Danfei Xu +17 · 209 citations
Computer Science · Engineering · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO) #cs.AI #cs.LG #cs.RO
paper · pdf · doi:10.48550/arxiv.2108.03298
CoRL 2021 (Oral)
openalex publication_date 2021/08/06 · openalex created_date 2021/08/16 · arxiv created 2021/09/25 · arxiv updated 2021/09/28 · openalex updated_date 2026/07/28
Abstract
Imitating human demonstrations is a promising approach to endow robots with various manipulation capabilities. While recent advances have been made in imitation learning and batch (offline) reinforcement learning, a lack of open-source human datasets and reproducible learning methods make assessing the state of the field difficult. In this paper, we conduct an extensive study of six offline learning algorithms for robot manipulation on five simulated and three real-world multi-stage manipulation tasks of varying complexity, and with datasets of varying quality. Our study analyzes the most critical challenges when learning from offline human data for manipulation. Based on the study, we derive a series of lessons including the sensitivity to different algorithmic design choices, the dependence on the quality of the demonstrations, and the variability based on the stopping criteria due to the different objectives in training and evaluation. We also highlight opportunities for learning from human datasets, such as the ability to learn proficient policies on challenging, multi-stage tasks beyond the scope of current reinforcement learning methods, and the ability to easily scale to natural, real-world manipulation scenarios where only raw sensory signals are available. We have open-sourced our datasets and all algorithm implementations to facilitate future research and fair comparisons in learning from human demonstration data. Codebase, datasets, trained models, and more available at https://arise-initiative.github.io/robomimic-web/
Citations
Cited by
- Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
- PAC-DP: PAC-Bayesian Diffusion Policy Learning
- Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations
- Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
- ReinforceGen: Hybrid Skill Policies with Automated Data Generation and Reinforcement Learning
- Sceniris: A Fast Procedural Scene Generation Framework
- ISS Policy : Scalable Diffusion Policy with Implicit Scene Supervision
- AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis
- OXE-AugE: A Large-Scale Robot Augmentation of OXE for Scaling Cross-Embodiment Policy Learning
- An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
- Symmetry-Aware Steering of Equivariant Diffusion Policies: Benefits and Limits
- See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations
- Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation
- What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models
- SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction
- EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
- DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies
- SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning
- AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations
- EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
- L1 Sample Flow for Efficient Visuomotor Learning
- DynaMimicGen: A Data Generation Framework for Robot Learning of Dynamic Tasks
- An Alignment-Based Approach to Learning Motions from Demonstrations
- From Power to Precision: Learning Fine-grained Dexterity for Multi-fingered Robotic Hands
- Scalable Policy Evaluation with Video World Models
- SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment
- From Demonstrations to Safe Deployment: Path-Consistent Safety Filtering for Diffusion Policies
- ScheduleStream: Temporal Planning with Samplers for GPU-Accelerated Multi-Arm Task and Motion Planning & Scheduling
- Temporal Action Selection for Action Chunking
- ForeRobo: Unlocking Infinite Simulation Data for 3D Goal-driven Robotic Manipulation
- GUIDES: Guidance Using Instructor-Distilled Embeddings for Pre-trained Robot Policy Enhancement
- EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities
- When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning
- InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation
- Nautilus: From One Prompt to Plug-and-Play Robot Learning
- ACG: Action Coherence Guidance for Flow-based VLA models
- Two-Steps Diffusion Policy for Robotic Manipulation via Genetic Denoising
- Sequentially Teaching Sequential Tasks (ST)2: Teaching Robots Long-horizon Manipulation Skills
- PointMapPolicy: Structured Point Cloud Processing for Multi-Modal Imitation Learning
- Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning
- Fast Visuomotor Policy for Robotic Manipulation
- Improving Generative Behavior Cloning via Self-Guidance and Adaptive Chunking
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- ARMADA: Autonomous Online Failure Detection and Human Shared Control Empower Scalable Real-world Deployment and Adaptation
- Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
- Enhancing Diffusion Policy with Classifier-Free Guidance for Temporal Robotic Tasks
- Failure Prediction at Runtime for Generative Robot Policies
- Toward Autonomous Soft Robotic Endovascular Navigation via Imitation Learning
- DM1: MeanFlow with Dispersive Regularization for 1-Step Robotic Manipulation
- DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
- Geometry-aware Policy Imitation
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing
- ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
- Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
- CroSTAta: Cross-State Transition Attention Transformer for Robotic Manipulation
- Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies
- SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
- U-DiT Policy: U-shaped Diffusion Transformers for Robotic Manipulation
- Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning
- LLM Trainer: Automated Robotic Data Generating via Demonstration Augmentation using LLMs
- D3Grasp: Diverse and Deformable Dexterous Grasping for General Objects
- SAGE:State-Aware Guided End-to-End Policy for Multi-Stage Sequential Tasks via Hidden Markov Decision Process
- Score the Steps, Not Just the Goal: VLM-Based Subgoal Evaluation for Robotic Manipulation
- Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
- Self-evolved Imitation Learning in Simulated World
- SOE: Sample-Efficient Robot Policy Self-Improvement via On-Manifold Exploration
- N2M: Bridging Navigation and Manipulation by Learning Pose Preference from Rollout
- Generalizable Domain Adaptation for Sim-and-Real Policy Co-Training
- Residual Off-Policy RL for Finetuning Behavior Cloning Policies
- DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning
- RoboManipBaselines: A Unified Framework for Imitation Learning in Robotic Manipulation across Real and Simulated Environments
- Learning from Observation: A Survey of Recent Advances
- Factorizing Diffusion Policies for Observation Modality Prioritization
- LodeStar: Long-horizon Dexterity via Synthetic Data Augmentation from Human Demonstrations
- Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference
- 4D Visual Pre-training for Robot Learning
- Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges
- MEMBOT: Memory-Based Robot in Intermittent POMDP
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration
- Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution
- How well can LLMs provide planning feedback in grounded environments?
- Data Retrieval with Importance Weights for Few-Shot Imitation Learning
- SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation
- Survey of Vision-Language-Action Models for Embodied Manipulation
- Offline Imitation Learning upon Arbitrary Demonstrations by Pre-Training Dynamics Representations
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- Self-Guided Action Diffusion
- KDPE: A Kernel Density Estimation Strategy for Diffusion Policy Trajectory Selection
- Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
- Towards Safe Imitation Learning via Potential Field-Guided Flow Matching
- D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
- Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution
- On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
- Real-Time Iteration Scheme for Diffusion Policy
- D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss
- FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
- CLASS: Contrastive Learning via Action Sequence Supervision for Robot Manipulation
- Physically-based Lighting Generation for Robotic Manipulation
- COLLAGE: Adaptive Fusion-based Retrieval for Augmented Policy Learning
- Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training
- VITA: Vision-to-Action Flow Matching Policy
- Towards Consistent Long-Term Pose Generation
- From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
- Latent Policy Steering with Embodiment-Agnostic Pretrained World Models
- Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
- Should We Ever Prefer Decision Transformer for Offline Reinforcement Learning?
- GenAI-based Multi-Agent Reinforcement Learning towards Distributed Agent Intelligence: A Generative-RL Agent Perspective
- Behavioral Exploration: Learning to Explore via In-Context Adaptation
- FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency
- EXPO: Stable Reinforcement Learning with Expressive Policies
- Reinforcement Learning with Action Chunking
- Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration
- Spatial-Temporal Aware Visuomotor Diffusion Policy Learning
- Value from Observations: Towards Large-Scale Imitation Learning via Self-Improvement
- Learning to Evaluate Autonomous Behaviour in Human-Robot Interaction
- Hybrid Diffusion Policies with Projective Geometric Algebra for Efficient Robot Manipulation Learning
- Latent Actions from Factorized Transition Effects under Agent Ambiguity
- Structured Task Solving via Modular Embodied Intelligence: A Case Study on Rubik's Cube
- VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation
- Wavelet Policy: Lifting Scheme for Policy Learning in Long-Horizon Tasks
- RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot
- SE(3)-Equivariant Diffusion Policy in Spherical Fourier Space
- RoboScape: Physics-informed Embodied World Model
- RoboPearls: Editable Video Simulation for Robot Manipulation
- Knowledge-Driven Imitation Learning: Enabling Generalization Across Diverse Conditions
- Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning
- Reinforcement Learning via Implicit Imitation Guidance
- Is an object-centric representation beneficial for robotic manipulation ?
- CUPID: Curating Data your Robot Loves with Influence Functions
- Haptic-Informed ACT with a Soft Gripper and Recovery-Informed Training for Pseudo Oocyte Manipulation
- Accelerating Residual Reinforcement Learning with Uncertainty Estimation
- CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity
- Steering Your Diffusion Policy with Latent Space Reinforcement Learning
- TACT: Humanoid Whole-body Contact Manipulation through Deep Imitation Learning with Tactile Modality
- Vision in Action: Learning Active Perception from Human Demonstrations
- Latent Action Diffusion for Cross-Embodiment Manipulation
- LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction
- What Matters in Learning from Large-Scale Datasets for Robot Manipulation
- CHARM: Considering Human Attributes for Reinforcement Modeling
- DynaGuide: Steering Diffusion Polices with Active Dynamic Guidance
- Human-assisted Robotic Policy Refinement via Action Preference Optimization
- Block-wise Adaptive Caching for Accelerating Diffusion Policy
- SAIL: Faster-than-Demonstration Execution of Imitation Learning Policies
- Viewpoint-Agnostic Manipulation Policies with Strategic Vantage Selection
- Dynamic Mixture of Progressive Parameter-Efficient Expert Library for Lifelong Robot Learning
- A Smooth Sea Never Made a Skilled SAILOR: Robust Imitation via Learning to Search
- Learning dissection trajectories from expert surgical videos via imitation learning with equivariant diffusion
- Diffusion Models are Secretly Exchangeable: Parallelizing DDPMs via Autospeculation
- STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector Quantization
- FreqPolicy: Frequency Autoregressive Visuomotor Policy with Continuous Tokens
- SCIZOR: A Self-Supervised Approach to Data Curation for Large-Scale Imitation Learning
- Streaming Flow Policy: Simplifying diffusion/flow-matching policies by treating action trajectories as flow trajectories
- ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
- EgoZero: Robot Learning from Smart Glasses
- Grounding Bodily Awareness in Visual Representations for Efficient Policy Learning
- ManiFeel: Benchmarking and Understanding Visuotactile Manipulation Policy Learning
- Canonical Policy: Learning Canonical 3D Representation for SE(3)-Equivariant Policy
- What Do You Need for Compositional Generalization in Diffusion Planning?
- Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills
- Bootstrapping Imitation Learning for Long-horizon Manipulation via Hierarchical Data Collection Space
- 3D Equivariant Visuomotor Policy Learning via Spherical Projection
- Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning
- A Practical Guide for Incorporating Symmetry in Diffusion Policy
- MTIL: Encoding Full History with Mamba for Temporal Imitation Learning
- H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos
- Zero-Shot Visual Generalization in Robot Manipulation
- Counterfactual Behavior Cloning: Offline Imitation Learning from Imperfect Human Demonstrations
- Object-Centric Representations Improve Policy Generalization in Robot Manipulation
- Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps
- Learning Long-Context Diffusion Policies via Past-Token Prediction
- Latent Theory of Mind: A Decentralized Diffusion Architecture for Cooperative Manipulation
- DataMIL: Selecting Data for Robot Imitation Learning with Datamodels
- ChicGrasp: Imitation-Learning based Customized Dual-Jaw Gripper Control for Delicate, Irregular Bio-products Manipulation
- Adaptive Diffusion Policy Optimization for Robotic Manipulation
- Spline Policy: A Structured Representation for Robot Policies
- Freeform Preference Learning for Robotic Manipulation
- UniSkill: Imitating Human Videos via Cross-Embodiment Skill Representations
- What Matters for Batch Online Reinforcement Learning in Robotics?
- DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies
- Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning
- SIME: Enhancing Policy Self-Improvement with Modal-level Exploration
- Fast Flow-based Visuomotor Policies via Conditional Optimal Transport Couplings
- B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations
- DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation
- RoboPocket: Improve Robot Policies Instantly with Your Phone
- RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots
- J-PARSE: Jacobian-based Projection Algorithm for Resolving Singularities Effectively in Inverse Kinematic Control of Serial Manipulators
- Same Weights, Different Robot: A Deployment Safety View of VLA Policies
- RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
- Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities
- PRISM-DP: Spatial Pose-based Observations for Diffusion-Policies via Segmentation, Mesh Generation, and Pose Tracking
- Gated Memory Policy: In-Context Memorization and Adaptation
- Robot Motion Planning using One-Step Diffusion with Noise-Optimized Approximate Motions
- RoboVerse: Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning
- Offline Learning of Controllable Diverse Behaviors
- A hierarchical approach to imitation learning for manipulation tasks requiring time varying forces
- HERB: Human-augmented Efficient Reinforcement learning for Bin-packing
- Latent Diffusion Planning for Imitation Learning
- Phoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction
- DiffOG: Differentiable Policy Trajectory Optimization with Generalizability
- On the Importance of Tactile Sensing for Imitation Learning: A Case Study on Robotic Match Lighting
- Novel Demonstration Generation with Gaussian Splatting Enables Robust One-Shot Manipulation
- Diffusion Models for Robotic Manipulation: A Survey
Related