π0.5: a Vision-Language-Action Model with Open-World Generalization
2025/04/22 by Physical Intelligence, Intelligence, Physical, Kevin Black +66 · 303 citations
Social Sciences · #Religion and Sociopolitical Dynamics in Nigeria #Geographic Information Systems Studies #African history and culture analysis
paper · pdf · doi:10.48550/arxiv.2504.16054
Abstract
In order for robots to be useful, they must perform practically relevant tasks in the real world, outside of the lab. While vision-language-action (VLA) models have demonstrated impressive results for end-to-end robot control, it remains an open question how far such models can generalize in the wild. We describe π0.5, a new model based on π0 that uses co-training on heterogeneous tasks to enable broad generalization. π0.5 uses data from multiple robots, high-level semantic prediction, web data, and other sources to enable broadly generalizable real-world robotic manipulation. Our system uses a combination of co-training and hybrid multi-modal examples that combine image observations, language commands, object detections, semantic subtask prediction, and low-level actions. Our experiments show that this kind of knowledge transfer is essential for effective generalization, and we demonstrate for the first time that an end-to-end learning-enabled robotic system can perform long-horizon and dexterous manipulation skills, such as cleaning a kitchen or bedroom, in entirely new homes.
Cited by
- ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm
- τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision
- Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
- Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
- Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
- WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
- FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking
- VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
- Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
- LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments
- A Pragmatic VLA Foundation Model
- Compressing Observation History into Agent Memory: Distilling Transformers into Recurrent Transformers
- Being-H0.7: A Latent World-Action Model from Egocentric Videos
- A Few Words Go a Long Way: Language Guided Robot Policy Synthesis
- N0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
- N0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
- LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory
- WCM: World-Cognition Model for Generalizable Human-Robot Interaction
- Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding
- DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning
- Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
- CAST: Game Solvers as Turn-Level Teachers for LLM Agents
- CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
- A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models
- RoboMME-Interference: Benchmarking Robot Memory Under Interference
- StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
- RoboCade: Gamifying Robot Data Collection
- EVE: A Generator-Verifier System for Generative Policies
- Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting
- DeliveryBench: Can Agents Earn Profit in Real World?
- Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface
- Point What You Mean: Visually Grounded Instruction Policy
- LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
- AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation
- Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation
- Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
- Unifying Deep Predicate Invention with Pre-trained Foundation Models
- Vidarc: Embodied Video Diffusion Model for Closed-loop Control
- PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
- Monte Carlo Query Search: Active Capability Assessment of AI Agents
- mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
- MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
- VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
- Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models
- Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model
- OXE-AugE: A Large-Scale Robot Augmentation of OXE for Scaling Cross-Embodiment Policy Learning
- Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
- Motus: A Unified Latent Action World Model
- TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
- Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
- RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
- Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models
- GLaD: Geometric Latent Distillation for Vision-Language-Action Models
- H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
- VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer
- Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
- See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations
- Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
- Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models
- STARE-VLA: Progressive Stage-Aware Reinforcement for Fine-Tuning Vision-Language-Action Models
- FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
- SIMA 2: A Generalist Embodied Agent for Virtual Worlds
- dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
- Vision-Language-Action Models for Selective Robotic Disassembly: A Case Study on Critical Component Extraction from Desktops
- FALCON: Actively Decoupled Visuomotor Policies for Loco-Manipulation with Foundation-Model-Based Coordination
- ResponsibleRobotBench: Benchmarking Responsible Robot Manipulation using Multi-modal Large Language Models
- SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL
- PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention
- Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
- VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling
- Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols
- HumanoidExo: Scalable Whole-Body Humanoid Manipulation via Wearable Exoskeleton
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation
- DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
- TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation
- Real-World Reinforcement Learning of Active Perception Behaviors
- IGen: Scalable Data Generation for Robot Learning from Open-World Images
- VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference
- CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception and Understanding
- Transforming Monolithic Foundation Models into Embodied Multi-Agent Architectures for Human-Robot Collaboration
- Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment
- LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models
- Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
- Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention
- DIPOLE: Fusing Vision and Geometry for Robust Visuomotor Generalization
- VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation
- E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Continuized Discrete Diffusion
- From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings
- SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
- When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
- Reinforcing Action Policies by Prophesying
- ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation
- GigaWorld-0: World Models as Data Engine to Empower Embodied AI
- Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
- MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization
- Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation
- Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation
- SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control
- Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories
- MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
- SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning
- How to Train Your Latent Control Barrier Function: Smooth Safety Filtering Under Hard-to-Model Constraints
- EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
- ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
- L1 Sample Flow for Efficient Visuomotor Learning
- Contact-Rich Robotic Assembly in Construction via Diffusion Policy Learning
- RynnVLA-002: A Unified Vision-Language-Action and World Model
- Unify Robot Actions in Camera Frame
- SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding
- InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy
- Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
- In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
- π*0.6: a VLA That Learns From Experience
- AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
- RoboTidy : A 3D Gaussian Splatting Household Tidying Benchmark for Embodied Navigation and Action
- From Power to Precision: Learning Fine-grained Dexterity for Multi-fingered Robotic Hands
- ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-based Model
- Decoupled Action Head: Confining Task Knowledge to Conditioning Layers
- SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
- RoboBenchMart: Benchmarking Robots in Retail Environment
- RGMP: Recurrent Geometric-prior Multimodal Policy for Generalizable Humanoid Robot Manipulation
- SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards
- How Do VLAs Effectively Inherit from VLMs?
- ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval
- EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation
- TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
- iFlyBot-VLM Technical Report
- Real-to-Sim Robot Policy Evaluation with Gaussian Splatting Simulation of Soft-Body Interactions
- TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System
- XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations
- Learning Interactive World Model for Object-Centric Reinforcement Learning
- GenDexHand: Generative Simulation for Dexterous Hands
- Maestro: Orchestrating Robotics Modules with Vision-Language Models for Zero-Shot Generalist Robots
- iFlyBot-VLA Technical Report
- EgoMI: Learning Active Vision and Whole-Body Manipulation from Egocentric Human Demonstrations
- Learning Generalizable Visuomotor Policy through Dynamics-Alignment
- A Step Toward World Models: A Survey on Robotic Manipulation
- EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities
- DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
- Running VLAs at Real-time Speed
- RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence
- π_
RL: Online RL Fine-tuning for Flow-based Vision-Language-Action Models - Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
- Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
- When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning
- HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models
- Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic
- Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control
- StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
- ContactFlow: A video action conditioning that transfers across embodiments
- CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation
- Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations
- VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
- PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking
- InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation
- Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?
- Nautilus: From One Prompt to Plug-and-Play Robot Learning
- TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans
- CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
- What Questions Should Robots Be Able to Answer? A Dataset of User Questions for Explainable Robotics
- NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies
- Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification
- BLM1: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning
- Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World
- RoboOmni: Proactive Robot Manipulation in Omni-modal Context
- Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents
- Dexbotic: Open-Source Vision-Language-Action Toolbox
- Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
- Generalizable Hierarchical Skill Learning via Object-Centric Representation
- Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
- MemER: Scaling Up Memory for Robot Control via Experience Retrieval
- SutureBot: A Precision Framework & Benchmark For Autonomous End-to-End Suturing
- Learning Affordances at Inference-Time for Vision-Language-Action Models
- GigaBrain-0: A World Model-Powered Vision-Language-Action Model
- Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
- A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents
- MoMaGen: Generating Demonstrations under Soft and Hard Constraints for Multi-Step Bimanual Mobile Manipulation
- RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation
- From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
- RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
- RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks
- QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
- RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
- Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning
- RoboHiMan: A Hierarchical Evaluation Paradigm for Compositional Generalization in Long-Horizon Manipulation
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- VLA-0: Building State-of-the-Art VLAs with Zero Modification
- Learning to Grasp Anything by Playing with Random Toys
- HiMaCon: Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data
- Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- A Survey on Agentic Multimodal Large Language Models
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
- PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
- Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation
- USIM and U0: A Vision-Language-Action Dataset and Model for General Underwater Robots
- DM1: MeanFlow with Dispersive Regularization for 1-Step Robotic Manipulation
- IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction
- DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
- BLAZER: Bootstrapping LLM-based Manipulation Agents with Zero-Shot Data Generation
- Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered
- From Data to Rewards: a Bilevel Optimization Perspective on Maximum Likelihood Estimation
- ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems
- TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training
- VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
- INSIGHT: INference-time Sequence Introspection for Generating Help Triggers in Vision-Language-Action Models
- MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption
- ActiveUMI: Robotic Manipulation with Active Perception from Robot-Free Human Demonstrations
- Contrastive Representation Regularization for Vision-Language-Action Models
- LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
- GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert
- Hybrid Training for Vision-Language-Action Models
- MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
- OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation
- dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
- Data-Efficient Multitask DAgger
- Fidelity-Aware Data Composition for Robust Robot Generalization
- Unifying Agent Interaction and World Information for Multi-agent Coordination
- Training Agents Inside of Scalable World Models
- Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints
- Transferring Vision-Language-Action Models to Industry Applications: Architectures, Performance, and Challenges
- VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search
- HELIOS: Hierarchical Exploration for Language-grounded Interaction in Open Scenes
- From Watch to Imagine: Steering Long-horizon Manipulation via Human Demonstration and Future Envisionment
- MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation
- EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
- AnywhereVLA: Language-Conditioned Exploration and Mobile Manipulation
- Normalizing Flows are Capable Models for Bi-manual Visuomotor Policy
- EgoBridge: Domain Adaptation for Generalizable Imitation from Egocentric Human Data
- Agentic Scene Policies: Unifying Space, Semantics, and Affordances for Robot Action
- TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction
- RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents
- World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models
- Cross-Embodiment Transfer via Behavior-Aligned Representations
- RL2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
- A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world
- SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation
- System 0/1/2/3: Quad-Process Theory for Multitimescale Embodied Collective Cognitive Systems
- MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
- ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation
- Pure Vision Language Action (VLA) Models: A Comprehensive Survey
- Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations
- N2M: Bridging Navigation and Manipulation by Learning Pose Preference from Rollout
- Growing with Your Embodied Agent: A Human-in-the-Loop Lifelong Code Generation Framework for Long-Horizon Manipulation Skills
- VGGT-DP: Generalizable Robot Control via Vision Foundation Models
- Residual Off-Policy RL for Finetuning Behavior Cloning Policies
- Latent Action Pretraining Through World Modeling
- Ratatouille: Imitation Learning Ingredients for Real-world Social Robot Navigation
- IDfRA: Self-Verification for Iterative Design in Robotic Assembly
- FILIC: Dual-Loop Force-Guided Imitation Learning with Impedance Torque Control for Contact-Rich Manipulation Tasks
- TranTac: Leveraging Transient Tactile Signals for Contact-Rich Robotic Manipulation
- A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
- Self-Improving Embodied Foundation Models
- Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
- Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
- RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
- Dual-Actor Fine-Tuning of VLA Models: A Talk-and-Tweak Human-in-the-Loop Approach
- GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
- Robust Online Residual Refinement via Koopman-Guided Dynamics Modeling
- The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
- Embodied Navigation Foundation Model
- Deceptive Risk Minimization: Out-of-Distribution Generalization by Deceiving Distribution Shift Detectors
- EgoMem: Lifelong Memory Agent for Full-duplex Omnimodal Models
- Igniting VLMs toward the Embodied Space
- Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
- NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows
- PegasusFlow: Parallel Rolling-Denoising Score Sampling for Robot Diffusion Planner Flow Matching
- RoboMatch: A Unified Mobile-Manipulation Teleoperation Platform with Auto-Matching Network Architecture for Long-Horizon Tasks
- RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation
- TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
- EMMA: Scaling Mobile Manipulation via Egocentric Human Data
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- Galaxea Open-World Dataset and G0 Dual-System VLA Model
- TReF-6: Inferring Task-Relevant Frames from a Single Demonstration for One-Shot Skill Generalization
- Prompt-to-Product: Generative Assembly via Bimanual Manipulation
- CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- Survey of Vision-Language-Action Models for Embodied Manipulation
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- Human Centric General Physical Intelligence for Agile Manufacturing Automation
- KDPE: A Kernel Density Estimation Strategy for Diffusion Policy Trajectory Selection
- Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
- Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation
- Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control
- H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
Related