Boston Institute for Artificial Intelligence · 学术成果与论文发表
本文提出 WholeBodyVLA,一种统一的视觉-语言-动作(VLA)框架,旨在实现人形机器人的全身移动操作(Loco-Manipulation)控制。与传统仅针对操作或移动单一模态的 VLA 模型不同,我们的方法通过潜动作模型(LAM)从无需动作标注的人类第一视角视频中学习统一的潜动作表示。我们引入了面向移动操作的强化学习策略(LMO-RL),一种新颖的策略优化方法,实现了上半身双臂操作与下半身移动的全身闭环协调。通过在大规模第一视角视频数据上进行无需动作标注的预训练,WholeBodyVLA 显著降低了数据采集成本,同时实现了对大空间环境中复杂长时程任务的泛化能力。在真实人形机器人上的实验表明,我们的方法在全身协调任务上达到了最先进的性能,任务成功率比现有方法高出 34%。本研究为能够在非结构化环境中执行多样化任务的通用型人形机器人提供了可扩展的技术路径。
| 来源 | 《科技信息与研究》| 2026 年第 7 期 | 192-196 | 共 5 页 |
| 作者 | 夏志敏 |
| 作者单位 | 波士顿人工智能研究院(BIAI) |
| 原文格式 | |
| 正文语种 | 中文(chi) |
| 中图分类 | 机器人;人工智能理论 |
| 关键词 | 视觉-语言-动作(VLA);潜动作模型(LAM);统一潜动作学习;面向移动操作的强化学习(LMO-RL);人形机器人;第一视角视频预训练;全身协调控制 |
本文提出 HALO,一种利用可微分仿真进行系统辨识和重载敏捷运动策略零样本 Sim-to-Real 迁移的新型框架。通过将 50 公斤以上的重载视为结构化的仿真-现实差距,我们采用可微分 MuJoCo/MJLab 动力学引擎,通过梯度优化联合优化质量、质心(CoM)与惯性张量参数。我们的方法将系统辨识目标形式化为端到端可微分优化问题,同时识别 38 个惯性参数,地面反作用力(GRF)预测误差低至 2.3%。与传统领域随机化方法相比,HALO 将 GRF 预测误差降低 82-86%,并实现零样本策略迁移而无需任何真实世界微调。在承载 50-80 公斤重载的全尺寸人形机器人上的实验表明,该方法可实现速度达 1.2 米/秒的稳定动态运动,轨迹跟踪误差低于 5 厘米。
| 机构 | 波士顿人工智能研究院(BIAI) |
| 中图分类号 | TP242[机器人] |
| 学科分类号 | 080206[智能装备与机器人];140502[人工智能];140503[智能系统与工程] |
| 关键词 | 可微分仿真;系统辨识(SysID);Sim-to-Real 迁移;领域随机化;重载运动;人形机器人;MuJoCo;地面反作用力预测 |