关于ZAKER Skills 合作
量子位 16分钟前

Science Robotics 梳理人形机器人运控 60 年:强化学习之后,生成式控制正在成型

人形机器人控制本身的技术范式正在重新分工。

近日,Science Robotics(《科学 · 机器人学》)发表论文《Evolution of humanoid locomotion control》。

作者团队来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和 Meta,系统梳理了过去数十年人形机器人控制的发展:从早期实时反馈与动力学模型,到轨迹优化和模型预测控制(MPC),再到依赖大规模物理仿真的强化学习(RL),以及正在进入控制系统的扩散模型、视觉—语言—动作模型(VLA)和世界模型。

作者认为,这些看似不同的方法始终围绕三个底层问题展开:如何表示机器人与环境的物理动力学,如何在接触、摩擦和执行器约束下做决策,以及如何面对模型误差与真实世界的不确定性。

由此,论文提出一个更具统一性的方向:人形机器人控制正在走向物理引导的生成智能。

这把优化、学习、预测推理与在线适应重新组合进同一个控制体系。

作者将数十年的人形机器人控制演进概括为经典方法、基于学习的方法和新兴方法三个阶段:从受限地形上的稳定行走,到复杂地形上的敏捷运动,再到开放环境中的多任务运动—操作

三代控制范式及核心原则从经典控制到强化学习:真正改变的是 " 优化发生在哪里 "

经典人形控制的核心,是把动力学写出来,并在约束内求解。

早期常用线性倒立摆、ZMP、捕获点等降阶模型,只保留与平衡和落脚相关的关键变量,以换取高频、可解释的反馈控制。

随着算力提升,全阶动力学、逆动力学、全身 QP、轨迹优化与 MPC 逐渐能够处理更复杂的全身运动与接触约束。

这类方法的优势很明确:摩擦锥、关节限位、力矩边界和接触模式都可以直接写进优化问题。

但人形机器人是高维、欠驱动、混合动力系统;一旦把滑动、柔性、结构振动、执行器非线性和复杂地形同时纳入,模型与在线求解都会迅速变重。

建模方法可以看作从基于物理到数据驱动、从低到高表达力的连续谱:降阶模型、全阶模型、物理仿真器、学习得到的动力学、隐式动力学、世界模型,以及位于中间的混合模型

强化学习改变了这一结构,但并不意味着 " 摆脱模型 "。现代人形 RL 高度依赖 Isaac、MuJoCo 等高吞吐量物理仿真器,而物理仿真器本身就是复杂动力学模型。

真正变化的是优化发生的位置。

经典预测控制往往在部署时根据当前状态在线求解优化问题;强化学习则在仿真中提前经历大量状态、扰动和接触,通过大规模离线训练把求解结果 " 编码 " 进神经网络策略,部署时主要变成快速推理。

从这个角度看,RL 与经典控制并非两条割裂路线。

论文指出,今天许多常见的学习技巧都能找到经典控制中的思想对应:领域随机化对应鲁棒控制,自适应模块对应自适应控制,隐式表征对应模型降阶,分层学习则延续了级联控制的系统分工。

因此,经典控制并没有被强化学习淘汰。即使在最先进的人形 RL 系统中,PD 跟踪、逆运动学、全身控制、MPC 和解析动力学仍频繁出现在底层接口与训练结构中。

A 比较模型 / 数据复杂度,以及主要训练或优化发生在离线还是在线;B 展示部署前后的层级结构和典型控制时间尺度:关节力矩层约 1000Hz、运动生成层约 100Hz、任务规划层约 1Hz

左侧是经典控制:状态估计器、解析模型与在线控制器;右侧是强化学习:在物理仿真器中离线优化策略,部署时主要由策略根据观测输出动作

稳定性、高维动力学、混合接触、约束、鲁棒性和适应性等挑战,被横向对应到经典方法、基于学习的方法和新兴方法三套技术路线下一阶段:从 " 输出动作 " 到 " 生成物理可行的未来 "

论文认为,人形控制正在进入第三阶段。

变化同时发生在五个维度:判别式→生成式、单模态→多模态、单任务→多任务、运动→运动—操作、离线训练→测试时适应。

传统策略往往学习 " 观测→动作 " 的直接映射。但在真实世界,同一个状态可能存在多个合理选择,例如绕障时向左或向右都可能成立。生成式策略则试图学习可行动作或轨迹的分布,再根据视觉、语言、历史状态等条件生成未来行为。

这使生成式控制与预测性控制出现了新的交汇点:二者都在对未来进行推理,只是前者更多从数据中学习可行轨迹分布,后者更多依赖显式动力学和在线优化。

但机器人和语言模型有一个本质区别:机器人输出最终必须落到物理世界。生成出来的轨迹不能只是 " 看起来合理 ",还必须满足接触、摩擦、力矩、运动学限位与安全约束。生成式方法只有与物理可行性绑定,才可能真正成为控制方法。

变化并不只发生在模型架构上,而是同时发生在五个维度 VLA 到底应该控制到哪一层?

当视觉—语言模型和 VLA 进入人形机器人,一个关键问题是:基础模型到底应该直接输出什么?

目前多数系统仍倾向于分层架构。高层基础模型负责视觉与语言理解、任务意图和较低频的运动学目标;低层控制器或跟踪策略负责平衡、接触处理与全身执行。例如,Helix 把高层命令交给独立运动模块,NVIDIA 的 GR00T 体系也采用高层运动意图与低层全身跟踪相结合的路线。

另一条更激进的方向,是让一个统一模型直接覆盖高频平衡、全身运动与富含接触的操作。这可能带来更深的跨模态耦合,但也会显著增加鲁棒性、安全性与验证难度。

所以,"VLA 会不会接管控制 " 并不是最精确的问题。更值得关注的是:未来基础模型的控制边界到底停在任务级意图、运动学轨迹,还是最终能够直接覆盖高频、富含接触的全身控制?

从 " 会走 " 到 " 会做事 ",以及部署后的继续适应

通用人形机器人不能永远把运动和操作分开。只会运动的系统可以到达目标位置,却很难真正与环境交互;只做操作的系统又常常假设基座静止,忽略整个身体的动力学。

因此,论文把运动→运动—操作视为关键转变。目标不是简单把 " 机械臂策略 " 接到 " 走路策略 " 后面,而是让系统联合推理移动、接触与力,实现真正的全身物理交互。

与此同时,真实机器人部署后还必须继续适应。无论仿真多复杂,真实系统都必然存在摩擦变化、载荷变化、结构误差和未见扰动。经典自适应控制、RL 中的适应模块,以及新兴的上下文学习和测试时适应,本质上都在回答同一个问题:机器人能否利用部署时的信息修正自己的控制行为,同时不破坏稳定与安全?

真正影响部署的,可能不是平均成功率,而是罕见失效

论文在展望中指出,摔倒仍然是阻碍人形机器人部署的主要障碍之一。这意味着,只报告平均回报或平均成功率并不足够。未来还需要更加标准化地评估恢复能力、摔倒频率、冲击严重程度,尤其要关注那些概率很低、但后果严重的失败。

数据同样是硬约束。机器人很难像语言模型那样直接获得互联网规模的数据。遥操作和仿真都很重要,但任何一种单独都不足以覆盖真实世界泛化所需要的分布;尤其缺少罕见失效、富含接触的交互、恢复行为与以人为中心的部署数据。

因此,下一代人形基础模型的核心问题并不只是 " 模型还能不能更大 ",而是如何把经验数据与物理规律真正结合,让数据驱动的泛化能力始终受到物理结构和安全约束的引导。

从工程化的稳定性,到智能自主性

回看过去几十年,人形机器人控制并没有经历 " 经典控制被强化学习淘汰、强化学习又即将被大模型淘汰 " 的线性替代。

更准确地说:经典控制把动力学、稳定性和约束显式写进系统;强化学习借助大规模物理仿真与策略优化,将大量计算前移到离线训练,从而获得更强的敏捷性与鲁棒性;生成式模型、基础模型与世界模型则开始进一步把多模态感知、多任务行为、预测性推理和测试时适应带入闭环。

最终,这些路线正在走向融合。物理规律并不会消失,而会继续通过仿真器、奖励设计、系统辨识、实时接口和安全约束进入学习系统。

人形机器人控制正在从 " 让机器稳定地动起来 ",走向 " 让机器在复杂物理世界中自主地理解、预测、行动并适应 "。而决定这条路线能否真正成立的,不只是模型能生成多丰富的动作,而是这些动作能否长期、稳定、安全地经得起真实世界检验。

作者团队简介

本文由来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和 Meta 的研究者共同完成,团队覆盖经典控制、优化、强化学习、人形机器人与具身智能等方向。

顾彦(Yan Gu):普渡大学机械工程学院副教授;共同第一作者。

石冠亚(Guanya Shi):卡内基梅隆大学机器人研究所助理教授;共同第一作者。

石凡(Fan Shi):新加坡国立大学电子与计算机工程系助理教授;共同第一作者。

张益嘉(I-Chia Chang):普渡大学机械工程学院博士生。

王彦仁(Yen-Jen Wang):加州大学伯克利分校计算机科学博士生。

程启龙(Qilong Cheng):纽约大学 Tandon 工程学院博士生。

Zachary Olkin:加州理工学院机械与土木工程系博士生。

Ivan Lopez-Sanchez:纽约大学 Tandon 工程学院博士生。

Yunchu Feng:纽约大学 Tandon 工程学院博士生。

张健(Jian Zhang):Meta Robotics Studio 技术负责人兼总监。

Aaron D. Ames:加州理工学院机械与土木工程系教授。

苏浩(Hao Su):纽约大学 Tandon 工程学院副教授;通讯作者。

Koushil Sreenath:加州大学伯克利分校机械工程系教授;通讯作者。

其中顾彦、石冠亚和石凡为共同第一作者,苏浩和 Koushil Sreenath 为通讯作者。

论文标题:《Evolution of humanoid locomotion control》

论文链接:https://www.science.org/doi/10.1126/scirobotics.aed3973

资源库:https://github.com/purdue-tracelab/Humanoid-Locomotion-Survey

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目 / 主页链接,以及联系方式

我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容