人形机器人控制本身的技术范式正在重新分工。
近日,Science Robotics(《科学 · 机器人学》)发表论文《Evolution of humanoid locomotion control》。
作者团队来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和 Meta,系统梳理了过去数十年人形机器人控制的发展:从早期实时反馈与动力学模型,到轨迹优化和模型预测控制(MPC),再到依赖大规模物理仿真的强化学习(RL),以及正在进入控制系统的扩散模型、视觉—语言—动作模型(VLA)和世界模型。
作者认为,这些看似不同的方法始终围绕三个底层问题展开:如何表示机器人与环境的物理动力学,如何在接触、摩擦和执行器约束下做决策,以及如何面对模型误差与真实世界的不确定性。
由此,论文提出一个更具统一性的方向:人形机器人控制正在走向物理引导的生成智能。
这把优化、学习、预测推理与在线适应重新组合进同一个控制体系。


经典人形控制的核心,是把动力学写出来,并在约束内求解。
早期常用线性倒立摆、ZMP、捕获点等降阶模型,只保留与平衡和落脚相关的关键变量,以换取高频、可解释的反馈控制。
随着算力提升,全阶动力学、逆动力学、全身 QP、轨迹优化与 MPC 逐渐能够处理更复杂的全身运动与接触约束。
这类方法的优势很明确:摩擦锥、关节限位、力矩边界和接触模式都可以直接写进优化问题。
但人形机器人是高维、欠驱动、混合动力系统;一旦把滑动、柔性、结构振动、执行器非线性和复杂地形同时纳入,模型与在线求解都会迅速变重。

强化学习改变了这一结构,但并不意味着 " 摆脱模型 "。现代人形 RL 高度依赖 Isaac、MuJoCo 等高吞吐量物理仿真器,而物理仿真器本身就是复杂动力学模型。
真正变化的是优化发生的位置。
经典预测控制往往在部署时根据当前状态在线求解优化问题;强化学习则在仿真中提前经历大量状态、扰动和接触,通过大规模离线训练把求解结果 " 编码 " 进神经网络策略,部署时主要变成快速推理。
从这个角度看,RL 与经典控制并非两条割裂路线。
论文指出,今天许多常见的学习技巧都能找到经典控制中的思想对应:领域随机化对应鲁棒控制,自适应模块对应自适应控制,隐式表征对应模型降阶,分层学习则延续了级联控制的系统分工。
因此,经典控制并没有被强化学习淘汰。即使在最先进的人形 RL 系统中,PD 跟踪、逆运动学、全身控制、MPC 和解析动力学仍频繁出现在底层接口与训练结构中。



论文认为,人形控制正在进入第三阶段。
变化同时发生在五个维度:判别式→生成式、单模态→多模态、单任务→多任务、运动→运动—操作、离线训练→测试时适应。
传统策略往往学习 " 观测→动作 " 的直接映射。但在真实世界,同一个状态可能存在多个合理选择,例如绕障时向左或向右都可能成立。生成式策略则试图学习可行动作或轨迹的分布,再根据视觉、语言、历史状态等条件生成未来行为。
这使生成式控制与预测性控制出现了新的交汇点:二者都在对未来进行推理,只是前者更多从数据中学习可行轨迹分布,后者更多依赖显式动力学和在线优化。
但机器人和语言模型有一个本质区别:机器人输出最终必须落到物理世界。生成出来的轨迹不能只是 " 看起来合理 ",还必须满足接触、摩擦、力矩、运动学限位与安全约束。生成式方法只有与物理可行性绑定,才可能真正成为控制方法。

当视觉—语言模型和 VLA 进入人形机器人,一个关键问题是:基础模型到底应该直接输出什么?
目前多数系统仍倾向于分层架构。高层基础模型负责视觉与语言理解、任务意图和较低频的运动学目标;低层控制器或跟踪策略负责平衡、接触处理与全身执行。例如,Helix 把高层命令交给独立运动模块,NVIDIA 的 GR00T 体系也采用高层运动意图与低层全身跟踪相结合的路线。
另一条更激进的方向,是让一个统一模型直接覆盖高频平衡、全身运动与富含接触的操作。这可能带来更深的跨模态耦合,但也会显著增加鲁棒性、安全性与验证难度。
所以,"VLA 会不会接管控制 " 并不是最精确的问题。更值得关注的是:未来基础模型的控制边界到底停在任务级意图、运动学轨迹,还是最终能够直接覆盖高频、富含接触的全身控制?
从 " 会走 " 到 " 会做事 ",以及部署后的继续适应
通用人形机器人不能永远把运动和操作分开。只会运动的系统可以到达目标位置,却很难真正与环境交互;只做操作的系统又常常假设基座静止,忽略整个身体的动力学。
因此,论文把运动→运动—操作视为关键转变。目标不是简单把 " 机械臂策略 " 接到 " 走路策略 " 后面,而是让系统联合推理移动、接触与力,实现真正的全身物理交互。
与此同时,真实机器人部署后还必须继续适应。无论仿真多复杂,真实系统都必然存在摩擦变化、载荷变化、结构误差和未见扰动。经典自适应控制、RL 中的适应模块,以及新兴的上下文学习和测试时适应,本质上都在回答同一个问题:机器人能否利用部署时的信息修正自己的控制行为,同时不破坏稳定与安全?
真正影响部署的,可能不是平均成功率,而是罕见失效
论文在展望中指出,摔倒仍然是阻碍人形机器人部署的主要障碍之一。这意味着,只报告平均回报或平均成功率并不足够。未来还需要更加标准化地评估恢复能力、摔倒频率、冲击严重程度,尤其要关注那些概率很低、但后果严重的失败。
数据同样是硬约束。机器人很难像语言模型那样直接获得互联网规模的数据。遥操作和仿真都很重要,但任何一种单独都不足以覆盖真实世界泛化所需要的分布;尤其缺少罕见失效、富含接触的交互、恢复行为与以人为中心的部署数据。
因此,下一代人形基础模型的核心问题并不只是 " 模型还能不能更大 ",而是如何把经验数据与物理规律真正结合,让数据驱动的泛化能力始终受到物理结构和安全约束的引导。
从工程化的稳定性,到智能自主性
回看过去几十年,人形机器人控制并没有经历 " 经典控制被强化学习淘汰、强化学习又即将被大模型淘汰 " 的线性替代。
更准确地说:经典控制把动力学、稳定性和约束显式写进系统;强化学习借助大规模物理仿真与策略优化,将大量计算前移到离线训练,从而获得更强的敏捷性与鲁棒性;生成式模型、基础模型与世界模型则开始进一步把多模态感知、多任务行为、预测性推理和测试时适应带入闭环。
最终,这些路线正在走向融合。物理规律并不会消失,而会继续通过仿真器、奖励设计、系统辨识、实时接口和安全约束进入学习系统。
人形机器人控制正在从 " 让机器稳定地动起来 ",走向 " 让机器在复杂物理世界中自主地理解、预测、行动并适应 "。而决定这条路线能否真正成立的,不只是模型能生成多丰富的动作,而是这些动作能否长期、稳定、安全地经得起真实世界检验。
作者团队简介
本文由来自普渡大学、卡内基梅隆大学、新加坡国立大学、加州大学伯克利分校、纽约大学、加州理工学院和 Meta 的研究者共同完成,团队覆盖经典控制、优化、强化学习、人形机器人与具身智能等方向。
顾彦(Yan Gu):普渡大学机械工程学院副教授;共同第一作者。






Ivan Lopez-Sanchez:纽约大学 Tandon 工程学院博士生。
Yunchu Feng:纽约大学 Tandon 工程学院博士生。
张健(Jian Zhang):Meta Robotics Studio 技术负责人兼总监。
Aaron D. Ames:加州理工学院机械与土木工程系教授。



论文标题:《Evolution of humanoid locomotion control》
论文链接:https://www.science.org/doi/10.1126/scirobotics.aed3973
资源库:https://github.com/purdue-tracelab/Humanoid-Locomotion-Survey
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见