关于ZAKER Skills 合作
文汇 18小时前

智元一天发布两款模型,一款让机器人“边看边动”,一款让它“越学越会”

机器人能不能像人一样 " 看着走 "、根据人眼看到的场景随时调整动作?如果训练数据扩大 100 倍,它又能不能像大语言模型一样,持续解锁新的操作技能?

9 月 9 日,智元机器人一天之内接连发布两款模型:AGILE2.0 感控一体模型和 GE-Act 2.0 原生世界—动作模型。前者让机器人进一步实现 " 边看边想边动 ",后者则尝试回答具身智能领域一个更基础的问题——机器人模型能否沿着大模型的 Scaling 路径,通过不断扩大数据规模获得更强的通用能力。

两款模型瞄准的方向不同,却指向同一个目标:让机器人走向能够理解真实世界、持续行动并适应复杂场景。

从 " 看见 " 到 " 边看边想边动 "

传统机器人系统中,视觉感知、运动规划和执行控制往往由不同模块承担。相机捕捉画面后,AI 识别目标、计算位置,再将指令传给运动控制系统。这样的链路一旦面对快速变化的环境,视觉信息与身体动作之间的时间差就可能造成机器人晃动、失稳甚至动作中断。

AGILE2.0 试图进一步打通这条链路。在此前 AGILE1.0 实现感知与运动链路贯通的基础上,AGILE2.0 将环境观测、地形理解、动态可通行性分析、全身运动控制、接触状态切换以及末端操作等环节进一步耦合,形成视觉感知、环境理解、全身运动控制和上下肢协同的统一闭环耦合与全域一体化自主推理,构建面向开放环境的感控一体运动智能体系。

为了展示这一能力,智元没有采用常见的技术演示,而是拍摄了一支 " 机器人杂技团 " 短片《杂技 BOT》。在视频中,灵犀 X2 完成钻火圈、抖空竹、跳长绳、跳山羊、协作上高台、抛三球、搬箱子等动作。在 " 踩球走 " 动作中,灵犀 X2 双脚站在大球上,滚动大球向前行进, 仿佛真正的杂技运动员一样。

智元介绍,这是行业内首次有双足人形机器人自主实现踩球运动。这一动作的难点并不只是保持平衡:机器人需要通过视觉实时判断球体、身体和周围环境的变化,同时连续调整身体姿态和脚部动作,在动态过程中维持整体稳定。

在跳长绳场景中,两台机器人负责挥动长绳,另一台机器人则需要观察绳子的运动状态,判断进入和离开的时机;在搬箱子场景中,两台机器人还需要根据彼此的动作进行协作。

这些动作背后,是人类习以为常、机器人却并不容易完成的能力:看到环境变化,并立即把 " 看到 " 转化为身体动作。

数据扩大 100 倍,机器人能学会什么?

如果说 AGILE2.0 给了机器人更像人的运动能力,原生世界—动作模型 GE-Act 2.0 则让机器人拥有了从海量数据中持续学习、解锁新技能的能力。

与一些从现成视频生成模型出发、再接入动作模型的技术路线不同,GE-Act2.0 的视觉表征、未来生成和动作预测等核心组件均从随机初始化开始,在具身数据上从头训练。更重要的是,智元尝试用 "Scaling" 来检验这种模型路线是否成立。

研究团队分别使用 300 小时、1200 小时、5000 小时和 3 万小时四档数据进行训练,并在训练完成后不针对测试任务进行额外微调或示范,直接让机器人面对陌生场景和陌生物体进行零样本测试。

图中每个任务接受四档数据量训练(300 小时 /1200 小时 /5000 小时 /30000 小时),随着训练数据不断扩大,技能覆盖范围与任务成功率同步扩大,这验证了原生世界 - 动作模型预训练与 Scaling 路径。

结果显示,随着训练数据扩大 100 倍,机器人不仅原有技能的成功率不断提高,还逐渐出现此前无法完成的新技能。

在 G1-OP 机器人上,取得非零成功率的任务数量从 39 项增加到 76 项;在 G2-90D 机器人上,则从 24 项增加到 72 项。折叠毛巾、嵌套纸杯、拔插笔盖、插花等精细操作,在小规模数据训练的模型中基本无法完成,当数据规模扩大至 3 万小时时开始出现明显的能力增长。

整体任务成功率也同步提升:G1-OP 从 17.1% 提高到 44.1%,G2-90D 从 13.4% 提高到 31.1%。值得注意的是,从 5000 小时增加到 3 万小时后,模型能力仍未出现明显饱和。

这意味着,对于具身智能模型而言," 堆数据 " 可能并非简单增加重复样本,而可能带来技能覆盖范围和泛化能力的持续扩展。

对于正在加速进入工厂、物流、服务等真实场景的人形机器人而言,这种底层能力的提升或许比单个 " 炫技 " 动作更值得关注:机器人最终要面对的,并不是一个被提前设计好的测试环境,而是一个不断变化、充满意外的真实世界。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容