一天没上网,又跟不上时代了!
听说,现在机器人都开始自己刷小视频,学手艺了?

简单说,就是给机器人看一段人类操作的短视频,它当场就能上手干活。
平均只要 29 秒,成功率能到 62%,你泡碗面还得等三分钟呢。
听起来是不是有点科幻?

叠衣服叠不明白、摆碗筷摆得乱七八糟……
那是因为想让机器人学会一个新技能,简直太难了。

一个专业工程师戴上 VR 头显,像遥控玩具一样,一帧一帧地控制机械臂。
整套动作重复几十遍,录下来的数据拿去给模型做监督微调,离线 " 炼丹 " 四个小时,机器人才能勉强学会一个新动作。

有业内人士算过账,传统真机数据采集,单条成本轻松破百美元,一小时数据成本过万。
于是行业开始找便宜路子。
印度那边迅速冒出一批 " 数据工厂 ",工人们戴着摄像头,记录工作流程。


可问题是人和机器人的身体结构天差地别。
你有五根灵活的手指,它可能只有两个夹爪。
让人看一遍视频就能学会打球,那是因为大家都是同类,身体结构是一样的。
但让一个机械臂强行模仿,就像大象学芭蕾舞,别扭且低效。

也就是说,你让机器人学会叠衣服,它可能就不会洗碗了。
整个行业都卡在这个死结里:想让机器人学新技能,就得烧钱采数据,花时间调模型,学完还可能把旧的忘了。

说白了,别让机器人模仿人的动作,让它理解人做事的结果。
传统方案是 " 照猫画虎 ",HOST 的做法更像个会动脑子的人。它不模仿动作,而是先 " 想象 " 结果。
看到人类拿起一杯水,它先在脑子里脑补出 " 夹爪拿起水杯 " 的画面。再从这幅画面反推:机械臂该怎么动,才能达到这个效果?

自变量的研究人员把这个逻辑搬进了机器人学习,把范式从 " 训练时微调 " 改成了 " 推理时获取 "。
简单说,机器人出厂前已经见过大世面,遇到新任务只需要 " 看一遍就会 ",不用再重新训练。

HOST 内部有两个 " 大脑 "。
" 视觉大脑 " 负责看懂视频里人类干到哪一步了,脑补出机器人视角下应该看到的画面。
" 动作大脑 " 把脑补出的画面变成现实,计算机械臂怎么动。
还有个很关键的细节:进度对齐。
同样十秒钟,视频里的人可能已经切完菜开始炒菜了,机器人还在切菜。
HOST 用了一种叫 " 动态时间规整 " 的算法,把视频帧和操作步骤映射到同一个向量空间,自动匹配 " 人类视频第 X 帧对应机器人第 Y 步 "。
对齐误差降了一个数量级,基本能做到同步。

看一段 29 秒的人类视频,HOST 复现技能成功率 62%。
而同行里的 Vid2Robot 和 AWDA 做同样的事,成功率只有 19%。
如果走传统微调路线,给 Pi-0.5 示范 50 个任务,再花 4 小时训练,成功率也才 38%。
HOST 用五十分之一的数据量,五百分之一的时间,做到了比它们都高的成功率。

投资方名单里有美团战投、阿里云、联想之星、德联资本,阵容相当豪华,前途一片光明。

别急!62% 的成功率,放在实验室里很好看,离 " 靠谱 " 还有距离。
家庭场景不是工厂流水线,光照会变、东西会挪、杯子奇形怪状,成功率大概率还要往下掉。
从 " 看视频学会叠衣服 " 到 " 真正帮你把一屋子衣服叠好收好 ",中间还有很长路要走。

过去十年,行业的主流思路一直是用海量的遥操作数据去硬灌。
这条路走得通,但代价太高,速度太慢,而且每学一个新技能都得从头来一遍。
HOST 证明了一件事:机器人学习可以不用那么笨。
它可以通过观察、理解、推理来掌握技能。就像人类从 " 死记硬背 " 进化到 " 举一反三 " 一样。
你说这算不算机器人的 " 开窍时刻 "?
参考资料:
APPSO、报告派、自变量机器人
编辑:chacha
