李飞飞老师的World Labs,补了块关键拼图。
刚刚,借助新收购机器人公司SceniX之力,World Labs 发布了全新的机器人策略训练与评估引擎——
Real-to-sim-to-real ( R2S2R ) 。
这套引擎将 World Labs 空间智能的版图从生成可交互的虚拟世界,进一步延伸到了真实机器人的训练、评估与部署,并首次打通了从仿真训练到真实运行的闭环。

其中,Real-to-Sim负责把现实中的机器人、传感器、物体以及交互过程搬进仿真,构建与真实任务对齐的虚拟环境。
Sim-to-Real则让机器人在这些虚拟环境中完成训练和评估,再将策略直接部署回真实世界。
李飞飞老师在 X 上表示,基于这套方法训练出来的策略,即使完全没用过真实世界数据,也已经能够连续自主运行 1 小时,无需人工干预。
不仅如此,R2S2R 还让机器人策略的评估变得更容易规模化。
通过对齐策略在仿真与现实中的运行过程,真实世界里的成功、失败及其触发条件,都可以在虚拟世界中被复现和分析。
可以说,R2S2R 不仅打通了世界模型从生成世界,到训练、评估和部署真实机器人的闭环,也推进了李飞飞此前提出的世界模型三分法中,最关键的一块——
仿真器。
在她的经典划分中,世界模型可以承担三种功能:渲染器负责生成观察,仿真器负责模拟世界状态,规划器则负责输出行动。

想 scale 具身智能,先得 scale 机器人学习的世界
那么,为什么要扩展机器人的学习环境,而且还非得在仿真里?
在博客中,World Labs 表示:
当前机器人发展的主要瓶颈,已经不只是模型架构,而是缺少能够规模化获取的经验和评估。

要让机器人真正走出实验室,就必须提前覆盖足够丰富的场景,并反复测试它在什么情况下会成功、又会在哪里失败。
另一方面,与训练大模型的互联网数据不同,机器人的每一条经验都需要真实发生。
每轮实验都要占用硬件,人工重置物体、恢复失败并维护系统。即便拥有海量人类视频,也很难系统覆盖不同环境、物体属性、机器人状态和失败条件。
因此,仿真最大的价值,并不只是 " 省下采集数据的钱 ",而是可以主动制造现实中昂贵、危险或难以重复的情况,让机器人反复经历成功与失败。
但过去的仿真技术也存在着明显短板。
它不仅需要为每项真实任务单独搭建环境,成本高、速度慢,而且仿真与现实之间往往存在视觉、几何和物理动态上的差距。
更重要的是,机器人在仿真中学会的策略,到了真实世界未必依然有效;仿真中的测试结果,也未必能反映真实表现。
基于上述背景,World Labs 推出了从现实到仿真再到现实训练(R2S2R)的仿真引擎,用于训练和评估机器人策略。

Sim-to-Real 则利用这些世界完成策略训练与评估,找到模型容易失败的状态,并判断仿真中的表现能否迁移到真实硬件。
两者连接起来,便形成了一套闭环:
从现实中提取任务,在仿真中规模化生成经验、训练和寻找失败,再把策略部署回现实;现实中的新结果,又会继续修正世界模型、训练数据和机器人策略。
也就是说,R2S2R 不是简单地用仿真替代真实数据,而是把一个真实任务扩展成大量可控制、可复用的学习世界,让机器人能够以更低的成本反复训练、评估和迭代。
Real-to-sim-to-real
具体来说,这套方法首先从 Real-to-Sim 开始。
团队先采集机器人、传感器、环境、物体和任务演示等信息,再通过生成式世界建模系统,将其重建为一个可交互的虚拟世界。
这个世界不仅要还原外观和几何结构,还要尽可能复现物体的物理和动力学特性。
比如,在下面的双机械臂装箱任务中,仿真和现实环境会执行相同的动作序列,从而产生高度一致的观察结果、物体运动情况以及最终效果。
这里的难点在于,真实环境并不会提供一套准确参数。
物体的重量、摩擦力可能难以测量,机器人和摄像头也可能与标称规格存在偏差,电缆、包装等柔性物体的形变更难用简单模型描述。
因此,R2S2R 会根据不同任务的需要,组合使用不同的表示和建模方法。
完成重建后,团队会让机器人在现实与仿真中执行相同动作,直接比较视觉观测、物体反应和最终结果,从而验证两边是否真正对齐。
而在Sim-to-Real 阶段,对齐后的仿真世界会进一步变成一套可扩展的训练与评估引擎。
具体的,机器人先在仿真中学习新策略,评估系统再主动寻找它容易失败的状态,并围绕这些弱点生成新的交互经验,形成 " 发现问题—补充数据—改进策略 " 的闭环,最后再部署回真实硬件。
此外,相比现实数据采集,仿真可以系统调整物体位置、机器人状态、视角、外观、物理属性和任务难度,让策略反复经历现实中成本高、难复现甚至不安全的情况,并获得物体状态、接触、受力等硬件上难以采集的监督信号。
而且,一个重建好的任务并不只服务于某个模型或某款机器人。同一套仿真环境可以继续适配不同策略、传感器和机器人平台,从一次性实验变成可复用的训练基础设施。
报告中显示,在没有真实世界数据参与,只在仿真里训练的策略可以直接迁移到 ALOHA、RB-Y1、YAM、Flexiv 和 xArm 等机器人平台,完成装箱、绕线、试管转移和杂乱环境中的单件抓取等任务。
其中,电源线绕行、线缆插拔、试管转移,以及马克笔和铅笔抓取等任务,均连续自主运行 1 小时,期间没有失败,也没有人工接管。

最后,在评估方面。
由于机器人受制于物理世界的运行速度,每测试一个 checkpoint,都要重新布置场景、运行机器人并处理失败,成本高,能够覆盖的情况也十分有限。
相比之下,R2S2R 则可以先在数千种受控条件下主动寻找失败,提前筛掉表现不佳的 checkpoint,只把最有希望的策略留给真实硬件测试。
这里的关键,并不是要求仿真与现实的成功率完全一致,而是两边能够得出相同的判断:
哪些策略更好、它们在哪里成功或失败,以及训练中的提升能否真正迁移到硬件。
在 ALOHA 双臂方块交接任务中,团队测试了 GR00T N1.6 和 π . 两种策略架构,以及不同训练配置、ID 和 OOD 场景。每个 checkpoint 分别进行了 2000 次仿真试验和 100 次真机试验。
结果显示,仿真中表现更好的 checkpoint,在真机上通常也表现更好。仿真不仅保持了不同策略之间的相对排名,也呈现出与现实相似的成功和失败分布。

团队会让机器人在仿真和现实中执行完全相同的动作,再比较两边看到的画面、物体的反应和最终结果是否一致。
即使是在线缆、关节物体等很难模拟的任务,也要尽可能复现真实的物理变化。
以方块交接为例,当方块放在机器人不太熟悉的位置时,机械臂会抓得更靠近边缘,差一点就失手。这种 " 险些失败 " 的过程,不仅出现在真机上,也在仿真中被复现了出来。
也就是说,仿真还原的不只是机器人最后成功了还是失败了,还能还原它为什么会走向成功或失败。
这也意味着,R2S2R 可以成为机器人开发中的高通量评估层,用来筛选 checkpoint、发现性能退化,并决定下一轮应该补充什么数据。
World labs 收购 SceniX
事实上,在正式发布 R2S2R 的前一周,World Labs 就已经宣布收购SceniX。

SceniX 联合创始人李昀烛目前是哥伦比亚大学助理教授,曾在 MIT 获得博士学位,随后在斯坦福跟随李飞飞从事博士后研究。
有意思的是,这两家公司的合作并不是从这段师生关系开始的。
最早,SceniX 只是 World Labs 生成式世界模型 Marble 的客户。直到李飞飞发现这家公司由李昀烛创办,双方才进一步意识到彼此技术上的互补,并展开了收购计划。
World Labs 擅长生成模型、计算机视觉和 3D 重建,可以从稀疏输入中快速生成具有空间一致性的世界;
SceniX 则更熟悉机器人、仿真、学习算法和硬件系统,知道怎样让这些世界真正用于策略训练、评估和部署。
换句话说,就是前者解决 " 世界怎么生成 ",后者解决 " 机器人怎么在里面学习 "。
在 a16z 访谈中,李昀烛表示,这次收购并不意味着 World Labs 要亲自造机器人。
它们真正想建设的,是一套与机器人形态和模型架构解耦的基础设施:
无论客户使用单臂、双臂还是移动机器人,VLA 还是 World Action Model,都可以进入同一个数字世界训练和测试。
在未来,双方将围绕仿真、基础模型和动作条件模型逐步整合,并希望先在仓库、实验室和电子装配等半结构化场景中,与客户完成真实部署验证。
参考链接
[ 1 ] https://www.worldlabs.ai/blog/real-to-sim-to-real
[ 2 ] https://www.worldlabs.ai/blog/taxonomy-of-world-models?utm_source=chatgpt.com
[ 3 ] https://x.com/drfeifei/status/2082137342824075357
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见