关于ZAKER Skills 合作
第四波 9小时前

昆仑万维方汉 : 具身模型的拐点 , 看谁先跑到百万、千万小时

研究员|冯皓钦

三个多月前的中关村论坛上,昆仑万维集中发布了 Matrix、SkyReels 和 Mureka 三条模型产品线的新版本。今年 WAIC 期间,昆仑万维除了再次更新模型矩阵,还发布了一款面向物理世界的 Riemann-1.0 机器人模型,把模型的输出对象扩展到了机器人动作。

昆仑万维董事长方汉告诉第四波,具身智能模型接下来真正的能力分化,不在于谁能做出更多的 Demo,而在于谁能率先把训练数据采集到百万小时、千万小时,甚至亿小时级别。

昆仑万维董事长兼 CEO 方汉

01 EGO 数据,让机器人训练走向百万小时

过去几年,文本大模型和视频大模型已经反复证明,模型能力会随着数据、算力和参数规模的扩大持续提升。具身智能目前之所以还没有出现明显的能力分化,并不是 Scaling 规律在机器人领域失效,而是行业手里的有效数据仍然太少。多数企业只有数十万小时数据,远没有达到能够充分释放 Scaling 红利的量级。

方汉把 2026 年称为 " 世界模型元年 "。在他看来,所谓 " 元年 " 并不是世界模型的概念突然变热,也不是机器人馆里出现了更多产品,而是行业开始证明:具身智能有了一种有可能规模化扩张的预训练数据来源—— EGO 第一视角视频。

此前,机器人数据主要依赖真机遥操作、UMI 设备或者带有传感器的数据采集手套。这些方式能够获得动作轨迹、手部姿态、触觉反馈等高质量信息,但采集设备贵、人员要求高、场景覆盖有限,很难迅速扩展到百万小时。方汉提到,UMI 数据采集设备去年均价约为 15 万元,今年已经出现 1.6 万至 1.7 万元的产品,未来还可能继续下降到四五千元。双目摄像头、运动传感器、采集帽和胸前摄像头等设备也在加速出现,机器人数据采集正在经历一轮明显的成本下降。

但即使设备继续降价,完全依赖专门组织的遥操作和真机采集,成本仍然很高。EGO 数据的优势恰恰在于,它不要求采集者专门操纵机器人,也不一定需要佩戴复杂的手套或 VR 设备。普通人在快递配送、工厂作业、整理房间、烹饪和家务劳动时,只要佩戴轻量化摄像设备,就可以持续记录人类在真实环境中的操作过程。

方汉给出了一个更具体的设想:当 EGO 数据的额外采集成本下降到每小时 10 元,快递员、工人等劳动者就可以在正常工作的同时完成数据采集。与专门雇人进行遥操作相比,这种模式不仅成本更低,还能够覆盖家庭、商场、仓库、工厂、户外等大量场景。对于需要在开放环境中工作的机器人而言,场景多样性本身就是泛化能力的重要来源。

EGO 数据过去并不是没有人看到,而是行业普遍认为它太 " 脏 "。普通第一视角视频只有二维画面,看不到精确的关节状态、手指姿态和动作轨迹,也缺少触觉、深度及机器人控制信号。人在视频中抓起一个杯子,模型只能看到手和杯子的像素变化,却无法直接知道手指用了多大力度、杯子位于多远的位置,以及整个动作应该如何映射到机械臂上。

方汉介绍,昆仑万维试图通过专门的数据清洗和重建模型补齐这些信息,包括从二维视频中反推深度关系,重建手部运动的前后位置,并利用 3D 重建技术还原手部模型和抓取动作等方法。经过清洗后,原本只有平面画面的 EGO 视频,可以转化为包含更多空间和动作信息的训练语料。未来随着双目摄像头、深度信息、鱼眼视角和运动传感器逐渐集成到采集设备中,EGO 数据本身的质量也会继续提高。

Riemann-1.0 验证了这条路线。方汉称,模型目前使用的输入数据只有 20 多万小时,尚未真正进入大规模 Scaling 阶段,但实验已经证明,经过清洗的异构 EGO 数据能够提升模型能力。在 RoboCasa365 评测中,模型成功率由 50% 多提高到 62%,提升约 8 个百分点。其意义并不只是刷新一项成绩,而是验证了低成本、来源复杂的真人视频,也可以成为具身模型的有效预训练数据。

02 3D 仿真再便宜,也替代不了真人数据

这也是为什么视频模型团队也在进入具身智能。

相比主要依赖真机和遥操作数据的机器人团队,视频模型厂商已经积累了处理几十亿级视频 Clip 的经验,熟悉视频清洗、自动标注、空间重建和大规模训练。当具身智能开始需要海量真实世界数据时,这些能力可以直接迁移过来。

不过,视频模型团队能够迁移的,并不是单纯生成画面的能力,而是从复杂视频中提取有效信息的能力。普通视频模型只需要让画面看起来连贯、自然,具身模型却要判断动作发生之后,物体会产生怎样的真实反馈。对视频而言可以忽略的小误差,落到机器人执行中就可能直接导致任务失败。

所以,这就让真实视频与游戏、仿真数据之间出现了明显区别。

游戏和 3D 仿真数据的优势是成本低、生成快,也可以批量构造不同场景和失败案例。但方汉认为,数据便宜并不代表数据足够真实。游戏引擎对材质、摩擦力、形变和受力反馈的模拟通常并不完整,角色还可能飞行、悬空或完成现实中不存在的动作。

例如,真人抓握塑料杯时,杯体可能发生形变;但在游戏环境中,如果不专门制设计,塑料杯只是一个不会变化的刚体。如果机器人长期学习这类数据,就可能形成与真实物理世界不一致的判断。

方汉提到,昆仑万维自身拥有大量游戏模型数据,但不会因此直接用这些数据训练现实世界的具身模型。游戏世界追求的是画面效果和可玩性,具身模型需要学习的则是动作发生后,真实物体究竟会怎样变化。

当然,仿真数据并非没有价值。它仍然可以用于补充危险场景、长尾案例和难以反复采集的任务,但更适合作为真实数据的补充,而不是主要来源。

因此,视频模型团队进入具身智能,真正的优势并不是拥有更多虚拟视频,而是能够把海量真人视频清洗、重建并转化为训练语料。

仿真数据可以帮助机器人练习,但真实世界数据,才决定机器人最终能不能离开仿真环境。

编辑|符永康

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容