2026 世界机器人大会已经在亦庄落幕。
展馆里的人形机器人争相秀出绝活:优必选 Cruzr Y1、Cruzr S2 在复刻的汽车产线做钣金上下料、纸箱和料箱拆码垛;魔法原子轮式人形机器人 XGZ1、分拣机器人 HyperBot 在物流场景异构多机协同作业,完整呈现 " 供包分拣转运 " 全流程闭环方案。大屏上,奇瑞墨甲的智警机器人正在 22 座城市的真实车流里指挥交通。
沉浸在现场的赛博氛围里,人形机器人进千行百业似乎指日可待。可是,据 Counterpoint Research 统计,今年上半年全球人形机器人(含泛人形)出货仅为 2.2 万台。刨去被同行买回去拆着学习的、被数据工厂拿去做采集的,真正落进工业、商业、物流场景的,还得再砍一大截。
一边是展馆里锣鼓喧天、大家高呼 " 爆发元年 ";一边是出货量还不够一家大型制造企业的用工规模。盛夏的热闹与初春的体量,挤在同一条赛道里。那么,人形机器人为何迟迟无法大规模落地呢?
答案,就藏在 WRC 的展馆里。
数据,刚进入规模化元年
关于机器人行业 "ChatGPT 时刻 " 何时到来,2025 年 8 月世界机器人大会上,王兴兴的判断相当乐观:" 快的话,未来一到两年,慢的话三到五年,是很有可能实现的。" 在那次演讲里,他甚至嫌行业对数据的关注过了头—— " 目前全球范围内对机器人数据问题的关注度有点太高了。现在最大的问题,其实是模型的问题。"

经过一年的高强度学习、深度思考,他把 GPT 时刻的到来时间从一年前的 1 – 5 年(相当于今年的 0-4 年)延长到了 2 – 10 年。而且这一次,王兴兴对数据的态度也发生了转变:" 目前的机器人都是 AI 驱动的,AI 基本都数据驱动——有多少数据,尤其有多少高质量的数据,就有多少 AI。" 开始把工作重心从本体转向具身大模型的宇树,也终于意识到了一点:用于训练具身大脑的数据,不管数量、质量还是多样性,没一个达标的。
这个瓶颈,在 WRC 的展馆里看得最直观。
数据采集设备被多家厂商摆上了最显眼的位置:帕西尼的 PXCap 五指触觉采集手套,整手内置 30 个六维触觉模组、3015 个触觉点,全五指无盲区覆盖,人类戴上做个动作,指尖的力、滑移、纹理信息连同关节角度一起被录进数据里;鹿明机器人摆出了 " 数采全家福 ":手持夹爪、头戴环、背包工作站一应俱全——人戴上就能采,不需要机器人本体;背上背包,采集者就能走进工厂、餐厅、商场,在真实场景里边干活边采。光轮智能则开源了号称全球首个十万小时级的全模态数据集——而据觅蜂科技 CEO 姚卯青的测算,具身模型要达到 GPT-3.5 那样开箱即用的能力,需要一亿小时量级的数据。

换句话说,机器人的 " 大脑 " 训练,至今仍处在数据准备阶段。
大脑,苦等 GPT 时刻
机器人要走进千行百业,如果每个场景、每种身体都要单独训练一个模型,研发成本永远降不下来;这件事要玩得转,最终必须做出一颗 " 一脑多能 " 的通用大脑:同一个大脑,既统一理解任务,又统一规划行动,还能把完整的智能能力注入双足、轮式、重载等截然不同的身体,指挥它们在家庭、零售、工业等场景中各自完成任务。
在 WRC 展馆里,做大脑的分两类。一类造整机,脑子长在自家身体上:银河通用让新品银河星仔和 Galbot G1、S1 三种形态同台轮番演示,背后是同一颗 " 银河星脑 ";星海图端出 Nexo、Kengo、Lemo 三大整机平台,驱动力是 G0.5,跨本体适配 18 种机器人。另一类不押整机,主业就是卖大脑:蚂蚁灵波的 LingBot-VLA 2.0 用 6 万小时数据预训练,覆盖 17 个品牌、20 种构型;首度参展的大晓机器人带来 " 开悟 " 世界模型 3.1,把视觉、语言、力触、动作轨迹压进统一隐空间。

事实上,有关大脑的技术路线,大家最近才逐渐达成共识—— C 位由 VLA 让位给世界模型。机器人要去的是家庭、工厂、商场,环境天天变、东西天天被人挪,只有真正吃透动作与物理环境之间的因果,一颗大脑才能换个场景照样干活。VLA 底座是大语言模型,硬把三维连续世界压扁成一维的离散符号序列,几何、受力、接触这些关键因果信息在压缩中就丢了。世界模型可直接在三维空间里建模物理交互:动作怎么改变世界、世界怎么回应动作,因果是在原生维度上长出来的,泛化自然更有底气。

" 转向世界模型 " 更多是叙事的转向,而非技术的突破。等哪家真做出来,行业自然会向它收敛了——这或许就是大家认为的机器人 GPT 时刻。
效率与成本,ROI 的拦路虎
数据和大脑解决的只是 " 能不能干 " 的问题——机器人能不能听懂指令、可不可以换个场景照常干活。可对工厂老板、门店经理这些真正的需求方来说,账从来不止这一层:这台机器干活快不快、多久能回本、能不能顶得上人工,是一笔必须算清的 ROI。而算清这笔账,绕不开两个核心变量:一是效率,决定这台机器的产出;二是成本,决定这台机器的投入。极智嘉联合创始人陈曦把效率这层账说得很透:" 效率是 1,泛化是后面的 0" ——没有效率打底的泛化能力,只是演示品,不是生产力。
最能看清效率这笔账的,是展会上最讨喜的环节——叠衣服。WRC 2026 的展馆里,有机器人为叠一件短袖衬衫耗上两分钟,有的叠完一件衣服用了三分多钟,中途折错了,还得拎起来抖一抖、从头再来。一件衣服几分钟——如果你是老板,看见员工以这个速度干活,恐怕很难不上火。

那机器人为什么这么慢?一方面是端侧芯片算力依然有限,一方面是因为大脑的技术路线正转向世界模型,而世界模型的推理开销高于 VLA。星海图发布的 " 全球最快 " 世界动作模型 Fast-WAM,靠推理创新提速四倍多,才把单步延迟从传统范式的约 800 毫秒压到 190 毫秒——折算下来每秒也就输出 5 个动作。脑子转不过来,手脚就只能放慢——叠件衣服要几分钟,根子在这里。

写在最后
WRC 的眼花缭乱让一些乐观者高呼 " 爆发元年 ",可刨掉六成多流向友商、商演与科教的出货,上半年全球人形机器人的销量不足万台。热闹与销量之间,隔着一段没走完的路。
数据积累不过两三年,且标准未立、样本零散,离 " 备齐 " 还远;大脑集体转向世界模型,声势浩大,但目前更像叙事的转向——世界模型许诺的因果理解,还没真正长进任何一款机器人的大脑里;账本更难:叠一件衣服要几分钟,单台售价二三十万,效率与成本两条腿都短,回报迟迟算不平。
但这未必是坏消息——当行业把短板和难算的账一起摊上台面,遮羞布掀开,路反而更加清楚:机器人离进入千行百业,差的已不是方向,而是把补齐数据、训练大脑、提高效率、降低成本这四件事走完的耐心。