


北京人形把这项数据业务比喻做 " 天工风火轮 "。风火轮的核心是 " 转 ":让数据高速稳定持续滚动,才能转出产业加速度。
但当下具身智能行业正撞上一堵墙:截至今年 7 月,国内真实物理交互场景数据不到 50 万小时,而机器人商业化落地需要至少数千万小时数据,缺口超 99%。李飞飞今年在访谈中直言,机器人面临极其困难的问题,就是非常缺乏数据。
大模型喝的是 " 自来水 ",互联网上数十年积累的文本、代码、论文,爬下来就能用。机器人喝的却是 " 瓶装水还得自己灌 ",每一条数据,都要让机器人在真实物理世界里亲手做一遍,贵、慢、还容易坏。
普遍缺数据的当下,天工的风火轮为什么能转?答案藏在原料、加工、交付的运转逻辑里。

数据原料从哪来?三条路各有利弊,北京人形 " 全都要 "
原料是风火轮的第一步,但行业普遍卡在这里。
要攻克数据荒,行业有三条主流路线,不过都有各自的天花板。
仿真合成:在虚拟物理世界里批量生成机器人操作数据。优点是成本极低,可无限生成,能覆盖各种危险或难以在现实中复现的场景。但 Sim2Real 鸿沟是一道绕不过去的坎。斯坦福 HAI 今年发布的《AI Index Report 2026》显示,机器人在仿真环境中的操作成功率高达 89.4%,迁移到真实家庭场景骤降至 12%,落差高达 77 个百分点。
无本体 Ego/UMI:采集人类第一视角的操作视频和数据。具备规模大、成本低的优势,人类每天都在拿东西、开门、做饭,本身是个巨大的数据矿。但致命短板是缺本体反馈:机器人不知道 " 这样做的时候关节用多少力、夹爪抓的多紧 ",无法直接训练真机策略。就像看了一万遍别人游泳的视频,自己不下水还是学不会。
真机遥操作:人通过 VR 头显和遥操设备远程操控真实机器人完成任务,同步采集动作与环境数据。数据质量最高、对齐度最强,完整保留了物体材质、摩擦力、重力、环境扰动等真实物理变量,是真机落地的决定性数据。但弊端是硬件成本高,一台机器人几十万;人力成本高,操作员全天候值守,单小时有效数据成本 500-1000 元;规模化困难,一台机器人 24 小时不停,一次操作 10 秒,采满一千万次要三年多。


它在自主搭建的 6000㎡基地里布局了行业最全的五大数据采集技术形态:光学动作捕捉、无本体 Ego/UMI 采集、真机遥操作、远程遥操、仿真合成,构建了 " 真机数据定基准、无本体便携示教扩规模、仿真合成补长尾 " 的三维数据体系,以真机原生交互数据锚定机器人本体的操作精度底线,依托无本体人类示教快速放大日常场景数据的覆盖广度,最后用仿真环境定向生成极端、危险、低概率的长尾场景样本,形成 " 高精度 - 大规模 - 全场景 " 的完整数据闭环。

数据数量大,质量也很关键。基地内,布置了家居、商超、工业装配、特种作业等 40 余个模拟实景分区。旗下 100 套无本体采集设备还部署至全国真实工厂和家庭,常态化、真实化采集,让数据采集长在真实场景里,采的是机器人未来要面对的真实工况。





2
数据怎么加工?行业唯一跑通全链路闭环
原料备齐了,怎么把 " 生数据 " 变成 " 熟数据 "?这一步才是真正的分水岭。
行业正在形成一个共识:本体和算法不是壁垒,数据闭环能力才是壁垒。算法可以写、本体可以造、算力可以买,但 " 数据采集—清洗—智能标注—质检—模型训练—模型评测—模型部署—难题回流 " 的全链路能不能跑通、能不能跑出效率,才是真正的竞争关键。

更大的隐患是:大量团队把数据采集等同于拍视频扫点云,却忽略了力矩、姿态、接触力、打滑临界等本体与物理环境交互的运动数据。大语言模型可以只靠文本涌现能力,但具身智能必须在与物理世界的互动中学会理解重力、摩擦、碰撞、形变。没有物理交互的数据,是不完整的具身数据,只靠视觉和点云训练出来的机器人,或许能看懂世界,却永远无法走进世界。
北京人形做了一件行业还没有第二家做到的事:把全链路闭环跑通了,成为行业唯一具身智能数据全链路闭环能力的平台。

这一套组合拳,使得北京人形的数据生产效率提升 50% 以上,综合生产成本缩减 30% 以上。
数据加工全链路闭环,让北京人形机器人的工具链完备度稳居行业第一。没有自动化生产管线、智能标注体系与三道质检机制的支撑,再海量的原始数据也只是沉睡在仓库里的无效资产。
不过,闭环跑通了,只解决了 " 效率 " 问题。还有一道更关键的题:数量重要,质量更重要。行业早期,资本市场很容易用 " 累计多少小时数据 " 作为核心评判指标。但经过一轮实践,市场发现盲目采集一百万小时并不难,但这样任务场景单一、数据同质化的数据几乎没有价值。
工信部今年批准发布首份行业标准《人工智能关键基础技术具身智能数据集质量要求及评价方法》,涵盖完整性、一致性、多样性、真实性、易用性等质量维度,2026 年 11 月将正式实施,这标志着行业从 " 规模导向 " 转向 " 质量导向 "。对于头部玩家来说,标准既是门槛,也是护城河。
质量维度里,最反直觉的一条:错误数据可能比正确数据更值钱。场景落地中冒出来的异常 case:抓取失败、姿态偏差、工具打滑、物体掉落,这些 " 失败经验 " 的回流迭代效率,才是决定模型优化速度的关键。这跟自动驾驶踩过的坑一模一样:99% 正常行驶没有信息增量,1% 的 edge case(边缘案例)才是真金。

3
数据交付到哪?对内造血,对外赋能
风火轮转起来,数据往哪去?
北京人形既内部使用,更开放给行业。对内,数据直喂天工,满足企业自我造血。值得一提的是,这种造血是在真实场景中,而非实验室。
赛场之上,天工机器人 8.64 秒夺冠、举重项目包揽前四名,源自基地采集的跑步、举重、障碍赛等动作数据,有效支撑了天工的竞技突破。赛场之外,基于基地采集的物流分拣数据训练的模型,已在顺义京东物流分拣厂投入实际运行:机器人在真实的快递分拣线上干活,而不是在实验室里分拣标准的快递盒。

对外,北京人形将全栈能力赋能行业伙伴,避免重复造轮子。目前,天工风火轮已服务多家具身智能头部企业,覆盖行业核心参与主体。联动百余家外部数采厂,将自研平台能力对外赋能。目前,其已支持 SaaS 服务与私有化部署两种模式,合作伙伴可以按需选用。其交付至行业伙伴的数据验收通过率达 95% 以上。
在交付端,北京人形也实现了三个 " 第一 ":开源数据集下载量行业第一、合作伙伴规模全国第一梯队、高质量真机数据交付规模全球第一。它们共同回答了一个关键问题:数据做出来了,有没有人用、用不用得起、用了能不能落地。
风火轮之所以能越转越快,不只靠技术和产能,还有两个根基:标准和合规。作为国家队,北京人形联合工信部制定数采场建设、数据采集标注、高质量数据集相关行业标准,把标准嵌入采集 / 质检 / 交付全流程,让行业有据可依。在其操作过程中,已经做到来源授权、全程脱敏、安全流通、可溯可查,数据全链路血缘追溯、版权合成覆盖,配套权限审批、操作日志留痕机制,让数据在合规框架下跑起来、不失控。
标准和合规不是限制,是让风火轮转得更稳、更久的轴承。没有标准的行业,数据交易靠私下协商,质量参差不齐,伙伴不敢用、生态建不起来;没有合规的数据,来源不明、隐私不清,一旦出事整个飞轮停摆。
这些都是北京人形作为国家队应当承担的责任,而其也在朝着这个方向前进。目前,其开源数据集 RoboMIND 全球下载量突破 2000 万,未来还将搭建行业数据联盟实现资源共享,目标是打造全球首个百万小时高质量具身智能数据平台。
4
结语
据 IT 桔子统计,2026 年上半年 25 家中国具身智能数据创业公司合计拿到超过 170 亿元融资,数据采集需求占人形机器人订单比例从 2025 年的 31% 预计突破 50%。资金正在从 " 造机器人 " 转向 " 喂机器人 "。在 LLM 时代 Scale AI 靠数据标注跑出独角兽估值,在具身智能时代物理数据无法爬取、必须在物理世界采集,全链路数据闭环的壁垒远高于文本标注。谁先跑通,谁就是这场淘金热里最稳的 " 铲子商 "。
不过,北京人形不以数据业务逐利为核心,作为国家队,其更在意做大行业生态。天工踩着风火轮跑出了 8.64 秒,北京人形要做的是让机器人行业踩上风火轮。
当数据原料备齐备纯、加工闭环运转、交付通且稳、标准管住、合规托底,数据飞轮就会越转越快,整个行业才有望打破数据荒,越来越多机器人将踩上风火轮。
