机器人翻山越野——家务机器人清理卫生摔倒;机器人耍功夫——货架机 器人弄倒货架。
这就是现在机器人的现状了:表演时生猛如虎,真去干活马上趴菜。
明明视频数据、动作数据喂了那么多,为什么机器人一工作还是不行?
其实机器人学干活,跟人学做饭挺像的。
咱们刷一万遍肠粉教程视频,真把盘子塞手里,大概率还是不会拉。
为什么?因为普通视频只会从第三视角演示给你看 " 发生了什么 ",但背后粉浆怎么舀、切肠粉的力度多大——这些关键细节,视频里根本没有。
这些细节,光看视频学不到,对机器人也是一样。
所以现在具身智能落地最大的难关,就是缺少优质的 " 真人干活教材 "。

它从上一代的局部动作采集,全面升级为全身 + 全模态采集——好比把一台只能录上半身的摄像头,换成了能同步捕捉全身动作、触觉力度甚至环境声音的 " 全景录影棚 "。
戴上它,不仅能保留人的观察视角,还能同步记录手部、手臂和腿部的完整动作轨迹,覆盖范围更广、视角更大。
同时,设备可搭配触觉手套与神经腕带协同使用——相当于给机器人的 " 学习 " 配了一套 " 全身传感网 ",能精准捕获手指细粒度微操、全身姿态和触觉感知信息,让机器人不仅看到 " 手怎么动 ",还能理解 " 使了多大劲 "。
更重要的是,这套设备正从 " 专业工具 " 变成 " 人人可用 "。
新增 Wi-Fi 和蓝牙连接,配合专属 App,众包采集模式正式打开——以前是少数专业团队在录,未来成千上万普通人都能一起参与,为千万小时级数据目标铺平了规模化道路。

算法层,京东云自研了自动化标注和 " 手部—上半身—全身一体化 " 人机对齐算法——相当于给采集到的动作配了一套 " 同声传译系统 ",把每一个关节角度、动作节奏和力矩变化,自动 " 翻译 " 成机器人能直接学习的数字指令,彻底打通了人类动作到机器人本体之间的隔阂。
京东云最新开放的人类第一视角实操视频数据集 EgoLive,首批公开约 2000 小时数据,已吸引大量高校和科研机构关注。
那这些数据到底能不能让机器人真正进化?
京东云基于自采真实场景数据训练出的 JoyAI-RA 0.5,在真机具身 Benchmark 上,已见任务平均成功率达 92.0%,未见泛化场景达 75.5%,两项指标均超过 π .5 等开源 SOTA 模型,展现出很强的泛化能力——证明 " 大量真实场景 + 第一视角 " 这条路,走得通。

京东正在建设全球最大的具身智能数据采集中心,计划两年内累计采集超过 1000 万小时高质量真实场景数据。
可以说,具身智能正在从模型竞争,进入到数据竞争的阶段。
以后大家不仅比谁模型更强,还要比谁能拿到足够真实、多样、可学习的数据。
这方面,京东有着独一份的天然优势。
京东 20 多年的零售、物流、仓储业务积累,覆盖上百种真实场景。
其他公司得专门搭建的训练环境,在京东每天都在发生,每天都在产出真实数据。

结果在团队配置和研发周期不变的情况下,模型对未知物体的操作能力得到提升, 数据预处理与预训练投入明显优化——证明第一视角真实数据,确实能推动模型进化,加速具身 智能走进真实世界。
数据有了,不代表就稳了。真机换个场景,可能照样翻车。
京东云推出的 JoyAI-Sim,就是负责把人类数据、仿真数据和真机数据连接起来,做合成数据生产,也做模型评测。
仿真评测与真机评测结果一致性约 90%,评测效率是真机的 3.2 倍,重复评测偏差降低了 37.7%。

京东干脆把这些环节打包进 LeRobot 具身模型开发平台,提供 " 数据 + 工具 + 算力 + 模型 " 全栈服务。企业不用从零搭基础设施,拿到就能用。
从真实数据采集,到模型训练,再到验证评测,京东云打通了一条完整的闭环。
具身智能的竞争,很像大模型的上半场——比参数;下半场,比的是谁能持续拿到足够真实、足够丰富的数据。
因为真实世界永远不是标准的。杯子换个材质、货架乱一点、光照暗一些,都可能成为新的考题。
京东正在做的,就是把拿杯子、理货架、搬箱子这些散落在真实世界里的人类经验和判断,低成本、规模化地收集起来,变成机器人可以直接学习的数据。
机器人离真正能干活还有多远?答案可能很简单:取决于我们教给它多少真实世界里的小事。
机器人产业最重要风向标,世界机器人大会(WRC)2026 重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等 300 余家 TOP 展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC 都将给出答案。
雷科技 WRC 2026 报道团已抵达 WRC 现场。
End
扫码免费加入
「一起 AI」社群,一起拥抱 AI 大时代。