具身智能呼唤基础设施时刻。
作者|栗子
7 月 17~20 日这几天,上百家具身智能公司涌入 WAIC。
「甲子光年」在这几天的探展中发现,这一届 WAIC 上的具身智能,并没有出现非常颠覆性的产品。但有一个肉眼可见的变化:把机器人放进真实生活场景里的 demo,越来越长了。
比如蚂蚁灵波的药房机器人现场分拣 30 多种 SKU,识别率 99.8%;银河通用的机器人可连续完成烤面包、倒饮料、取出面包并装盘;一家做家用陪伴的厂商,在不到 10 平方米的展示区里,搭建了一个端茶递水的多步任务场景。
如果说去年的机器人还集中在 " 动起来 ",那么今年,显然大家都已经开始要求机器人能够真正完成一件事了。
而完成一件事,就离不开" 长程任务 "。
它指的是那种包含几十甚至几百个动作、需要机器人持续决策并保持上下文的复合任务。蚂蚁药房在分拣 30 多种药品时,需要连续完成识别、定位、抓取、扫码、放置的链路;银河通用的煎饼果子机器人需要走完从打蛋到装袋的完整动作链。
但长程任务并不好完成。
1. 长程任务成为新考场
今年的世界人工智能大会,甚至可以被称为机器人大会。因为具身智能企业太多了,一共有 242 家具身智能相关企业来到了 WAIC 2026。
这是第一个变化。
第二个变化是,各家的 demo 场景明显变长了。
去年大家还在展示 " 单步抓取 " 和 " 机械臂能拿起一个杯子 "。而今年几乎所有头部企业的展示位都包含至少一个 3 步以上的复合任务。
从分拣药品到煎饼果子制作,从装盘到上料,越来越多 demo 跑的是几十步连起来的连续任务。
第三个变化,是具身智能真正开始尝试业务落地了。
比如,蚂蚁灵波的 " 机器人智慧药房 " 已在国大药房上海门店运营,门店无需改造,机器人直接进入既有经营环境;智元联合擎天租为大会公共服务提供了 60 台各类型机器人,在主会场和两个分会场承担指路引路,这是行业内首次实现具身智能公共服务。
不过,在「甲子光年」的实际观察中,机器人真实落地的案例并不多。以货物分拣为例,「甲子光年」看到某品牌机械臂在拣选货盘中贴边的货品时,就尝试了大约 10 次才成功,这在真实场景中可能反而会影响最终业务效率。
某具身智能企业联合创始人向「甲子光年」表示:" 这个行业处于早期阶段,大家看到满屏 Demo,但是真正去干活,客户其实是非常抓狂的状态。做完 Demo 之后没法持续,这是我们看到产业上面真正的问题。"
显然,今天的具身智能行业,已从 " 能不能动 " 的技术验证阶段,全面进入 " 能不能干活 " 的产业交付阶段。而长程任务正在成为具身智能的新考场。
2. 长程任务为什么难
" 大家对具身机器人能做的事情的预期和期望,和机器人现在真正能做的能力提升之间,存在差距。" 艾欧智能联合创始人丁哲章在接受媒体采访时表示。
demo 跑得通,deployment 跑不通,是目前具身智能行业的普遍难题。
长程任务为什么落地难?
首先是" 大脑慢、小脑快 "异步控制矛盾。
VLM 或世界模型的推理延迟通常在 100-500 毫秒,电机控制则要求 1 毫秒,量级差两个数量级。让两个反应速度完全不同的系统协同工作,本身就是工程难题。
比如灵初智能把机器人系统分成了 3 个脑——底层控制(500-1000 Hz)、感知(10-15 Hz)、大脑(0.x Hz),描述的就是这种 " 反应速度梯度 "。
其次是从仿真到真实的物理鸿沟。
仿真器里训练出来的策略,部署到真实世界经常会崩溃。比如光照变了、摩擦变了、关节间隙变了。灵初智能 CEO 陈源培坦言:" 目前仿真与真实的物理仿真度还有 10%-20% 的差距。"
第三是数据荒。
近期,「甲子光年」走访了多家具身智能公司,每一家都在自建数据采集基础设施。灵初智能的裸手数据已经达到 10 万小时;还有灵生科技的 " 百万小时 " 目标、艾欧智能 "in the wild"(到实际场景里去做任务采集)工厂化采集路径。这些都说明,具身智能领域目前的可用数据是极其稀缺的。
第四是长周期任务中的" 因果错觉 "。
受限于目前的模型能力,AI 在执行几百步的复合任务时,容易在某一个步骤上累积微小的误差,导致后续步骤全面崩溃。数据驱动的模型还会产生因果混淆,错误地把人类示教时的无意义小动作当作成功的必要条件。
第五是硬件本体的安全性与物理极限。
AI 输出的是概率分布,物理世界不容许幻觉。灵初智能的 " 硬件 + 模型 + 数据 " 的小全栈路线,其实很大程度上是为了让硬件和模型更紧密地耦合,避免 "AI 想做一件事,但硬件做不了 " 的问题。
这 5 个问题,是不少具身智能企业在实现长程任务落地上的共同卡点。不过我们也看到了,已有一些具身智能公司正在从各自角度突破这些问题。
3. 如何解决长程任务难题?
灵初智能的策略最简单也最重:用高质量的人类示教数据训练大模型。
根据灵初智能的介绍,公司已经积累了 10 万小时裸手数据,也就是人在真实场景下不带手套操作的高质量视频数据。
这个数字什么概念?英伟达开源的 EgoScale 数据集,规模约 2 万小时 Ego 视频。灵初智能的 10 万小时,是 5 倍于这个数字。
10 万小时数据对于存储来说,并不是一个小数字,它需要一个对象存储基础设施。腾讯云存储产品总经理陈峥介绍说,腾讯云推出的 Agent Bucket 是专门为具身智能设计的数据存储,能让数据从 30 分钟的训练集变成 3 天的训练集。这正是灵初智能这种 " 砸人类数据 " 路线需要的底层设施。
10 万小时数据不只是存储的挑战,更意味着算力的量级跃升。腾讯云异构计算研发总监陈煜东观察到,具身智能客户的训练需求去年到今年增速达到 200% 到 300%。加之模型两三天就迭代一个版本,视觉、雷达点云乃至外网视频等多模态数据都要做清洗和标注,对底层算力的拉动尤为明显。这正是灵初智能这种 " 砸人类数据 " 路线背后必须解决的算力底座问题。
而为什么是裸手?因为手是人类最复杂的 " 末端执行器 ",有 24 个自由度、5 个手指、近百个关节。人类手部的精细动作是机器人灵巧手最好的训练数据。
灵初智能把这 10 万小时喂进模型,得到的是能完成 " 光模块装配 " 这种精密多步任务的策略。
但 10 万小时还不够。
灵初的产品矩阵里有 R 系列和 W 系列两条产品线。R 系列是 "World Action Model",输入图片和语言,输出未来视频和动作,让模型能在脑内想象未来再做决策,解决长程任务的执行。
W 系列是 "Action-Conditioned World Model",输入动作,输出未来视频,用反事实推理评估人类示教数据,筛掉无意义的小动作,解决 " 长程任务的数据质量 " 问题。
对应长程任务的卡点,灵初智能的解法是:
10 万小时裸手数据解决数据荒;W 系列反事实推理解决因果错觉;R 系列端到端世界动作模型解决 Sim-to-Real 鸿沟;R1 快慢脑架构解决大脑慢小脑快的异步控制;硬件 + 模型 + 数据 " 小全栈 " 解决 1 到 N 复制。
而乐享科技则用工程化来解决长程任务问题。
根据乐享科技 CTO 李元庆介绍,公司从一开始就坚持 "rule based+modular based+end2end 三层融合 " 的架构。
rule based 使用明确的规则约束和以前的 corner case 的工程化积累完成高解释性、可靠性、低成本的策略,作为产品的智能化前的安全兜底,modular based 是借助有效的 perception,decision making 的规划,记忆模块,执行模块完成快速的产品功能流程打通和落地,在此基础上将显式结构特征再利用数据驱动用数据补充其他的特征逐步升维简化为隐式结构特征的策略。
这种路线的潜台词是,长程任务不能完全依赖模型。因为 AI 输出概率分布,物理世界不容许幻觉,所以 rule base 必须存在,给模型兜底。
对应长程任务的卡点,乐享科技的解法是:rule base 兜底解决长周期因果错觉(每一步都有人类定义的安全规则约束);端云协同(2.5B 模型在端侧、30B 模型在云端)解决大小脑异步。
据「甲子光年」了解,目前不少具身智能的数据处理和模型推理都是在云端。例如乐享科技的元点 M1 机器人接入了腾讯云在具身领域的 Agent"ClawPro" 产品,给机器人加入了 Agent 能力。这个就是部署在云端。
而数据与推理在云端,就离不开低延迟的交互。据腾讯云存储产品总经理陈峥介绍,目前腾讯云专门为具身智能定制了云存储服务,包括 COS(对象存储)、TI 平台(智能钛机器学习平台)等组件。
其实对于具身公司而言,腾讯云能提供的支持远不止此。去年,腾讯云就发布了 Tairos(钛螺丝)具身智能开放平台,像一个可快速接入的大脑底座一样,为具身企业提供具身开源模型、模型服务等。
目前,宇树、越疆、众擎等机器人厂商都已接入了 Tairos 平台。
4. 具身智能的 " 基础设施时刻 "
根据「甲子光年」近期对具身智能企业的走访后,一个明显的判断是,具身智能公司都重度依赖云。
比如,灵初智能需要 10 万小时裸手数据的对象存储和异构计算;乐享科技需要云端模型和端侧模型的端云协同;灵生科技需要云 - 边 - 端一体化的低延迟数据飞轮;艾欧智能需要跨地域远程操作和工厂化数据采集。
他们在用不同的方式解决同一道题,而解法的底层都是云。
腾讯云在这个过程中,侧重于把机器人 " 跑起来 " 所依赖的底层能力,沉淀成一套可以被反复调用的基础设施——并围绕具身智能的实际需求,收敛成" 算力底座—模型服务—感知交互 " 三层。
这三层,恰好接住了前面四家公司的不同诉求。
最底下的算力底座,用 GPU 高性能计算、星脉网络和 COS、GooseFS 等存储,解决海量数据的存和喂卡问题;
中间的模型服务层,由 TI 平台等承担模型的训练与推理调度,把端云协同的算力密集环节放到云上跑;
最上面的感知交互层,则以实时音视频、视觉理解、智能标注等能力,支撑跨地域远程操作、云 - 边 - 端的低延迟数据飞轮等需求。
换句话说,具身智能公司专注在数据、模型与本体这些 " 离场景最近 " 的部分,把算力、存储、网络、模型平台和 Agent 接入这些 " 离地基最近 " 的部分交给云——双方各守一段、彼此咬合,机器人完成一个长程任务的完整链路才真正被托住。
这,正是走访中反复被印证的" 云 + 具身 "协同共进的样子。
也就是说,今天的具身智能,需要的不是 ChatGPT 时刻,而是更大规模、更深入的基础设施时刻。
因为 ChatGPT 时刻是一个产品横空出世,把所有人的预期拉到一个新台阶。但我们认为,今天的具身智能,距离 ChatGPT 时刻还有距离。
但基础设施时刻是,所有环节都有一个可用的底座,让算力、存储、网络、模型平台、Agent 接入。只有这些要素同时具备,整个具身产业的 " 长程任务 " 才有可能从 demo 走向 deployment。
显然,今天的具身智能,已经出现了基础设施时刻的雏形。
「甲子光年」走访的这些企业,每一家都在用打地基的方式,突破长程任务这道难题。
显然,谁能把地基打得更深,谁就能让长程任务跑得更长。
(封面图来源:AI 生成)
END.