文|三少爷
最近一两年,OpenAI、Anthropic 每发一款大模型,具身智能的研究者都会把它接进机器人本体试下成色。每试一次,机器人公司都会松一口气:不过尔尔嘛。但这一次,似乎狼真的来了。
这回的主角,是 GPT-6 Astra。有人把它接上车,让它自己看路、打方向,跑完整段封闭场地测试,媒体说它 " 考过了科目二 ";斯坦福大学的研究人员给它接上宇树 G1,进厨房收拾、干活,新环境没采数据重训,就干成了;银河通用拿它做具身操作——在公开评测基准 RoboDojo 上,GPT-6 Astra 加上 π 0.5 的混合模式下,十个任务平均得分 62.6,领先第二名近一倍。
一个并非为机器人造的通用大模型,正零训练地接管 " 机器人大脑 " 那份活:看懂环境、做决策、调度动作。有人甚至叫它具身智能的 " 银子弹 " ——机器人公司再也不用苦哈哈攒数据、训专用模型了。可它真是那颗银子弹吗?
GPT-6 Astra,表现惊艳但有短板
GPT-6 Astra 开上真车、接进机器人收拾厨房,这件事本身不是噱头。通用大模型驱动机器人做事,早有先例—— 2024 年 Figure 01 就接上 OpenAI 的 GPT-4V 视觉语言模型,做过能对话、能多步推理执行的演示,但那一代的泛化与成功率都很有限。GPT-6 Astra 这一回,是把成功率与跨环境泛化能力大幅推高:零训练跨环境、靠上下文自我修正、连真车都能从第一次失败里学出第二次策略——这一步,值得认真看待,而不是一句 "Demo 罢了 " 就可以打发掉的。

先说成本。DrivingBench 让 GPT-6 Astra 控制一辆真车跑完 134.7 米的封闭道路,单次驾驶烧掉约 660 万 Token,按模型价格算成本约 7.74 美元。单公里大几十美金,显然不是能摊到量产自动驾驶车辆上的成本结构。通用模型按 Token 计费,而物理世界的动作是连续的、稠密的,需要海量的 Token 消耗,这笔账算不过来。

最难的是精细操作。在银河通用的评测里,Astra 直接模式(不搭配 π 0.5)在高精度接触、稳定抓取上的成功率断崖式下降。至于原因,斯坦福在报告里解释得很直白—— HomeBody 的导航,以地图坐标里的 2D 目标点和朝向点为基准,单位是米。米级精度意味着它只知道 " 大概到哪 ",能在封闭的无人场景里把车开到终点,却做不了厘米级的高精接触与稳定抓取。

分层架构,挑战一段式端到端
通用大模型接入机器人、开上车,最容易被误读成 AI 巨头要来抢自动驾驶公司和机器人公司的饭碗了。但技术上的真问题其实是,具身大脑该选择什么样的架构。
跟自动驾驶探索技术路线时曾经经历过的大乱战一样,具身大脑的架构设计,目前分化成了两条技术路线。
一条是一段式端到端——把视觉、语言、动作放进同一个模型,从识别物体一路学到完成动作。这条路线在自动驾驶领域已经成为不容讨论的共识,甚至被当成了第一性原理。另一条是分层双系统:系统 1 负责快思考,执行抓取、移动、轨迹追踪,通常由连续动作策略实现;系统 2 负责慢思考,理解任务、做长程规划、在关键节点纠错和恢复,通常由 VLM 实现。



云端基座动辄万亿参数,端侧芯片装得下的只有百亿量级,差着两个数量级。而把大模型压小的蒸馏这条路,历史上从来只有几倍压缩。小鹏把云端 720 亿的基座蒸馏到端侧百亿出头,七倍上下的蒸馏幅度已经很激进了,拿智谱的 GM-5.3 和其 Flash 版本做对比,压缩幅度只有 2.3 倍而已。所以,万亿参数的云端大脑,蒸馏不成端侧百亿的模型,这可不是工程上「再优化一下」就能解决的。那么好解决,咱不早就对 OpenAI、Anthropic 弯道超车了嘛,还成天就到底是落后三个月还是六个月吵个啥?
机器人公司的护城河
蒸馏不易,是不是可以认为机器人公司可以高枕无忧矣?当然不是,OpenAI 掌门人奥特曼最近在播客里把话挑明了:" 我们肯定会研发人形机器人 "。言外之意清晰无比:OpenAI 迟早会为具身智能定制一款大模型。它不会是 GPT-6 这种万亿参数体量,而是千亿级别;再叠上端侧芯片算力升级、几倍压缩,他们完全可能做出效果惊艳的几百亿参数端侧模型。当事情真的进展到了这一步,机器人公司的考验就真的来了:当 AI 王者把聪明的脑袋塞进机器人的身体里,它们的护城河到底在哪里?


把这点放到宁德时代和理想汽车的拉扯里看,会格外清楚。理想汽车掌门人李想曾解释,为什么电池不再选用宁德时代——理想希望供应商把数据和定义跟他深度互通。可在 AI 时代,数据是最核心的资产和命根子。宁德时代宁可丢掉理想这位大客户,也要守住自己的数据防线。同理,机器人公司手里那些在千辛万苦之中积累的场景暗数据,也是 OpenAI 这类公司无法轻易突破的防线。
写在最后
银子弹的说法,从一开始就把模型的能力当成了产品的能力,这是典型的以偏概全。
GPT-6 Astra 确实把机器人的 " 大脑 " 顶到了没人到过的高度,可它顶高的也只是大脑;真正让一家机器人公司最终立足的,不只在模型身上,更在脚下那块具体的场景——产线的节拍、料箱的种类、跟客户们一场场交流磨出来的信任,这些东西一天天攒成暗数据,通用大模型巨头买不到,也爬不下来。
这次狼来了的争论愈辩愈明,也让所有人看清,AI 时代最底层的资产是数据。谁站在现场、握着数据,谁才能最终留在牌桌之上。