文 | 定焦 One,作者 | 王璐,编辑 | 魏佳
具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当 " 第一 " 几乎成为各家标配时,榜单还有可信度吗?
一个多月前,千寻智能就经历了尴尬时刻。6 月初,其具身基座模型 Spirit v1.6 在 RoboArena 榜单上以 1918 分的成绩超过了英伟达 Cosmos3 的 1880 分,一度位居 " 世界第一 ";紧接着,千寻宣布完成 15 亿元 A+ 轮融资,三个月内累计完成四轮密集融资,总额接近 50 亿元,创下具身智能赛道的融资频率新高。
不过,业内对评测数据的质疑几乎从次日就开始升温。有观察者指出,在 310 次评测记录中,有 72% 的分数来自两个账号。更值得关注的是,RoboArena 官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。Spirit v1.6 也随之从榜单上除名。
但这一事件并未浇灭玩家们的热情,翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个 " 第一 ",且这些 " 第一 " 维度各不相同。
这一景象或许不难理解,具身智能目前技术路线还没统一、真机成功率大多卡在五六成,外界想判断一家公司到底行不行,很大程度上只能依赖榜单。可当发榜的既有高校、机构也有媒体,各家标准各不相同、有的还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个问题。
一位关注具身赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考,他对于千寻这件事并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个 " 第一 ",可能正是他们 " 写在报告里一个比较好的入口 "。但也有投资人持不同看法,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。
当 " 第一 " 的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看?
01. 技术路线还没统一,先人手一个 " 第一 "
我们先来盘一盘目前市面上的榜单,建立一个大致印象。据不完全统计,目前具身智能的活跃榜单高达 20 余个。按评测内容,这些榜单大致可以分成三类。

世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是 World Arena 和 WorldModelBench;
专项基准榜,考察 " 极端情况下会不会露馅 ",针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是 RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。
需要说明的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。
有了这层坐标,近半年具身基座模型的战报就能对号入座。如果把近两个月具身基座模型的战报汇总,可以得到一份相当壮观的名单。
今年 5 月,星动纪元 Era0 宣称拿下 RoboChallenge Table30 第一;智元 GE-Sim 2.0 是 World Arena Track1 第一;跨维 DSCFuncWorld 是 World Arena Track2 第一。进入 6 月,千寻 Spirit v1.6 拿下 RoboArena 第一(后被除名),鹿明 Prime R0 登顶 MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。
而乱象,也是从各种榜单开始的。
最明显的是,榜首像流水席,"第一名 " 更换频繁。
RoboChallenge Table30 的榜首,过去半年里至少换了四次:先是千寻 Spirit v1.5 以 50.33% 的成功率刷新纪录,很快又被极佳视界 GigaBrain-0.1、美国波士顿动力 Atlas、星动纪元 Era0 先后超越。
这个速度,比大语言模型的主流榜单更新快得多。2023 年到 2025 年,GPT-4、Claude 3、Gemini 1.5 在 MMLU、GSM8K 等榜单上的榜首位置,通常能守数月甚至一年,即便是 2020 年到 2022 年的高速迭代期,GPT-3、PaLM 也是以月为换榜周期。" 当下的具身智能,单个模型能霸榜一周就算不容易。" 一家头部具身智能公司的从业者米范表示。
其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而 MMLU 这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像 RoboChallenge 的 Table30,30 项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的 " 保质期 " 于是被压到了以周计。
更让人迷惑的,是同一个榜里会同时冒出好几个 " 第一 "。
World Arena 就是典型,智元 GE-Sim 2.0、跨维 DSCFuncWorld 对外都称自己 " 登顶 World Arena",但事实是,这个榜单含有多条赛道,智元 GE-Sim 2.0 在 Track1(感知与动作响应)以 68.26 分排第一,跨维 DSCFuncWorld 在 Track2(数据引擎)排第一。" 第一 " 分属不同个子榜,对外却被统一写成了同一句话。
对不熟悉赛道划分的读者来说,两家并列的 "World Arena 第一 " 的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。
还有一层更模糊的地带是,榜单性质混杂," 第一 " 的含金量却被默认成同一档,容易产生误导。
一些公司的对外口径里,经常会同时列出 " 某模型在 RoboChallenge 排名第一 ",和 " 在某具身智能媒体的测评中也位居第一 "。前者是 7 × 24 小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。
其中最模糊的是 " 产业榜 ",有些榜单顶着 " 产业 " 二字,但既不是真机锁死的硬榜,也不是学术机构背书的 benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层," 双料第一 " 才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。
三种现象叠加,结果就是榜单 " 第一 " 严重通货膨胀。而且这种通胀不只停留在营销层面,一个 " 第一 " 的头衔往往能换来关注度、资源和实打实的估值溢价。
02. 一个 " 第一 " 是怎么造出来的?
既然榜单能撬动真金白银,如何把第一造出来,也形成了 " 潜规则 "。业内人士介绍,虽然千寻 Spirit v1.6 属于极端个例,但行业里造 " 第一 " 的现象并不少,手法大致有三种。
成本最低、也最普遍的一种方式是话术包装," 单科第一 " 成了 " 总分第一 ",核心是省掉关键限定词。
比如实际拿的是 "RoboTwin 2.0 双臂协同 VLA 类 Clean 档第一 ",对外就变成 " 登顶 RoboTwin 2.0";实际是 "LIBERO-Plus 场景泛化专项第一 ",对外就成了 "LIBERO-Plus 榜首 "。数据没造假、成绩也是真的,但 " 第一 " 所指代的范围被人为放大了。
第二种方式是利用 " 刷题 " 等方式直接干预结果。
一条是 " 照着考题练 "。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复 " 刷题 "、过拟合到特定场景换来高分。
米范表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和 LLM 领域的 " 数据泄露、数据污染 " 有本质区别。
另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如 RoboArena 采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子。

一是评测者身份无门槛。任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的 Elo 分数快速推高;
二是匹配不强制全覆盖, 随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A 是固定的,B 是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上。比如 Spiritv1.6 早期与 DreamZero 交手,23 场后停战,与 5 月 30 日入榜的英伟达 Cosmos3-Nano-Policy 为零对战;
三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。比如 Spirit v1.6 的 310 次评测记录中,72% 的分数来自于 ECUST 和 Robotics Lab 两个账号,它们用 224 场评测刷出 97% 胜率,把 Spirit v1.6 推上第一,但英伟达用同样条件自测 21 次,胜率 0%,两组数据摆在一起,直接让从业者产生怀疑。
事后,RoboArena 补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于 20% 的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。
还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。
不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份 " 权威报告 ",把媒体榜和学术 benchmark 并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。
这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下," 第一 " 就成了。
这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底,技术越复杂,外行越难分辨,故事就越容易讲。
03. 去掉水分,还该信什么?
不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。
更深一层的问题是,这个行业目前还没有一把 " 通用的尺子 "。
具身智能从业者 gashero 用 " 炒鸡蛋 " 和 " 拌凉菜 " 打了一个比方:机器人 A 擅长炒鸡蛋、成功率 90%,机器人 B 擅长拌凉菜、成功率 85%,但不能就此说 A 比 B 强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把 " 炒鸡蛋的能力 " 和 " 拌凉菜的能力 " 折算进同一个打分体系里。
不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。

综合业内共识,真正可信的榜单,大体同时具备三个特征。
一是分项透明,不是只甩一个 " 第一 "。
不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以 RoboChallenge Table30 为例,它测的是 30 项日常任务的综合成功率,可信之处在于,不仅告诉读者 64.33% 这个综合数字,还让读者看到 30 项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。
二是评测由第三方掌控,且有反刷题设计。
MolmoSpaces 不允许微调,模型直接 " 裸考 ";LIBERO-Plus 则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。
三是看评测机制,而不是看更新频率。
更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,可能因为真机评测成本极高,比如 RoboChallenge 一次完整评测周期可能要数周,30 项任务每项跑 10 次,一共 300 次真机尝试,7 × 24 小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如 RoboArena 采用了 Elo 评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。
但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?
答案在于行业当下的阶段。
眼下这场 " 第一 " 的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。
当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候," 第一 " 的通货膨胀会自然消散,榜单也会退回它本该在的位置。
或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。
* 应受访者要求,文中米范为化名。