当大家已经看腻了所谓一个更比一个强的 Benchmark 刷榜,什么样的场景能真正评价 Agent 和模型?
硅星人想到的答案是:让 AI 打实时对抗的游戏。在 AgenTank 游戏中,让 Agent 来玩 Tank 击杀游戏,如果你还没有了解过,可以看看下面这场冠军对战:
比赛分为 1v1 个人赛和 3v3 团赛,均以击毙对方或者吃到更多的星星为获胜条件,玩家可以在创建坦克时选择不同的技能,并针对该技能制定相应的策略。
于是,在这个刚结束的周期长达 14 天的比赛里,我们联合 30 个社区和顶尖高校 AI 社团, 450 名选手、500 多辆 Agent Tank,消耗近千亿 Token,完成了一次大规模 Agent 众测。
在对战的过程中,我们发现区别于传统静态的 BenchMark,在实时对抗的游戏环境里,比赛周期长、版本迭代多,对手的能力和策略都在变化,Coding Agent 不能只写好某个 JS 文件,还要在多轮失败、回放、日志中分析失败原因迭代坦克,直至发布新版本,再重新跑一遍这个闭环。
实时对抗还带来了动态博弈。没有任何策略是绝对制胜的:今天能赢大多数人的打法,明天可能被某个对手专门针对;团队赛里,策略还要根据队友分工和敌方行为重新调整。
最终,AgenTank 测到的是模型、Agent Harness 和人机工作流的综合能力,而不是单纯的裸模型智商。
测评说明与全局总览:
本次测评的数据集均来自选手在 AgenTank World Cup 中使用的参赛模型和 Agent 的数据,而不是等量控制的实验室样本。

最终的测评结果对应的不是游戏里的孤立技巧,而是实际工作中选择 Agent 时真正关心的问题:谁更会写可维护代码,谁更有全局观,谁能适应变化,谁能组织工具链,谁能把长任务持续推进到稳定结果。
所有的 AI,无论模型还是把模型藏在里面的 Harness 工具、模型产品等,最终都要解决真实场景的问题。于是在普通用户那里,解决问题最重要,管你是模型还是什么,一视同仁。
这也解释了为什么我们会把 Codex、Cursor、Claude Code、GLM、Agnes 等放在同一张表里。

我们按 " 实际承担主要 coding、规划和迭代工作的能力来源 " 归类:产品主导时看产品 /Agent 栈,模型变化主导时把模型作为参考维度。
因此,我们把这次 Eval 评测拆成五个维度:代码质量分、全局规划能力、实时任务适应、技能与工具编排、长程任务能力。


Claude 更像架构师,Codex 更像工程执行者。
Claude 更擅长把握宏观框架、搭出清晰结构,但后期处理精准细节时可能出现失真;Codex 架构能力没那么强,却更像一把便宜、高频、精准的手术刀,哪里有问题就直接改哪里,在动态环境里的适应性更好。
国产模型已经有局部 coding 亮点,在静态代码能力上,甚至部分优于顶级模型。这次比赛里,国产模型和顶级模型在代码质量上的差距没有想象中那么大。
国产模型真正落后的地方,是全局规划和长程执行:一旦策略从单个函数扩展成一套持续迭代的系统,就更容易出现目标前后不一致、代码越叠越厚、修复后缺少验证闭环的问题。但在实时响应上,国产模型反而有一些亮点,GLM、DeepSeek、Doubao 在明确场景下能较快补出针对性策略,说明它们对局部变化的反应并不弱,弱的是把这些反应长期组织成稳定系统。

模型能力足够强时,它决定第一版代码的质量、架构和策略上限;但任务进入动态环境后,胜负就不只看模型会不会写,而看 Harness 能不能帮它记住状态、调用工具、读取回放、处理上下文,并把失败反馈转化成下一轮调整。
Agent 的自反馈能力决定它能不能从工具走向独立。一个 Agent 的水平,不是由某次生成的代码、某一局胜负,或者某个模型榜单分数决定的;评判标准应该是:代码能不能长期维护,目标能不能持续记住,环境变化后能不能调整,工具和技能能不能被组织成策略链,失败以后能不能自己复盘、修复并验证。
接下来我会继续拆解每一项评分标准,以及这些分数分别对应到 AgenTank 对战中的哪些具体能力。
一、工程能力及代码质量
首先说明的是,工程能力分不是胜率,也不代表最终排名。它衡量的是 Agent 能不能把 " 能跑的策略 " 做成 " 能长期维护和迭代的工程系统 ";代码质量只是其中最基础、也最关键的一项。

同时,AgenTank 的规则中已经对代码做了初步限制,即代码体积需在 200K 以内,在同时击中等特殊判定中,代码运行时间也会成为决定胜负的依据之一。

Claude 适合搭策略基座,代码体积克制、结构清晰、完成度高。Codex 便宜、产量大,适合跑更多轮试错。不少上榜坦克先用 Claude 搭好策略骨架,再交给 Codex 或国产 Agent 跑迭代,在质量、效果和成本之间找性价比。
但这种接力不总是成功:有选手让 DeepSeek 为 Codex 生成的函数补注释,结果始终无法准确对齐原有策略,只能放弃。也有选手认为 GLM 的策略生成和落地效果不够,成本又没有优势,最终换回 Codex。工程接力的前提是接棒者能理解前一棒的架构意图,国产模型的弱项也在于此。
Cursor 的优势不完全来自底层模型,而是与 IDE 结合得更紧。个人赛和团赛都上榜的选手解释道:对一个已经迭代了几十上百版的 tank 来说,找准该改哪里比写代码本身更重要。进入长程任务后,拉开差距的是 Agent 工作流是否完备,而不是不停的烧 Token。
国产模型与第一梯队的差距集中在工程闭环和稳定性。局部改写、轻量执行、特定战术中能打出亮点,但长程任务里选手仍然选 Claude 们。
体感上,国产模型驱动的 Tank 容易在某个段位停滞,迭代不是做不了,但更依赖人持续跟进催促;Claude 和 Codex 则能自己走完从生成到测试到发布的完整流程。有选手搭了本地模拟器作为发版门槛,新版本必须通过 36 到 72 场全胜才允许发布,国产模型写出的代码没能通过本地测试,策略根本没走到发布节点。
二、长程任务能力
长程任务把时间拉到 14 天、上百个版本,考验的是 Agent 能不能在很多轮迭代之后,还记得自己要干什么,还能把失败转化成下一轮修复。
AgenTank 在计算长程能力时,先折叠内容相同的重复保存多点几次保存不算有效迭代。真正进入评分的,是版本链里发生过实际变化、能延续目标、能处理失败反馈的有效推进。


相比之下 Claude 写得清楚、稳健,但当任务进入很多轮反馈和修复时,它的长链路推进证据不如 Codex。代码质量第一的模型,在长程任务上只排第三,尤其在进入第 50 个版本迭代后,Claude 的代码质量开始出现比较大的波动和下降。

DeepSeek V4、MiniMax M3 的问题则更偏向闭环不稳:能补局部代码,但很难持续记住目标、读结果、定位问题、修复并验证。国产模型在这里暴露出的核心短板,是从 " 完成一次修改 " 到 " 长期托管一个任务 " 之间还差一整条工程链路。
三、全局规划能力
代码写得好,不等于知道下一步该往哪走。
AgenTank 中,坦克可以获取地图、墙体、星星、敌人和队友等信息,但每一帧的行动都受视野、移动距离、转向成本和技能冷却限制。全局规划考察的是:Agent 能否围绕地图、资源和长期目标安排连续行动,而不是看到敌人就开火、看到星星就追。


在全局规划上,国产模型的表现比代码质量更能暴露差距。GLM、DeepSeek、MiMo 在部分规划指标上有信号,说明它们能理解路径、资源和目标这些基本概念;但多数国产模型的问题是目标容易断:这一帧会抢资源,下一帧又被敌人或局部收益牵走,连续几步看不出稳定计划。
ZCode、Mavis Agent 在代码质量分上分数不低,在全局规划上没有同步跟上,说明 " 会写清楚代码 " 和 " 能组织长期行动 " 是两件事。国产模型要补的不是单个 BFS 函数,而是把路径、资源、风险和状态放进同一个决策系统。
当模型记不住的目标,只能由 Harness 替它记住。实战中,选手通常会在 Harness 或策略架构里补上跨帧状态。
例如 myth-tank 训练中采用了 " 行为树 + 黑板 " 机制,让坦克不再每帧从零判断,而是能记住上一轮目标,并在攻击、躲避、追星和蹲草之间持续调整优先级。
团队赛多一层考验:单个 Agent 的判断能不能服从团队分工。Agnes-Go 初期就出现过两辆坦克争抢同一颗星、彼此卡住的情况。复盘后不同坦克逐渐形成分工,存活追星、持续火力、开局猛攻各司其职,再把分工固化进共享约束。这里的全局规划不只是「我下一步去哪」,而是「我们接下来几步怎样不互相打架」。
反过来,即使每辆坦克都是最强坦克,其局部判断都合理,但若一辆坦克选择埋伏,另一辆却主动出击,团队仍可能输掉比赛。
四、实时任务适应能力
实时适应,是 AgenTank 对模型和 Agent 最严苛的考验之一。战场在变、对手在变,同一个对手的打法也在持续升级。进入王者段位后,蹲草、突击、转向甩弹已是常规操作,甚至有人会针对榜单头部坦克专门编写反制代码。
很多选手把 AgenTank 的模式类比做 " 黑客攻防 ",不跟进跌打,马上掉分掉段位;改的太紧太多,又可能 " 打赢一局,改坏全局 "。这就很考验实时复盘迭代能力,比如来自超参数的冠军选手就在他迭代工作流中设置了门槛条件,不仅要在不同地图上击败旧版本、胜率超过 60%,面对其他技能坦克时也表现也不能退步。

实时适应主榜的分差非常小,在这个维度没有绝对领先者,不同 Agent 走了不同的路线,也有着不同的弱点。

Claude 和 Cursor 更像保守但表现均衡的选手,除事件响应稍弱外,没有明显的短板但运行可靠性很高。代码通常结构清晰、保护条件充分、运行稳定,但策略仍可能偏向固定优先级和安全规则。它们能可靠处理眼前事件,却不一定持续积累对手信息,也不会频繁重组整体打法。对于需要长时间运行的复杂任务来说,这种稳定性尤为关键。
实时适应是国产模型最容易打出局部亮点的地方。GLM、DeepSeek、Doubao 在执行速度、局部反应和对战术变化的处理上都有有效信号,尤其是面对明确场景时,它们能较快补出针对性策略。
但问题也在这里:如果只针对某个对手、某个技能或某种打法做特化,短期可能上分,长期会牺牲泛化胜率。国产模型在这一部分更像 " 反应不错,但稳定复盘不足 ":能看见局部变化,也能改出局部补丁,但还不够稳定地判断这个补丁是否会破坏整体策略。
五、技能和工具调用能力
不少 Agent 写出的代码,看起来什么都能做,移动、射击、放技能、躲子弹一项不少。有时这些工具组合在一起,反倒互相打架,输掉对局,体现在代码层就是追星逻辑让坦克往前冲,避弹逻辑又让它后退;技能冷却还没结束,代码已经开始尝试释放。

除 Codex 在工具覆盖和情境映射部分有明显优势外,主榜模型之间策略链路的差距其实没有想象中大。

个人赛冠军(CCS 超参数)即是在另一个层面印证了 Codex 的编排能力。他用 Codex 串起读取回放、分析问题、修改代码、运行测试和决定发布的完整流程,说明它擅长把多个工具和步骤组织成一条连续、可验证的工作链。
这个部分,国产模型体现的差距不在 " 会不会调用工具 ",而在能不能把工具组织成策略链。Doubao、DeepSeek、MiMo 在局部动作组合上能打出一些分数,说明它们知道什么时候移动、攻击、躲避或释放技能;但工具之间的关系常常没有被统一管理,比如资源、冷却、风险、目标优先级各算各的。
GLM 相对更完整,但仍然缺少顶级模型把 " 状态判断—候选动作—评分选择—执行验证 " 串成闭环的稳定性。简单说,国产模型能写动作,但还不够会编排动作。
Agnes 由于自建了 Harness 层,通过清晰保留日志、版本和工具调用记录等,让中途报错等任务也能接着断点继续跑。
结尾:
接下来,我们也会把 AgenTank 继续往更标准化的 Benchmark 方向推进:进一步完善指标口径、扩大样本规模、沉淀可复现的数据集和评测方法,并尝试把这套实时对抗评测写成论文发布出来。我们希望它不只是一次杯赛复盘,而能成为观察 Agent 能力演进的一种长期方法。
如果你也在关注 Agent Benchmark,或者有更多实时对抗、动态协作、长程任务场景的想法,也欢迎一起参与进来。今天的 Agent 评测还远没有定型,静态题库只能回答一部分问题;真正复杂的能力,往往要放进会变化、会反馈、会互相博弈的环境里才能看清楚。我们希望和更多研究者、开发者、参赛者一起,把这件事做得更专业。