关于ZAKER Skills 合作
钛媒体 36分钟前

Gemini 3.8 Flash 上线:性能接近 Opus 5,价格不变但任务更贵

文 | 字母 AI

Gemini 3.8 Flash,来得比想象中还快。

8 月 13 日,Gemini 3.7 Flash 刚刚上线;9 月 2 日,Gemini 3.8 Flash 已经接棒。过去 6 周,Google 已经连续更新了三次 Flash。

就在前一天,Anthropic 刚发布了 " 全球最先进的 "Fable 5.1 和 Mythos 5.1;OpenAI 也已经开始为下一代模型 Astra 预热,官方称其将 " 很快 " 上线。新一轮前沿模型大战正在开打,谷歌要是再不拿出点 " 大牌 ",留给 Gemini 3 的型号已经不多了。

只看 Benchmark,Gemini 3.8 Flash 在部分任务上已接近 Opus 5。

在长程软件工程测试 DeepSWE v1.1 中,Gemini 3.8 Flash 拿到 73.7%,距离 Opus 5 的 74.0% 只差 0.3 个百分点;Terminal-Bench 2.1 上,它甚至以 89.4% 超过了 Opus 5 的 89.1%。

谷歌并没有顺手给它涨价。Gemini 3.8 Flash 的 API 输入价格仍然是 0.75 美元 / 百万 Token,输出 3.75 美元 / 百万 Token,和上一代 3.7 Flash 完全一样。

但这一次,便宜并不像看上去那么简单。

谷歌自己也提醒,3.8 Flash 会比上一代 "work harder" ——它会进行更多推理、调用更多工具,也消耗更多 Token。Artificial Analysis 的首轮测试里,3.8 Flash 的单任务成本反而比 3.7 Flash 上涨了约 40%。

也就是说,虽然 Token 没涨价,但完成一件事变得更贵了。

谷歌啊,在性能上向顶级模型学习就够了,不要连这种事情也学 Anthropic 啊……

Flash 碰上了旗舰模型

从谷歌公布的 Benchmark 来看,Gemini 3.8 Flash 这次最明显的提升仍然集中在 Coding 和 Agent 能力。

和 3.7 Flash 相比,它在长程软件工程测试 DeepSWE v1.1 上的成绩从 65.3% 提高到 73.7%,一下涨了 8.4 个百分点,距离 Opus 5 的 74.0% 只差 0.3 个百分点。

Terminal-Bench 2.1 也是类似的情况,在这个命令行 Agent 实战测试里,3.7 Flash 此前已经拿到 85.8%,而 3.8 Flash 进一步提高到 89.4%,略微超过 Opus 5 的 89.1%。

另外,面向金融分析任务的 Vals Finance Agent v2 中,3.8 Flash 拿到 61.4%,高于 Opus 5 的 58.6%;Harvey 的法律 Agent 测试中,3.8 Flash 为 10.0%,Opus 5 为 6.7%;衡量多学科专家级推理能力的 HLE-Verified 上,两者则分别为 54.9% 和 54.4%。

谷歌因此把 3.8 Flash 定位成目前 " 最智能的 Flash 主力模型 ",重点面向长程软件工程、自治 Agent 和复杂企业工作流。

至少在一部分 Coding 和 Agent 任务里,Gemini 3.8 Flash 已经跑到了 Opus 5 身边。

不过,暂时还没能实现完全赶超。

在更难、更强调通用 Agent 能力的 Terminal-Bench 4.0 上,3.8 Flash 只有 19.1%,而 Opus 5 达到了 51.8%;GDPVal-AA v2 知识工作测试中,3.8 Flash 为 1545 Elo,Opus 5 则达到 1824;测试电脑操作能力的 OSWorld 2.0 上,两者分别为 59.0% 和 75.4%。

独立评测给出的结果也更接近这种判断:Artificial Analysis 跑完了 Gemini 3.8 Flash 的 low、medium 和 high 三档推理强度,其中 high 档在 Artificial Analysis Intelligence Index 上拿到 59 分,而 Opus 5 max 目前是 63 分。

顺便一提,昨天刚发布的 Fable 5.1 max 已经达到了 66 分,当前榜单前七个席位都被 Anthropic 模型的不同推理档位占据。

所以,准确地说,Gemini 3.8 Flash 只能算是一款开始在部分旗舰任务上越级竞争的 Flash 模型。

速度上,它保持了 "Flash" 的优势。在 Artificial Analysis 通过 Google API 进行的测试中,3.8 Flash high 的输出速度达到 304.6 Token/ 秒,在其比较组 195 个模型中排名第一。

核心产品规格方面,3.8 Flash 和上一代完全一样。它依然拥有约 100 万 Token 上下文窗口和 65,536 Token 最大输出,支持的主要工具能力也保持不变。谷歌的模型卡直接说明,3.8 Flash 建立在 3.7 Flash 之上,是一次继续迭代,而非底层模型换代。

和 Gemini 3.8 Flash 一起升级的,还有 Gemini 3.8 Flash Cyber。

新的 3.8 Flash Cyber 在 CyberGym 漏洞发现测试中超过上一代 3.5 Flash Cyber;在谷歌覆盖 20 种编程语言的内部真实漏洞测试中,成功率超过 70%;在 CWE-Bench 自动漏洞修补测试中则达到了 47.2%,超过 GPT 5.6 Sol。

在 " 安全模型 " 上,谷歌和 Anthropic 的做法不太一样。Fable 5.1 和 Mythos 5.1 本质上是同一个底层模型,只是通过不同的网络安全和生物安全限制区分开放范围;谷歌则从 3.5 Flash 开始单独做了一条 Cyber 支线,在 Flash 基础上针对漏洞发现、验证和修补进行专项微调,同时为 Cyber 版本采用更宽松的网络安全限制。

有意思的是,这种专项训练开始反过来影响主模型。

谷歌称,3.8 Flash 和 3.8 Flash Cyber 共享同一个基础智能核心,而这一代在 Coding 和 Reasoning 上的提升,部分就来自网络安全这一高难度领域的训练。

模型价格正在从 Token 价格转向任务成本

如果只看 API 价目表,Gemini 3.8 Flash 几乎是一次免费的性能升级。

它的输入价格依然是 0.75 美元 / 百万 Token,输出 3.75 美元 / 百万 Token,缓存读取 0.075 美元 / 百万 Token,和 3.7 Flash 完全一样。性能涨了,Token 单价一分钱没涨。

但真正跑起来,账单可不是这么算的。

Artificial Analysis 的测试中,Gemini 3.8 Flash high 完成一个 Intelligence Index 任务的平均成本达到 0.58 美元,而上一代 3.7 Flash 只有约 0.40 美元。

也就是说,同样的 Token 价格,单任务成本上涨了四成。

原因很简单:3.8 Flash 变得更能 " 想 " 了,也更能花 Token 了。

Artificial Analysis 发现,3.8 Flash high 每个任务平均生成约 4.8 万个输出 Token,比 3.7 Flash 增加了 30%;在 Agent 测试中,它还会进行更多次交互。最终,虽然 Token 没有变贵,但为了完成同一套测试,需要购买的 Token 更多了。

值得注意的是,这并不是谷歌一家碰到的问题,Anthropic 刚用 Fable 5.1 展示了一个更极端的案例。

Fable 5.1 这次没有调整普通输入和输出价格,依然是 10 美元和 50 美元 / 百万 Token,但 Anthropic 把缓存读取价格从 1 美元直接降到了 0.25 美元,降幅达到 75%。

对于 Agent 来说,这是一次相当实在的降价。因为 Agent 在长时间工作时需要不断读取此前已经进入上下文的代码、文档和历史对话,缓存读取往往会占据大量输入 Token。Anthropic 估算,仅这一项调整,就可以让典型工作负载成本降低约 25%,高度 Agent 化的任务最高降低约 45%。

结果 Artificial Analysis 一跑,事情又被翻了个面。

Fable 5.1 max 虽然以 66 分登顶了 Artificial Analysis 智能指数,但它完成一次 Intelligence Index 任务平均要花 3.76 美元,上一代 Fable 5 max 只有 3.14 美元。

缓存读取便宜了 75%,Fable 5.1 的单任务成本反而贵了 20%。

问题还是出在 Token 消耗,但 Fable 5.1 不是 " 太能想 ",是 " 特能唠 "。

Artificial Analysis 发现,Fable 5.1 max 生成的输出 Token 大约是 Fable 5 的 1.7 倍。缓存降价已经为每个任务省下约 1.40 美元,如果没有这次 75% 的缓存折扣,它的单任务成本甚至会达到约 5.16 美元。

于是就出现了一个很反常的结果:谷歌没有涨 Token 价格,Anthropic 甚至大幅降低了缓存价格,但模型做任务就是变贵了。

现在的前沿模型正在越来越多地用计算量换成功率:更长的思考、更多的输出、更频繁的工具调用、更长的 Agent 执行链,都可以把 Benchmark 再往上推一点,但这些动作最后都会进入账单。

过去比较模型价格,一张 API 价格表基本就够了,0.75 美元还是 10 美元 / 百万 Token,是一个非常直观的数字。但到了 Agent 时代,这个指标正在变得不那么可靠。

毕竟,Token 只是模型公司的计价单位——任务才是用户真正付钱购买的东西。

某种意义上,模型的价格竞争正在从 " 一个 Token 多少钱 ",慢慢变成 " 把一件事做完多少钱 "。

但也并不是模型用了更多 Token 就一定不好,关键还是要看性价比,看多花掉的这些 Token,换来的任务成功率有多少。

Gemini 3.8 Flash 其实也说明了这种变化的另一面:虽然 high 档单任务成本涨到 0.58 美元,但它以 59 分的智能指数,仍然处在 Artificial Analysis 的 Intelligence vs. Cost per Task 帕累托前沿,被评为目前达到这一智能水平最便宜的模型。

谷歌在用做软件的节奏做模型

谷歌更新 Flash 模型的速度,实在有些太快。

7 月 21 日,谷歌发布 Gemini 3.6 Flash;23 天后的 8 月 13 日,3.7 Flash 上线;又过了 20 天,3.8 Flash 已经接棒。

43 天,三个版本。

有网友调侃:AI Benchmark 现在的保质期,已经和超市里的三明治差不多了。

虽然比喻有点抽象,但道理是这个道理。模型迭代快到这个程度,今天刚刷新的榜单,可能几周后就会失去参考价值。

而谷歌之所以能更新得这么频繁,一个重要原因是,这几次并不是传统意义上的模型换代。

3.7 Flash 建立在 3.6 Flash 之上,主要是在原有基础上继续做算法和能力优化;到了 3.8,谷歌直接明牌,3.8 Flash 就是基于 3.7 Flash 继续迭代。这一次谷歌甚至连架构、训练数据、软硬件等信息都直接让开发者参考上一代模型卡。

也就是说,谷歌一直在同一条 Flash 主线上不断打补丁、加能力、调推理,再把新版本推给用户。

以前,一个新的大模型版本往往意味着一次明显的代际跃迁:GPT-4 到 GPT-5,Gemini 2 到 Gemini 3。模型公司训练一个新的底座,再围绕它发布一整套产品。

但现在,大模型越来越像软件了。

模型上线之后,开发者开始使用,真实任务暴露问题;模型公司再根据反馈调整算法、后训练和推理策略,强化 Coding、Agent 或者某些专项能力,然后几周后直接推一个新版本。

前面提到的 Cyber,也是这种迭代方式的一部分。

最早的 3.5 Flash Cyber 先在网络安全这个高难度领域进行专项训练,强化漏洞发现、验证和修补;到了 3.8,一部分在 Cyber 训练中获得的 Coding 和 Reasoning 能力,又被带回通用 Flash 模型。

专项模型不再只是从通用模型上分出去的一条支线,也可以反过来成为下一版通用模型的训练场。

于是,大模型的版本迭代开始形成一种越来越接近软件开发的循环:

模型上线、真实使用、收集反馈、专项强化,然后发布下一版。

某种意义上,谷歌的模型发布正在从 " 换代 ",变成 " 更新 "。

对一家靠搜索、浏览器、云服务和广告系统长大的公司来说,谷歌最熟悉的就是让产品长期运行在真实用户面前,在真实流量里不断测试、更新和优化。

现在,谷歌正在尝试把这种工程方式搬到模型上。

甚至就连最近 Google DeepMind 的人事调整,也能和这条路线联系起来。8 月 5 日,Koray Kavukcuoglu 升任 Google DeepMind 高级副总裁。过去一年多,他实际上已经负责 Gemini 模型开发;这次调整则进一步把前沿 AI 研究、Gemini App 和开发者团队也纳入了他的职责范围。

模型、开发者反馈和产品,被放进了一条更短的组织链路里。

理想的情况下,模型不再需要等研究团队完成一次 " 大版本 ",再经过漫长的产品化过程才交到用户手里;研究、模型、开发者和产品之间的反馈,可以直接推动下一次迭代。

对 Gemini Flash 来说,3.6、3.7、3.8 或许已经不太能看作一次次独立的新品发布,更像同一个产品不断滚动的版本号。

由于更新得太过频繁(且一直拿不出 Pro 和 Gemini 4),甚至被网友评论:要不然直接把模型名也改成 Flash 吧。

最后,虽然模型更新了,性能也确实有所提升,但 Flash 3.8 这个发布时间,多少还是带点不利。

网友的吐槽非常直接:所以你们偏偏选择在 Fable 5.1 和 Astra 之间发布?到底用了什么小丑逻辑做出这个决定?

怎么说呢,Flash 跑得很快,抢头条这件事未必。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容