
编译 | 王涵
编辑 | 心缘
智东西 9 月 3 日消息,昨晚,谷歌发布其迄今为止最强的推理与编程模型Gemini 3.8。在保持低成本的同时,Gemini 3.8 在定量及专业领域以及端到端自主解决复杂工程问题方面,有了进一步提升。
谷歌 DeepMind 研究员姚顺宇说:"(这次模型发布)对模型来说是一小步,对 RSI(递归自我改进)来说却是一大步。"

Gemini 3.8 Flash:主力模型,上下文窗口为100 万个 token,在软件工程、智能体任务以及专业领域中的关键多步推理等方面,相较 3.7 Flash 均有明显提升。
Gemini 3.8 Flash Cyber:网络安全模型,在漏洞检测和自动修补方面达到前沿水平,将通过全新的 Fairwind 计划向受信任的防御者开放。
两个模型共享同一套基础智能,由长时运行的 Agentic loop进一步加速。这类 loop 用于递归评估和优化底层模型,使该共享核心的编程、推理能力获得显著提升。
基准测试方面,Gemini 3.8 Flash 在 14 项测试中有8 项成绩排名第一,超过了 Claude Opus 5 和 GPT-5.6 Sol,分别是金融分析测试 Vals Finance Agent v2、法律工作流测试 Harvey Legal、终端代码测试 Terminal-bench 2.1、复杂图表推理 CharXiv、长视频理解 LVBench 以及跨学科专家难题 HLE-Verified、生物学真实科研任务 LABBench2。
在 Artificial Analysis 智能指数上,Gemini 3.8 Flash 取得59 分,与 GPT-5.6 Sol 和 Grok 4.6 的非最高推理配置持平。
在推理成本上,Gemini 3.8 Flash(high)每个智能指数任务成本为0.58 美元,是在同等级智能水平下成为最便宜的模型。中等推理模式下,Gemini 3.8 Flash 的每任务成本降至0.41 美元,低推理模式下降至0.24 美元。

对比来看,Claude Opus 5 定价为输入每百万 Token 5 美元、输出每百万 Token 25 美元,是 Gemini 3.8 Flash 标准定价的3倍多。
GPT-5.6 Sol 定价为输入每百万 Token 5 美元、输出每百万 Token 30 美元,是 Gemini 3.8 Flash 标准定价的3 到 4 倍;Terra 定价为输入 2.5 美元、输出 15 美元,约为 Gemini 3.8 Flash 标准定价的2 倍;Luna 定价为输入 1 美元、输出 6 美元,则更为便宜。

有开发者对比了 Gemini 3.8 Flash 和 Claude Opus 5。对于同一个海浪模拟器任务,Opus 5 耗时 24 分钟,3.8 Flash 仅用了 37 秒,但 Opus 5 的成果细节处理较完善。
该开发者对此很乐观,说:" 如果给 Gemini 和 Opus 5 相同的时间,Gemini 在质量上也会把 Opus 彻底碾压。"

Lumina 评价称:"Gemini 3.8 Flash 比 Gemini 3.8 Flash 明显清爽利落得多,说实话也是这里面生成质量最好的之一。谷歌这次升级确实不错。"



在 Artificial Analysis 智能指数排行上,Muse Spark 1.3 超越了 Gemini 3.8 Flash(high),仅次于 Claude Fable 5.1 和 Claude Opus 5。
Meta 首席 AI 官、超级智能实验室创始人 Alexandr Wang(汪涛)转发了该推文,还明呛谷歌:"gemini 是谁?"

Gemini 3.8 Flash 能在 8 项基准测试中超过Claude Opus 5 和 GPT-5.6 Sol,表现着实亮眼,那Gemini 3.8 Flash 在实际应用中表现如何呢?
在博客中,谷歌团队放出了几个 Gemini 3.8 Flash 的实测案例:
Gemini 3.8 Flash 仅凭一个简单的提示词,配合 Google Antigravity 中的循环指令,就构建出了这款游戏。该游戏融合了谜题、环境叙事,并利用 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡,玩家将扮演一位巫师在城堡中探索穿行。
Gemini 3.8 Flash 还可以仅凭单个提示词,就构建出了一个功能完整的 DOS 版谷歌地图,完全可交互,支持地点查询、路线规划和街景浏览。



中国 AI 博主 Chasen 实测了 " 鹈鹕踩单车 ",感叹称:" 这输出速度简直了,其实 10s 就把整体代码写完了,后面的是验证和再输出一次。"
可以看到,Gemini 3.8 Flash 生成的内容在整体画面色彩上比较协调,体现出来了单车在向前行驶。但美中不足的是鹈鹕的脚并没有踩在单车踏板上,自行车框架与车轮也错位了。
还有开发者用 Gemini 3.8 Flash 生成了纯 Three.js 的 DeBerti Design 2019 款福特 F-250 "Transformer" 工作卡车,3D 汽车模型各组件齐全,还可以进行交互。
目前,Gemini 3.8 Flash 可以通过 Google AI Studio、Android Studio 或 Gemini API 直接调用,开发者也可以在 Google Antigravity 和 Stitch 里体验智能体工作流。
企业用户在 Gemini Enterprise 中使用 Gemini 3.8 Flash。订阅了 AI Pro 或 Ultra 的普通消费者可以在 Gemini 应用、谷歌搜索的 AI Mode 以及谷歌表格里体验该模型。
二、编程、金融、法律、多步推理全领先,每任务成本仅 0.58 美元
回过头来,我们再来看看 Gemini 3.8 Flash 在基准测试上的具体表现。
在长周期软件工程基准测试 DeepSWE v1.1 上,Gemini 3.8 Flash 在端到端自主解决复杂工程问题方面的表现超过了大多数更大的前沿模型,而成本却比其他模型降低许多。





与 Gemini 3.8 Flash 一同发布的,还有专注于安全领域的 Gemini 3.8 Flash Cybe。
Gemini 3.8 Flash Cyber 在用于漏洞发现的标准行业基准 CyberGym 上,超越了 GPT-5.6 Sol、Mythos 5 和 GPT-5.5-Cyber。


在外部补丁能力测试 CWE-Bench 上,Gemini 3.8 Flash Cyber 的pass@1 达 47.2%,而领先的前沿模型为 47.8%,但前者的成本却显著更低。Gemini 3.8 Flash Cyber 也已经处于帕累托前沿了。
在实际应用中,谷歌团队已率先将 Gemini 3.8 Flash Cyber 应用于谷歌内部代码的安全防护。
Chrome 安全团队发现,Gemini 3.8 Flash Cyber 为 Chrome 漏洞生成正确补丁的数量,是那些规模更大的顶尖商业模型的2.6 倍。
Wiz 公司在其内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber 的召回率比其他前沿模型高出 7.5~9.7 个百分点,而成本仅为后者的2.3~5.2 分之一。
谷歌云漏洞研究团队则利用 Gemini 3.8 Flash Cyber 模型,在不到 2 小时内就发现了一个关键的基础性漏洞,而这类漏洞的常规研究和发现通常需要耗费数月之久。
目前,网络安全领域的受信任机构(政府、关键基础设施等)需要通过 Fairwind 计划单独申请访问 Gemini 3.8 Flash Cyber。
结语:六周连发三版 Flash,谷歌或押注递归自我改进
谷歌在六周内迎来了第三次 Flash 版本更新,其迭代速度之快令人瞩目。
然而,在技术快速迭代的背后,用户对旗舰级 Pro 版本的期待依然强烈。与此同时,Meta 也在同日发布了 Muse Spark 1.3,可以看出 AI 模型赛道的竞争之激烈。
对于谷歌而言,如何平衡发布节奏、满足不同用户群体的需求,并在激烈的市场竞争中持续保持技术领先,仍是值得长期关注的课题。
值得注意的是,谷歌 DeepMind 研究员姚顺宇的评价或许暗示了谷歌真正押注的方向,可能并非某一款具体模型,而是让模型能够自我迭代、自我进化的底层能力。