关于ZAKER Skills 合作
智东西 昨天

“美国豆包”又又又更了,15% 价格叫板 Opus 5,姚顺宇高度评价

智东西

编译 | 王涵

编辑 | 心缘

智东西 9 月 3 日消息,昨晚,谷歌发布其迄今为止最强的推理与编程模型Gemini 3.8在保持低成本的同时,Gemini 3.8 在定量及专业领域以及端到端自主解决复杂工程问题方面,有了进一步提升。

谷歌 DeepMind 研究员姚顺宇说:"(这次模型发布)对模型来说是一小步,对 RSI(递归自我改进)来说却是一大步。"

新推出的 Gemini 3.8 包含两款模型:

Gemini 3.8 Flash:主力模型,上下文窗口为100 万个 token,在软件工程、智能体任务以及专业领域中的关键多步推理等方面,相较 3.7 Flash 均有明显提升。

Gemini 3.8 Flash Cyber:网络安全模型,在漏洞检测和自动修补方面达到前沿水平,将通过全新的 Fairwind 计划向受信任的防御者开放。

两个模型共享同一套基础智能,由长时运行的 Agentic loop进一步加速。这类 loop 用于递归评估和优化底层模型,使该共享核心的编程、推理能力获得显著提升。

基准测试方面,Gemini 3.8 Flash 在 14 项测试中有8 项成绩排名第一超过了 Claude Opus 5 和 GPT-5.6 Sol,分别是金融分析测试 Vals Finance Agent v2、法律工作流测试 Harvey Legal、终端代码测试 Terminal-bench 2.1、复杂图表推理 CharXiv、长视频理解 LVBench 以及跨学科专家难题 HLE-Verified、生物学真实科研任务 LABBench2。

在 Artificial Analysis 智能指数上,Gemini 3.8 Flash 取得59 分与 GPT-5.6 Sol 和 Grok 4.6 的非最高推理配置持平

在推理成本上,Gemini 3.8 Flash(high)每个智能指数任务成本为0.58 美元,是在同等级智能水平下成为最便宜的模型。中等推理模式下,Gemini 3.8 Flash 的每任务成本降至0.41 美元,低推理模式下降至0.24 美元

价格方面,Gemini 3.8 Flash 目前采用优惠定价,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,其标准定价为每 100 万输入 token 1.5 美元、每 100 万输出 token 7.5 美元

对比来看,Claude Opus 5 定价为输入每百万 Token 5 美元、输出每百万 Token 25 美元,是 Gemini 3.8 Flash 标准定价的3倍多。

GPT-5.6 Sol 定价为输入每百万 Token 5 美元、输出每百万 Token 30 美元,是 Gemini 3.8 Flash 标准定价的3 到 4 倍;Terra 定价为输入 2.5 美元、输出 15 美元,约为 Gemini 3.8 Flash 标准定价的2 倍;Luna 定价为输入 1 美元、输出 6 美元,则更为便宜。

在外网,已经有不少开发者体验了 Gemini 3.8 Flash。

有开发者对比了 Gemini 3.8 Flash 和 Claude Opus 5。对于同一个海浪模拟器任务,Opus 5 耗时 24 分钟,3.8 Flash 仅用了 37 秒,但 Opus 5 的成果细节处理较完善。

该开发者对此很乐观,说:" 如果给 Gemini 和 Opus 5 相同的时间,Gemini 在质量上也会把 Opus 彻底碾压。"

外网 AI 模型测评博主 Lumina 对比了 Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-5.6 Sol 和 Grok 4.6,全部开到最高配置,用同一套提示词生成罗马斗兽场,结果如下:

Lumina 评价称:"Gemini 3.8 Flash 比 Gemini 3.8 Flash 明显清爽利落得多,说实话也是这里面生成质量最好的之一。谷歌这次升级确实不错。"

在官宣推文的评论区中,多数用户留言期待 Pro 版本模型发布。

与谷歌前后脚,Meta 在今日凌晨发布了Muse Spark 1.3

在 Artificial Analysis 智能指数排行上,Muse Spark 1.3 超越了 Gemini 3.8 Flash(high),仅次于 Claude Fable 5.1 和 Claude Opus 5。

Meta 首席 AI 官、超级智能实验室创始人 Alexandr Wang(汪涛)转发了该推文,还明呛谷歌:"gemini 是谁?"

一、一句话生成可交互 DOS 版谷歌地图,但鹈鹕脚踩不到单车上

Gemini 3.8 Flash 能在 8 项基准测试中超过Claude Opus 5 和 GPT-5.6 Sol,表现着实亮眼,那Gemini 3.8 Flash 在实际应用中表现如何呢?

在博客中,谷歌团队放出了几个 Gemini 3.8 Flash 的实测案例:

Gemini 3.8 Flash 仅凭一个简单的提示词,配合 Google Antigravity 中的循环指令,就构建出了这款游戏。该游戏融合了谜题、环境叙事,并利用 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡,玩家将扮演一位巫师在城堡中探索穿行。

Gemini 3.8 Flash 还可以仅凭单个提示词,就构建出了一个功能完整的 DOS 版谷歌地图,完全可交互,支持地点查询、路线规划和街景浏览

用户可以使用美国地质调查局的真实数据集,用 Gemini 3.8 Flash 构建地形图,并可在其中探索实时横截面、2D 投影以及科学解释

Hardware Anatomy 是一个由 Gemini 3.8 Flash 构建的交互式 3D 可视化工具,能够生成符合物理尺寸比例的硬件设备拆解图,并基于 Three.js 实现逼真渲染。它可以自动将设备分解为多个层级,用户可通过拆解滑块进行展开和查看。

在 X 上,有很多开发者发出了自己用 Gemini 3.8 Flash 做出的成果。

中国 AI 博主 Chasen 实测了 " 鹈鹕踩单车 ",感叹称:" 这输出速度简直了,其实 10s 就把整体代码写完了,后面的是验证和再输出一次。"

可以看到,Gemini 3.8 Flash 生成的内容在整体画面色彩上比较协调,体现出来了单车在向前行驶。但美中不足的是鹈鹕的脚并没有踩在单车踏板上,自行车框架与车轮也错位了。

还有开发者用 Gemini 3.8 Flash 生成了纯 Three.js 的 DeBerti Design 2019 款福特 F-250 "Transformer" 工作卡车,3D 汽车模型各组件齐全,还可以进行交互。

目前,Gemini 3.8 Flash 可以通过 Google AI Studio、Android Studio 或 Gemini API 直接调用,开发者也可以在 Google Antigravity 和 Stitch 里体验智能体工作流。

企业用户在 Gemini Enterprise 中使用 Gemini 3.8 Flash。订阅了 AI Pro 或 Ultra 的普通消费者可以在 Gemini 应用、谷歌搜索的 AI Mode 以及谷歌表格里体验该模型。

二、编程、金融、法律、多步推理全领先,每任务成本仅 0.58 美元

回过头来,我们再来看看 Gemini 3.8 Flash 在基准测试上的具体表现。

在长周期软件工程基准测试 DeepSWE v1.1 上,Gemini 3.8 Flash 在端到端自主解决复杂工程问题方面的表现超过了大多数更大的前沿模型,而成本却比其他模型降低许多。

此外,在专业知识领域。Gemini 3.8 Flash 在需要高级分析和报告能力的定量及专业领域,如 Vals Finance Agent V2 和 Harvey 法律智能体基准中,Gemini 3.8 Flash 的表现均优于 Gemini 3.7 Flash 和其他前沿模型。

Gemini 3.8 Flash 在人类最终测试 HLE-Verified 基准上还取得了54.9%的成绩,证明了其在 STEM、人文学科和专业领域中进行多步推理的能力。

在任务完成速度上,在高推理模式下,Gemini 3.8 Flash 的平均输出速度约为每秒 300 个 token,每任务耗时2.5 分钟,略优于 GPT-5.6 Luna 和 GPT-5.6 Terra。在低推理模式下,Gemini3.8 Flash 的任务耗时缩短至0.8 分钟,在 " 智能水平 vs. 每任务耗时 " 的权衡中达到了帕累托前沿

四、漏洞发现能力超 GPT-5.6 Sol,2 小时挖出人工数月发现的漏洞

与 Gemini 3.8 Flash 一同发布的,还有专注于安全领域的 Gemini 3.8 Flash Cybe。

Gemini 3.8 Flash Cyber 在用于漏洞发现的标准行业基准 CyberGym 上,超越了 GPT-5.6 Sol、Mythos 5 和 GPT-5.5-Cyber

此外,谷歌团队还在一个更加全面的内部基准上评估了 Gemini 3.8 Flash Cyber,该基准要求模型在涵盖 20 种编程语言的复杂代码库中发现各种漏洞。在这一评估中,该模型的成功率超过 70%,相较谷歌前代模型能力大幅提升。

谷歌团队分享称,在开发 Gemini 3.8 Flash Cyber 时,他们重点致力于为防御者赋予专家级能力,使其在面对攻击者时占据主动。正因如此,谷歌团队从一开始便将漏洞修复作为模型的投入重心,并优先于漏洞利用等攻击性能力。

在外部补丁能力测试 CWE-Bench 上,Gemini 3.8 Flash Cyber 的pass@1 达 47.2%,而领先的前沿模型为 47.8%,但前者的成本却显著更低。Gemini 3.8 Flash Cyber 也已经处于帕累托前沿了。

在实际应用中,谷歌团队已率先将 Gemini 3.8 Flash Cyber 应用于谷歌内部代码的安全防护。

Chrome 安全团队发现,Gemini 3.8 Flash Cyber 为 Chrome 漏洞生成正确补丁的数量,是那些规模更大的顶尖商业模型的2.6 倍

Wiz 公司在其内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber 的召回率比其他前沿模型高出 7.5~9.7 个百分点,而成本仅为后者的2.3~5.2 分之一

谷歌云漏洞研究团队则利用 Gemini 3.8 Flash Cyber 模型,在不到 2 小时内就发现了一个关键的基础性漏洞,而这类漏洞的常规研究和发现通常需要耗费数月之久。

目前,网络安全领域的受信任机构(政府、关键基础设施等)需要通过 Fairwind 计划单独申请访问 Gemini 3.8 Flash Cyber。

结语:六周连发三版 Flash,谷歌或押注递归自我改进

谷歌在六周内迎来了第三次 Flash 版本更新,其迭代速度之快令人瞩目。

然而,在技术快速迭代的背后,用户对旗舰级 Pro 版本的期待依然强烈。与此同时,Meta 也在同日发布了 Muse Spark 1.3,可以看出 AI 模型赛道的竞争之激烈。

对于谷歌而言,如何平衡发布节奏、满足不同用户群体的需求,并在激烈的市场竞争中持续保持技术领先,仍是值得长期关注的课题。

值得注意的是,谷歌 DeepMind 研究员姚顺宇的评价或许暗示了谷歌真正押注的方向,可能并非某一款具体模型,而是让模型能够自我迭代、自我进化的底层能力。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容