来源:环球市场播报
谷歌旗下人工智能研究部门 DeepMind 正准备推出一款编程能力大幅升级的新模型 Gemini 3.8 Flash,内部代号为 "Skimaki"。该模型最早可能于当地时间周三(9 月 2 日)上线。知情员工称,这款模型的编码能力较此前版本有显著提升,公司正试图借此补上今年以来相对 Anthropic、OpenAI 旗舰模型的短板。不过,对外发布窗口尚未由公司正式宣布,行业标准基准分数也尚未公开。
此次发布距离 8 月 13 日 Gemini 3.7 Flash 上线仅三周左右,延续了谷歌首席执行官桑达尔 · 皮查伊在二季度业绩会上所说的 " 每月一版 " 的发布节奏。此前,一家科技媒体援引公开 " 氛围编程 " 排行榜称,Anthropic 的 Claude Fable 与 OpenAI 的 GPT-5.6 Sol 仍排在前十,当时已上市的 Gemini 3.7 Flash 大约排在第 17 位。3.8 Flash 若按内部口径兑现编码提升,瞄准的正是这一段差距。

知情人士透露,在谷歌内部编程工具 Jetski 的一对一试用中,部分工程师表示更愿意使用 Gemini 3.8 Flash,而不是 Anthropic 的旗舰模型 Claude Opus。一名参与试用的员工称,新模型的体验已明显优于 8 月 13 日上线的 3.7 Flash,但同时强调当时下完整结论还为时尚早。谷歌当时未就内部测试置评。
Flash 系列体量更小、推理更便宜、改动所需算力也更少,因此可以同时开辟多条路线试错。相比之下,改动参数规模以万亿计的 Pro 级模型则需要集中调用更多内部资源。8 月下旬,员工已能在 Jetski 上调用名为 "Gemini 3.8 Flash Preview" 的预览版。皮查伊今年 3 月还曾表示,谷歌内部约 75% 的新代码已由 AI 模型生成、再由工程师审核。
Flash 加码编码与强化学习
今年以来,谷歌将更多研究人力和算力投向编码领域,并加码强化学习——即在训练后期用试错方式教模型掌握具体技能。公司近期还聘用了巴雷特 · 佐夫担任研究副总裁,分管强化学习和后训练。佐夫曾在 OpenAI 负责后训练,并参与创办了 Thinking Machines Lab。
知情人士强调,3.7 Flash 与 3.8 Flash 的研发在今年 8 月管理层调整之前已经启动数月。8 月 13 日发布的 3.7 Flash 是目前唯一有公司官方分数的最近一版 " 干活模型 "。谷歌当时给出的数据显示:长周期软件工程测试 DeepSWE v1.1 从 3.6 Flash 的 49.0% 升至 65.3%;面向维护者意图的 FrontierCode 1.1 Main 从 34.4% 升至 43.6%;网页开发对战榜 WebDev Arena Elo 从 1538 升至 1588。定价方面,3.7 Flash 为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,约为 3.6 Flash 原价的一半。3.8 Flash 的对应分数、价目和接口,截至发稿仍未公布。
旗舰 Pro 延期,Gemini 4 仍在后训练
知情人士称,仅凭 3.8 Flash 一次发布,外界不太会将其视为谷歌重新站上所谓 " 前沿 " 的标志。Flash 被设计为更小、更便宜、运行更快的模型系列,算力消耗低于参数规模最大的那批旗舰模型。去年 11 月 Gemini 3.0 发布后,谷歌曾短暂走在模型竞赛前列,随后在旗舰对标上再度落后;代理式编程同期成为生成式人工智能最主要的企业用途。今年夏天,Character.AI 联合创始人诺姆 · 沙泽尔与首席科学家杰夫 · 迪恩等高知名研究人员先后离开谷歌。
更强一档的 "Pro" 系列已落后原计划数月。皮查伊 5 月曾表示新模型 " 下个月 " 就会推出,但内部用于 3.5 Pro 的候选模型后来被废弃,理由是相对 Flash 系列提升不够显著。下一代旗舰模型 Gemini 4 在预训练评估中表现良好,但后训练尚未完成。后训练是将预训练模型调整到可对外使用、并补上工具调用与安全约束的关键阶段。
管理层调整与并行研发
8 月,DeepMind 联合创始人德米斯 · 哈萨比斯卸下日常管理职责,转任部门主席及 Alphabet 首席科学家。长期担任其副手的科拉伊 · 卡武克朱奥卢升任 DeepMind 高级副总裁,全面接手日常运营。卡武克朱奥卢已向员工强调,他希望加快执行速度。知情员工称,他至少从去年起就已主持 Gemini 的日常研发,哈萨比斯则更多时间放在对外事务上。实验室内部同时推进多条模型线,一条线进度落后,并不自动决定其他在研模型的结果。