关于ZAKER Skills GEO服务 合作

海外开源模型重新提速:Mistral、“美版 DeepSeek ”同时亮牌

整理 | 褚杏娟

西方开放模型阵营开始提速。

当地时间 10 月 5 日,被称作 " 美版 DeepSeek" 的美国创业公司 Reflection 发布首款开放权重模型 Beam;一天之后,法国 Mistral 推出迄今最大的 Mistral Large 4。两家公司发布模型时选择的主要比较对象高度一致:GLM、Kimi、DeepSeek、Qwen。

Hugging Face 数据显示,过去一年,中国模型已经占到平台模型下载量的约 41%,月度下载量和累计下载量均超过美国。DeepSeek、阿里 Qwen、月之暗面 Kimi、智谱 GLM、MiniMax、小米 MiMo 等模型轮番刷新开放模型能力上限,中国开放模型成为全球开源开发者的追赶对象。

另一方面,开放模型已经不再只是研究者和极客使用的 " 小众替代品 ":Vercel AI Gateway 的生产流量数据显示,今年 8 月开放权重模型已经处理了其平台 56% 的 Token,而去年 12 月这个比例还不到 10%。因此,全球开放模型竞赛是必然的。

美欧开放模型同期亮相

" 美版 DeepSeek" 第一次交卷:还有差距

被寄予厚望的 Reflection 成立于 2024 年,两名创始人都来自 Google DeepMind:CEO Misha Laskin 曾负责 Gemini 的奖励建模,CTO Ioannis Antonoglou 则参与过 AlphaGo、AlphaZero,后来领导 Gemini 的人类反馈强化学习(RLHF)工作。

不过,Reflection 一开始并不是冲着 " 美版 DeepSeek" 去的。公司最初聚焦自主编程,希望用强化学习打造能够自主完成复杂工作的 " 超级智能系统 ",同时原本判断西方会不断出现足够强的开放模型,Reflection 可以直接建立在这些模型之上。

真正改变公司路线的是 DeepSeek V3。按照 Reflection 创始人的说法,在中国开放模型快速推进、而西方迟迟没有出现同等级别替代品之后,公司决定自己训练前沿开放模型,并逐渐将目标明确为 " 把开放模型前沿重新带回西方 "。

两年后,Beam 算是 Reflection 第一次真正交卷。

Beam 是一个 MoE 模型,总参数量 5010 亿,每个 Token 激活 230 亿参数,主要面向编程、推理和 Agent 工作负载。模型使用 23.8 万亿 Token 进行预训练,Reflection 又动用了 1.05 万张 Nvidia GB300,连续进行 4 周高算力强化学习,生成超过 1 亿次 rollout。模型目前仍处于最终红队测试阶段,Reflection 计划在 10 月份公开模型权重、技术报告和开发工具。

从 Reflection 自己公布的测试结果来看,Beam 最大的亮点并不是绝对能力,而是推理效率。公司称,在部分高级推理任务上,它能够以 GLM-5.2 约四分之一到三分之一的推理算力实现接近的表现。

但如果和中国最新一代模型横向比较,Beam 距离真正 " 追平 " 还有明显差距。

例如,在 Agent 编程测试 DeepSWE v1.1 中,Beam 得分为 44.4,几乎与 GLM-5.2 的 44.0 持平,但低于 GLM-5.3 的 61.0、Kimi K3 的 68.0,以及 DeepSeek V4.1 Flash 的 74.2;Terminal Bench v2.1 上,Beam 得分 80.1,而 GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash 分别达到 88.2、88.3 和 90.6。在 Humanity's Last Exam(HLE)上,Beam 得分 36.2,也低于 GLM-5.3 的 42.3 和 Kimi K3 的 46.9。

因此,目前 Beam 把美国开放模型重新拉回了中国头部模型附近,但追上的主要还是前一代 GLM-5.2,与中国最新一轮开放模型还有一代左右的差距。

Reflection 自己对此也没有避讳。官方直接承认 Kimi K3 在绝对能力上仍然领先,并把 Beam 的卖点转向 " 单位推理算力能够换来多少智能 "。CEO Misha Laskin 将 Beam 定位成企业可长期运行的 " 主力模型 ",而不是单纯冲榜的最大模型。

这也很像 DeepSeek 最初打动市场的部分逻辑:价值不在于模型是不是第一,而是达到某个能力需要付出多少钱。区别在于,Reflection 很难称得上一个 " 低成本版 DeepSeek"。

Beam 单是最后一轮强化学习,就同时占用了超过 1 万张最新 GB300;公司已经融资数十亿美元,并从 Nvidia 获得大额投资,又通过 SpaceX、Nebius 等合作锁定大量算力。它是一个拥有美国资本和 Nvidia 最新硬件加持的 " 重资产版 DeepSeek"。

Ioannis 表示,公司未来几年的目标是让 " 开放前沿 " 和 " 封闭前沿 " 最终变成同一个前沿。2027 年,Reflection 计划发布规模更大的模型,同时继续扩大强化学习算力,并像 GLM 等模型一样,在基础模型之上连续推出多个强化学习增强版本。

Misha 则认为,这条路线背后其实是一个更大的判断:强化学习已经从过去 AlphaGo、AlphaZero 中的特定领域技术,变成了可以持续推动通用模型、编程模型和 Agent 模型进步的基础方法。

在他看来,目前这些模型 " 要么已经是某种形式的 AGI,要么至少已经非常清晰地处在通往 AGI 的连续路径上 "。接下来的核心问题已经不只是如何把模型继续做强,而是如何把这种能力工程化、产品化,并通过一个多极化、开放程度更高的生态扩散出去。

Mistral 重新冲刺头部开放模型

相比刚刚推出第一款基础模型的 Reflection,欧洲模型厂商 Mistral 面临的压力其实更大。

两三年前,它一度是开放模型最具代表性的公司,但随着 DeepSeek、Qwen、Kimi、GLM 等模型快速迭代,Mistral 在前沿能力榜单上的存在感不断下降。今年 9 月,CEO Arthur Mensch 接受采访时甚至被直接问到:Mistral 的模型已经跌到 Artificial Analysis 排名 20 名之外,是不是被美国和中国甩开了?

Mensch 当时的回应是,新一代大模型即将发布,而且公司未来一年已经规划了接下来两代产品;Mistral 刚融资的资金将大量用于扩大训练算力,未来可调用的训练计算量可能提高约 20 倍。

两周后,Mistral Large 4 出现了。

Mistral Large 4 激活参数 520 亿,总参数 1.05 万亿,搭载 16 亿参数的视觉编码器,同时原生支持多模态和超过 160 种语言,上下文窗口达到 100 万 Token。值得注意的是,它是在 Mistral 位于欧洲的数据中心中,使用约 3800 张 Nvidia Grace Blackwell GPU 从头训练而成;模型目前已经开放 API 预览,完整权重将在 10 月底发布。

Mistral 官方公布的 Coding Agent Index 中,Large 4 已经超过 DeepSeek V4 Pro 和 Qwen 3.8 Max,但低于 Kimi K3;在与第三方 Surge AI 合作进行的盲测中,专业评审给 Large 4 的代码质量评分为 3.74,低于 Claude Opus 5 的 4.22,但高于 Kimi K3 的 3.59、GLM-5.3 的 3.60 和 GLM-5.2 的 3.40。

Mistral 明显在抢 " 企业 Agent" 而不是只抢开发者。在 AutomationBench 的 657 个跨 Gmail、Google Sheets、Slack、Salesforce 等应用的业务工作流中,Mistral 称 Large 4 超过了 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro,但低于 GLM-5.3。在科学代码、网络安全以及部分金融、法律任务上,Mistral 同样宣称已经达到开放模型头部水平。

这次,Mistral 还特别介绍了网络安全能力。 Mistral 称 Large 4 已进入 Artificial Analysis Cyber Index 全球前五,在其中一个 " 复现真实漏洞并修复 " 的任务上达到 82%,是该测试最高分;Cybench 上完成 93% 挑战。Mistral 还刻意强调,部分闭源模型因为安全拒绝机制,在某些漏洞复现任务上几乎无法作答,而开放权重模型可以由企业自己定义安全策略,并部署在私有云或本地环境。

当然,这些数据目前很大一部分来自 Mistral 自身测试,而且 Large 4 仍处在 public preview 阶段,真正的权重尚未开放。

补中国厂商初步跑通雏形的商业模式

模型能力之外,Mistral 和 Reflection 也在走一条国内厂商初步验证了的商业路线。

Reflection 是非常 " 美国式 " 商业故事:它希望建立一个新的完整 AI 基础设施提供商,从基础模型出发,向上承接推理、Agent、软件和企业部署,向下深入算力管理、集群调度,长期甚至自己拥有数据中心。

他认为,模型、应用、云计算、裸金属等每一层长期都会商品化,真正能够持续获得较高利润的公司,往往是把整个技术栈垂直整合起来的公司。Misha 甚至给出了一个很 " 硅谷味 " 的公式:

收入潜力 = 智能密度 × 算力规模 × 企业信任。

Misha 表示,开放模型本身不一定直接赚钱,但它能够创造巨大的推理需求。就像 Kubernetes 本身开放,却推动了云市场一样,开放模型会推动企业购买算力、推理和完整 AI 基础设施。因此,Reflection 真正卖的是围绕 Beam 建立整套智能基础设施的能力。

它甚至把自己与早期 AWS、GCP 类比。AWS 最初是 Amazon 为解决自己的服务器基础设施问题而发展出来的,Google Cloud 则来自 Google 支撑搜索业务形成的大规模分布式系统能力。Reflection 的逻辑是,自己为了训练前沿模型,本来就必须解决数万亿 Token 服务、数十亿 Agent 沙箱、GPU 调度等问题,这些内部技术最终也可以像云计算一样向外输出。

Mistral 的商业模式同样强调企业部署,但它更偏向 " 欧洲版全栈 AI"。

Arthur 主张,小而高效、能够定制和部署的开放模型,比只追求最大规模的通用模型更加符合企业需求。Mistral 同时建设自己的模型、企业定制平台和欧洲算力基础设施,希望成为从训练、推理到部署都能够发生在欧洲法律和基础设施体系内的供应商。

在其看来,欧洲企业不能把核心 AI 能力完全建立在别国厂商是否愿意继续提供服务之上,也不能把自己的技术底座转而交给他国模型。Mistral 因此不仅要自己训练模型,还在欧洲建设数据中心,希望控制从算力、模型到企业部署的完整链条。

对国内开放模型的态度

两家公司一个身处欧洲,一个来自美国,但近期创始人的公开表态显示,他们对开放模型正在形成一套越来越相似的判断:AI 市场已经从 " 谁能提供最好用的 API",进入 " 谁拥有模型、谁控制基础设施 " 的阶段。

在 " 为什么必须做开放模型 " 这个问题上,Reflection 的解释是:AI 市场正在从 " 租赁智能 " 走向 " 拥有智能 "。

Misha 将闭源 API 比作 " 租房 "。过去三年,AI 商业市场刚刚形成,企业调用 OpenAI、Anthropic、Google 等公司的模型,本质上是在租用智能。这种模式在市场早期足够简单,也足够高效。但随着 AI 真正进入企业核心业务,事情开始发生变化。

" 几年前还很小的创业公司已经成长为大型企业,大型企业自己也开始真正使用 AI,所有权市场自然就出现了。"Misha 表示,如果一家公司希望真正拥有智能,就必须能够把模型部署在自己的基础设施上,控制数据、修改模型、进行定制,而这意味着模型必须足够开放。

Ioannis 则从技术角度表示,开放模型与闭源模型最前沿之间的距离正在缩小,而且 " 没有任何技术理由会决定开放模型必须永远落后 "。在他看来,只要拥有足够的人才和算力,开放模型完全有能力做到与闭源模型相同的水平。过去企业不用开放模型,一个核心原因只是 " 能力还不够 ";现在,一批中国开放模型已经能直接替代闭源模型完成大量任务,商业迁移的前提开始成立。

Mistral CEO Arthur Mensch 的判断与 Reflection 在这一点上非常接近。在他看来,随着开放模型能力提升,大量企业已经没有必要继续为闭源模型支付额外的 API 溢价。他近期表示,Mistral 接触的大约 99% 企业场景都可以用开放模型完成。

那为什么过去一年是中国模型先跑出来呢?

两家公司对此的判断也颇为一致:中国开放模型的领先不是单纯某一家公司偶然跑出一款好模型,而是商业激励、产业环境和训练资源共同作用的结果。

Misha 表示,美国过去其实也曾拥有最强的开放模型,Llama 3 就是一个明显节点。但当时美国 AI 商业市场仍然以 API 为主,Meta 或其他公司并没有足够强的商业动力持续把最前沿能力开放出去。

中国的情况不同。DeepSeek V3 是一个重要转折点,它第一次让来自中国的开放 " 智能 " 在全球形成大规模影响,此后中国出现了一次更集中的开放模型推进。Misha 认为,这背后相当一部分动力来自:建设自己的开放权重生态,本身就具有产业和战略价值。

" 实际上,这些中国实验室直到最近都没有赚到太多钱。只是现在它们的模型能力足够强了,同时市场也成熟到可以为开放智能买单,所以它们才开始真正产生收入。"Misha 说道。

Arthur 则从偏工程层面解释:中国头部实验室的算力虽然低于美国最大的几家 AI 公司,但仍然高于 Mistral;与此同时,其会尽可能使用互联网上的数据,迭代方式也已工业化。这些条件让中国实验室能够快速迭代。

开放模型会不会更危险?

虽然两家公司都在积极为开放模型辩护,但都没有把自己描述成 " 所有模型都应该无条件开放 " 的极端开放派。

Reflection 的核心安全论点是,开放本身能够增加系统安全性。Misha 借用了开源软件世界里的 "Linus 定律 ":只要有足够多双眼睛,所有漏洞都会变得浅显。在他看来,封闭 AI 实验室只有几百名安全研究人员,不可能覆盖极其复杂模型里的所有长尾问题。如果开放模型能够让数十万研究者参与检查、攻击和修复,整个生态反而可能更加安全。

OpenAI 内部网络安全评测中的智能体越出测试环境并进入 Hugging Face 系统一事,被 Reflection 反复引用。Misha 认为,这件事说明单一安全哲学并不可靠:封闭模型可能因为安全护栏无法执行某些防御任务,而开放模型能够提供另一套工具。

Ioannis 进一步提出 " 用 AI 防御 AI" 的思路。随着模型越来越强,未来一个行为异常的 Agent 可以被另一个 AI 系统发现和约束。模型和提供者越多,系统的冗余就越高;如果最强能力只集中在一两家公司手中,反而会形成 " 单点故障 "。

但 Reflection 同样承认,开放并不是无限制的。Ioannis 明确表示,模型达到某种能力等级之后,部署方式需要更加谨慎;Misha 也表示,模型超过某个风险阈值后,行业和政府应该共同决定在什么条件下可以发布,以及是否需要访问控制。

Arthur 则近期公开反驳过关于超级智能失控风险的说法。相比主动减速,他更倾向于加强 Agent 监控、安全工程和实际治理。

这与 Anthropic 的立场其实也存在一部分重合。Anthropic 对开放权重的高风险扩散更加谨慎,但同样主张开放与闭源模型应该面对一致的能力安全门槛。

参考链接:

https://reflection.ai/blog/introducing-beam?utm_source=chatgpt.com

https://mistral.ai/news/mistral-large-4/?utm_source=chatgpt.com

https://www.youtube.com/watch?v=BKnAeVej0dc

https://mena.entrepreneur.com/business-news/live-from-ai-everything-abu-dhabi-2026-mistral-ais-arthur-mensch-on-the-divide-between-open-and-closed-ai?utm_source=chatgpt.com

https://www.lemonde.fr/economie/article/2026/09/24/arthur-mensch-directeur-general-de-mistral-ai-dans-l-ia-nous-sommes-les-seuls-completement-europeens-du-calcul-au-deploiement-dans-les-entreprises_6781335_3234.html?utm_source=chatgpt.com

声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

今日好文推荐

坚决不用行业标准 AGENTS.md,Claude Code 惹来 " 封杀令 ":Anthropic 终于回应了,但开发者更气了

独家|撬开 Jev 黑箱,对话全球首批复现者:9B 小模型跑通 79 毫秒 " 快决策 "

CLAUDE.md 还是 AGENTS.md?Anthropic 的答案是:以后都不用

对话 Tibo:入职第三天就把生产环境弄宕机了,今天他掌管 Codex

会议推荐

QCon 全球软件开发大会 · 2026(上海站)将于 10 月 22 日— 24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。限时 9 折优惠立减 680!查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

科技频道

科技频道

科技改变世界

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容