来源:盒饭财经
进入前沿牌桌不等于改变牌桌规则。
作者 | 许有阳
来源 | 盒饭财经(ID:daxiongfan)
头图及封面来源 | GPT
K3 突然成了关注的焦点。
先是马斯克。
北京时间 7 月 17 日凌晨,马斯克在 Artificial Analysis 一条 Kimi K3 的评测帖下回复 "Impressive"(令人印象深刻)。第二天,他又在谈及 xAI 正在训练的 2 万亿参数模型时表示,它 " 可能超过 Kimi"。
随后,月之暗面 Kimi 在微博上隔空喊话:" 欢迎加入「2 万亿 +」俱乐部 "。
为什么是 "2 万亿 + 俱乐部 "?
7 月 16 日晚,月之暗面发布新一代大模型 Kimi K3,而 "2 万亿 +" 便是 K3 的参数规模范围。据月之暗面介绍,Kimi K3 参数规模达 2.8 万亿,上下文窗口 100 万 token,原生支持视觉理解,搭载自研 KDA 注意力算法,以及每个 token 从 896 个专家中激活 16 个。
Kimi K3 的讨论范围,不只在海外的社交媒体。
Arena 联合创始人兼 CEO Anastasios Angelopoulos 接受媒体采访时称,这可能是今年最大的一次模型发布。与此同时,K3 登上 Frontend Code Arena 第一,在 Artificial Analysis 智能指数发布时排到第三。
而算力紧缺,又为 K3 的出圈添了一把火。
7 月 19 日晚间,月之暗面旗下 AI 助手 Kimi 发布《关于算力紧缺与会员暂停开放的说明》,宣布即日起暂停 C 端新用户订阅,将现有算力全部用于保障已订阅用户权益,并全速推进扩容。
气氛的烘托中,K3 的讨论中带上了 " 下一次 DeepSeek""DeepSeek 时刻 2.0" 等话题。事实上,截至发稿前,许可证尚未披露,完整技术报告也仍未发布。
但如果把两者放到同一张账单上,差异随即出现。Artificial Analysis 测得 K3 完成一项加权评测任务平均花费 0.94 美元,同一口径下 DeepSeek V4 Pro 约为 0.04 美元。K3 已进入全球前沿比较,却没有复制 DeepSeek 最关键的一击。
确实看起来像 2025 年的 DeepSeek
K3 制造的冲击,更多来自它的比较对象突然变了。
据月之暗面公布,K3 拥有 2.8 万亿总参数、原生视觉和 100 万 token 上下文,每个 token 从 896 个专家中激活 16 个。Artificial Analysis 给出 57 分,发布时位列第三;在现实知识工作评测 GDPval-AA v2 中,它获得 1668 Elo,高于 Claude Opus 4.8 和 GPT-5.5,低于 Claude Fable 5;在 AA-Briefcase 长程知识工作评测中,发布时仅次于 Fable 5。
" 虽然其整体性能仍然落后于最强大的专有型号 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评估套件中展示了前沿级别的性能,始终优于其他测试型号。"《Kimi K3:开放前沿智能》这样写道。
这些名次都有边界。
截至 7 月 21 日,K3 已由发布时的第三移至第四。而 Frontend Code Arena 测量的是前端页面的视觉、交互和用户偏好,并不等于全部代码能力。
但,这些变化,也无法否认 kimi 完成了一次身份切换:K3 不再只是 " 国产模型里表现不错 ",而是直接进入 Fable、GPT 和 Opus 构成的全球比较。
一个直观的变化是,关注度从 K3 转向杨植麟本人。
K3 发布后,杨植麟的导师 Russ Salakhutdinov 在 X 上公开祝贺;不少媒体先后刊发其人物侧写,海外科技媒体甚至单独写了一篇月之暗面会议室的命名方式。
2015 年从清华大学毕业后,他前往卡内基梅隆大学攻读博士,参与 Transformer-XL 和 XLNet 等研究,直到 2019 年毕业。有媒体写道,杨植麟在卡内基梅隆大学读博期间,就以喜欢 Pink Floyd 等摇滚乐队闻名。这种个人趣味后来也进入公司命名:" 月之暗面 " 取自 Pink Floyd 的同名专辑,Kimi 则是杨植麟的英文名。
Pink Floyd,翻译过来为 " 平克 · 弗洛伊德 ",这支乐队在 1973 年发布了一张名为《The Dark Side of the Moon》的专辑。专辑名翻译过来,就是 " 月之暗面 "。
这种种很容易唤起 DeepSeek 式联想:一个年轻的研究者、非互联网大厂组织、以架构创新逼近前沿,再由一次集中发布闯入全球舆论。
但相似的出场方式,并不等于相同的商业动作。Kimi 要做的一直都很清晰,并不是下一个 "DeepSeek"。
3 月 25 日,杨植麟在 2026 中关村论坛年会全体会议上,以《开源 AI:加速探索智能上限》为题发表演讲,提出大模型发展核心判断,并系统披露 Kimi 最新技术路线与行业价值。期间,他将月之暗面的扩展方向概括为三条:提高 token 效率、拉长上下文、组织 Agent 集群。
不到四个月后,K3 几乎就是这三个判断的实体化。
Kimi 的目标,沿着一条线程工作下去
Token 效率解决成本,长上下文解决容量,Agent 集群突破顺序执行瓶颈。杨植麟对月之暗面规划的方向,共同指向了一个目的地:模型竞争正在从 " 一次回答 ",转向 " 一条持续运行的任务线程 "。
聊天的终点是一段回复,工作的终点则是一个能够继续使用的结果。这个曾经承载 " 咨询 "" 搜索 " 功能的助手,要进一步上岗干活了。
那自然就会对他有新的要求。比如,要完成任务时,他得记住目标,还要阅读文件和网页,过程中自然也要调用终端及浏览器,保存中间产物。相对过去,这个流程就变长变复杂了。
如果这个助手中途某一步出错,它需要知道从哪里恢复,而不是让用户从头再来。如果它在工作时忘掉一句重要要求或限制条件,过去或许只是体验瑕疵,现在却可能意味着全部返工。
而 100 万 token 上下文并不等于长线程。更长的上下文窗口,像一张足够大的工作台,决定一次能摊开多少资料;而长线程则是一项持续推进的项目,还取决于状态保存、工具反馈、任务拆解和错误恢复。
K3 的厉害之处,是和 DeepSeek 一样用技术显化了战略。
比如,KDA 先处理长任务为什么越来越贵。
2025 年 10 月,Kimi Team 发布了名为《Kimi Linear: An Expressive, Efficient Attention Architecture》的相关研究。该论文中,已经用 KDA 与 MLA 组成混合注意力架构。在 48B 总参数、3B 激活参数的实验模型上,论文报告 KV Cache 最高减少 75%,100 万 token 下解码吞吐最高达到全 MLA 基线的约 6 倍。
这当然不是 K3 实测,却说明如果读取和保存历史的成本无法下降,线程越长,产品越难成立。
而 Attention Residuals 处理网络深度上的信息稀释问题。
相关论文显示,模型可以根据输入选择此前层的表示,而不是固定地逐层相加。验证同样来自 48B 模型,不能据此声称 "Agent 不会忘记目标 ",只能说明它为超深模型提供了更稳定的内部信息流。
还有,Stable LatentMoE。
它能让每个 token 只激活 896 个专家中的 16 个,把总容量与单次计算拆开。月之暗面称,这些架构和训练配方合计将扩展效率提高到 K2 的约 2.5 倍。截至发稿前,技术报告尚未发布,暂时无法拆分各项贡献。
然而,单模型变得更能装,并没有消除顺序执行的限制。
Kimi 从 K2.5 引入 Agent Swarm,到 2026 年 4 月的 K2.6 已扩展到最多 300 个子 Agent 和 4000 多次工具调用。官方称大规模搜索速度相较单 Agent 最高提高 4.5 倍,当前集群已经由 K3 驱动。每个子 Agent 保留自己的上下文,只向协调者汇报关键结论。也就是说,月之暗面不仅在拉长线程,还打算把它拆成一支临时组织。
产品也沿着同一方向展开。
6 月 3 日上线 Beta 的 Kimi Work 以 Kimi Code 为内核,把本地文件、WebBridge、Skills 和权限控制接入桌面。它还能系统拆解目标、调用工具,并最终交付文档、表格、演示文稿或代码。
K3 又同时进入 Kimi.com、Kimi Work、Kimi Code 和 API。这意味着,Kimi 正在从底模走向运行时和工作入口。
K3 与 DeepSeek,在这里分岔
进入前沿牌桌不等于改变牌桌规则,DeepSeek 当年真正让市场不安的,是它顺手把牌桌的价格锚定点改了。
2024 年 5 月 6 日,DeepSeek 发布 V2,并以极低的 API 价格引发国内大模型价格战。不久后,在《暗涌 Waves》的专访中,梁文锋表示,公司只是核算成本后定价,原则是不补贴,也不追求暴利。
这个判断在 2025 年 1 月 20 日变成了一个完整动作。
R1 和 R1-Zero 发布当天,DeepSeek 给出 6 个从 1.5B 到 70B 的蒸馏版本;API 未缓存输入价为 0.55 美元、输出价为 2.19 美元/百万 token。能力、价格、权重、许可和不同尺寸的模型同一天到位,开发者不仅可以调用,还可以下载、修改、部署和继续蒸馏。
到 2026 年 4 月 24 日发布 V4 Pro 时,这套动作仍然连贯。
V4 Pro 拥有 1.6 万亿总参数、49B 激活参数和 100 万 token 上下文,发布时同步开放 MIT 许可权重,并兼容 OpenAI Chat Completions 与 Anthropic 接口。截至 7 月 21 日,官方未缓存输入价为 0.435 美元、输出价为 0.87 美元/百万 token。
DeepSeek 降低的不只是 token 标价,而是获得、迁移和改造模型的门槛。
R1 发布一周后的 2025 年 1 月 27 日,英伟达市值在一个交易日内蒸发约 5930 亿美元,创下当时美国上市公司单日市值损失纪录。当然,这不能代表算力不再重要,但足以记录这次市场的恐惧:如果接近前沿的能力可以低价获得、立即下载,还能被压进不同尺寸的模型,围绕稀缺智能建立的价格和资本开支叙事就必须重算。
"DeepSeek 时刻 " 代表的是,能力进入前沿、价格骤降、权重和蒸馏模型即时可得。三件事同时发生,强模型才从稀缺产品向可兼容、可改造的供应品移动。
Kimi 走的是另一条路。
截至 7 月 21 日,K3 已经进入 Kimi Work、Kimi Code 和 API,但完整权重承诺最迟于 7 月 27 日发布。价格方面,API 未缓存输入为 3 美元、输出为 15 美元/百万 token。
月之暗面称,编程负载缓存命中率超过 90%,命中后的输入价会降到 0.30 美元,这能降低实际调用成本,却仍没有把 K3 放进 DeepSeek 式的低价区间。
制作:盒饭财经
Artificial Analysis 的同口径结果把分岔显示得更直接。
K3 完成一项加权评测任务平均花费 0.94 美元,V4 Pro 约为 0.04 美元,相差约 23.5 倍。当然,这一指标包含评测中的输入、缓存、推理和输出 token,并不等于企业真实项目的总成本。如果模型可以把工程师一周的工作压缩到一天,昂贵的 token 依然可能是便宜的劳动力。
但这也意味着,K3 的溢价不能再靠参数和榜单解释,只能靠结果解释——更少的重试、更少的人工接管、更低的返工概率,以及更高的最终交付成功率。
K3 押注的是,用户愿意为更高的任务完成概率付费。
而这意味着,Kimi 面对的竞争不再局限于模型榜单。它需要依次证明这条线程值钱、可靠、留得住结果,并且能够规模化交付。
用户付费,不是为了 2.8 万亿参数本身,而是希望模型可以解决实际的问题。比如,某程序员用 AI 产品连续工作数小时,读完代码库,调用终端与浏览器,处理数千页材料,他的目的是有一个能继续使用的结果。但如果无法交付这样可继续使用的结果,那么再低的 token 单价也没有意义。
K3 的技术选择都在服务这场赌博。
比如,价格方面。
K3 没有必要在 token 价上击败 DeepSeek,但必须证明多付的钱能够换来更少的失败。AA 的 0.94 美元只是一个更接近任务经济性的代理指标,它仍没有计入人工审核、外部工具、错误恢复和返工。只有进入企业的真实流程之后,成功任务总成本才会揭晓。Kimi 押注任务价值,就必须接受这种比跑分更苛刻的核算。
比如,运行方面。
7 月 9 日,OpenAI 推出 ChatGPT Work,并披露 Codex 周活跃用户超过 500 万,其中 100 万以上已经用于非软件工作。Codex 已经把沙箱、越界操作审批、diff 和测试闭环做成基础能力。而 Anthropic 也为 Claude Code 提供文件和网络隔离、修改前检查点与恢复能力。竞争已经从模型能否完成任务,推进到模型出错之后系统能否限制损失、验证结果并恢复现场。Kimi 需要证明的,不是它能调用多少工具,而是能否让一个会犯错的模型安全地行动。
比如,入口方面。
7 月 15 日发布的 WPS 灵犀专业版可以直接调用 WPS 文档内核与原生 API,生成可编辑、可审阅的文档、表格和演示文稿。微软则在 4 月把 Word、Excel 和 PowerPoint 中的 Agent 能力推向全面可用。它们未必始终拥有最强底模,却掌握文件对象、格式、版本、企业权限和协作关系。
Kimi Work 也在连接 WPS、Canva、Notion 和专业数据库,但这既是扩张方式,也暴露了位置问题。如果成果最终仍要回到 Office 继续编辑、审阅和流转,Kimi 究竟是新的工作入口,还是被旧入口调用的一层模型能力?模型越强,其他平台吸收它的价值反而越容易。
还有,来自 K3 自身。
7 月 19 日的公告称,过去 48 小时的用户请求量已经逼近现有推理集群承载上限。
这证明了关注度,也直接暴露了长线程的供给账单。一次聊天可能只调用模型几轮,一项持续数小时的编程、研究或多 Agent 任务却会反复推理、读写上下文、调用工具。而 K3 官方又建议采用 64 个以上加速器组成的 supernode。
热度越高,月之暗面越需要同时维持服务质量、单位任务成本和毛利。如果扩容只能换来更多昂贵推理,长线程会成为一张不断增长的成本表。
巧合的是,DeepSeek 发布 R1 后,OpenAI CEO Sam Altman 也曾用 "impressive" 评价它,与马斯克评价 K3 时用了同一个词。
DeepSeek 的关键一击已经写进价格、权重和产业扩散,它让前沿智能从稀缺产品变成低价、兼容的供应品。
K3 没有重复这一击。杨植麟选择把模型送进更长的任务,让它读取更多材料、调动更多工具、组织更多 Agent,最终拿走更多工作价值。它试图改变的不是一单位智能的价格,而是模型参与工作的长度。
参考资料:
1.《Kimi K3 achieves #3 in the Artificial Analysis Intelligence Index, comparable to Opus 4.8 and GPT-5.5》,Artificial Analysis
2.《月之暗面杨植麟专访:AI 不是接下来一两年找到 PMF,而是接下来十到二十年如何改变世界》,腾讯科技《潜望》
3.《算力紧缺!Kimi 宣布:暂停新用户订阅!》,e 公司官微
4.《Kimi K3:开放前沿智能》,K3 官方博客
5.《月之暗面杨植麟:未来每个研究员将配海量 Token,AI 研发将进入 AI 主导时代》,每日经济新闻
6.《Copilot ’ s agentic capabilities in Word, Excel, and PowerPoint are generally available》,微软官网
7.《揭秘 DeepSeek:一个更极致的中国技术理想主义故事 |36 氪独家》,暗涌 Waves
8.DeepSeek-R1,GitHub
9.《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
10.《金山办公推出 AI 办公智能体灵犀专业版,支持专业 Office 操作》,it 之家
11.《Kimi Linear: An Expressive, Efficient Attention Architecture》,arXiv 论文和 GitHub 仓库
12.《The Meeting Rooms At Moonshot, Company Behind Kimi 3, Are All Named After US Rock Bands》,OfficeChai
13.《Attention Residuals》,arXiv 论文和 GitHub 仓库
14.《Agent Swarm 能力》,Kimi 官网
15.《Kimi Work Overview》,Kimi 官网
16.《Kimi Code Overview》,Kimi 官网
17.《ChatGPT 现已成为你攻坚克难的得力伙伴》,OpenAI 官网
18.《在 OpenAI 内部安全运行 Codex》,OpenAI 官网
19.《Beyond permission prompts: making Claude Code more secure and autonomous》,Anthropic 官网
20.《Enabling Claude Code to work more autonomously》,Anthropic 官网