关于ZAKER Skills 合作
新京报 2小时前

月之暗面回应 K3: 做难而正确的事 , 不惧马斯克挑战

7 月 21 日下午,北京海淀知春路月之暗面总部,在一个充满摇滚风格的会议室里,月之暗面企业业务负责人黄震昕接受了新京报贝壳财经记者的采访,这也是 Kimi K3 大模型发布后 Kimi 首次公开接受媒体采访。

月之暗面企业业务负责人黄震昕回答新京报贝壳财经记者问题。罗亦丹 摄

K3 大模型参数量达 2.8 万亿,是目前全球参数规模最大的开源权重模型,在多个权威榜单上拿到第一,受到了国际上的广泛关注。连马斯克都在 K3 评测报道的评论区留言称 " 令人印象深刻 ",并表示后续将推出 2 万亿参数的模型 " 可能超越 Kimi"。K3 的火爆程度也导致需求量激增,7 月 19 日,月之暗面暂停了 C 端新用户订阅。

对于算力紧缺的现状以及未来企业的发展。黄震昕坦言 "K3 过于火爆,我们其实已经做了预案,但挡不住用户热情,有人说这和去年的‘ DeepSeek 时刻’一样,最后我们选择优先保证老客户的体验。"

而对于马斯克的 " 挑战 ",黄震昕笑言,可能这次的表现(让他们)得到一点震撼的感觉,现在拭目以待,希望他们出来跟我们掰一掰手腕," 我们的技术有很多都开源给了全世界,我们也不担心技术会马上被别人学走,我们有这样的胸襟和气度,希望马斯克也能做出 2 万亿的模型,我们一起共同进步。"

" 其实已经做了比较充分的准备,但挡不住用户热情 "

7 月 17 日凌晨,Kimi K3 正式对外发布。消息传开后的 48 小时内,全球开发者的使用请求涌入了月之暗面的服务器,远超团队此前的预估,用户量迅速逼近现有算力集群的承载极限。7 月 19 日晚间,Kimi 官方发布说明称 " 收获了远超预期的支持,但也面临始料未及的算力挑战 ",随即暂停 C 端新用户订阅。

" 我们提前做了充分的算力储备预案,但用户和客户的热情还是超出了预估。" 黄震昕在采访中坦言。他表示,目前公司的优先级是保障存量付费用户的使用体验," 不愿为了扩大用户规模牺牲存量用户体验 "。与此同时,团队正通过两条路径缓解供需矛盾——一是模型效能的持续优化,二是算力供给的快速扩容。

这种 " 幸福的烦恼 " 并非没有先兆。K3 的技术实力在发布前就已引起业内关注。其核心支撑技术之一 "Attention Residuals"(注意力残差)早在 2026 年 3 月就以技术报告形式开源,该技术方案可让模型训练与推理效率提升 25%。马斯克当时就在社交媒体上公开称赞,评价其为 " 非常令人印象深刻的工作 "。

当 K3 的完整性能数据在发布后揭晓,行业反应剧烈。在被业内视为最贴近真实工程开发的编程 " 金标准 "Frontend Code Arena 榜单上,K3 以 1679 分登顶。K3 的上一代模型 K2.6 在同一榜单上排第 18 位,一代之间跃升 17 个位次。Vercel 的 CEO Guillermo Rauch 发帖称,K3 在 Next.js 官方综合 Web 工程基准(nextjs.org/evals)评测中领先 Fable," 这是开源模型首次在该综合 Web 工程评测上全面超过闭源模型。"

和 DeepSeek-R1 推出后英伟达一度大跌类似,K3 也影响到了美股表现,美东时间 7 月 17 日,CNBC 报道美股半导体板块走出今年以来最差单周行情,跌幅创下 2025 年 4 月之后新低,而导火索是 " 中国月之暗面发布全新 AI 大模型。"

对于 K3 在全球的影响,黄震昕表示," 我们在全球市场上真正做出了 SOTA 级别的模型,定价不是朝便宜去定的,我们也摆脱了‘开源模型就是要做便宜的、低价的’这样的印象。"

" 模型公司一定要做模型 "

面对用户的热情与海外广受关注的表现,Kimi 显得颇为低调。

" 不做高性价比的标准化业务,而是聚焦‘难而正确’的前沿探索。" 黄震昕这样解释公司的核心理念。如同登月一般,一旦实现突破,将为全人类创造巨大价值——这并非一句口号,而是贯穿在月之暗面从技术研发到商业布局的每一个决策之中。

在当前,越来越多的 AI 企业开始聚焦落地和 Agent 时,月之暗面却一直保有对基础模型的执念," 模型公司一定要做模型。" 黄震昕说。

基础模型的强度是所有上层应用的前提,Agent、C 端产品、行业解决方案都是模型能力提升到一定阶段后的自然产物。只有持续打磨最强模型,才能构建长期竞争壁垒。

这种执念在 K3 身上得到了集中体现。根据月之暗面公布的技术文档,K3 基于月之暗面自研的 KDA 混合线性注意力机制和 Attention Residuals 技术构建,采用 MoE(混合专家)架构,在 896 个专家中高效激活 16 个,扩展效率较前代 K2 提升约 2.5 倍。更关键的是,月之暗面是 Scaling Law(缩放定律)的坚定信仰者——模型参数量、训练数据量、计算量三者同步提升,模型性能就会持续增强——但传统 Scaling Law 面临指数级成本的硬约束:算力投入扩大 100 倍,模型性能仅提升 10 倍。

月之暗面的解法不是简单的工程效率优化,而是底层架构创新。

黄震昕透露,过去 8 到 11 年间,大模型领域的三大核心基础技术从未出现本质迭代,而公司在 2025 至 2026 年完成了对这三项底层技术的突破,这也是 K3 能够实现 SOTA 性能的核心支撑。其中,Moon Clip 二阶优化器是行业首次在万亿级大模型训练中应用该新型优化器,大幅提升 Token 效率,可让 20TB 训练数据发挥出相当于 40TB 的效果。K2 系列曾在过去 12 个月中保持 9 个月的参数量领先,K3 也将在参数量与性能上保持一段时间的领先优势。

黄震昕告诉记者,Kimi 现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部 AI 企业,核心发力打磨模型基础能力,他也明确了行业参数规模趋势,表示 Kimi 的大模型参数规模会持续向上拓展,不会止步于当前 2.8 万亿规模。

Kimi 的 " 审美 ":不做娱乐性场景,聚焦生产力

技术突破只是起点,商业化落地才是检验模型价值的关键。

K3 在编程能力上的表现已经为它赢得了开发者生态的初步认可,其在多项评测中展现出与顶级闭源模型抗衡的实力。在 Program Bench 评测中,K3 得分 77.8,以 0.2 分的微弱优势超过 GPT-5.6 Sol 的 77.6;在 FrontierSWE 上得分 81.2,大幅领先 GPT-5.6 Sol 的 71.3,但次于 Fable 5 的 86.6。在实际应用中,K3 展示了长程工程能力——在计算天体物理 "I-Love-Q" 普适关系复现任务中,K3 用约两小时完成了通常需要资深研究人员一到两周才能完成的工作。

但月之暗面的商业化视野不止于此。黄震昕在采访中透露,公司即将推出 Kimi Hosted Agent 企业级服务,开放 Agent 编排调度(Harness)能力,将沙箱环境与智能体调度框架整合为标准化平台,向企业客户提供 PPT 生成等场景的 API 接口,支持嵌入企业内部系统,可自定义内容风格,适配投研分析、内容生产、办公自动化等多元场景。

谈及与海外头部模型公司的竞争,黄震昕表示,全球模型公司在商业化方面已找到一条可行路径,Kimi 在产品创新上持续投入,包括 AgentSwarm 路由在行业做 Agent 之前就已经做出来。" 我们还是希望从产品驱动,然后设计不同的商业模式,打造出非常有竞争力的产品。"

黄震昕在采访中强调了 Kimi 一贯的 " 产品审美 "," 我们不会做娱乐性的场景,也不做生图、生视频,我们一直的定位就是生产力场景,包括编程、金融、法律、科学研究等领域,这就是我们的审美,我们会一直按照这个价值观去努力奋斗。"

在北京,从海淀知春路到清华校门口,短短一段路程聚集了智谱、Kimi 等多家国内头部 AI 企业。黄震昕说,这里的产业集聚并非偶然—— " 人才密度高、政策支持完善,端一杯咖啡就能找到对应领域的专业人才 "。这片被业内称为中国 AI" 卧龙池 " 的土地上,蛰伏的故事远不止一个。而 K3 的全球爆火和随之而来的算力告急,或许只是月之暗面 " 登月计划 " 的一个阶段性注脚。

新京报贝壳财经首席记者 罗亦丹

视频 罗亦丹 陈蜜蜜 实习生 彭紫桐

编辑 杨娟娟

校对 杨利

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容