关于ZAKER Skills 合作
财闻 13小时前

Kimi K3 引爆全网的秘密:2.8 万亿参数之外,杨植麟和他的天才团队,最小成员仅 17 岁!

Kimi K3 爆火的背后,不只是 2.8 万亿参数和百万 Token 上下文,更有着一家仅 300 余人的创业公司,和一位坚持底层技术创新的创始人杨植麟。

一款 AI 模型发布不到 72 小时,暂停了会员充值。

7 月 17 日,北京月之暗面科技有限公司(Moonshot AI)正式发布新一代开源大模型 Kimi K3。

7 月 19 日晚,月之暗面通过官方公众号发布说明,称 " 过去 48 小时,用户请求量已大幅超出我们的预估,并且逼近现有集群的承载极限 "。为保障已订阅用户的体验,公司决定即日起暂停 C 端新用户订阅,将现有算力优先服务已订阅用户;随着新增算力陆续到位,将逐步开放更多订阅名额直至全面恢复正常。

WAIC2026 Kimi 展台 顾群生 / 摄

月之暗面还计划调整会员权益,将 Kimi Web、App 和 Work 等主要产品权益与 Kimi Code 权益拆分,以更精细地匹配不同业务的算力需求。

对于一家仍处于高速增长阶段的大模型公司而言,主动暂停新增付费入口并不常见。

棱镜咨询创始人况玉清向财闻表示,暂停新增会员的选择在经营层面具有一定合理性,目前国内 C 端用户整体付费意愿仍然有限,难以规模化,真正具有长期价值的还是企业客户。

7 月 21 日,月之暗面 B 端企业业务负责人黄震昕接受《科创板日报》采访时表示,公司正在通过模型效能优化和增加算力供给,解决当前的服务能力不足问题。

01

从长上下文到 Agent,杨植麟没有改变方向

K3 的出现,是杨植麟和月之暗面过去多年研究方向的延续。

公开资料显示,杨植麟本科毕业于清华大学,随后赴美国卡内基梅隆大学攻读博士,师从自然语言处理领域知名学者 William Cohen,研究方向长期聚焦自然语言处理、大模型及长上下文理解,并先后在 Google Brain、Meta AI 等机构参与前沿研究。

2023 年 Chat GPT 引发全球 AI 浪潮后,杨植麟创办月之暗面。同年 10 月,公司推出 Kimi 智能助手,并以长文本处理能力进入公众视野。

从他后来的公开访谈中可以看出,与外界对创业公司 " 快速做应用、抢市场 " 的普遍期待不同,杨植麟更关心模型能力本身。他曾表示,AI 创业不是寻找一两年的产品机会,而是未来十至二十年的技术革命。

过去几年,无论是凭借超长上下文能力让 Kimi 出圈,还是后来持续投入推理能力、Agent 能力建设,Kimi 的技术路线几乎没有发生根本变化。

在海外一次长篇访谈中,杨植麟反复强调一句话:"Lossless long context is everything(无损长上下文能力至关重要)。" 在他看来,人类的信息处理能力不断提升,本质上就是能够处理越来越长的上下文,大模型同样如此。

这种技术导向,也体现在 Kimi 对产品路线的判断上。

黄震昕近日再次强调," 模型公司一定要做模型。模型是最重要的基础,Agent 能力是模型强到一定程度后自然而然产生的能力。"

02

一家研究型公司的 " 天才密度 "

月之暗面始终保持着浓厚的研究型机构色彩。

支撑 K3 的重要技术 Attention Residuals(注意力残差),今年 3 月便以论文形式率先向全球公开。

Kimi 团队 Attention Residuals 论文 图源:网站截图

论文的共同第一作者包括陈广宇、张宇和苏剑林。其中,陈广宇只有 17 岁,是一名来自深圳的高中生,也是月之暗面实习生。

这篇论文发布后,也引发国际 AI 社区关注,马斯克在社交平台评价称:"Very impressive work from Kimi。"

据相关报道,陈广宇深入接触人工智能研究的时间不到一年。他主要通过阅读论文、追踪 GitHub 开源项目和参与技术社区积累基础。2025 年暑假,他前往旧金山一家人工智能初创公司实习七周,回国后于当年 11 月加入月之暗面实习。

论文共同第一作者苏剑林后来在《Attention Residuals 回忆录》中写道,张宇和陈广宇共同提出了论文中的 Block AttnRes 设计。该方案将层划分为多个区块,并对区块信息进行压缩,在尽量保留完整 Attention Residuals 效果的同时降低计算和通信成本。

陈广宇的经历提供了一个容易传播的年轻 " 天才 " 故事,但 K3 显然不是少数个人可以独立完成的成果。Attention Residuals 论文署名作者达到数十人,K3 背后还涉及模型架构、训练数据、分布式系统、推理部署和产品工程等多个环节。

根据此前报道,Kimi 员工仅有 300 余人,平均年龄不到 30 岁,其内部保持着高度扁平化的组织结构,没有传统意义上的部门、职级、Title、OKR 和 KPI。

公司没有明显的职级壁垒,实习生也可以直接与创始人沟通,研发团队更强调科研贡献、技术品味(Taste)以及跨领域学习能力。

近年来,无论 OpenAI、Anthropic 还是 Google DeepMind,都越来越强调研究驱动(Research-driven)的研发模式,月之暗面的发展路径,与这一趋势颇为相似。

当然,这种组织方式也并非没有挑战。

但随着公司人数和业务线增加,这种高度依赖个人主动性和核心创始人的组织方式能否继续维持效率,仍需时间验证。

03

2.8 万亿参数之外

Kimi K3 参数规模 2.8 万亿,是迄今为止参数量最大的开源权重模型,超越了参数规模 1.6 万亿的 DeepSeek-V4-Pro。

在模型能力上,第三方测评平台 Artificial Analysis 显示,Kimi K3 排名全球第三,落后于 Claude Fable 5 和 GPT-5.6 Sol,强于 Anthropic 上一代旗舰级模型 Claude Opus 4.8 和 OpenAI 上一代旗舰模型 GPT-5.5。

月之暗面对此也保持了相对克制的态度,在公告中表示,Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。

不少人把关注点放在 2.8 万亿参数这一数字上,但在月之暗面看来,真正带来性能跃升的,是底层架构创新。

黄震昕近日接受《科创板日报》采访时表示,"Kimi 和其他模型厂商最大的不同,是我们一直坚持底层架构技术创新,这一轮性能提升主要来自于此。"

黄震昕说,支撑 K3 的核心创新主要来自三个方向。

第一,是今年 3 月公开发布在论文里的(Attention Residuals),这是 K3 训练过程中的核心技术之一,可将模型训练效率和推理效率提升约 25%。

第二,是 MoonClip 优化器。黄震昕将 MoonClip 描述为一种基于 Muon 的优化技术,并称其可以让 20T 训练数据取得接近 40T 数据的训练效果。

第三,是 Kimi Linear Attention(线性注意力机制)。在实验模型中,这套架构可以显著减少长上下文推理所需的 KV Cache,并提高百万 Token 上下文下的解码效率。K3 沿用了 Kimi Delta Attention,并将其扩展至 2.8 万亿参数规模。

目前,K3 已支持最高 100 万 Token 上下文长度,可一次处理数十万行代码、多个大型项目或二十余篇研究报告。

更重要的是,它针对代码生成、复杂推理以及 Agent 任务进行了重点优化,而这些恰恰是当前企业 AI 应用最迫切的需求。

04

" 甜蜜的烦恼 "

K3 发布后的算力告急是一场 " 甜蜜的烦恼 ",却也折射出中国 AI 产业下阶段的重点。

近年来,包括 Kimi、DeepSeek 等中国 AI 公司近期都在积极融资扩充算力,美国对高端 GPU 出口的限制,也使算力资源成为中国 AI 企业共同面对的挑战。

不过,况玉清认为," 算力虽然紧张,但主要还是性能决定竞争力。"

他表示,对于头部模型企业而言,融资能力普遍较强,既可以采购 GPU,也可以借助云计算资源扩充推理能力,算力更多是资本投入问题;相比之下,模型性能能否持续领先,才真正决定用户规模和商业价值。

在他看来,目前国内模型已经事实上进入了 " 各领风骚数十天 " 的阶段。K3 的发布,再次改变了国内基础模型竞争格局,但是这种领先未必能够持久。

过去一年,千问、DeepSeek、智谱、Kimi 等模型都曾在不同时间段占据领先位置,但没有一家企业能够长期保持绝对优势。

" 大家都很强,也都在快速迭代。真正的风险不是竞争对手,而是谁先在下一轮技术迭代中掉队。" 况玉清分析称。

据报道,Kimi 计划于 8 月启动上市前最后一轮融资谈判,目标估值高达 500 亿美元。融资完成后,Kimi 将立即启动新一轮融资洽谈,最快于今年内登陆香港资本市场。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容