关于ZAKER Skills 合作
钛媒体 12分钟前

Kimi K3 开放权重:技术报告能否回应 Claude 蒸馏质疑?

7 月 27 日晚,Kimi K3 开放日如约而至。月之暗面发布了 Kimi K3 模型权重和技术报告,同时开源三项支撑模型训练与运行的关键基础设施:面向超大规模 MoE 通信的 MoonEP、面向线性注意力的 FlashKDA,以及服务于长周期智能体强化学习的 AgentEnv。

一天过去,围绕 K3 的讨论转向更难回答的问题:这些开放内容,究竟能否解释 K3 为什么突然变强,又能否帮助 K3 洗清蒸馏 Claude 的质疑。

严格来说,K3 此次属于开放权重,而非完整意义上的开源,但凭借 2.8 万亿总参数和约 1042 亿激活参数,它仍是目前规模最大、能力最接近闭源旗舰的开放权重模型之一。

这份技术报告来得正是时候。

Anthropic 及部分美国官员指控,月之暗面曾大规模获取 Claude 输出,并将相关能力用于 Kimi 模型训练。中国商务部随后回应称,美方有关蒸馏和窃取知识产权的说法缺乏实际证据和法律依据,并反对以此为由调查、制裁中国 AI 企业。

争议的核心并不是 K3 训练中有没有使用蒸馏技术,蒸馏本就是大模型行业普遍采用的训练方法,真正的问题是,K3 是否工业级蒸馏了 Claude 最新模型的海量数据。

现在,月之暗面第一次较为系统地摊开了 K3 的技术全景:更大的混合专家模型、重新设计的注意力和残差结构、百万 Token 智能体强化学习,以及覆盖通用任务、智能体和编程任务的九个专业策略。

图片来自 AI 生成

K3 为何突然变强

Kimi K3 采用混合专家架构,拥有 2.8 万亿总参数。模型内部共有 896 个路由专家,每个 Token 选择其中 16 个,同时调用两个共享专家,实际激活参数约 1042 亿。

相比拥有 1.04 万亿总参数、326 亿激活参数的 Kimi K2,K3 不仅将模型总容量扩大至近 2.7 倍,单次计算调用的参数也增长了两倍以上。

规模增长,是解释 K3 能力提升最直接的一条线索,但月之暗面给出的答案不只是继续堆高参数。

K3 以 3 ∶ 1 的比例组合 Kimi Delta Attention 与 Gated MLA。简单来说,前者以相对较低的缓存成本处理长上下文,后者定期执行全局信息交互,在效率和能力之间取得平衡。这种混合结构帮助 K3 把原生上下文窗口扩展到约 100 万 Token。

Attention Residuals 解决的是深层模型中的信息稀释。传统模型主要逐层传递信息,K3 则可以有选择地调用此前网络区块的表示,让早期的重要信息更直接地影响后续计算。

Stable LatentMoE 进一步扩大了专家空间,同时只让少数专家参与每次计算。这样既能增加模型的知识容量,又不必让全部 2.8 万亿参数同时运行。月之暗面称,K3 相较 K2 实现了约 2.5 倍的整体扩展效率提升。

一位业内人士表示,这些技术并没有完全消除复杂性,而是把一部分复杂性转移给了更底层的 AI Infra,更多专家意味着更困难的跨卡调度,KDA 减少了长上下文的缓存压力,却引入新的递归状态,Attention Residuals 则增加了跨层信息的保存和传递,AI infra 层的压力实际变得更大。

月之暗面因此同步开放了 MoonEP 和 FlashKDA,前者负责平衡超大规模 MoE 中的专家负载,后者帮助 KDA 更高效地运行在 GPU 上。这意味着 K3 的效率并不只存在于模型权重中,还强依赖于 Kernel、通信、缓存和集群调度的协同。

权重开放后,这套系统已经开始接受外部工程验证。例如,昇腾在 7 月 28 日宣布对 K3 进行 0day 适配,覆盖训练、推理、显存优化和 MXFP4 等数值格式;vLLM、SGLang 和 TokenSpeed 也已提供运行支持。

不过,开放仅一天,社区大多还停留在调试阶段,尚未独立复现其 2.5 倍扩展效率、百万 Token 吞吐和长周期智能体表现。

因此,技术报告已经提供了一套足以解释能力增长的架构,但其中一些关键结论仍然来自月之暗面的自身实验。

九个专业模型,如何教会一个 K3

相比基础架构,K3 的后训练流程可能更直接地解释了它在编程和智能体任务上的跃升。

根据技术报告,月之暗面先通过监督微调建立冷启动模型,随后在通用任务、通用智能体和编程智能体三个方向进行强化学习,每个方向又分别训练 low、high 和 max 三档推理强度,由此形成九个专业教师策略。

最后,九个专业模型通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation,MOPD),合并为统一的 K3。

这里的 " 在线 ",意味着学生模型不是简单模仿教师提前生成的一批答案。学生先按照自身策略生成任务轨迹,再由相应领域和推理强度的教师提供反馈,这种方式更接近学生模型实际会遇到的状态,也更容易把九套不同策略整合进一个模型。

多教师在线蒸馏并不是 K3 首创。从公开资料看,小米 MiMo 团队在 2025 年 12 月发布 MiMo-V2-Flash 时,已经明确使用并命名了 Multi-Teacher On-Policy Distillation;多教师知识蒸馏和在线蒸馏的基础思路出现得更早。

K3 的新意不在于首先提出 MOPD,而在于把它应用于由三个任务领域和三档推理强度组成的九教师体系。更需要区分的是,技术报告中的 MOPD 与美国方面指控的 Claude 蒸馏不是同一件事。

按照报告披露的流程,MOPD 阶段的直接教师,是九个由 K3 冷启动模型经过分领域强化学习形成的内部专业策略。报告没有将 Claude 或 Fable 列为这一阶段的教师。

技术报告没有完整披露预训练语料、监督微调数据、奖励模型数据和合成任务的来源,因此无法证明外部模型输出从未进入 K3 的训练流程。

独立评测显示,K3 在 Frontend Code Arena 等评测中处于领先位置,在部分智能体和编程基准上接近或超过 Claude、GPT 系列;但在 DeepSWE、FrontierSWE 以及部分综合知识工作评测中,仍落后于 Claude Fable 5 或 GPT-5.6 Sol。

开放解释了能力增长,却没有还原数据来源

Anthropic 在今年 2 月表示,月之暗面、DeepSeek 和 MiniMax 通过大量虚假账户及代理渠道获取 Claude 输出,三家公司累计产生超过 1600 万次交互,其中与月之暗面相关的活动超过 340 万次,目标包括智能体推理、工具调用、编程、数据分析、计算机操作和计算机视觉。

美国白宫科技政策办公室主任 Michael Kratsios 近日表示,美方掌握的信息显示,月之暗面曾蒸馏 Anthropic 的 Fable 模型,用于 K3 开发。围绕 " 工业级蒸馏 " 的调查、制裁和实体清单措施,也被美国官员放上讨论桌面。

中国商务部则在 7 月 27 日作出直接回应,称美方忽略了中美相关模型发布时间间隔很短、中国模型已经具备领先能力等事实,并指有关说法缺乏实际证据和法律依据。商务部同时表示,模型蒸馏是行业普遍使用的技术,美国企业也在研究和利用中国开放模型。

上述行业人士认为,Fable 5 公开可用与 K3 发布之间时间很短,要在这段时间完成海量数据获取、后训练、评测和产品部署,并由此解释 K3 的全部能力,并不符合超大模型通常的研发周期。

开放权重本身同样无法给出答案,2.8 万亿参数的 Stable LatentMoE、KDA 与 Attention Residuals、九教师 MOPD、百万 Token 强化学习,以及 MoonEP、FlashKDA 和 AgentEnv,共同形成了一条相对完整的能力增长路径。

月之暗面证明了一套足以生产前沿模型的架构、算法和基础设施,但还无法自证蒸馏陷阱。(作者 / 张帅,编辑 / 杨林)

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容