导语:7 月 17 日凌晨,月之暗面正式发布新一代大模型 Kimi K3,参数规模 2.8 万亿,配 100 万 token 上下文窗口,原生支持视觉理解。
摘要:
7 月 17 日凌晨,月之暗面正式发布新一代大模型 Kimi K3,参数规模 2.8 万亿,配 100 万 token 上下文窗口,原生支持视觉理解。按官方与多家媒体的说法,它超过参数 1.6 万亿的 DeepSeek-V4-Pro,成为目前参数量最大的开源权重模型。架构上,K3 采用 KDA 混合线性注意力机制与注意力残差技术。编程能力上,它在 FrontierSWE 基准得分 81.2,位列前部,低于 Fable 5 的 86.6。价格方面,每百万 token 缓存命中输入 2 元、未命中 20 元、输出 100 元。月之暗面表示,Kimi K3 的完整模型权重将在 7 月 27 日前放出。
正文:
在多项权威基准测试中,Kimi K3 展现出逼近全球顶尖闭源模型的实力。
7 月 17 日凌晨,月之暗面(Moonshot AI)正式发布新一代大模型 Kimi K3。该模型参数规模达 2.8 万亿,超越参数规模 1.6 万亿的 DeepSeek-V4-Pro,成为迄今为止参数量最大的开源权重模型。

核心参数与架构
Kimi K3 基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
在模型架构层面,K3 采用 Mixture of Experts(MoE,混合专家)架构,结合 Stable LatentMoE 框架,可在 896 个专家中高效激活 16 个。
这意味着虽然模型总参数量达到 2.8 万亿,但单次推理仅调用其中一小部分参数,从而在控制计算成本的同时扩大模型容量。
在 API定价方面,Kimi K3 采用按量计费模式:缓存命中输入为 0.30/ 百万 ??????????,缓存未命中输入为 3.00/ 百万 token,输出为 $15.00/ 百万 token。模型默认最大生成长度为 131072token,最高可设置为 1048576token。
月之暗面表示,完整模型权重将于 2026 年 7 月 27 日前发布,模型架构、训练和评测细节将随技术报告一同公布。

与前代模型比较
首先是扩展效率的显著提升。通过模型结构、训练方法和数据配方的协同优化,K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地将算力转化为模型能力。
其次是上下文窗口的大幅扩展。相较 K2.7 Code 等前代模型的 256K 上下文,K3 提升至 100 万 token,可一次性处理相当于《三体》三部曲体量的文本,适用于大型代码库分析、长篇法律卷宗检索、金融研报深度解析等长程任务。
第三是多模态能力的原生集成。K3 并非简单拼接文本与视觉模块,而是原生支持图像和视频理解,可将截图、界面录屏、示意图与代码、工具调用置于同一会话中处理,适用于前端工程、游戏开发、CAD 设计等需要视觉反馈的编程场景。
此外,K3 始终开启思考模式,在推理过程中展示完整思维链,用户可通过流式输出分别获取推理增量和最终答案。
主流大模型横向对比
根据月之暗面公布的评测数据,K3 在多个主流编程和智能体基准中与目前全球最强的两款大模型 Claude Fable 5 和 GPT-5.6 Sol 达到可比区间,并超越了此前被认为代表国产模型编程能力的 GLM-5.2。
在编程能力方面,K3 在 FrontierSWE 基准中得分 81.2,仅次于 Fable 5 的 86.6,高于 GPT-5.6 Sol 的 71.3;在 Program Bench 中得分 77.8,超过 GPT-5.6 Sol 的 77.6 和 Fable 5 的 76.8;在 SWE Marathon 长程编程任务中得分 42.0,领先 Opus-4.8 的 40.0、GPT-5.6 Sol 的 39.0 和 Fable 5 的 35.0。

在智能体(Agentic)任务方面,K3 表现尤为突出。根据 BenchLM 的对比数据,K3 在 Agentic 类别平均得分 91.2,大幅领先 DeepSeek V4 Pro(Max)的 74.5。在 BrowseComp 网页浏览任务中,K3 得分 91.2%,高于 DeepSeek V4 Pro(Max)的 83.4%。
在知识推理方面,K3 在 GPQA 基准中得分 93.5%,高于 DeepSeek V4 Pro(Max)的 90.1%;在 HLE(Humanity's Last Exam)高难度测试中,K3 得分 56%,显著高于 DeepSeek V4 Pro(Max)的 37.7%。
不过,K3 在部分基准中仍与顶尖闭源模型存在差距。例如在 DeepSWE 编程基准中,K3 得分 67.5,低于 GPT-5.6 Sol 的 73.0 和 Fable 5 的 70.0;在 GDPval-AA v2 Elo 评分中,K3 为 1668.0,低于 Fable 5 的 1760.0 和 GPT-5.6 Sol 的 1748.0。
2.8 万亿参数的意义
参数即能力上限。2.8 万亿参数让 K3 成为全球首个触及 3 万亿级别的开源模型,也意味着中国大模型在预训练规模上已与国际顶尖水平并跑。月之暗面官方数据显示,在过去 12 个月(2025 年 7 月至 2026 年 7 月)中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。
与闭源模型不同,K3 选择以开源权重形式发布。这意味着研究机构、开发者和企业可以下载模型权重,进行学术研究、二次开发或私有化部署。对于金融、医疗、法律等对数据隐私要求极高的行业,这一开放路径具有不可替代的价值。
但开源不等于免费午餐。2.8 万亿参数的 MoE 模型对推理硬件要求极高,本地化部署需要大量高端 GPU 集群,中小团队难以独立承担。更关键的是,具体的开源协议、商用授权条款、是否允许微调等细节,仍需等待 7 月 27 日权重正式发布时才能明确。在协议落地之前," 开源 " 的商业价值仍是一个待解的问号。
定位与使用建议
月之暗面将 K3 定位为 " 通用旗舰智能 " 模型,而非 K2.7 Code 的替代者。K2.7 Code 仍专注于编程专精场景,K2.6 继续服务于通用长程 Agent 任务,而 K3 面向的是 " 难、跨领域且被 256K 上下文卡住 " 的复杂任务。
K3 特别适合以下场景:大型代码库理解与修改、多步骤金融研究与产业分析、结合视觉反馈的交互式开发、需要 100 万上下文窗口的长文档推理等。对于日常 IDE 编程、低延迟自动补全等任务,K2.7 Code 仍是更经济高效的选择。
(文章为作者独立观点,不代表艾瑞网立场)