关于ZAKER Skills 合作
钛媒体 12分钟前

四小时发言实录刷屏背后,梁文锋的克制

文 | 唐辰同学

DeepSeek 蹚出通往 AGI 的第二条路。

今天,梁文锋在近期与投资者交流的会议记录刷屏。一个可能的背景是,DeepSeek 近日完成成立以来的首轮外部融资,总额超 500 亿元人民币(约合 74 亿美元),投前估值约 3675 亿元(约 543 亿美元)。

在此之前,梁文锋对外坚持 " 不融资、不上市、不商业化 " 的三不原则。

这段长达 4 个小时谈话实录,梁文锋详细阐述了 DeepSeek 的组织文化、开源逻辑、技术路线图以及对行业竞争格局的看法。需要注意的是,该会议实录还没有得到其本人确认。

" 克制是一种战略 "

我在流传出的多个版本中,都注意到一个高频关键词:克制。

梁文锋花了很大篇幅对投资者强调,克制是一种战略。舍弃短期利益,砍掉非主线业务,不是为了显得清高,而是为了换取实现 AGI 的最大概率。

其中一个实录版本提到,他说了非常多次的 " 不 ":不是天才,不赚不合理的利润、不追求用户量、不闭源、不做 3D / 视频生成 / 世界模型,不做下一个超级 App 。

不少观点将梁文锋的 " 克制 ",解读为资源不足时的无奈取舍。因为这在追求效率,着眼商业化以兑现资本承诺时,几乎把资本的故事都抽离掉,重点落在为了 AGI 的 " 克制 ",很反常识。

这固然是基于现实作出的判断,但恰是这种非主流的姿态,成为市场重估 DeepSeek 价值的新标尺。

若再把梁文锋的路线,放在全球 AI 竞争的坐标系里看,我更愿意把这种 " 克制 " 理解为:在算力约束下,他为换取 AGI 最大概率而进行的精密计算。

他在谈及中美差距时断言," 我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。"

目前,硅谷 AI 的范式是 " 资源溢出驱动涌现 "。即堆最多的卡,训最大的模型,做最全的 AI 能力,相信规模到了智能自然会涌现。

这套逻辑在过去三年被验证有效,但模型能力越强、上下文越长、用户调用越频繁,对推理算力的消耗也越高,算力成本也越来越贵。

最新消息显示,OpenAI 预计到 2030 年将在计算资源上投入约 7500 亿美元,高于 2026 年早些时候提出的 6000 亿美元规划。

同时,无边界扩张导致研发资源分散,商业化动作变形,组织熵增加剧。以 Meta 为例,其在开源 Llama 系列赢得声誉的同时,内部却因同时推进文本、多模态、元宇宙及机器人等多条战线,导致核心大模型团队的顶尖人才频繁流失,产品迭代节奏多次被打乱。

Google 则在搜索、云业务与 AI 实验室的多重目标拉扯下,一度陷入 " 创新者窘境 ",明明手握最强技术储备,却在生成式 AI 的产品化落地中屡屡迟疑,错失了先发身位。

这些巨头的困境,多来自技术以外的 " 战略贪婪 "。当一家公司同时押注多条 AI 路径," 什么都想做 " 的全能叙事,稀释了攻克 AGI 核心瓶颈所需的专注度。

按照梁文锋的表述,DeepSeek 的路线很 " 克制 ":当算力成为硬约束时," 做什么 " 远比 " 不做什么 " 更重要。极致聚焦主线任务,用工程能力弥补硬件代差,追求单位算力的产出效率而非绝对规模。

这在技术路线未收敛前,少即是多。只有砍掉那些 " 看起来很美但偏离核心目标 " 的旁支业务,才能将有限的算力和人才集中在 CoT(思维链)、Agent、持续学习等真正决定 AGI 成败的关键瓶颈上。

比如,DeepSeek-V3 的训练成本远低于 GPT-4o,性能却逼近第一梯队。

MiniMax 和其创始人闫俊杰看到这里,不知会作何感想。他们一开始就将有限的资金、人员等资源押注在文本、视频、语音、音乐四大模态上。如今,MiniMax 的颓势,让不少人为其捏一把汗。

通往 AGI 的第二条路

DeepSeek 的路线,正在被 Kimi K3 验证。

作为月之暗面首款 3 万亿参数级 MoE 模型,K3 总参数规模达到 2.8 万亿。按照常规理解,这个规模的模型,每输出一次,算力都是指数级消耗。但在其独特核心架构的支持下,达到华为在芯片领域提出的 " 韬定律 " 效果。

这个架构也被视为是一架超级引擎,通过落地 KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度 MoE 三项关键技术,完成了一次对 " 模型生产效率 " 的重构。

根据月之暗面此前发布的技术报告,在实验模型上采用 KDA 与 MLA 混合比例,KV 缓存占用最高削减 75%,100 万上下文长度下的解码吞吐量提升至原来的 6 倍。配合注意力残差与高稀疏度 MoE 技术,训练效率提升约 25%,额外成本不到 2%。

这意味着同样一笔算力预算,过去只能跑 1 个任务,K3 能跑 4 个,且质量不打折。

SemiAnalysis 的报告指出,KDA 将推理速度提升 300%,同时在长上下文处理上保持接近 Transformer 的性能。开发者社区的实测也反馈,在长流程 Agent 任务和代码生成方面,K3 已具备与国际头部模型竞争的实力。

从根本上看,K3 依然遵循 Scaling Law,但它把刀挥向了粗糙的算法浪费。当硅谷 AI 企业还在不断囤卡时,Kimi 通过重构算法链路、精简计算冗余,走出了一条 " 每瓦特智能产出比 " 最大化的路径。

也可以说,K3 所采用的 KDA 混合线性注意力机制,正是 AI 领域的 " 韬定律 " 实践。硅谷主流的 Transformer 路线是 " 大力出奇迹 " 的燃油车,KDA 更像是追求 " 热效率极致 " 的混动引擎。

与此同时,企业用户和开发者也开始用脚投票。一部分开发者已经用上 " 模型路由 " 服务,根据不同任务自动选择成本最低、效率最高的 AI 模型,这其中当然包括 Kimi 在内的中国模型。

这个范式让华尔街观察人士和投资者感到意外,他们像惊诧 DeepSeek 一样,再度质疑硅谷数千亿美元投资 AI 是否能得到相应回报、美国 AI 领先优势是否被削弱。

2025 年 1 月,DeepSeek 的横空出世,冲击了硅谷 AI 的算力叙事。它表明,中国 AI 要追上世界领先模型的水平,未必需要投入同等量级的芯片与资金。

随着梁文锋版 AGI 路线图的明确、Kimi K3 的落地,中国 AI 的效率范式轮廓也愈发清晰。

更重要的是,它已经在影响中国 AI 产业链的上下游。比如算力供给侧,它倒逼国产芯片厂商不再盲目对标英伟达的峰值算力,转而优化编译器、互联带宽与系统级能效。

应用落地侧,它让大量原本被高昂推理成本挡在门外的中小企业、垂直行业开发者得以入场,医疗、教育、工业质检等场景的 AI 渗透率因此加速提升。

可以说,DeepSeek、Kimi 所代表的路线正在催生效率革命,也在重塑整个中国 AI 产业的成本结构与价值分配方式。它让外界相信:通向 AGI 的道路,不必都挤在硅谷 AI 的赛道上。

但我们也需要认识到,克制是一种战略,也就要有边界。比如,基础科学研究、超大规模基础预训练等环节,依旧需要持续重金投入,不能盲目套用取舍逻辑。更不能神化 DeepSeek、Kimi 的发展路径,将克制教条化。

在我看来,梁文锋这场长达四小时的交流,除了向投资者宣讲商业蓝图,也向 AI 行业提出了一个重要的问题:奔赴 AGI,我们能不能允许自己慢一点,少追逐一些边缘诱惑?

这在普遍存在 FOMO(错失恐惧症)情绪的当下,Sora 火了做视频、具身智能热了造机器,聚焦一下,也可能是另外一种 " 快 "。

参考资料:

腾讯科技,《4 小时、118 个回答,梁文锋内部交流回应一切》

唐辰同学,《Kimi" 熔断 ",杨植麟 " 摸高 "》

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容