文 | 明晰野望
美股 AI 交易近日再度遭遇 "DeepSeek 时刻 "。
7 月 17 日凌晨,月之暗面发布新一代旗舰模型—— Kimi K3。这个 2.8 万亿参数的开源模型,在 Artificial Analysis 智能指数上得分 57,综合水平直逼国际两座大山,位列全球第三,仅排在 Claude Fable 5 和 GPT-5.6 Sol 之后。
技术能力上追平全球前三,成本上做到对手一半,路线上用开源挑战闭源—— K3 发布后首个交易日,美股半导体板块出现明显下跌,英伟达单日蒸发 1111 亿美元。
K3 不是最强的模型,但它是最强性价比的模型。它引发的震荡,在于迫使市场系统性重估 AI 产业链的价值分配。

一边是中国模型让美股 AI 板块再次剧烈重估,一边是美国头部厂商集体放弃 " 最强智能 " 的神话叙事。过去两年支撑整个 AI 行业估值和话语权的 " 最强模型 " 崇拜,正在被打破——不是被某一家颠覆,而是 " 差距 " 本身被消解了。
大模型的竞争维度,正在从模型参数转向效率闭环。
模型差距在收敛
过去三年,大模型行业赖以生存的商业底层逻辑是 " 赢家通吃、代差压制 ",在绝大多数投资人和创业者的认知里,只要 OpenAI 或 Anthropic 能保持一年以上的智能水平代差,那么任何后发者的追赶都会沦为低水平的重复劳动。
然而到了 2026 年夏天,这场围绕 " 代差 " 筑起的护城河正在被多路大军以不同方式无情填平。
一直以来,万亿级参数大模型被视为效果的唯一保证,但模型通过架构优化和长上下文注意力机制的改良,正在彻底打破 " 体型决定智商 " 的迷思。
根据 OpenAI 官方披露的数据,GPT-5.6 的中档模型 Terra、综合能力已经微幅超越了上一代的全球标杆;而处于最底层的轻量级模型 Luna,在多个复杂推理与编码测试中甚至反超了曾经的 Claude Opus 4.8。
换句话说,OpenAI 今天仅用原本四分之一左右的推理成本,就复现了半年前行业顶级顶配才有的智力产出,旗舰模型 " 降维打击 " 的震慑力,正在其内部子系列的分化中逐渐消解。
与此同时,开源梯队集体跟上闭源模型的现实,也证明了大模型之间的代差正不断收敛。
在代码能力测评严苛的 SWE-bench Verified 榜单上,曾经的高端闭源顶配 Claude Opus 4.8 得分约为 88.6%,采用 MIT 协议开源、且允许完全本地自部署的 DeepSeek V4 Pro,在该榜单上的得分则为 80.6%,今年四月份亮相并开源的 Kimi K2.6,也同样将成绩保持在了 80.2% 的第一梯队水准。
在 7 月 17 日公布的 Artificial Analysis 独立测试中,Kimi K3 以 57 分登上综合智能指数全球第三,超过 Claude Opus 4.8;在衡量长周期知识工作的 AA-Briefcase 中位列第二,仅次于 Claude Fable 5。另一边,K3 还以 1677 分登顶 Arena 前端开发榜,压过一众海外闭源模型。

当一个新版本的发布只需要几个月时间就能完成对上一代顶尖模型的超越," 谁最强 " 这个命题的含金量也不可避免地走向贬值。
差距收敛也在改写市场对大厂的定价。过去两年,A 股和港股的头部互联网公司普遍被贴上 " 模型能力落后 " 的标签——这个标签一度是拖累估值的重要因素之一。但随着模型能力的差距被压平、追赶所需的时间被缩短," 大厂能不能跟上 " 这件事的赔率,正在被重新评估。
价格战取代神话叙事
当 " 最强模型 " 这个词不再能撑起议价能力,价格就成了下一个战场。而这一轮价格战和过去两年那种 " 清库存式打折 " 完全不是一回事——它不是把旧模型甩卖,而是把新旗舰的定价直接向下重构。
最直白的信号来自 OpenAI。GPT-5.6 一次性被拆成 Sol、Terra、Luna 三档:最强的 Sol 每百万 Token 输入 5 美元、输出 30 美元;中档的 Terra 对半砍到 2.5/15 美元;最低的 Luna 下探到 1/6 美元。
同一款旗舰内部就出现了六倍的价差——这本身就是一次立场转变:厂商开始承认," 最强 " 并不是每个用户都愿意为之买单的东西。
跟进者立刻出现,同一天,xAI 的 Grok 4.5 把输入价压到 2 美元,Meta 则把 Muse Spark 1.1 的 API 首度对外开放,直接定到 1.25/4.25 美元——头部厂商第一次不再享有价格的品牌溢价。
战火延伸至国内。7 月 16 日,DeepSeek-V4 正式版上线,首次引入峰谷分时计费,打破了大模型 API" 统一单价 " 的行业惯例。API 定价第一次按 " 使用时段 " 而不是 " 能力档位 " 分层,供需匹配开始取代技术溢价,成为新的定价逻辑。
大模型从 " 稀缺技术产品 " 往 " 水电煤式基础设施 " 的方向又滑了一步。

腾讯 Hy3 把缓存命中价打到基础输入价的四分之一;月之暗面开源的 Mooncake 分离式推理架构声称能在长代码任务里把命中率维持在 90% 以上——那些动辄几十万字的项目背景,理论上只需要付一次钱。
而 Kimi K3 首创并开源的 Mooncake 分离式推理架构,则能在处理高密度的编程任务和长代码仓库时,将真实缓存命中率维持在超 90% 的区间,意味着那些动辄几十万字的项目背景、数十个历史版本迭代的中间过程,并不需要每次都去付费重新读取。

竞争要件变了
价格和成本迅速下降、模型分数差异持续缩小,既然大家都能把题的分数刷得这么接近,在下半场的终局里,什么才是不可复制、绝对稀缺的核心壁垒?
高价值的 " 真实工作流数据 " 算一个。
在美国市场,OpenAI 正把自己的产品不断做 " 重 ",他们不满足于仅让 ChatGPT 当一个 " 小秘书 ",而是把庞大的编程平台 Codex 直接并入了 "ChatGPT Work" 生态中,开辟出了企业级高阶 Agent 的专属战场。
要知道,Codex 每周活跃调用人数超 500 万,而在这之中有超过 100 万个复杂请求,被用于用户写代码之外的专业文档撰写、繁琐数据排查以及公司项目协作。千万企业最隐秘、最复杂的工作链路流转,就这样被完全截留在了 OpenAI 的密闭体系之内。

Anthropic 旗下的 Claude Code 不仅把代码编译反馈、系统终端交互通通包装进自己的闭环管道,还通过与 LTM 等咨询公司合作把业务推进金融、制造等垂直领域,进一步拓宽从代码到业务流程的覆盖范围。
企业选择与市场反馈证明了,在真实业务中的任务定义能力远比刷分更重要。模型基座只是原料,真正稀缺的不是场景本身,而是把真实反馈工程化、并回流进模型利用的闭环能力。

第一条路径的精髓在于通过宽广的产品入口矩阵,押注场景广度与反馈频率密度,它能让底层大模型经历多角度的任务抗压测试,以火力覆盖的方式完成自我迭代。
谷歌把 Gemini 横向铺进搜索、浏览器、workspace 和 YouTube,让同一套模型能力在数十亿量级的日活入口里被反复调用、反复回收信号。国内有此优势的是拥有 14 亿超级入口的腾讯,并且不只是微信,是把 AI 能力嵌进社交、内容、支付等场景以及新推出的 WorkBuddy 工作流工具,用 C 端与 B 端协同两条腿同时接触真实任务。
两家产品形态不同,赌的是同一件事:入口足够多、频次足够高,模型的每一次能力代际更新都能被立刻转化为用户行为反馈。

Cursor 凭什么可以每天生成 1.5 亿行企业代码、让马斯克在内的科技大佬眼红心热?就因为它做深做透了 " 编程 " 这件事,不仅代码生成速度不断提升、支持 20 多种编程语言,甚至能自动纠错和重构项目,准确率超过 95%。
两套路径虽在体量上存在鲜明的差距,但与竞争优势却没有必然联系,相较于生态丰富度,更重要是谁能把 " 任务 - 反馈 - 模型 - 再任务 " 的流程跑通。
产品提供高质量的任务反馈链条,让模型在垂直专业度上完成大跃升;能力的跃升降低了任务耗时和人工干预,又反过来吸引高价值商业用户带着更珍贵的数据涌入,高效可循环的闭环就这样达成。
7 月以来,阿里巴巴、腾讯股价回暖,这类生态型公司 AI+ 云业绩加速兑现,为新资金流入提供了信心。而智谱、MiniMax 等大模型公司股价冲高回落大幅震荡,也从侧面说明,大模型企业单纯的参数护城河正在日益变窄。
资本对 AI 的定价逻辑开始从 " 看谁资本开支大、算力囤得多 ",转向 " 看谁能把算力真正转化成收入和利润 "。
这也并不意味着硬件和算力基础设施被抛弃,而是它们开始被市场严苛地要求给出切实的回报;软件与应用层也并非凭空全面胜出,而是因为它们直接触达客户、离真实业务的 " 收入与现金流 " 更近,因而被资本重新估值。
从价格内卷到回归真实工作流,相较于无限烧钱、贩卖参数故事的上半场,与亿万用户息息相关的真实应用与商业闭环,或许才是新一轮 AI 浪潮的最终指向。