关于ZAKER Skills GEO服务 合作
钛媒体 16分钟前

阿莫迪偷师姚顺雨,奥特曼偷师梁文锋

文 | 字母 AI

正所谓天下文章一大抄,看你会抄不会抄。

刚刚发布的 Opus 5.5 和 GPT-6 Luna,一眼望去,这两个模型上面满满是姚顺雨和梁文锋的影子。

或许是因为两家公司都已经将预训练做到了极致,为了提升模型的智能以及降低算力成本,所以这两个新模型都选择开辟新的战场。

Opus 5.5 是对上下文动手,GPT-6 Luna 是对缓存动手。

这我可熟啊!一个混元,一个 DeepSeek 啊!

但你别说,阿莫迪和奥特曼还真抄得挺像那么回事。

阿莫迪偷师姚顺雨

先看一组数字,Artificial Analysis 的智能指数里,有一项统计是 " 跑完一道题平均要输出多少 token"。

在这张榜单上,Claude Opus 5.5 在 max 档位下,平均每题要吐出 11.9 万个输出 token,其中 8.4 万个是 " 思考 ",3.5 万个是最终答案。而 OpenAI 的 GPT-6 Astra,在同一档位下只用了 2.7 万个 token。

大模型想要提升模型的智能水平,传统路线是在预训练阶段堆数据、堆算力,把智力放进模型的权重里,一次训练、反复使用。

这条路线的模型在推理时几乎不做额外思考。模型训练时数据价值越高,模型的智能水平就越高。

但传统路线就怕出现没见过的题型,传统模型的泛化是插值。在训练数据覆盖的分布附近,它表现很好。一旦碰到没见过的题型,或者需要多步推理的题,它就开始瞎编。因为它的 " 智力 " 全在权重里,权重没见过的模式,它推理时也补不出来。

就像你对着木桩练了很久的拳法,结果发现上了战场以后,对方不会站着不动,而且还会使用武器。

另一条是 test-time 路线。训练完的模型只是个半成品,真正答题时,先让它写一大段推理,想得越久、答得越好。智力不再只来自权重,还来自于每次调用时现场的推理。

换句话说,智力被搬进了上下文。

Opus 5.5 走的就是 test-time 路线。

官方有这么一条声明:除非特别注明,所有成绩都跑在 "adaptive thinking at max effort"(最大力度的自适应思考)下。

而且从这一代开始,Opus 5.5 不再提供 " 关闭 thinking 模式 " 的选项。变相就是在说,推理过程就是模型的一部分。

代价就是思考过程会消耗更多 token,成本也会随任务难度飙升。Opus 5.5 的核心逻辑是,该训练的数据都训练得差不多了,预训练边际收益见顶,因此智能的增量只能从推理里找。

这种从上下文中找智能的逻辑,姚顺雨很早就提出来过。

2023 年,姚顺雨提出 Tree of Thoughts(思维树)这个概念,其本质就是一种 test-time。

推理时展开多条思路,边想边搜索最优解。

同一年,他还提出了 ReAct 架构,让模型 " 推理 " 和 " 行动 " 交替进行。

2025 年 4 月,姚顺雨发表博客《The Second Half》。

文章的核心判断是,AI 的上半场,拼的是 " 训练方法与模型 ",比如更大的参数、更多的数据、更强的算力。到了下半场,拼的是 " 如何使用与评估模型 ",增量正在从 " 训练 " 挪到 " 推理与行动 "。

他在文中写到," 把推理放进动作空间之后,我们才获得了‘针对不同决策灵活分配 test-time compute(推理时算力)’ " 的能力。

姚顺雨把 " 思考 " 称作一种 " 奇怪的动作 "。

RL 里的动作是用来改变环境的,比如打开一个箱子,那么箱子的状态就会发生改变。动作的意义,就在于 " 让世界发生变化,从而换来奖励 "。

但思考不会,即使想了一万遍,箱子也不会自己打开。

姚顺雨在文章中举了个例子,说有两个盒子,一个有 100 万美元、一个空的,这时候,期望收益就是 50 万。

现在往里塞进无数个空盒子,期望收益就会越来越低,因为要从无穷多个盒子里挑那个 100 万美元的盒子。

然而,如果把 " 推理 " 这个动作加进去之后,模型反而更强了,会更容易选中那个 100 万美元的盒子。

姚顺雨的解释是,那些 " 空盒子 ",你在生活里以及各种游戏里都见过。挑选它们的过程本身,就是在为 " 选中那个装钱的盒子 " 做准备。

Opus 5.5,就是把姚顺雨的这个理念给工程实现了。

奥特曼偷师梁文锋

如果说 Opus 5.5 的重点是 " 怎么想 ",那 GPT-6 Luna 的重点就是 " 怎么便宜地想 "。

GPT-6 Luna 输入 0.1 美元 / 百万 token、输出 0.5 美元 / 百万 token,比上一代 GPT-5.6 Luna 直接砍半。

如果缓存命中,那么读一次缓存的价格是 0.01 美元 / 百万 token,比标准输入价便宜 90%。

模型的每一次调用,都要把你给它的全部上下文 " 读一遍 "。比如系统提示、长文档、历史对话,一个字都不能少。

但是这段上下文,重复度极高。Agent 每多走一步,前面那一大坨都要重读一遍。长上下文,就成了烧钱的黑洞。

GPT-6 Luna 使用的缓存复用(prompt caching/KV cache 复用),它所要解决的就是这件事。同一段上下文,算过一次就存起来,下次直接 " 读缓存 "、不重算。于是 " 重复的那部分 ",从最贵变成了最便宜。

但这套动作,DeepSeek 早就做过了。

2026 年 8 月 2 日,DeepSeek 上线 "Context Caching on Disk"(磁盘上下文缓存),把重复内容缓存在磁盘阵列上,命中时直接取用、跳过重算。

当时公告写着,缓存命中价砍到 0.1 元 / 百万 token,比未命中便宜正好也是 90%,和 GPT-6 Luna 一样。

到了 V4 Flash 这里,命中 0.02 元、未命中 1 元,差 50 倍。

GPU 显存非常贵,所以能存的 KV cache 容量有限。但是硬盘很便宜,并且容量大,将 KV cache 存进去以后成本会大大降低。

OpenAI 现在做的 prompt caching 和 DeepSeek 原理几乎相同,同一段前缀算过一次存起来,下次直接读。

不止价格,还有架构。

GPT-6 Luna 的上下文窗口是 105 万 token,DeepSeek V4 是 100 万 token,两边几乎对齐。

但是,100 万上下文的 KV cache,按标准注意力机制来算,一半的模型根本扛不住。

为此,DeepSeek 使用了 MLA 架构,把 Key 和 Value 联合压缩进一个低维潜空间,缓存那个潜向量、用时再上采样还原。

DeepSeek-V2 的技术报告里提到,MLA 把 KV cache 砍掉了 93.3%,生成吞吐提升到 5.76 倍。到了 V4,又叠上压缩稀疏注意力和重度压缩注意力,V4-Pro 在百万 token 上下文下,KV cache 只有上一代 V3.2 的 10%。

除此以外,OpenAI 还 " 偷师 " 了一招:推测解码。

OpenAI 在官方博客里说,他们跑一个更小的 draft(草稿)模型,让它和主模型并行地 " 猜 " 接下来几个 token,主模型再批量验收。

猜对了,一次前向就能吐好几个 token。OpenAI 官方表示,这一项改进让 token 生成效率提升了 15% 以上。

这个思路在 2024 年的 DeepSeek V3 里就有了,DeepSeek 使用的是 MTP(Multi-Token Prediction,多 token 预测)。

其做法是在主干模型后面直接挂一个 MTP 头,训练时和主干一起训,共享主干的 hidden state。推理时这个头知道主模型内部状态长什么样,猜得准、验收通过率高。

这个头可以直接丢掉不影响主干,也可以留着当草稿机。

OpenAI 相当于是外挂了一个独立的小模型去打草稿。两个模型各跑各的,草稿不知道主模型在想什么,只是猜完由主模型验收。

虽然方法不太一样,但是两者的思想是同一个。小的先猜、大的批量验,把串行解码变并行。

天下文章一大抄

以前,定义模型的是硅谷,国内 AI 公司因为算力有限,所以会把这些定义转换成更便宜的解决办法。

这一轮,反过来了。学术范式和工程范式,都是中国公司做的。

美国的巨头们则负责最后一步,把它做成产品,卖给全世界。

过去几年,大厂的资源、人才、注意力全部 all in 在预训练这个主战场上。

大家根据 Scaling Law 来堆数据、堆算力、刷榜单。可头部公司都陷入了前文提到的,Anthropic 如今的窘境,优质数据几乎全部训练完成,模型预训练边际收益递减。

那么这时,行业的增量自然而然就会出现在第二战场,比如推理时怎么想(test-time compute)、上下文怎么用(context learning)、长上下文怎么便宜(caching/MLA/ 稀疏注意力)。

这就好比武林里,大门派花了几十年练一门功夫。练着练着就发现,武功练到一定程度就不涨了,反而以前那些不起眼的 " 旁门左道 " 更能提高功力。

这里还有个反直觉的地方,主战场上的优势,到了第二战场,反而成了 " 累赘 "。

手里攥着最多算力和数据的一方,恰恰最没动力去抠成本、抠效率。头部公司已经形成了 " 反正我堆卡就能解决问题,何必费劲去想更聪明的办法?" 的想法。这就导致省显存、省钱这件事,从一开始就不是他们的议题,甚至有点 " 掉价 "。

只有算力吃紧的一方,才会把每一分钱都花在刀刃上。

DeepSeek 的 MLA、磁盘缓存、稀疏注意力,本质上都是 " 穷则思变 "。

当年它们只是 " 没钱的替代方案 ",是没办法的办法。可真到全行业开始拼效率的时候,这些 " 土办法 " 忽然成了最硬的通货。

于是才会出现国外 " 偷师 " 国内的现状。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容