报!整个美西北已经打成一锅粥了。
23 号凌晨,先是 Anthropic 甩出了 Claude Opus 5.5,强势登顶 AA 智力榜。
俩小时后,OpenAI 立马对掏 GPT-6 Sol 和 GPT-6 Luna,还以颜色。
世超也是赶紧上手测了一通,然后就发现,说 Opus 5.5 劲儿大没毛病,但 GPT-6 Sol 就差很多意思了,好在 GPT-6 Luna 发挥稳定,靠一手性价比才扳回点局势。

但 AA 榜上,Claude Opus 5.5 几乎是一骑绝尘,比自家大哥 Fable 5.1 还高了 5 分。
反观 GPT-6 Sol 以及 Luna,基本就是跟上一代的打平而已,位置没咋动,可能就是 Astra 很常规的一次能力下放。

这点在网友的测试中也很明显。
不说别的,虽然三个模型几乎是一起发的,但网上的案例大都是用 Claude Opus 5 跑的,顶多跟 GPT-6 Astra 或者 Sol 对比一下,至于 Luna,基本没声音。
其中比较多的是这种动画小短片,建模精细,动效也很自然,看着非常丝滑,尤其是转场节奏和纹理的质感,让人很难相信这玩意儿是纯代码搓出来的。
还有这个被 Three.js 官方转载的,可交互式的 3D 镜头拆解。
光线从树林景象那头一路穿过好几层镜片,打在成像板上。调整焦距光圈,还有对应的光路和成像变化,对物理的解析力和表现力都拉满了。
那跟 GPT 那边对比一下如何呢?
来看这个赛车游戏,Opus 5.5 无论是模型细节还是场景渲染,质感都要更高一筹,而且还有漂移和道具时刻的镜头特写,Sol 那边就有点捉襟见肘了,连 UI 都还是那种 AI Slop 的味道。
好家伙,敢情前些天说好的世纪大和解,一起放慢 AI 的发展节奏,到头来竟是 A/ 的缓兵之计?

因为说实话,大伙儿测模型的时候一般是氪度拉满使劲蹬的,但真到了现实工作场景,这性价比的账还是得好好算算的。
AA 榜上也正好算了这么一笔,画风就跟刚才不一样了。
GPT-6 Luna 的价格以 0.07 刀强势触底,GPT-6 Sol 则是 1 刀;而我们尊贵的 Claude Opus 5.5 大人直接干到了 5.98 刀。

不过这也符合现在模型的趋势,就是次旗舰虽然跑分看起来跟旗舰相当,但干活儿的时候很容易雷霆大思考,烧出更多 token。

我们也跑了几个 One-Shot 的一句话任务,发现体感上 Sol 略拉,Luna 基本吻合,而 Opus 5.5 则大有惊喜。
比如让他们仨做一个动画,回顾爱因斯坦的一生,禁止用第三方工具,纯代码硬搓。
GPT-6 Luna 的效果有点像 PPT,就是幻灯片那种样式,非常模板化,左边是字,右边是图,切场景的效果甚至还是经典的渐入渐出。
画面绘制的没啥问题,配色也很讨喜,不过就是确实很难称之为动画。但考虑到这玩意儿全程就烧了 2% 的 5 小时 Plus 额度,也不好多做苛责。
再来看 GPT-6 Sol 的直出效果,呃,这就多少有失水准了,关键还消耗了比 Luna 多好几倍的额度。。。
仍然是那套 PPT 的思路做的,而且分镜,配色,动效跟 Luna 基本没差,米黄色的底子点缀一些来回晃荡的小组件。像是同一锅蒸出来的效果,调味儿一样的平平无奇。
不过翻看思维链,能发现点 GPT-6 Sol 的小巧思。
它会更在意工程的完成度,网页端搓完了,还要去手机端瞅瞅效果,额外适配一下,态度这一块儿很到位嗷。

没有了突兀的左右分区,整个画面都围绕故事主线来设计,让人感叹,这特喵的才是动画啊。
我们的提示词里说的 " 剪纸拼贴 " 风格,它也真的搞出来了。仔细看钟表,星球和爱因斯坦这些组件,边上有小毛刺,背部打上了阴影,看着就有剪纸拼贴的立体感了。
而且动效也丰富得多,它能精准的为组件构造出合适的动画,小提琴能拉,水流和船能配合着浮动,就算是时空弯曲,也给你搞个引力井动画出来,解析力确实强,让人怀疑是不是专项特训了。。。
对了,整个动画做完,其实也就消耗了 30% 的 5 小时额度,反而没出现那种雷霆大思考,跟 AA 的评测略有出入。

GPT-6 Luna 仍然首发,耗时 12 分半,烧了 2% 的 5 小时额度就搓出来了,不愧是价格干到 Astra 百分之一的模型,就是耐用。。。
但质量么,也是一言难尽,虽然蜘蛛侠样子不赖,但整个城市的材质基本跟 Minecraft 没啥关系,更像是工业白模的风格。

我只好又花 3% 的额度去修了几轮 bug,修复完成后才算勉强能玩儿。

再来看 GPT-6 Sol 呢?
很遗憾,说它跟 Luna 是一个屉子蒸出来的真不冤,犯的毛病都一模一样。
约束不强的话,它还是偏爱这种风格的方块,而且左右方向的映射又反了,

相比之下,Claude Opus 5.5 搓出来的游戏就有点鹤立鸡群了。
开始菜单旁边放的是游戏的实时运行画面,一手环绕运镜,逼格拉满。

街道里还放了几辆车在跑,配合云雾缭绕的效果,氛围质感就上来了。
尤其是整个作品是一次性搓出来的,大概消耗了一个 5 小时的额度,除此之外,并没有来回 Debug,用起来相当丝滑。
所以从这些测试也能看出来,虽然 Claude Opus 5.5 看似跟 GPT-6 Sol 同代,但意图理解和执行效率明显都要高一档。而且额度开销也没想象中那么大,相比自家的 Fable 和隔壁 GPT-6 Astra,能更放心的多蹬几下。
而 GPT-6 Luna 作为执行模型,干点脏活累活也没毛病,毕竟性价比这块儿香的批爆。
至于 GPT-6 Sol,就略显乏力了,前端这块儿确实打不过 Claude Opus 5.5,只能看后续有没有别的路子能榨一榨它的潜力了。

真实场景下,大伙儿还是组合着用居多,聪明的贵的去设定计划,便宜管饱的再拿来执行,怎么有性价比怎么来。
关于这件事,模型厂商显然也琢磨明白了,一方面像手机厂造手机一样,把不同价位段都给铺满,小中大杯甚至超大杯都有;另一方面,优惠大促的营销手段也开始搞起来。
这不,看着 Tibo 老哥猛发重置卡拉月活,Anthropic 也有样学样,模型发布的同时就给大伙儿安排上重置卡了。


眼下 RSI 自进化的概念正搞得火热,这很难让人不浮想联翩啊,莫非这一代的 Claude,正在种出下一代?

只是打到这儿,突然又想起还有位老朋友 Gemini。
身为远古御三家,隔壁都打成这样了,你就不打算支棱一下?
撰文:风华
