关于ZAKER Skills GEO服务 合作
差评 45分钟前

说好的放慢 AI 脚步,怎么一转眼又开始神仙打架了?

报!整个美西北已经打成一锅粥了。

23 号凌晨,先是 Anthropic 甩出了 Claude Opus 5.5,强势登顶 AA 智力榜。

俩小时后,OpenAI 立马对掏 GPT-6 Sol 和 GPT-6 Luna,还以颜色。

世超也是赶紧上手测了一通,然后就发现,说 Opus 5.5 劲儿大没毛病,但 GPT-6 Sol 就差很多意思了,好在 GPT-6 Luna 发挥稳定,靠一手性价比才扳回点局势。

先看跑分,按理说,如果 Astra 对标的是 Fable/Mythos,那 Sol 怎么也应该跟 Opus 旗鼓相当才对。

但 AA 榜上,Claude Opus 5.5 几乎是一骑绝尘,比自家大哥 Fable 5.1 还高了 5 分。

反观 GPT-6 Sol 以及 Luna,基本就是跟上一代的打平而已,位置没咋动,可能就是 Astra 很常规的一次能力下放。

这不怕不识货,就怕货比货啊,就算 AA 榜单可能有水分,这差距看上去还是太大了。

这点在网友的测试中也很明显。

不说别的,虽然三个模型几乎是一起发的,但网上的案例大都是用 Claude Opus 5 跑的,顶多跟 GPT-6 Astra 或者 Sol 对比一下,至于 Luna,基本没声音。

其中比较多的是这种动画小短片,建模精细,动效也很自然,看着非常丝滑,尤其是转场节奏和纹理的质感,让人很难相信这玩意儿是纯代码搓出来的。

还有这个被 Three.js 官方转载的,可交互式的 3D 镜头拆解。

光线从树林景象那头一路穿过好几层镜片,打在成像板上。调整焦距光圈,还有对应的光路和成像变化,对物理的解析力和表现力都拉满了。

那跟 GPT 那边对比一下如何呢?

来看这个赛车游戏,Opus 5.5 无论是模型细节还是场景渲染,质感都要更高一筹,而且还有漂移和道具时刻的镜头特写,Sol 那边就有点捉襟见肘了,连 UI 都还是那种 AI Slop 的味道。

好家伙,敢情前些天说好的世纪大和解,一起放慢 AI 的发展节奏,到头来竟是 A/ 的缓兵之计?

诶,倒也未必,这事儿可能还有一丝丝反转的余地。

因为说实话,大伙儿测模型的时候一般是氪度拉满使劲蹬的,但真到了现实工作场景,这性价比的账还是得好好算算的。

AA 榜上也正好算了这么一笔,画风就跟刚才不一样了。

GPT-6 Luna 的价格以 0.07 刀强势触底,GPT-6 Sol 则是 1 刀;而我们尊贵的 Claude Opus 5.5 大人直接干到了 5.98 刀。

这种差距可不是光单价能拉开的,看 Token 消耗就能发现,Claude Opus 5.5 做任务相当吃 token,基本是 GPT-6 Sol 的 3 倍,Luna 的 2 倍。

不过这也符合现在模型的趋势,就是次旗舰虽然跑分看起来跟旗舰相当,但干活儿的时候很容易雷霆大思考,烧出更多 token。

那真实情况如何呢?

我们也跑了几个 One-Shot 的一句话任务,发现体感上 Sol 略拉,Luna 基本吻合,而 Opus 5.5 则大有惊喜。

比如让他们仨做一个动画,回顾爱因斯坦的一生,禁止用第三方工具,纯代码硬搓。

GPT-6 Luna 的效果有点像 PPT,就是幻灯片那种样式,非常模板化,左边是字,右边是图,切场景的效果甚至还是经典的渐入渐出。

画面绘制的没啥问题,配色也很讨喜,不过就是确实很难称之为动画。但考虑到这玩意儿全程就烧了 2% 的 5 小时 Plus 额度,也不好多做苛责。

再来看 GPT-6 Sol 的直出效果,呃,这就多少有失水准了,关键还消耗了比 Luna 多好几倍的额度。。。

仍然是那套 PPT 的思路做的,而且分镜,配色,动效跟 Luna 基本没差,米黄色的底子点缀一些来回晃荡的小组件。像是同一锅蒸出来的效果,调味儿一样的平平无奇。

不过翻看思维链,能发现点 GPT-6 Sol 的小巧思。

它会更在意工程的完成度,网页端搓完了,还要去手机端瞅瞅效果,额外适配一下,态度这一块儿很到位嗷。

而到了 Claude Opus 5.5 这儿,就完全不是一个画风了。

没有了突兀的左右分区,整个画面都围绕故事主线来设计,让人感叹,这特喵的才是动画啊。

我们的提示词里说的 " 剪纸拼贴 " 风格,它也真的搞出来了。仔细看钟表,星球和爱因斯坦这些组件,边上有小毛刺,背部打上了阴影,看着就有剪纸拼贴的立体感了。

而且动效也丰富得多,它能精准的为组件构造出合适的动画,小提琴能拉,水流和船能配合着浮动,就算是时空弯曲,也给你搞个引力井动画出来,解析力确实强,让人怀疑是不是专项特训了。。。

对了,整个动画做完,其实也就消耗了 30% 的 5 小时额度,反而没出现那种雷霆大思考,跟 AA 的评测略有出入。

接下来加大难度,让他们仨开发个网页小游戏,Minecraft 结合漫威蜘蛛侠的玩法,看看他们会怎么融合二者。

GPT-6 Luna 仍然首发,耗时 12 分半,烧了 2% 的 5 小时额度就搓出来了,不愧是价格干到 Astra 百分之一的模型,就是耐用。。。

但质量么,也是一言难尽,虽然蜘蛛侠样子不赖,但整个城市的材质基本跟 Minecraft 没啥关系,更像是工业白模的风格。

尤其是两种玩法出现了机制上的冲突,光标被锁定在人物中心,没法拖出去。

我只好又花 3% 的额度去修了几轮 bug,修复完成后才算勉强能玩儿。

然后你就会看到透明的蛛丝,纯色填充的方块和凿不动的地底,金门大桥的建模也是相当简陋。只能说快是真的快,草率也是真的草率。。。

再来看 GPT-6 Sol 呢?

很遗憾,说它跟 Luna 是一个屉子蒸出来的真不冤,犯的毛病都一模一样。

约束不强的话,它还是偏爱这种风格的方块,而且左右方向的映射又反了,

不过 Sol 修 Bug 的效率还是比 Luna 高太多,基本一轮过去就能知道你要的是什么,但就是这个交付质量还是难崩啊。

相比之下,Claude Opus 5.5 搓出来的游戏就有点鹤立鸡群了。

开始菜单旁边放的是游戏的实时运行画面,一手环绕运镜,逼格拉满。

方块本身的材质,维持了 Minecraft 的样式,建筑的完成度也很高,基本是照着旧金山的景点搓的。

街道里还放了几辆车在跑,配合云雾缭绕的效果,氛围质感就上来了。

尤其是整个作品是一次性搓出来的,大概消耗了一个 5 小时的额度,除此之外,并没有来回 Debug,用起来相当丝滑。

所以从这些测试也能看出来,虽然 Claude Opus 5.5 看似跟 GPT-6 Sol 同代,但意图理解和执行效率明显都要高一档。而且额度开销也没想象中那么大,相比自家的 Fable 和隔壁 GPT-6 Astra,能更放心的多蹬几下。

而 GPT-6 Luna 作为执行模型,干点脏活累活也没毛病,毕竟性价比这块儿香的批爆。

至于 GPT-6 Sol,就略显乏力了,前端这块儿确实打不过 Claude Opus 5.5,只能看后续有没有别的路子能榨一榨它的潜力了。

不过话说回来,现在模型越来越多以后,追求一个模型大包大揽也没啥必要。

真实场景下,大伙儿还是组合着用居多,聪明的贵的去设定计划,便宜管饱的再拿来执行,怎么有性价比怎么来。

关于这件事,模型厂商显然也琢磨明白了,一方面像手机厂造手机一样,把不同价位段都给铺满,小中大杯甚至超大杯都有;另一方面,优惠大促的营销手段也开始搞起来。

这不,看着 Tibo 老哥猛发重置卡拉月活,Anthropic 也有样学样,模型发布的同时就给大伙儿安排上重置卡了。

只能说卷的好啊,毕竟大伙儿还是以订阅消费为主,所以比起什么 token 价格,倒不如多发几张重置卡来的实惠。

说起来,这次发布 Claude Opus 5.5 的时候,Anthropic 还引用了个社区作者的视频,讲的是一个蚂蚁种西瓜的故事,每次西瓜吃完,就会留下种子再种下一轮。

眼下 RSI 自进化的概念正搞得火热,这很难让人不浮想联翩啊,莫非这一代的 Claude,正在种出下一代?

不过是不是彩蛋也不重要了,反正模型进化的脚步看着是没咋放缓的,OpenAI 和 Anthropic 也还是那对老冤家,你追我赶,谁也不想让谁消停。

只是打到这儿,突然又想起还有位老朋友 Gemini。

身为远古御三家,隔壁都打成这样了,你就不打算支棱一下?

撰文:风华

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容