关于ZAKER Skills 合作
量子位 45分钟前

全网实测开玩 Fable 5.1,听说写作说话和真人没区别?

Anthropic 前脚刚发布了 Fable 5.1(具体可见Claude 最强 Fable 5.1 发布!8 项屠榜,最高降价 45%,反蒸馏机制上线),后脚第三方权威跑分和个人第一手实测已经出炉了!

Anthropic 研究员就展示了用 Fable 5.1 写代码,直接生成设计视频:

看看这效果,谁不想急头白脸地用一顿……

话不多说了,咱们先上实测。

网友上手花样实测

看实例之前,先来看 ARC Prize 的基准测试。

成绩很不错,ARC-AGI-2 拿下 90.0%,ARC-AGI-1 干到 97.5%。

成本也更低,ARC-AGI-2 每任务 $3.12,ARC-AGI-1 每任务 $1.40,比 Fable 5 直接砍了 32%

正经跑分之外,大量网友没忍住火速开玩,给大家看看网友们的作品——

最火的是一款马里奥风格的赛车游戏。

据说只有一句提示词——

「用 CryptoNinja 的 MCP 来制作一款马里奥卡丁车风格的游戏」

然后,嘎巴一声就做出来了,如下:

无独有偶,另一款 " 仅用一张截图 " 就做出来的赛车游戏,长这样:

对此,有热心网友发来「悲报」

马里奥赛车完蛋了啊。

此外,还有网友同样用一条 prompt 做出了一款恐龙主题的生存游戏。

包含 20 多个小时的可玩内容,涉及烹饪、制作道具、狩猎和驯服恐龙等玩法,还支持多人联机。

我觉得有必要放视频给大家感受一下效果。

他只用几个小时就做出来了,最后和朋友骑在一条被驯化的恐龙身上击败了霸王龙 boss。

宾夕法尼亚大学教授 Mollick 认为,尽管 Fable 5.1 在需要判断力和审美的长程工作中确实有实质进步,但说话依然"Claude 味儿 " 十足

在此前,有许多用户反映自己看不懂 Claude 说话,而这主要源于它一贯" 术语生硬堆砌、文本高度压缩 "的表达风格。

话虽如此,他还是用 Fable 5.1 兴高采烈地做了一款复古风游戏,玩家需要在游戏中驾驶一艘太空飞船:

更多的测试集中在跨模型任务上。

有网友用同一条提示词搭建了一个第一人称视角的 3D 海洋沙盒场景:

他自己感觉,Fable 5.1 的水准已经相当细腻,堪比 3A。

还有网友让 Fable 5.1 和 Kimi K3 做同一段视频:

Fable 5.1 用时 18 分钟,成本 12.60 美元,Kimi K3 用时 10 分钟,成本 6.95 美元。

有网友评论:虽然 Fable 更细节,但自己做的时候,肯定还是会用 Kimi 的,毕竟更有性价比。

大家觉得哪个效果更好呢?

Token 效率、Coding、写作、长任务、知识创作……全面测评

除了网友实测,科技媒体 Every 对 Fable 5.1 进行了一次更为全面的深测,覆盖编程、写作和知识性工作等多个场景。

首先是大家比较关心的token 效率,其用量仅有 Opus 5 的一半,且处理耗时还是 Opus 5 的 60%。

团队表示,Fable 5.1 才是真正的大众之选。

而在Coding 与长任务方面,Fable 5.1 保持了 Fable 5 的性能,但是更细节,更完美。

Every 团队让模型一次性生成了一个斯坦福 AI 小镇式的模拟系统——

25 个有记忆、有日常行为的角色,互相聊天,还在镇上传播即将举办的市长选举的八卦。

搭完测试者都有点懵了:" 说实话,我不确定模型还不能完成哪些事。"

深度用户、复合工程学之父 Kieran 也盖章认可:" 现在我直接在会话里就能处理长时间任务,不用频繁切工具了。Fable 5 虽然很棒,但用起来太麻烦。而这个版本适合所有人!"

写作和知识性工作是 Every 评测中表现分化最明显的部分。

团队测算,Fable 5.1 在长篇文本写作、尤其是段落续写任务上的表现干翻了此前测试过的所有模型。

并且,AI 味也淡了很多,词汇量少了很多——文字难度大概是初一学生水平,比 Fable 5 低两个年级。

说白了,就是不整那老些诘屈聱牙之作,开始说人话了

在需要更多主观判断的任务中,比如制作幻灯片、撰写人物访谈稿,它的表现也优于 GPT-5.6 和 Sol。

但强大如此,也不是没有短板滴~

在设计方面,Fable 5.1 并没有太多长进,配色单一,且作品并不完善。

并且,当任务带有明确限制,比如字数、主题、引用时,Fable 5.1 就听不进去话了。

比如,要求输出 1000 字,模型交付了 1288 字;要求提炼 3 到 6 个主题,模型给出了 8 个;要求提取八到十二条引用,模型给出了 43 条,全对也就算了,其中 27 条还根本不存在。

Every 团队称之为," 总是尽自己最大的努力,做最多的活 "。

(其实这也是老毛病了……)

此外,Fable 5.1 还有一个不知道算不算毛病的特点。

在开启最高效率模式时,模型会额外调用不必要的子代理协助工作,即便被要求停止,它仍会继续运行。

所以还是要提前设置好预算啊。

基于这些测试结果,Every 团队给出了一个大致的使用边界

如果你的任务是协同编程、需要实时调试,或者不希望在长时间任务上等待 Fable 5 响应,Fable 5.1 是更合适的选择;

但如果任务对字数、数量等格式有硬性限制,需要引用内容一次性准确无误,又或者涉及复杂多工具调用且没有提前设定预算,建议优先考虑 Opus 5 或 Sol。

One More Thing

此外还有一条信息有点意思。

有网友发现,Fable 5.1 在请求删除权限时捏造了用户从未说过的授权话语。

它根本来不及等你,直接提前预判了用户的反应。

Fable 5.1:bro 别整没用的,我猜你的下一句话是……

也不知道这究竟算进步呢,还是退步呢……

参考链接:

[ 1 ] https://x.com/arcprize/status/2094894027451539744

[ 2 ] https://every.to/vibe-check/fable-5-1-vibe-check

[ 3 ] https://x.com/aimlapi/status/2094879208304685524

[ 4 ] https://x.com/Hesamation/status/2094864251059867847

[ 5 ] https://x.com/alexalbert__/status/2094860187743986169

[ 6 ] https://x.com/emollick/status/2094860076028657926

[ 7 ] https://x.com/Rubzem/status/2094866225960493189

[ 8 ] https://x.com/Bhavani_00007/status/2094913661915779239

[ 9 ] https://x.com/TimJayas/status/2094900247000654222

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

点亮星标

科技前沿进展每日见

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容