关于ZAKER Skills 合作
爱范儿 19小时前

实测千问 Qwen3.8 预览版,国产模型开始围攻 Fable 5

Kimi K3 的发布引起了海内外网友的高度关注,2.8T 的万亿大参数模型,直接在某些测试项目上,把国外闭源模型给击败了。

紧跟在 Kimi K3 之后,定位千问新一代旗舰基座模型的预览版 Qwen3.8-Max-Preview,也正式发布,开放给所有用户使用,接替 5 月发布的 Qwen3.7-Max。

两个月的时间,Qwen3.8-Max 的参数量从 3.7 时代的「超万亿的千问模型」到现在的 2.4T,千问团队表示 Qwen3.8-Max 是目前最强大的模型之一,兼容领先的前沿 AI 模型,仅次于 Fable 5。

▲目前在千问官网,已经能体验最新的 Qwen3.8-Max-Preview 预览版

虽然正式版还没上,Qwen3.8-Max-Preview 在 X 上的热度也并不比 Kimi K3 要低,将近 600 万次的浏览,但网友们讨论的内容都集中在「能聊 ≠ 能用,承诺 ≠ 交付」

大家都在等正式版 / 满血版的 Qwen3.8-Max,以及模型的 benchmark 表、激活参数量,和 Hugging Face 上带许可证的真实权重文件。

对比之前 Hy3 的预览版和正式版,三个月的时间简直是两个模型。这次 Qwen3.8-Max 正式版估计不会要等三个月,所以我们还是简单测试了一下 Qwen3.8-Max 的预览版,看看是不是值得期待。

实测 Qwen3.8-Max-Preview,速度很快但效果

几乎所有的大模型公司都开始有自己的「Codex」应用,Qwen 用于编程和效率工作场景的应用是 Qoder/QoderWork。我们这次使用 Qoder 来对 Qwen3.8-Max-Preview 进行测试。

在 Qoder 内可以看到 Qwen3.8-Max-Preview 的定位是最新一代基座模型,深度推理办公的首选,而模型上下文窗口在模型设置中,最多可以拉到 1M,即支持百万字上下文。

我们先是让它设计一个个人作品集网站首页,这类工作对大模型来说基本上都是「洒洒水」,关键点在于怎么做得高级又好看,有创新点。

生成过程中,Qoder 会弹出问题要我们选择网页的样式和内容,但也可以直接让 AI 自行决定。

最终的生成的网页效果确实不赖,并且还添加了适当的缓入缓出的渐变效果,让网页的阅读体验更高级。

在 Qoder 应用内,我们发现它提供了 161 种风格参考,包括 Aribnb、Apple、Figma、GOV.UK 等不同网站,我们可以直接应用对应风格,来创作网页。

此外,Qoder 非常好的一点是,我们可以直接对网页进行修改。通过应用内的「画布」功能,我们可以直接选择网页上的元素,进行排版、颜色、间距、文本内容、视觉编辑,以及描边等参数的修改。

接着测试「真才实学」的代码能力,自从 Fable 5 出来之后,有网友用它制作各式各样的 3D 网页,模拟真实的地理环境,创作不同的游戏场景。3D 测试也成了这段时间以来新发布大模型必测的项目之一。

我们从之前的 3D 测试提示词项目中随便找了一个,这次是在 Qoder,即代码场景下的应用内让它完成,完整的提示词是:

创建一款明亮的 Three.js 屋顶跑酷游戏,场景位于风格化的纽约街谷上方。玩家开局时已经在奔跑,朝着第一个发光的屋顶边缘冲去。

不要创建标题画面、菜单、关卡选择、新手引导浮层或按键开始状态。

核心玩法只有一个:在计时结束前,从一个屋顶边缘跳到另一个屋顶边缘,穿过屋顶检查点,最终抵达终点广告牌。打造一条充满活力但范围集中的天际线路,加入水塔、消防梯、屋顶通风口、广告牌、晾衣绳、远处车流、窗格阵列和清晰的落点标记。

加入计时器、检查点计数、重置功能、紧凑的操作提示和近距离第三人称镜头。整体要明亮、有动感、清晰易读,并且打开后即可游玩。

Qoder 的整个任务界面也很像 Codex,主页面显示当前任务的对话窗口,侧边栏显示项目概要,包括项目进展、产物和文件或 Skill 的引用,以及终端和文件信息等。

Qwen3.8-Max-Preview 的运行时间非常快,深度思考 29s、深度思考 1s、深度思考 1s,没用几分钟就把这个 3D 网页给做出来了。

游戏确实是能玩的,而且整体的风格和 Fable 5 也确实类似,但是这是第二版的结果。第一版 Qwen3.8-Max-Preview 给的网页没有控制好玩家前进的速度,导致游戏体验极差,几乎每次都要掉下去重来。

我们在 Qoder Work 和网页版内输入同样的提示词,只有 Qoder 交付的结果是比较乐观的,其他的平台应该是没有针对编程项目做过专门的优化,以及单独的 HTML 文件没有顺利加载 Three.js 库文件等问题。

▲ Qoder Work 内生成的网页是一片漆黑

接着我们又让它生成一些 3D 的艺术世界,在莫奈位于吉维尼的睡莲世界中,打造一个极限的 Three.js 体验:一片辽阔的池塘,同时也是一幅画,整个水面与花园都由漂浮的纯色笔触构成,乘船穿行其中。

光是听着就很有难度,这次 Qwen3.8-Max-Preview 的执行时间也比纽约屋顶跑酷任务更久,但整体上依旧很快,尤其是侧边栏显示的进展,经常是一瞬间就全部 Checked 完成。

最后的结果就相当抽象了,完全不知道这个网页是什么。虽然它在结果里写着 118,500 个独立色彩笔触,有睡莲叶、花朵、日本桥等等元素,但是交付的网页就是一些碎片在旋转。

二次修改让它重新检查之后,新的结果依旧是有点一言难尽,但至少是比第一次能明显地看到这个桥的形状了。

而如果是复刻 App,我们也输入「帮我复刻一个 flighty 的 app,给我可以分享的网页预览链接先。」,看看它能否学到 Flighty 精美的交互和动效,以及简洁大方的 UI。

结果也是相当简陋,而且几乎没有任何功能,只是找了几个航班放在这里展示。我甚至授权了 Vercel(网页部署平台)给它,但是这个交付的网页很明显是不够格的。

除了在 Qoder 内能体验到 Qwen3.8-Max-Preview,我们在千问官网也测试了一下模型的深度研究能力。

最后的结果,基本上和我们用 Qwen3.7-Max 测试是类似的,从核心摘要到市场格局,以及未来行业发展趋势,都没有太大的差别。

目前预览版的能力或许无法代表最终 Qwen3.8-Max 的能力,但国产开源模型进击的势头确实让人招架不住。

国产开源大模型首次超过闭源模型

国外的网友说,现在的开源模型几乎都是来自中国。已经发布的 GLM-5.2 和 Kimi K3,一个是接近 Anthropic 的 Opus 水平,一个来到了可以跟 Fable 5 一桌的等级。

而本月还将迎来 Qwen3.8-Max、DeepSeek V4 正式版、GLM-5.5,以及 MiniMax-M3-Pro,几乎都把「对标 Fable 5」当成了模型的评价基准。

OpenAI 的战略未来主管 Dean W. Ball 在 X 上发文,提到 Kimi 是一个非常优秀的模型,它不认为 Kimi 的性能可以用蒸馏之类的技术来解释。

而在 Agent Coding 测试里,Kimi K3 的表现几乎可以与今年一季度最好的公开模型相媲美。

今年以来,主要公司的大模型发布情况显示累计有 39 次模型发布,其中国产模型有 21 个,而美国的大模型 18 个。

39 个大模型中开源模型有 17 个,其中 13 个来自国产开源模型,4 个美国模型分别是 Mira Murati 的 Thinking Machine Lab 最新发布的 Inkling 模型、英伟达发布的 Nemotron 3 Ultra、Google 的 Gemma 4 以及英伟达的 Nemotron 3 Super。

或许现在谈要超过 Fable 5 为时尚早,但是当看到 X 上的网友一本正经的分析:

Mythos Preview 是 10T 参数模型;GPT-6、Fable 5.1 已经完成训练但尚未发布;美国实验室因为安全风险主动压低或隐藏能力;以及国产模型近期的进步有一部分仍然来自蒸馏等判断……

这就很让人忍俊不禁,照他们的逻辑,中国模型成绩追上来,可以归因于蒸馏和刷榜;尚未追上的部分,又可以解释成美国把真正的强模型藏起来了;无论出现什么结果,都不会输。

今天的榜单上,Kimi K3 可能超过了某个国外模型;明天 Qwen3.8-Max 可能又在另一个项目里拿到第一;再过几天,DeepSeek、智谱还会继续把新的模型推上来。

模型之间的差距,开源和闭源,国产和海外模型,都正在变得越来越短。

以前,想要最强的模型,可能只能选择少数几家海外闭源模型。现在,同样的能力开始出现在更多模型、更多产品,以及更多本地部署的方案里。

模型能力越接近,我们的选择就越多。最后决定我们能不能用上更强 AI 的,大概会是这些模型,谁先把价格打下来。

爱范儿

爱范儿

发现创新价值的科技媒体

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容