

两个月的时间,Qwen3.8-Max 的参数量从 3.7 时代的「超万亿的千问模型」到现在的 2.4T,千问团队表示 Qwen3.8-Max 是目前最强大的模型之一,兼容领先的前沿 AI 模型,仅次于 Fable 5。

虽然正式版还没上,Qwen3.8-Max-Preview 在 X 上的热度也并不比 Kimi K3 要低,将近 600 万次的浏览,但网友们讨论的内容都集中在「能聊 ≠ 能用,承诺 ≠ 交付」。
大家都在等正式版 / 满血版的 Qwen3.8-Max,以及模型的 benchmark 表、激活参数量,和 Hugging Face 上带许可证的真实权重文件。

实测 Qwen3.8-Max-Preview,速度很快但效果
几乎所有的大模型公司都开始有自己的「Codex」应用,Qwen 用于编程和效率工作场景的应用是 Qoder/QoderWork。我们这次使用 Qoder 来对 Qwen3.8-Max-Preview 进行测试。

我们先是让它设计一个个人作品集网站首页,这类工作对大模型来说基本上都是「洒洒水」,关键点在于怎么做得高级又好看,有创新点。

最终的生成的网页效果确实不赖,并且还添加了适当的缓入缓出的渐变效果,让网页的阅读体验更高级。



我们从之前的 3D 测试提示词项目中随便找了一个,这次是在 Qoder,即代码场景下的应用内让它完成,完整的提示词是:
创建一款明亮的 Three.js 屋顶跑酷游戏,场景位于风格化的纽约街谷上方。玩家开局时已经在奔跑,朝着第一个发光的屋顶边缘冲去。
不要创建标题画面、菜单、关卡选择、新手引导浮层或按键开始状态。
核心玩法只有一个:在计时结束前,从一个屋顶边缘跳到另一个屋顶边缘,穿过屋顶检查点,最终抵达终点广告牌。打造一条充满活力但范围集中的天际线路,加入水塔、消防梯、屋顶通风口、广告牌、晾衣绳、远处车流、窗格阵列和清晰的落点标记。
加入计时器、检查点计数、重置功能、紧凑的操作提示和近距离第三人称镜头。整体要明亮、有动感、清晰易读,并且打开后即可游玩。

Qwen3.8-Max-Preview 的运行时间非常快,深度思考 29s、深度思考 1s、深度思考 1s,没用几分钟就把这个 3D 网页给做出来了。

我们在 Qoder Work 和网页版内输入同样的提示词,只有 Qoder 交付的结果是比较乐观的,其他的平台应该是没有针对编程项目做过专门的优化,以及单独的 HTML 文件没有顺利加载 Three.js 库文件等问题。

接着我们又让它生成一些 3D 的艺术世界,在莫奈位于吉维尼的睡莲世界中,打造一个极限的 Three.js 体验:一片辽阔的池塘,同时也是一幅画,整个水面与花园都由漂浮的纯色笔触构成,乘船穿行其中。
光是听着就很有难度,这次 Qwen3.8-Max-Preview 的执行时间也比纽约屋顶跑酷任务更久,但整体上依旧很快,尤其是侧边栏显示的进展,经常是一瞬间就全部 Checked 完成。
最后的结果就相当抽象了,完全不知道这个网页是什么。虽然它在结果里写着 118,500 个独立色彩笔触,有睡莲叶、花朵、日本桥等等元素,但是交付的网页就是一些碎片在旋转。


结果也是相当简陋,而且几乎没有任何功能,只是找了几个航班放在这里展示。我甚至授权了 Vercel(网页部署平台)给它,但是这个交付的网页很明显是不够格的。



国产开源大模型首次超过闭源模型
国外的网友说,现在的开源模型几乎都是来自中国。已经发布的 GLM-5.2 和 Kimi K3,一个是接近 Anthropic 的 Opus 水平,一个来到了可以跟 Fable 5 一桌的等级。
而本月还将迎来 Qwen3.8-Max、DeepSeek V4 正式版、GLM-5.5,以及 MiniMax-M3-Pro,几乎都把「对标 Fable 5」当成了模型的评价基准。

而在 Agent Coding 测试里,Kimi K3 的表现几乎可以与今年一季度最好的公开模型相媲美。
今年以来,主要公司的大模型发布情况显示累计有 39 次模型发布,其中国产模型有 21 个,而美国的大模型 18 个。
39 个大模型中开源模型有 17 个,其中 13 个来自国产开源模型,4 个美国模型分别是 Mira Murati 的 Thinking Machine Lab 最新发布的 Inkling 模型、英伟达发布的 Nemotron 3 Ultra、Google 的 Gemma 4 以及英伟达的 Nemotron 3 Super。

Mythos Preview 是 10T 参数模型;GPT-6、Fable 5.1 已经完成训练但尚未发布;美国实验室因为安全风险主动压低或隐藏能力;以及国产模型近期的进步有一部分仍然来自蒸馏等判断……
这就很让人忍俊不禁,照他们的逻辑,中国模型成绩追上来,可以归因于蒸馏和刷榜;尚未追上的部分,又可以解释成美国把真正的强模型藏起来了;无论出现什么结果,都不会输。

模型之间的差距,开源和闭源,国产和海外模型,都正在变得越来越短。
以前,想要最强的模型,可能只能选择少数几家海外闭源模型。现在,同样的能力开始出现在更多模型、更多产品,以及更多本地部署的方案里。
模型能力越接近,我们的选择就越多。最后决定我们能不能用上更强 AI 的,大概会是这些模型,谁先把价格打下来。