好好好,都赶着国庆节之前开卷是吧。
前脚 DeepSeek 更新到了 V3.2,现在智谱又更新了——
正式推出GLM-4.6,代码能力直接推到了国内最强。
类似的结果还出现在了其它测评中。
例如在通用能力评测上,GLM-4.6 在 AIME 25、GPQA、LCB v6、HLE、SWE-Bench Verified、BrowseComp、Terminal-Bench、τ ^2-Bench、GPQA,这八大榜单中大部分都已经对齐了 Claude Sonnet 4,国内第一。
https://huggingface.co/datasets/zai-org/CC-Bench-trajectories
有一说一,卷,是真的卷。
根据量子位的老传统,新模型一出,那必须是得安排一波实测。
我们先小试牛刀地来一道题:
生成一个射击类的小游戏。
用 p5js 创建多彩的可交互动画。
编程这块,我们最后来测一道经典的题目:
显示球在旋转的六边形内弹跳。球应该受到重力和摩擦力的影响,并且必须逼真地从旋转的墙壁上反弹。
在编程能力之后,我们再来测试一下 GLM-4.6 的数学能力。
请听一道 AIME 2025 的试题:
整体来看,智谱这次新模型能力提升可以概括如下:
高级编码能力:在公开基准与真实编程任务中,GLM-4.6 的代码能力对齐 Claude Sonnet 4,是国内已知的最好的 Coding 模型。
上下文长度:上下文窗口由 128K → 200K,适应更长的代码和智能体任务。
推理能力:推理能力提升,并支持在推理过程中调用工具。
搜索能力:增强了模型在工具调用和搜索智能体上的表现,在智能体框架中表现更好。
写作能力:在文风、可读性与角色扮演场景中更符合人类偏好。
寒武纪、摩尔线程都跟进了
昨晚 DeepSeek 更新的时候,一个新现象伴随着诞生——
很多国产芯片公司立即宣布"Day0 适配 "。
这一现象在 GLM-4.6 身上也是发生了。
据了解,GLM-4.6 已经在寒武纪的国产芯片上实现了 FP8+Int4 的混合量化部署,这是国产芯片上第一次真正落地的 FP8+Int4 模型芯片一体化方案。
在 vLLM 推理框架的支持下,摩尔线程新一代 GPU 能够用原生 FP8 精度稳定运行 GLM-4.6,这充分体现了 MUSA 架构和全功能 GPU 在生态兼容性和快速适配上的优势。
最后,划个重点。
智谱在能力提升的同时,还把价格给打下来了!
智谱同步升级的 GLM Coding Plan(最低 20 元包月畅玩套餐):用 1/7 的价格,可以享受到 Claude 的 9/10 智商。
GLM-4.6 体验地址:
chat.z.ai
智谱 MaaS 平台:
bigmodel.cn
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见