撰文 | 高晓阳
编辑 | 郝 鑫
DeepSWE 12.8 到 62.7,约 4.9 倍。这是 DeepSeek 官方给出的 V4-Pro 正式版(版本号 0813)软件工程智能体能力提升幅度。
8 月 12 日晚,这个模型悄然出现在 DeepSeek 的 API 文档里,没有发布会,也没有官宣推文。

" 梁圣 " 就是 " 梁圣 ",一如既往地不走寻常路,连涨价预告都一并写得清清楚楚:" 计划近期整体上调 DeepSeek API 服务定价,预计涨幅较大 "。
于是,我们花了一宿,用社区最新的一批复杂测试手法,看看它的涨价底气到底从何而来。
结论先放在这里,这次升级绝对过硬,前端审美发生质变,Agent 能力稳稳得很踏实。不过,也有让我们暂时无解的卡 bug 问题,比如鹈鹕骑自行车翻车了,生成了两个挂在天上的弯月。

V4-Pro 不是新模型,是转正。今年 4 月 24 日,DeepSeek 发布 V4 系列,Pro 版当时还是 Preview 状态。三个多月后,正式版才来,命名也直白,直接用日期 0813。

官方的叙事,换了一个词
比参数更重要的是官方换了个说法,不再强调「更会答题」,而是强调「更会把一件事干完」。有博主把官方数据翻译成人话:DeepSWE 从 12.8 提到 62.7,测的不是「会不会写一段代码」,而是「能不能像工程师一样持续干活」。
九项 Agent 与代码基准全线大涨。Terminal Bench 2.1 打到 87.9(终端操作),Cybergym 提升至 83.3(网络安全),NL2Repo 涨到 61.5(自然语言转代码仓库),DeepSWE 增长到 62.7(软件工程),而相对应的 Preview 版本分别提升 15.8、30.6、23.0、49.9。


考题换代,从鹈鹕到指环王
在动手之前,有个背景必须交代,圈里的测试手法正在换代。8 月 2 日,入职 Anthropic 的 Karpathy 发了一条长推,说我们该告别「鹈鹕骑自行车」这类测试了。
他给 Opus 5 塞了《指环王》第一段,配 100 万 token 的预算(约 10 美元),要求生成三个 JS 渲染版本。Opus 5 跑了约 2 小时,写出 5500 行代码,用 Three.js 搭出一个「有点上世纪国产 3D 动画味」的霍比屯,穿模、漂浮不少。

所以我们给 0813 设计的测试,全部避开了基础能力,用的都是这类最新、最复杂的手法。方式上,我们没有走网页聊天界面,而是把 DeepSeek 接入 Claude Code 的 Anthropic 兼容接口,让它在真实的 Agent 环境里干活。一共 7 项,按难度递进,从鹈鹕这种旧基准,到指环王 3D 世界这种新基准,最后到连续三轮的长周期工程任务。
第一道题,它就翻车了
先说坏消息,DeepSeek-V4-Pro 上来就翻了车。
第一道题是我们的老朋友,即旧基准下的「鹈鹕骑自行车难题」,SVG 生成,让鹈鹕骑上车、动起来。尽管这是 Karpathy 点名要「退休」的考题,但正因为人人测过,拿来当对照组最合适。
0813 的表现是这样的,鹈鹕的脚踩在踏板上,但踏板不在自行车上。车架结构怎么看都不科学,这样的设计,鹈鹕的屁股不会冒火吗?


60 种风格,一张墙
第二道题直接翻盘,让 0813 在一个 HTML 文件里生成一张 Bento 卡片墙,60 种设计风格,每张卡片必须用该风格最典型的视觉语言,不能只换颜色。
结果出乎意料地完整,60 种风格全部实现,严格执行了不规则拼贴的要求,风格之间的差异非常明显,一次通过,没有任何敷衍的「换色卡」,以后 vibe coding 项目再也不用担心风格单调了。

把一段文字变成一部动画
第三道题是前端动画叙事,给 0813 一段描写「老水手夜晚等船」的文字,要求它做成自动播放、循环的动画页面,同时镜头要随时间推进,情绪要靠配色和节奏传达。
它交出了一部完整的叙事,画风、节奏、镜头推进都把握得很好,从镇子远景推到码头,再推到灯塔,自动循环流畅,文字以精致排版叠加在画面上随场景出现。


第四道题是 Three.js 3D 打砖块游戏,我们给出的要求是游戏机制闭环,要能玩到比出胜负,还要兼顾 UI 和游戏手感。
测试下来,游戏完整可玩,碰撞准确没有穿模,丢分、结算逻辑正常,一次通过。但让我们印象最深的不是机制,是配色,配色不再是之前一眼 AI 的感觉。

让 AI 搭一个中土世界
第五道题是这次的主角,Karpathy 的新基准,给 0813《指环王》第一章的开头,让它用 Three.js 把霍比屯的 111 岁生日宴会搭成一个可运行的 3D 世界。
和 Karpathy 给 Opus 5 完整段落不同,我们只给了一个开头,这样能在短时间内拿到结果。0813 的表现是,洞屋、宴会长桌、宾客、烟火要素齐全,没有漂浮、没有穿模,运镜从俯瞰霍比屯推近到比尔博,之后是单调的左右晃动。

1.5 小时,一座浮岛
第六道题是压轴大戏,我们用与 GPT-5.6、Kimi K3、V4-Flash-0731 完全相同的 Prompt,让 0813 做一个 React Three Fiber 的 3D 浮岛创意作品集网站,滚动驱动相机、四章节叙事、物件交互、Bloom 后处理、移动端降级,全部要求到位。
这道题它花了 1.5 小时,是全场最久。最后半小时,它一直在自己测试项目能不能顺利启动,直到确认没有问题才交付,交付结果首轮 0 bug 运行。


0813 这次,是在 V4-Flash 的基础上把运镜、转场、交互全部补上了。性能逼近 Fable 5 确实没有信口开河,0813 是有真材实料的。

最后一道题回到官方最狠的宣称,DeepSWE 风格的长周期工程。我们让 0813 从零搭一个记账本全栈应用,连续做三轮迭代,记账核心功能、月度分类统计、预算提醒。每轮都要改多份文件、补测试、跑测试、跑不过自己修。



把 7 项测试放回桌面上看,0813 的画像比官方基准更立体。
前端审美是这次最大的质变,从打砖块的配色到浮岛的运镜,它已经告别了「AI 前端一眼假」的阶段,站进了顶级模型的行列。创意类任务全线高分,指环王场景零漂浮零穿模,和 Opus 5 单场景不相上下。长周期工程扎实,测试闭环、自修 bug,是「能连续干活」的样子。
问题也存在,鹈鹕和月亮两处低级失误,都发生在它能力很强的领域,强如 K3 也犯过类似的错误,这个暂时解释不了。
有意思的是,Grok 4.6 几乎和 0813 同一时间发布,一个顶级闭源、一个顶级开源,都是超高性价比的定价路线。这场对决,可能比官方 benchmark 更能说明问题,我们已经在筹备两个模型的同题对比测试。

微信号|TMTweb
公众号|光子星球
别忘了扫码关注我们!