作者 | 赵芷姗
编辑 | 周伟鹏
8 月 12 日晚,DeepSeek 突然发布 V4 Pro 正式版,目前官网已更新部分信息。
它拥有 100 万 Token 上下文长度,最大 384K 输出长度,支持思考模式和非思考模式。
根据最新的跑分图,其多项能力逼近全球最强模型 Fable 5,甚至有几项超过了它。
这下子,梁子变梁神了。

可惜碰到了梁叔叔,DeepSeek V4 Pro 在性能稍强的情况下,输出价格只有 Grok 4.6 七分之一左右。
刚发布就要掉入斩杀区?

多个指标超过 Fable 5
4 月 DeepSeek V4 Pro 预览版问世时,它的智能体相关评测成绩还并不算亮眼,不少硬核任务跑分落后海外头部模型。
而这次 0813 正式版,完成了一次堪称脱胎换骨的迭代,尤其在智能体实操任务上实现大幅跨越。
在终端操作测试上,它拿到 87.9 分,高于 Opus 4.8 的 85 分,距离 Fable 5 只差 0.1 分。
这项测试考验模型操控 Shell 命令、运维沙盒环境、批量处理文件的真实动手能力,是智能体最硬核的指标之一。
在软件工程任务测评中,V4 Pro 正式版拿到 62.7 分,大幅甩开旧预览版的 12.8 分,高于 Opus 4.8 的 58 分。
这代表模型不再只擅长简单的代码补全,面对大型代码仓库、多文件项目重构、复杂 Issue 排错,已经具备成熟的处理能力。
而在网络安全智能体测试上,它更是一举超过 Fable 5,显示出面对漏洞复现、安全攻防类任务的独特优势。
当然,它并非全维度通吃,在高难度推理、超高难度综合任务上,对比 Opus 4.8、Fable 5 依旧存在差距。
价格上 V4 Pro 延续了 DeepSeek 超高性价比优势,百万 Tokens 输入只要 0.435 美元(国内 3 元),输出也只要 0.87 美元(国内 6 元)。
相比大洋彼岸的闭源模型,便宜得有点夸张。

DeepSeek 搭建起完整智能体方案
就在 DeepSeek V4 Pro 发布之时,有社区爆料 DeepSeek Harness 也将在今天开启公测。

大模型本身只会输出文本,真正要让 AI 去写代码、改文件、跑测试、调试报错、反复迭代直到任务完成,光有模型远远不够,中间需要一整套 " 手脚 " 和 " 调度系统 ",这就是 Harness。
今年 5 月,DeepSeek Harness 在内部正式立项,8 月 2 日开始内测,这两天 Harness 还注册了官方微信公众号。
一切的迹象都说明它快来了。
过去,开发者拿到大模型 API,想要做可用的代码智能体,所有执行逻辑、工具循环全部需要自己从零搭建。
而随着 Harness 开启公测,DeepSeek 可以直接交付一套完整闭环方案:模型负责思考推理,Harness 负责落地执行。
这意味着 DeepSeek 的竞争从单纯模型跑分升级到完整智能体栈的对抗。
Grok 4.6 很强但有短板
性价比还得看 DeepSeek
同一时间发布的 Grok 4.6,同样来势汹汹。
智能综合指数拿到 61 分,追平 GPT 5.6 Sol Max;Cursor 代码测评达到 69.9%,在单文件代码改写、日常代码补全场景表现亮眼,现实复杂任务测试甚至跑出 15.8% 的高分,通用综合推理是它的长板。

而 V4 Pro 几乎无短板。终端操作、代码工程、安全攻防、高难推理,没有任何一项掉出全球第一梯队。
Grok 4.6 虽然学习 GPT 也开始打价格战,不仅比 Opus 5 和 5.6 Sol 便宜,甚至比 Sonnet 5 还便宜,在海外模型中很有性价比。
但它偏偏遇上了 DeepSeek。
结语
这一次 Grok 4.6 与 DeepSeek V4 Pro 近乎同期发布,是全球 AI 竞争一个标志性的节点。
大模型比拼不再只看纸面综合分数,场景落地、配套工具链、成本、本地化可用性,正在变得越来越重要。
Grok 4.6 证明海外厂商依旧在通用推理上保持强大实力,而 DeepSeek V4 Pro 0813 加上 Harness,则证明国内团队已经有能力在智能体这个下一代 AI 核心赛道,拿出可以和海外顶尖产品掰手腕的完整方案。
END
欢迎点击科技每日推送视频号,看最新视频 ~
↓↓↓
Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注: