关于ZAKER Skills 合作
钛媒体 13分钟前

0.1 分性能差,60 倍价格差:不甘“平替”,DeepSeek 双杀硅谷

文 | 财经故事荟

01

8 月 12 日深夜,DeepSeek 官网 API 文档悄然换版—— V4 Pro 预览版切换为正式版。

作为性价比之王,DeepSeek 这次也摸到了全球大模型的性能天花板。Terminal Bench 2.1(衡量 AI 智能体在真实终端环境完成任务的能力):V4 Pro 87.9 分,全球第一的 Anthropic Fable 5 是 88.0 分,差距只剩 0.1。

三个月前,V4 Pro 预览版这个成绩还是 72.1 分。三个月,跃升 15.8 分。

更狠的是两项反超。AI 安全智能体测试 Cybergym 上,V4 Pro 83.3 分,压过 Fable 5 的 83.1;工作流智能体测试 AutomationBench 上,31.8 对 29.1,V4 Pro 直接赢。衡量软件工程能力的 DeepSWE,从 12.8 分飙到 62.7 分,近五倍跃升,超过了 Anthropic 上一代旗舰 Opus 4.8 的 58.0 分。

这不是纸面题库的分数内卷。Terminal Bench、DeepSWE 这类评测,考察的是 AI 能不能真正 " 干活 " —— 自主进入终端装环境、敲命令、排查报错,读懂完整代码仓库、处理复杂工程问题、调用多步工具完成长链条任务。

这些能力,正是大模型从聊天玩具走向生产工具的核心门槛。换句话说,DeepSeek 这次补上的不是 " 考试分数 ",是真实场景的战斗力。

当然客观来看,在纯知识推理、超复杂全栈软件工程等场景,V4 Pro 和全球最顶尖模型仍有细微差距,多模态能力也尚未补齐。

梁文锋此前在和投资人的对谈中也承认," 我们跟美国的差距可能是落后美国 12 个月,在总体算力还是有数量级差距的情况下,全面超越是不现实的。"

但差距正在持续缩小,回看 DeepSeek 今年的轨迹:4 月 V4 发布,API 以 2.5 折优惠上线;5 月优惠结束后直接永久降至原价四分之一,降幅 75%;V4 Flash 单周调用量突破 7 万亿 Token 登顶全球第一。长期以来," 价格屠夫 " 是它最鲜明的标签——性能不差,但和顶尖模型之间,还隔着一段可以感知的性能距离。这段差距,在 8 月 12 日深夜被压缩到了 0.1 分。

02

性能逼近,价格碾压。

Fable 5 每百万输出 Token 定价 50 美元,GPT-5.6 Sol Max 30 美元,Grok 4.6 6 美元,DeepSeek V4 Pro 仅 0.87 美元——约为 Fable 5 的五十七分之一。缓存命中输入更是低到 0.0036 美元,比 Fable 5 便宜数百倍。

0.1 分的跑分差距,60 倍的价格鸿沟。这个等式,足以让开发者重新审视自己的技术选型——过去用 DeepSeek,是 " 简单任务省成本 ";现在用 DeepSeek,是 " 性能摸到第一梯队,还能省一大笔钱 "。

过去,DeepSeek 的故事是 " 便宜够用 "。现在,故事变成了 " 又强又便宜 "。

就在 V4 Pro 上线前几个小时,马斯克的 xAI 发布了 Grok 4.6,在 GDPVal-AA v2 评估中以 1753 Elo 登顶,超过 Fable 5 的 1741 和 GPT-5.6 Sol Max 的 1728。两款主打高性价比的模型同夜撞车,改写全球大模型定价规则,真正感到有压力的,恐怕是 OpenAI 与 Anthropic。

V4 Pro 的强大性能,也给了 DeepSeek 涨价的底气。就在上线六天前的 8 月 6 日,DeepSeek 刚挂出一纸涨价预告:" 计划近期整体上调 API 服务定价,预计涨幅较大。"

刚敲定融资却选择涨价,这更像是主动的定价策略切换,而非被动的成本转嫁。摩根士丹利 8 月 9 日的研报说得很直白:模型智能,而非价格,才是大模型竞争的终极壁垒。当 V4 Pro 距 Fable 5 仅差 0.1 分时,DeepSeek 已经有资格为这份 " 足够接近 " 收取溢价。

当然,涨价完毕之后,DeepSeek 依然有数量级的成本优势。

整个行业也在同步转向。中国大模型平均 API 输出价格已从 2025 年一季度的 12.2 元 / 百万 Token 回升至 2026 年二季度的 21.9 元。智谱涨价 83% 调用量反而增长 400%;月之暗面 K3 发布后请求量逼近集群极限暂停新用户订阅;腾讯两轮上调 API 价格部分涨幅达 463%。

价格战的终局信号已经出现。

03

比涨价更值得关注的,是一个更宏观的趋势:中国大模型正在拿下全球定价权。

过去,大模型的定价权牢牢握在硅谷手里。OpenAI 定一个价,全行业跟;Anthropic 出一个档位,开发者照着算成本。中国厂商的定价策略本质上是 " 跟随者 " ——别人定多少,我打个折,性能比不了,就拼性价比。

现在,定价权正在易主。DeepSeek V4 Pro 以 0.87 美元的输出定价,直接把 " 准 Fable 级 Agent 能力 " 的价格锚定在了硅谷旗舰的 60 分之一。这个价格锚点不是跟随出来的,是中国厂商主动定义的。当全球开发者在选型时开始以 DeepSeek 的价格为参照系—— " 这个能力值不值这个价 " ——定价权就已经不在硅谷手里了。

不止 DeepSeek。截至 8 月 3 日 - 9 日当周,中国大模型在 OpenRouter 平台已连续 15 周调用量超过美国,稳居首位;美国企业调用中国 AI 模型的 Token 占比每周稳定在 30% 以上,峰值达 46%; 近 200 家硅谷初创企业联名致信美国政府,反对限制使用中国开源模型——他们不是在头脑发热,表达政治立场,是在用脚投票保护自己的成本结构。

性能逼近,价格碾压,全球开发者用脚投票——中国大模型正在完成从 " 跟随者 " 到 " 定价者 " 的角色转换。

当最擅长打价格战的玩家开始收枪,当 0.1 分的性能差距配上 60 倍的价格优势,中国大模型行业的竞争逻辑,已经翻过了一页——过去 DeepSeek 靠成本优势横扫市场,现在性能优势也逼近了。

对于硅谷来说,一个又强又便宜的对手,比一个只是便宜的对手可怕得多。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容