文 | 李炤锋 王欣逸
编辑 | 张雨忻
在深圳,林舟所在的 AI 创业公司只有十个人,大部分工作都靠 AI 来完成——每天数百个 Agent(智能体)同时运行,它们分头写代码、做研究。
而驱动这些 Agent 的,一直都是 OpenAI 的 GPT 系列模型。
但随着团队交给 Agent 的任务越来越多,林舟发现 GPT 跟不上了——他们当时使用的 GPT5.6,一次只能同时处理两三个任务。"GPT 能处理的并发任务有限,会耽误我们的工作进度。" 林舟说,团队开始寻找能让更多任务同时运行、调用价格也更低的模型。
DeepSeek V4.1 Flash 成了新选择。9 月以来,团队试用了 Claude 和几款国产模型,最后选中 V4.1 Flash:它能完成手头的开发任务,反馈更快,调用费用也更低。林舟说,这是他们眼下 " 性价比最高 " 的选择。
今年更早的时候,Google CEO Sundar Pichai 在 Google I/O 大会上说,据他了解,有些公司到了 5 月,全年 Token 预算就已经快用完了。就以 Google 自己为例,其内部 AI 编程工具每天消耗的 Token 也从 3 月的 5000 亿涨到 5 月的超过 3 万亿。
而就是在这次大会上,Google 推出了速度更快、成本也更低的 Gemini 3.5 Flash,瞄准更日常的开发和工作场景——今年以来,OpenClaw 掀起的 " 龙虾 " 热潮,让普通用户也开始用 Agent 处理各种工作事务,这是比编程更日常、更低门槛、更高频的需求。
与此同时,越来越多的小参数模型开始出现。因为任务越来越多,模型的调用也会更频繁,若使用几千亿甚至两三万亿参数的旗舰模型,用户要承担的费用会非常高;并且大参数模型的速度也快不起来,会大大增加用户的等待时间。
模型厂商,尤其是中国模型厂商,接连推出 Flash 版本的小参数模型,争的正是这批过去也在由旗舰模型完成日常需求。Flash,意为 " 闪电 "。模型厂商通常用这样的命名来表示更快、价格更低的模型版本:它每次运行调用的参数较少,适合用来反复处理日常任务;而复杂问题仍可交给 Pro 等旗舰模型。
7 月 31 日,DeepSeek 发布 V4 Flash 正式版;8 月 26 日,阿里 Qwen 团队的 Qwen3.8-Flash-Next 与智谱的 GLM-5.3-Flash 同日亮相;9 月,DeepSeek 又推出 V4.1 Flash。这几款模型参数大小不一,均在千亿级别(从 100B-500B 的参数区间),远小于当前的旗舰模型万亿级别的参数。
两个月前,当 DeepSeek V4 Flash 正式发布后,有开发者把它的评测成绩和完成任务的成本画在一张图上,提出所谓 " 斩杀线 ":那些性能不如 V4 Flash,做同样的任务却更贵的模型,就这样被 " 斩杀 "。

8 月下旬,美国编程 Agent 平台 Cline 开始免费提供一款未公布身份的模型。Cline 称,不到一周,这款模型承担了平台超过 11% 的推理量。随后,智谱认领了这款模型,正是后来推出的 GLM-5.3-Flash。此前,智谱创始人唐杰在业绩会上谈到下一代模型,他说,公司 " 不会做一个大而无用的模型 "。
事实上," 小模型 " 阵营还在不断扩大。智能涌现了解到,月之暗面和腾讯混元,都在推动 Flash 模型版本的开发。
另一方面,今年以来,资本市场已经给中国模型公司押下高额赌注,这一背景下,商业化就成了更现实的问题。
公开数据显示,到今年 8 月,智谱的 ARR(年化收入)约为 16 亿美元,其市销率高达 46 倍;尚未上市的 DeepSeek,估值更是高达其预估年化收入的 163 倍。而大洋彼岸的 Anthropic,市销率约为 20 倍。中国模型公司在商业化上还有很长一段路要走。
所以,中美模型竞争也出现了另一条主线:在继续追求 AGI,争夺模型能力上限的同时,谁能让性价比更高的模型完成更多真实任务、服务更多用户?谁能用高性价比的模型打开更大市场,创造更多营收?
01 一场模型效率革命
切换模型后,林舟的一大体验改善是模型的响应快多了。
团队经常会需要几十个 Agent 同时写代码,他会边看进展边调整指令;发现方向不对,马上让模型修改。此前用 Codex,他常要等模型输出一长段内容,才能插手纠正。" 无论你是用 CLI 格式,还是用它原生的 App,响应都要很长时间。" 而一旦遇到长项目,模型需要整理此前的对话内容,使用 GPT-5.6 时,又要再多等上一阵。" 但切换到 V4.1 Flash 后,你跟他说什么,他能立马反馈你。"
今年以来,Scaling Law 仍是大模型研发的主线。今年发布的 Qwen3.8-Max 总参数达 2.4T(T 表示万亿个参数),Kimi K3 达 2.8T。按 Elon Musk 今年 4 月披露的对比推算,当时的 Claude Opus 约有 5T,尽管 Anthropic 并未确认这一数字。
这些超级模型固然触碰到了更高的智能,但更大的底座需要更多训练和部署资源;Agent 场景下反复调用模型时,使用模型的成本也会指数级增加。
换用 V4.1 Flash 后,林舟另一个明显的感受是调用成本大大下降。他举了团队做小应用的例子:一名同事独自完成开发," 差不多三四美金,就成了一个小 App 出来 "。
模型服务平台 Requesty 8 月的周榜单显示,DeepSeek V4 Flash 占平台上实际 Token 用量约三分之一,排在所有模型首位。而在此前的第三方评测中,它与美国 GPT-5.6 Luna 高推理版本的综合得分接近,完成同组任务的成本低约六成。
" 模型公司也开始更多关注真实的市场需求,会更多去听开发者的声音。" 一位基模研究员对智能涌现说。小模型一轮训练所需的时间和资源更少,能更快让用户看到他们用模型跑出来的东西是否可行,是否需要调整。" 用小模型搞开发,可以更快地做版本迭代,更快拿认知。"
而在日常工作中,这位研究员自己也会按任务需求来选模型。他举例说,修改实验脚本这类简单但工作量大的任务,交给 GPT 处理可能要 20 分钟,使用 DeepSeek V4 Flash 就只需要 2 分钟。" 既然任务没有那么难,我就只希望模型赶紧把这件事情做完。"
正是在这样的用户场景驱动下,近期各家发布的 Flash 模型大都在 400B 以下(B 表示十亿个参数):DeepSeek V4 Flash 总参数 284B;GLM-5.3-Flash 总参数 320B;Qwen3.8-Flash-Next 的主模型为 125B。
" 从训练的角度上来,300B 和更大一些的模型,在能力上可能差不太多。" 这位研究员说,自己做过不同尺寸的训练实验。在他使用的那批数据和训练方案下,约 300B 的模型已经能学进更大模型输出的长推理链。
2025 年发表于《Nature Machine Intelligence》的一项研究分析了 51 个开源模型,发现要在知识、推理、数学和代码等五项测试中取得相近成绩,所需的参数越来越少。研究者称之为 " 能力密度 " 提高:同样大小的模型,能做更多事。
Qwen3.8-27B 是一个近期例子。在 Qwen 公布的同组测试中,它在编程测试 SWE-bench Pro 中得 61.7 分,上一代同尺寸模型为 53.5 分;在长程办公测试 CoWorkBench 中得 70.7 分,上一代为 61.0 分。
模型要解决的问题也随用户变化。这位研究员举例说,编程产品常回答程序员怎样写代码、管理项目;到了办公场景,问题变成了 " 我 Excel 的公式记不住怎么办 "" 怎么把这个论文写了 "。
底层工作仍可能是写代码,但实际要完成的工作复杂度可能是降低的。从 Code 到 Work,一场模型的效率和成本革命正在发生。
02 从 " 编程 " 到 " 日常办公 "
" 我觉得会是两条路。" 对当下 Agent 分化出的 " 编程 " 和 " 办公 " 两种产品,一位 Code Agent 创业者这样评价道。编程和办公产品都需要模型理解指令、写代码、调用工具,但面向的用户群体不同。他认为,面向普通人的办公产品," 一定需要的极致地省钱,极致的性价比。"
今年 1 月,腾讯混元负责人姚顺雨在 AGI-Next 峰会上谈到用户需求的差别:企业做生产力任务时仍愿意使用能力最强的模型,但普通用户多数时候不需要。
两类用户选模型的方式也不同。" 程序员会自己分辨哪些任务用更贵的模型,哪些用更便宜的。" 普通用户未必知道处理表格、撰写报告需要多强的模型。上述创业者说:" 这是办公 Agent 的产品经理要想办法去解决的问题。"
今年 1 月,Anthropic 推出 Claude Cowork,让原本主要辅助写代码的 Agent 也能处理桌面办公任务。OpenAI 随后推出 ChatGPT Work,也是让用户直接交代一项工作,而不必在对话框里逐步提问。
与此同时,国内产品也从编程走向办公。3 月,腾讯云 CodeBuddy 团队推出 WorkBuddy;8 月,阿里整合 QoderWork、悟空和 MuleRun,推出千问办公;而在差不多时间,字节将飞书、TRAE Work 等产品的办公能力整合到豆包,推出 " 豆包工作 "。
QuestMobile 报告显示,2026 年 7 月,腾讯 WorkBuddy 有 658.2 万月活跃用户;PC 客户端用户当月人均使用 19 次。
面对数百万用户反复交办的日常任务,办公 Agent 不能只按复杂编程的标准选模型。在一些 WorkBuddy 用户社区中,有用户这样评价 DeepSeek V4 Flash 和 GLM-5.3-Flash:" 有这两个 Flash 干活基本够用。" 而在企业端,一位接近智谱的人士表示,GLM-5.3-Flash 发布后,不少企业客户对这款总参数 320B 的模型表示出浓厚兴趣。
而在真实的办公 Agent 使用场景里,执行任务的模型甚至可以更小,小到百亿级别。
聚焦办公 Agent 的创业公司元空智能,已经在元空 AI Work 中用上几十 B 的模型。团队基于开源模型做后训练,让它处理更垂直的任务;通用任务则调用云端的混合模型。
用户交办任务,产品替他选模型,这样的模式下,元空团队观察到用户其实对交互的速度十分敏感。一位团队成员说:"我们现在系统稍微慢一点点,一分钟之内一堆用户马上就找过来了。"
事实上,一些办公任务甚至都不需要用到 DeepSeek Flash 的最高思考强度。一位元空团队成员说,这样做对他们的部分任务 " 其实是过剩的,会输出非常非常多 Token,产生大量成本浪费 "。
元空智能在权衡任务效果和 Token 消耗,千问办公也把任务分成两档:标准模式处理日常办公,高级模式应对更难的问题。8 月底,千问办公将 Qwen3.8-Flash 应用于标准模式。
按千问办公公布的测试结果,标准模式完成单项任务的速度提高约一倍,平均 Token 消耗减少 75%;这一模式可以完成其定义的约 95% 的日常任务,更难的任务则交给高级模式。
03 更大,但也更卷的市场
几个月前,美国创业公司 Lindy 宣布开始使用一款中国模型——把由平台管理的大部分日产工作 Agent 调用,从 Claude Sonnet、Gemini 切换到了 DeepSeek V4 Flash。公司披露,切换后这部分调用的模型费用下降约九成。
" 这是公司成立以来,对成本结构影响最大的一次调整,产品质量没有受到影响。"Lindy 的创始人 Flo Crivello 这样说道。
8 月下旬,一款名为 Ox-Alpha 的匿名模型进入海外编程 Agent 平台 OpenCode 和模型平台 OpenRouter,立刻引起大范围讨论。
美国编程 Agent 公司 Cline 拿自家代码库中的真实故障进行了测试:Ox-Alpha 和另一款模型都修好了问题,但前者消耗的输出 Token 只有后者约三分之一。
这款被中国用户戏称为 " 牛来 " 的模型,上线不到一周,仅在 OpenCode 就有约 50 万人使用;8 月 26 日,智谱认领了这款模型—— GLM-5.3-Flash。" 牛来 " 模型与智谱的旗舰 GLM-5.3 形成了高低搭配——难题靠旗舰,日常任务则给 Flash 版本。
开发者的免费试用只是第一步。显然,中国模型公司希望借 Flash 的能力和价格,进入全球 Agent 产品,让用户的更多日常任务转向自己的模型。
这几乎是一个被 DeepSeek 带起来的市场。全球范围内,DeepSeek 在 V4 Flash 发布后调用量一直居高不下。OpenRouter6 月数据显示,DeepSeek 占该平台 Token 用量的份额,从年初的 9% 升至 6 月初的 18%;增长主要来自 Agent 任务。到 5 月底,V4 Flash 已占 DeepSeek 系列 Agent 任务 Token 用量的 70%。
DeepSeek 让其他模型厂商看到,在 300B-500B 区间的 Flash 模型,有着巨大市场潜力——这是一个被拓宽出来的新市场。
不同类型的模型去打不同定位的市场,模型厂商赚钱的概率也会提升。
从市场角度看,旗舰模型和 Flash 模型正在形成不同的战场。但是在大模型研发团队看来,这似乎又并非是两个对立的策略。
一位业内人士表示,旗舰模型仍有继续训练的价值。他把它比作车企的赛车:" 它不一定能量产,但会有一些技术下放。" 在他看来,旗舰探索出来的能力和训练经验,最终可以进入服务更广泛用户的小模型。
比如,智谱上周披露,一个由 GLM-5.3 驱动的 Infra Agent,参与了 GLM-5.3-Flash 推理服务的搭建与优化,并成功将 GLM-5.3-Flash 部署到了国产芯片上。从初步适配到投入生产,不到两周;经过优化,同一套服务处理请求的能力提高到最初的约三倍。
另一方面,Flash 模型也成了下一代模型的试验场。Qwen 先在 Qwen3.8-Flash-Next 上使用计划用于 Qwen4 的新架构;据团队介绍,这款模型的训练算力消耗约为 Qwen3.7-Plus 的九分之一。
这场竞争不只发生在中国厂商之间,美国模型公司也参与了进来。
价格战已经打响。
7 月,OpenAI 将较轻量的 GPT-5.6 Luna 价格下调 80%。在 OpenAI 公布的客户反馈里,美国办公 Agent 公司 Dust 称,换用 Luna 处理同类任务后,速度提高了 40%,费用降低了 40%。显然,在全球范围内,模型厂商们都在试图用更小的模型,凭借速度和价格优势争取到的 Agent 客户。
OpenAI 首席财务官 Sarah Friar 写道:" 只要质量够用,低价模型就会被用于更多任务。" 而 " 模型处理更多任务 " 给模型公司带来的收入反馈,我们或将在下一个季度见到。
* 文中林舟为化名