点击 Tech 星球 > 点击右上角 " ··· " > 设为星标

文|任雪芸
封面来源| 豆包 AI
9 月 22 日的云栖大会上,阿里重新将大模型的 " 大参数 " 路线摆上台面。
阿里 CEO 吴泳铭现场披露,阿里正准备训练参数规模介于 5 万亿至 10 万亿之间的新一代人工智能模型。
随后,阿里 ATH 事业群 Token Foundry Qwen LLM 项目负责人刘大一恒也在现场提到,Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,未来 Qwen4.5、Qwen5 的参数规模计划迈向 5 万亿到 10 万亿。
同一天,另一则消息在行业流传:据 The Information 报道,DeepSeek 目前正在训练一个约 2 万亿参数的新模型;DeepSeek 创始人梁文锋还在近期一场投资者会议上表示,公司下一步计划继续把模型推到 8 万亿参数。
时间再往前推两个月,8 月,英国《金融时报》援引知情人士称,字节跳动正在训练一个最高可达 10 万亿参数的大模型。
参数,可以通俗理解为大模型的 " 脑容量 ",即模型推理计算时调用的经验权重总量。那 10 万亿是什么概念?对比 2025 年引爆行业的 DeepSeek-R1,其当时的参数量仅 6710 亿,不足 10 万亿的十五分之一。
从阿里到 DeepSeek,再到字节,国产大模型公司集体重拾参数 " 越大越好 " 的信仰。
但规模竞赛的另一面:参数越大,投入的资源和成本就越高,而智能并不会同倍增长。模型扩大之后,数据必须跟着扩大,而且不只是数量,质量也得提高。当所有人都在堆参数,真正的分水岭就变成了算力效率,即单位算力能换回多少智能。
阿里、DeepSeek、字节下场豪赌 10 万亿参数
在已发布的模型里,国产阵营的顶点是月之暗面 7 月推出的 Kimi K3,总参数 2.8 万亿,是全球首个开源的 3 万亿级别模型。阿里当前旗舰 Qwen 3.8-Max 约 2.4 万亿,DeepSeek 现役 V4-Pro 为 1.6 万亿。
如果将视线转到海外,闭源阵营的参数规模更高。业内估计,Anthropic 的 Mythos 5 约 8 万亿参数,Fable 5 约 5 万亿。
也就是说,国产已发布模型的参数顶点,距离海外估计的头部水平,还差着一到两倍的身位。而若以 10 万亿为靶心,各家现役旗舰普遍还要再放大约 5 倍。
那么问题来了,参数越大,真的越好吗?
支撑 " 越大越好 " 这个观点的逻辑指向 Scaling Law(缩放定律),指的是在模型、数据、算力三者同步放大时,模型能力会随之提升。
过去几年,从千亿到万亿,每一次参数跃升,都伴随着能力肉眼可见的跳跃。理论上来讲,参数越大的确意味着性能越高。
而这也是刘大一恒把 Scaling 说成是阿里实现 ASI 关键路径的底气。
但 Scaling Law 并不是无限有效的。它需要有前提保证,在参数变大的同时,数据量和算力也得同比例跟上,而且是 " 高质量数据 "。
到了万亿级别,单纯堆参数,边际回报明显递减。所以,从现实角度来看,一个所谓的 10 万亿参数的模型,如果喂不进等量的高质量语料,能力不会同倍提升。
还存在的变量是,数据、训练方法、架构,以及推理时的算法。
比如 Kimi K3 总参数 2.8 万亿,但用了 MoE(混合专家)架构,896 个专家每次只激活 16 个,实际激活参数仅约 1040 亿。也就是说,名义上是 2.8 万亿,真正干活时动用的远没有这么多。
放到实际使用中,参数大也不等于 " 好用 "。
一方面,模型越大,推理越慢,用户等待的时间肉眼可见地拉长。另一方面,推理成本随之水涨船高,最终会转嫁到价格上,即便只是几千亿乃至两三万亿参数的旗舰模型,用户的实际使用成本也已经相当高。
所以绕开 " 好不好用 ",回到竞赛本身:参数规模决定的是能力上限,而上限决定排位。
这正是阿里、字节、DeepSeek 明知边际递减、成本高企,仍要冲向 5 万亿到 10 万亿的原因,大参数争的不是当下体验,而是下一代模型的入场券。
10 万亿的账单:大模型烧钱,谁扛得住?
超级模型固然能触碰更高的智能,但更大的底座,意味着更多的训练与部署资源。大模型烧钱,已是各家大厂心照不宣的共识。
海外,微软、谷歌、Meta、亚马逊四家的资本开支,2026 年指引已飙至约 7200 亿— 7450 亿美元。
国内市场同样激进:阿里 2026 年 Q2 单季资本开支 677 亿元,同比大增 75%,自由现金流由正 738 亿元骤转为负 466 亿元;字节 2026 年资本开支上限最高可达 700 亿美元,约为上一年三倍,2027 年还可能再冲 1000 亿美元。
钱花在哪?最直接的一笔,是基础设施。
OpenAI 训练 GPT-4 时,算力需求以千亿 Token 计,成千上万张 GPU 要在高速互联的集群中协同运转数周乃至数月,那时 GPT-4 的参数量只有 2 万亿。
而 10 万亿参数的预训练,需要的 GPU 数量与时长还要再上数十个台阶,意味着数万张高端 GPU 连续跑数月,电费、集群运维、芯片采购,每一项都是天文数字。
单从数据中心的投入来看,云栖大会上,吴泳铭宣布阿里云到 2032 年运营的全球数据中心规模将超过 20GW;高盛此前估算,阿里目前已上线容量约 3 — 4GW。这意味着,未来六年要新增约 16 — 17GW,规模扩大到目前的 5 倍以上。
参照英伟达黄仁勋曾在财报电话会中透露的信息,建设 1GW 算力的成本约为 500 亿— 600 亿美元 —— 按此推算,阿里未来六年新增的 16 — 17GW,总建设投入可能达 8000 亿至 1 万亿美元量级。
其次是推理成本。模型训练完不是结束,而是开始。参数越大,每次生成回答调用的算力越多;当模型部署到千万用户的日常调用中,推理侧的电费与算力开销,往往比训练更持久、更烧钱。
还有一笔容易被忽视的隐形账单:数据。模型扩大,训练数据必须同步扩大,且不只是数量,质量也必须提高。当前行业共识是,高质量、经过精细清洗和标注的数据,比裸算力更稀缺。
三笔账单摆在面前,玩家们扛得住吗?
现金流已经给出了预警。过去 5 个季度,阿里自由现金流有 4 个季度为负。最新一个季度资本开支高达 677 亿元。账上约 4745 亿元现金及流动投资尚可托底,上月又通过港股配售募资约 800 亿港元用于 AI 基础设施。
但面对万亿美元级的算力投入,这点弹药远远不够,持续的外部融资几乎不可避免。
字节的情况如出一辙。据 The Information 报道,字节跳动今年上半年净利润同比下降个位数百分比,至约 200 亿美元。它是国内科技巨头中 AI 资本开支最大的公司,2025 年 AI 相关投入达 1500 亿元,2026 年进一步增至 2000 亿元。
缺口之下,字节近期完成了约 300 亿美元的银团贷款,规模为科技公司史上最大,部分资金预计将投入持续扩大的 AI 基础设施。
一场停不下来的军备竞赛:从 Flash 到 10 万亿参数
云栖大会前不到一个月,阿里刚把 Qwen3.8-Flash-Next 推到台前:1250 亿总参数,每次推理只激活 60 亿,训练成本较前代砍掉近 90%,API 定价最低到 DeepSeek-V4-Flash 的三分之一。
同一天,智谱的 GLM-5.3-Flash 也挂上开源榜,3200 亿总参数、激活 180 亿。
那两周,行业喊的是 " 成本革命 ":模型竞赛的胜负手,比的是谁更省、谁更快、谁能在高频调用里把单位成本压到最低。
一个月后,云栖又把 " 大 " 字推回 C 位,两种打法开始共存。
从模型本身来看,Flash 这类模型,优化的是 " 高频、实时、成本敏感 " 的场景,用户要的是又快又便宜,所以把激活参数压到极小。
而大参数模型,优化的则是最难、最杂、要覆盖最广的场景,要的是最硬的推理、最长的 Agent 链路、最广的能力覆盖。
让这两种打法能共存、甚至能来回切换的,是 MoE 架构(Mixture of Experts,混合专家架构),把模型拆成众多 " 专家 ",每次推理只唤醒其中一部分。它最核心的贡献,是把总参数和实际调用参数彻底解耦,总参数可以继续膨胀,撑住能力上限;单次计算量却被按住,不随总规模同比变重。
对大模型厂商而言,MoE 撬动的是成本结构本身:训练成本可控,推理按激活参数计费,等于用同一套底座,同时押注小而快与大而强两条路线。
Flash 与大参数最终都在回答同一个问题,怎么让每一分钱,产出更多的智能。
不过,大参数尚且是个期许,10 万亿还只是 PPT 上的数字。现役国产旗舰的顶点,仍是 2.8 万亿,等模型真落地,牌桌可能已经洗过一轮。那时 10 万亿不再是终点,而是新的起跑线。

第一时间接收文章更新



Tech 星球小助手 | 微信:miniworld007