关于ZAKER Skills 合作
36氪 1小时前

智谱的 Coding 是怎么炼成的

文 | 周鑫雨 张雨忻

编辑 | 张雨忻 杨轩

GLM 5.3 发布后不到一小时,智谱一名销售的电话和微信都爆了:十几个来询问 API 上线时间的,以及吸取了 Kimi K3 教训,想提前锁定智谱推理算力的客户也不少。这种状况一直持续了整个周末。

8 月 14 日下午,智谱突然发布了新一代模型,在测评榜单上再次刷新国产模型的 Coding 表现,与不久前发布的 Kimi K3 并列开源第一,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰模型处于同一水平。这瞬间引爆了客户们的热情。

Artificial Analysis 榜单。图源:智谱公众号

周末过去,消息和电话并没有停——原定 8 月 18 日要上线的 GLM 5.3 API 推迟了,销售再一次被客户 " 围攻 "。" 客户在电话里对我喊:内部预算和开发运维都到位了,delay 一天我们的管理成本就多好几万!"

上述销售回忆,如此这般的 "API 哄抢 " 大概是从 2026 年 2 月开始的——这是智谱发布大版本更新模型 GLM 5 的时间,当时多家外媒都评价其 " 第一次真正把中国开源模型推到全球前沿模型附近 "。在那以后的 GLM 5.1 来到全球第一模型梯队,GLM 5.2 拿到全球开源模型 SOTA(最佳)。可以说,每一个版本都在显著提升。

这期间,越来越多人开始问,这些模型背后的智谱,是一家怎样的公司?

其实,在中国 2023 年开始兴起的大模型浪潮中,智谱原本是一个 " 不够主流叙事 " 的存在。

它不够年轻—— 2019 年就已经成立,在推崇 " 小天才 " 的气氛下看起来不够酷;

它不够 " 公司化 " ——几乎完全脱胎于清华,带着鲜明的学院派和实验室气质;

它的商业化路径看起来不够性感——长期给政企客户做模型私有化部署,不是互联网的 " 可复制、规模化 " 逻辑。

但是,如果你是近一年才关注到这家公司,对它的认知大概率会是:全球大模型第一股,最高曾摸到 1.3 万亿港元市值,堪比好几个美团;拥有开源 SOTA 的模型,口碑全球出圈;ARR(年度经常性收入) 目前在中国模型厂里位列第一 ......

这种大转变的核心,就在模型的 Coding 能力上——当全球大模型都沉浸在 Anthropic 带来的 Coding 狂欢中时,智谱是中国最早拿到 Coding 门票的大模型公司,靠着足够好的 Coding 模型迎来口碑爆发和收入激增,并且一定程度上推高了过去半年国内大语言模型的竞争烈度。

智谱做了什么?率先拿到 Coding 门票的,为什么会是智谱?

要解答这些问题,需要先回到 2025 年 5 月," 智谱押中 Coding" 的前两个月。

一、背水一战,和意外的 Coding 爆发

2025 年 5 月,智谱紧急召开了一次战略会。" 只有核心高管和少数股东参与了,核心议题之一是,智谱下一阶段的模型要往哪个方向走。" 一位知情者告诉 36 氪。

这个议题,在那个时间点几乎决定了智谱的接下来的命运。

一方面,在 2025 年春节横空出世的 DeepSeek R1 几乎一刀悬在了智谱的商业化大动脉上。这个性能比肩 OpenAI o1,但价格只有 o1 1/30 的模型,冲击了当时整个 B 端市场,而面向 B 端做定制化模型部署是智谱当时最重要的商业化方向。

一位智谱做商业交付的员工告诉 36 氪,他就没能过个好年:" 一天接 5、6 个客户的电话,但大部分是来问能不能部署 DeepSeek 的。" 他心里有些五味杂陈,"DeepSeek 一夜之间全民知晓,不少客户的老板都交代下面的人改用 DeepSeek。" 另有智谱员工告诉 36 氪," 保守估计,当时智谱近 30% 的客户流向了 DeepSeek,对公司打击很大。" 他提到,为了留住客户,智谱给一些客户开出了非常低的折扣。

而另一方面,国内的大模型市场也在悄然转向。Chatbot 的热度褪去,当时与智谱同为 " 六小虎 " 成员的月之暗面、MiniMax 都在押注以调用工具、执行复杂任务能力见长的旗舰模型。

面对危机和变化,智谱的这次战略会做出了一个扭转命运的决定:改变原本针对文本、多模态、编程等能力各自做垂直模型的路线,押注 Reasoning(推理)、Coding(编程)、Agentic(智能体) 三类数据融合的大参数、三合一模型。

智谱意识到,必须走出舒适区,寻找属于下一阶段的新机会,而新机会只会从效果足够好的、能解决更复杂的生产力需求的大模型里长出来。

这个决定对智谱来说并不容易。" 不少股东都反对继续 scale up 模型(即推高模型参数),因为投入太高了。" 一位知情者告诉 36 氪。智谱的财务压力一直都不小—— 2025 年财报显示,智谱净亏损高达 47.18 亿元,仅研发一项就花费了 31.82 亿元,是当年总营收的 4 倍。

另一个原因则在于,多数据融合的模型,与智谱走 B 端定制的商业模式天然相悖。一名智谱 B 端业务人士告诉我们,为了匹配客户的具体业务场景,智谱此前将模型能力做了很清晰的垂直场景划分——对话、生图、生视频、Coding 等各有对应的模型和产品。若用一个融合模型匹配所有场景,那么部署成本会变得非常高。

这个 " 三合一 " 模型,就是在 2025 年 7 月上线的 GLM 4.5。" 原本 4 月就要上线的,但因为临时调整了模型方向,硬生生拖到了 7 月。" 一位知情人士告诉 36 氪。

这是智谱的背水一战。为了训练 " 三合一 " 的模型,智谱准备了 15 万亿 Token 的通用数据,以及 8 万亿 Token 的 Coding、Reasoning 和 Agentic 数据,总训练数据量几乎是同期模型的 1.5 倍

焦虑几乎弥漫在所有人身上。多位智谱员工告诉 36 氪,GLM 4.5 发布前的几个月,AI 院(智谱的技术和产研部门)的所有算法几乎住在公司,"4.5 发布那天,我凌晨下班,早上上班的时候,算法那边坐的整整齐齐,和昨晚我走的时候几乎一模一样。" 还有市场侧员工在发布日通宵到早上 8 点," 太焦虑了,不知道 GLM 4.5 的市场反响会怎么样。"

后来的故事人尽皆知:GLM 4.5 成为了智谱第一个在 Coding 上收获口碑的大模型,也让智谱成了国内最早押中 Coding 赛道的大模型公司之一。它真的帮智谱找到了属于下一竞争阶段的新机会—— Coding。

其实在国内,不少大模型公司在 2024 年 6 月 Claude 3.5 Sonnet 发布时就已经关注到了 Coding 的苗头,但却没敢入局。

MiniMax 创始人闫俊杰两年前就曾问过 DeepSeek 创始人梁文锋:" 你们要不要做 AI Coding。" 梁给出了否定的答案。" 当时大家的共识是,全中国会写代码的人可能只有 100-200 万,这似乎不是一个足够大的市场。" 闫俊杰在一场活动上回忆道。但他们没想到的是,当 AI Coding 成为改变生产方式的变量,200 万人的市场也可以变成 2000 万人。

不过,智谱的率先押中,也并非是 " 一切尽在计划中 "。

一名智谱员工告诉我们," 三合一 " 刚开始训的时候,Reasoning、Coding 和 Agentic 之间的优先级没有明显差别,模型最终聚焦到 Coding 上,一个直接的诱因是,用户的选择。

据 36 氪了解,研发过程中团队内部反复讨论提到,模型要贴近用户的真实需求,不要围着榜单来,模型真正的能力需要在真实任务中得到验证。所以算法团队会频繁参考用户 / 客户反馈,了解他们的需求点。其中," 提高研发效率 ",是一个被高频提及的需求。而恰好,这也与管理层所强调的 " 追求更高智能上限 " 方向一致。

GLM 4.5 发布后,一位销售记得,当时不断有 KA 客户提需求,将 GLM 4.5 接入程序员的工作流。社交媒体上,"Claude 平替 " 的声音也开始出现——毕竟,GLM 4.5 的 Coding 能力逼近 Claude Sonnet 4,价格却只要后者的 1/7。

Coding 成了 GLM 4.5 市场反响最好的能力。2025 年 9 月,智谱推出了 "GLM Coding Plan",成为国内第一个推出 Coding Plan 的大模型公司。10 月,"GLM Coding Plan 企业版 " 上线, 同月推出的新模型 GLM 4.6,据官方说法,特别强化了 Coding 能力。

到这里,智谱的新故事线逐渐清晰——在又重又难以复制的 B 端模型部署生意之外,抓住了能规模化、且商业价值较高的 Coding 生意。

"Chatbot 的故事,从 DeepSeek 出来后,就已经结束了。我们应该思考的是下一个 bet 是什么。" 在 2025 年初的一场活动上,智谱创始人唐杰曾提到。现在回头看,这个 bet 就是 Coding。

二、GLM 5.2 和万亿市值

智谱今年 1 月在香港挂牌上市、成为 " 全球大模型第一股 " 这天,CEO 张鹏给每位员工发了 200 元的红包。但这份喜悦只维持了一天——一天后,MiniMax 上市,股价首日暴涨 109%,市值突破千亿元,几乎是智谱的两倍。

当两家基因完全不同的大模型公司被同一时间放到公开市场上被审视,智谱在市值上暂时落了下风。" 在国内,当时 MiniMax 聚焦的 C 端市场被认为有更大的想象力,被贴上 toB、toG 标签的智谱看上去就没那么性感。" 一名大模型投资人对 36 氪说。

但仅过了 5 个月,智谱用一个开源的 SOTA 模型再次扭转局势,而这一次,比 GLM 4.5 那次更为彻底:收入、口碑、股价,迎来全面爆发。

2026 年 6 月 13 日,智谱发布了新一代旗舰模型 GLM 5.2 。这个依旧以 Coding 为最主要能力的模型在 Artificial Analysis 综合榜单上位列开源模型 SOTA,仅次于闭源的 Claude Fable 5、Claude Opus 4.8(max),以及 GPT 5.5(xhigh)。

用户的钱包是最诚实的。GLM 5.2 让智谱的 API 收入快速攀升。

智谱股东告诉 36 氪,2026 年 5 月,智谱的 ARR 还在 5-6 亿美元左右,对年底 ARR 的预期为 10-15 亿美元。而在 GLM 5.2 发布后一个月,36 氪再度独家获悉,7 月智谱的 ARR 已飙升至 10 亿美元,相较 2 个月前几乎翻倍,而年底的 ARR 预期也提升至 25 亿美元。针对这一数据,智谱暂无回应。

能够从销售第三方模型里获得分成的云厂商们也快速捕捉到了 GLM 5.2 带来的机会。一名智谱人士告诉 36 氪,阿里云、火山引擎、甚至小米和金山云," 推销 GLM 5.2 比智谱自己都狠 ",因为 " 客户都是来问 GLM 5.2 的 "。 阿里云一名销售也证实了这件事:由于下游需求太旺盛,到了 7 月,阿里云 " 直接给客户推 GLM 5.2" 。

智谱迎来了自己的 "DeepSeek 时刻 "。

不仅国内,海外影响力也因 GLM 5.2 被快速打开。云端部署与托管平台 Vercel 的监测显示,GLM 5.2 调用量的增长速度是 2026 年以来所有模型中最快的,超过了 4 月发布的 DeepSeek V4。

" 智谱没多少营销预算,我们的做法就是免费给潜在 KA 和 KOL early access(试用名额),让他们直观感受模型能力。" 一位销售告诉 36 氪。另有市场推广业人士告诉我们,在 GLM 5.2 发布前,智谱的中高层一有机会就飞去海外见 KA 客户和科技 KOL,邀请他们参与内测。" 当时不少海外客户用过之后发现,GLM 5.2 的综合能力超过了 DeepSeek V4,海外口碑就是这么逆转的

GLM 5.2 发布后,智谱总部搜狐网络大厦外墙的 LOGO,从汉字 " 智谱 ",换成了 "Z"。图源:作者拍摄

股价也飞升了。

GLM 5.2 发布后的第一个交易日,智谱股价大涨 32%,并在一周后,达成万亿市值。在这个时间点下,智谱的市值大约是 2.5 个美团,和 3.5 个京东。

回溯到年初股价节节攀升的时期,智谱在商业化上就做了一个决定:大幅提升 MaaS 业务的优先级。实际上,不少股东都认为,智谱原有的(B 端)定制化生意,撑不起太高的市值。

一方面,定制化业务没有规模效应,想接更多单子,就必须加更多人。据一位智谱员工的测算,B 端业绩每年稳定在 1.5 倍的增长幅度——稳健,但天花板就在那。并且,每一笔订单都是高度非标的。" 有时候为了尽快拿到验收单,我们工作之余还要付出很多额外的情绪和体力劳动:替客户开会,帮他们制作汇报 PPT,甚至帮他们接孩子 ...... 说白了,就是要付出大量人力把客户服务好。"

另一方面,现在模型的迭代速度太快,可能一个模型在开始部署时还是行业内最领先,但花几个月部署完之后已经被别的模型远远超过。越来越多客户也认为购买 MaaS 服务是更灵活的方式。

其实早在 2021 年,智谱内部就讨论过未来的商业模式,当时内部已经认为,应该对标(彼时的)OpenAI,把重点放在 API 调用收费上。但由于当时国内 MaaS 市场太早期,也没有真正能打的模型,所以没有条件推下去。

5 年后的现在,张鹏选择把对标对象明确为了 Anthropic。但对比 Anthropic 来看,智谱的 MaaS 业务还有巨大的收入鸿沟需要填补。根据最新的公开数据,智谱的市销率高达 Anthropic 的 5 倍多。基于 Anthropic 的市销率,智谱的市值若想稳定在万亿港元,ARR 要达到 487.8 亿港元,约 62.2 亿美元。而当下,智谱的 ARR 刚刚达到 10 亿美元。

图源:36 氪制作

三、取舍的胜利," 不犯错 " 的胜利

" 为什么是智谱?" 当智谱用 GLM 4.5 踢开 Coding 的大门,并以 GLM 5.2 一飞冲天后,不少人开始问出这个问题。

36 氪也向多位智谱员工抛出了这个问题,得到的答案几乎一致:克制地聚焦、没犯错、每一步基本做对了—— " 把每一步都做对,模型几乎不可能差 " 这个结论,在字节的 Seedance 的成功上也被验证过。

这些看起来偏 " 稳健 " 的风格和做法,与智谱这家公司的基因息息相关。回溯智谱在一些关键时刻做过的对的选择,有一个因素非常重要,那就是——尊重自己的基因。

张鹏曾这样评价智谱:" 就像清华的理工男一样,很明、很能干,你让他干什么事情,他能干得很漂亮,但是就是没有太多的情绪价值。" 这符合一直以来外界对智谱的印象:有技术、有视野,但看起来不够有趣,不够性感。

而张鹏关于智谱 " 没有太多情绪价值 " 的评价,与智谱的模型和产品之间,形成了有趣的互文。

2024 年,智谱曾与一家硬件厂商合作,将 GLM 接入产品。当时,智谱拿出了 GLM " 情商最高的系列 "。但在内部测评中,当员工输入 " 我的心情有点 down" 时,接入了 GLM 的产品的回复竟是:" 打开空调 "。

张鹏曾在媒体访谈中提到:"(杨)植麟(月之暗面创始人)知道怎么去理解普通人的需求和想法,我们在这方面可能做得没有那么好,这跟我们的定位有关系。" 智谱在这方面的弱势,使它在 toC 产品上存在短板。

两个典型案例是 Chatbot " 智谱清言 " 和视频生成模型 " 智谱清影 "。根据 "AI 产品榜 " 数据,截至 2025 年 3 月,Chatbot 大战约一年半后,智谱清言 App 端月活为 1043 万;同时期,豆包的月活是 9736 万。而 " 清影 " 的销售情况则可以用 " 惨淡 " 来形容,一位智谱销售告诉我们," 客户大多是从事艺术领域工作的,看不上清影的审美。"

不擅长聊天、不擅长视觉类审美这样的市场反馈,并没有让智谱失去战斗力。相反,意识到自己的短板后,智谱果断将资源从这些方向上撤出,聚焦到了自己擅长的方向上。" 智谱是一个非常理工科气质的公司,Coding 就是最适合他们的方向。" 一位业内人士评价。

目前,在智谱 AI 院中,负责多模态模型训练的算法降缩减 10 人左右;而聚焦文本、Coding 方向的算法则有百人。一名知情人士透露,智谱有较高的预算做 Coding、Agentic 的 RL 环境搭建和数据工程。

在当下算力资源、模型容量、模型数据量等现实掣肘下,模型厂商们都不可避免地要做选择题,为不同的模型能力排优先级。如果既要又要,可能导致哪方能力面都不够突出的结果。

" 模型每一种后训练目标都会占用其他目标的能力。 把提升 Coding 能力作为训练目标,意味着训练数据要少废话、高精度,这和正常人之间带有情感的交流是相悖的。" 智谱一名前算法员工举了个例子:GPT-5 和 DeepSeek V4 发布时,都因为提升了 Coding 和 Reasoning 能力,而被用户评价 " 情商变低 "。

还有一个例子是 MiniMax。模型 M3 发布后,一名参与训练的算法反思,M3 各项能力都不突出,就在于训练目标没有收敛:"MiniMax 的优势业务都是 toC 的,虽然老板们知道 Coding 和 Agentic 重要,但也放不下模型的情商优化工程。" 最后的结果就是,M3 发布后行业反响平平。

不过近期,36 氪独家获悉 MiniMax 在 6 月底解散了后训练团队中的 " 泛娱乐组 ",将人力和资源投入到了 Reasoning 和办公场景。

做对方向的取舍之后,在接下来模型训练的每一个关键环节中,智谱也基本做到了 " 不犯错 "。一个核心原因在于,智谱搭建了精细的 A/B Test 体系。一名智谱员工告诉我们," 遇到关键技术选型时,智谱会分两三波人马做 A/B Test,每个测试组放两三个研究员,就像实验室一样。"

另有员工提到,智谱将训练阶段和训练路线拆得很细致,一旦无法确定技术选型,算法就会将每一条路线下的训练结果去测试集上跑一跑,择优而取。

另一个不犯错的原因,则来源于 " 经验 "。早在 2021 年,唐杰就主导了智源研究院发起的万亿参数大模型 " 悟道 2.0" 的训练。在一众大模型公司的创始人中,做过这个参数量模型的只有唐杰和杨植麟。

经验带给智谱的,是对数据和后训练的重视。目前业界的共识是,提升 Coding 能力的关键,是做好 SFT(监督微调)和 Agentic RL(基于 Agent 任务环境做强化学习)。在这两个后训练环节,"至少对于一些前端任务,数据的作用比算法大。" 一位大模型行业人士判断。

然而,制定数据策略有相当高的经验壁垒。" 用哪些 query 去问,基于哪些 task 跑,合成的数据用来做 SFT 还是 RL,是用来生成训练的模拟环境,还是直接用于训练,这些决策都离不开经验。" 一名 MiniMax 算法告诉我们,M3 发布后,MiniMax 内部开了场反思会,内部得出的一个结论就是:数据策略没做好。

早在 2024 年,智谱就在海外投入了一个团队,从事数据的采购。在内部,负责模型训练和数据的张笑涵主导搭建了一个数据标注平台,名为 " 狂标 "。在语言模型和多模态模型两个组轮训期间,待训组的核心任务,就是标数据。

另外,自 GLM 4.5 起,算法团队开始愈发重视下游客户的反馈。一位智谱员工记得,AI 院常常与销售和交付团队的负责人们开会,从而收集 KA 客户的反馈。模型发版前,内部会设置两道测评:一道在 AI 院,做通用能力测试;另一道则在交付团队,基于目标用户高频场景做测评。" 所以,GLM 的 Coding 能力在开发者群体中口碑很好。"

四、人才壁垒:师门下的组织

这套 " 不犯错 " 的体系背后,是智谱 AI 院的数百名算法人员。"智谱的算法用钱挖不动。" 一名从事高招的猎头告诉 36 氪," 有大厂愿意开数千万元薪资包挖智谱 AI 院的核心算法,但最后以失败告终。"

一方面,智谱的核心算法确实很贵——公司市值快速攀升,核心算法手里的期权都值十几亿了。但更重要的原因是,智谱与它的核心人才之间形成了一种金钱之外的深度关系,这是其它大模型公司难以复制的。

这种关系是怎么建立的?

在国内一众大模型公司里,智谱是一个鲜明的存在:从创始人到各个岗位上的核心成员,几乎都来自清华,其中不乏大量同门和师生关系。很多行业人士在提到智谱的组织时都会提到几个词:学院派、清华系、唐杰和他的学生 ......

" 它是一个公司、学校、研究院的结合体 ",一名投资人如此评价智谱。

作为以模型训练为核心的组织,这个组织绕不开的人物,是它的创始人兼首席科学家唐杰。作为清华计算机系教授,唐杰是中国最早做机器学习、NLP(自然语言处理)的学者之一。多位投资人和 FA 评价,当他们在 2022 年底找对标 OpenAI 的标的时,脑海中最先跳出的清华学者是:唐杰、孙茂松、黄民烈。

在不少智谱员工看来," 唐杰热情、有信服力、执行力也强 ",但同时对待技术和业务又要求极高。一名智谱 AI 院的算法记得,智谱 Agent 产品 AutoGLM 2.0 的训练结果不理想,唐杰直接推迟了上线时间。

这家公司的核心团队带有强烈的清华系人际羁绊。负责商业化的 CEO 张鹏,清华本、硕、博出身,与唐杰同属计算机系;负责政府关系的智谱总裁王绍兰和董事长刘德兵,也都毕业于清华,与创始团队在清华数据科学研究院大数据研究中心共事过。

智谱港交所挂牌上市当天,张鹏(左二)、王绍兰(左一)、刘德兵(发言者)、张笑涵(左四)等智谱核心成员到场。图源:智谱

而智谱的心脏——负责模型训练的 AI 院,数百位位研究员中 70% 以上都是清华计算机系的本科生、硕士生或博士生

庞大清华师生构成的智谱形成了一个相对稳固的算法组织,被师门关系所包裹," 学院 " 文化鲜明。

学院文化一方面体现在工作方式上:AI 院层级扁平,比起公司,更像一个实验室。据智谱员工,很多关键方向都是从一个技术问题或一次实验结果的讨论开始的,不同背景的研究人员会很自然地参与进来。对年轻研究员来说,有比较大的空间来提出问题、验证想法。

并且,不少学生都表示,出于对自己老师、学长的尊重和情感,不会轻易选择离开。" 想在唐老师门下读硕士博士的学生里,有一些也会选择先来智谱工作。" 一位前智谱算法告诉我们。

源源不断的人才供给,加上较低的流失率,智谱的算法人才壁垒就这样形成。据 36 氪了解,GLM 5 发布后,有智谱的算法实习生一天之内就收到近 10 通猎头的电话;字节的猎头曾对着 GLM 论文上的署名,一个个打电话;腾讯混元愿意开两倍的底薪,去挖一个智谱的硕士。而以上种种,成功率都不高。

大模型公司之间的竞争,只会越来越激烈。

8 月 19 日,唐杰在 X 上发帖,阐述他对 Scaling Law 的理解:模型能力已经不再单纯由参数量决定,它更像是一个控制变量的实验,而变量包括 " 用了多少数据 "、" 准备把算力花在哪里 "、" 模型最终由谁、在什么条件下运行 " 等。这个论述指向 GLM 5.3 相较于上一代,实际是在后训练环节下功夫,而非卷预训练参数。

而大比例推高模型参数的几乎是剩下的所有头部大模型。过去一个月,月之暗面、DeepSeek、阿里都相继发布了新版旗舰模型,参数在 1.6 亿 -2.8 亿之间,是 GLM 5.3 的 2-4 倍。其中,月之暗面在 7 月 17 日发布的 K3,取代了 GLM 5.2 维持了一个月的开源 SOTA 之位;而仅过了 20 多天,智谱又用 GLM 5.3 再次夺回。

模型方向、训练路线、数据质量、算法人才 ...... 围绕大模型各个维度的争论和竞速,远没有到可以分出胜负的时候。

(36 氪作者邓咏仪、李炤峰对本文亦有贡献)

36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容