文 | 伯虎财经(bohuFN),作者 | 楷楷
一向低调的字节跳动创始人张一鸣,却在近日高调发声。
他在 7 月底的 Seed 全员会上罕见现身,明确表示 " 字节跳动不会把蒸馏当作提升 AI 模型能力的捷径,即便 Seed 的模型能力暂时落后于国内主要的竞争对手。"
话音未落,字节又干了一件大事。据 36 氪报道,其成立了一个新的一级部门 "AI 数据与安全 ",整合超千人的数据团队,与 Seed、Flow、抖音等部门平行。
此外,据《晚点 LatePost》报道,字节正在讨论训练一个参数规模超 5 万亿的模型,如果落地,将会是目前国内已知参数规模最大的模型。
同一时间,豆包的商业化也开始全面加速: 68、200、500 元三档包月正式上线;豆包针对生活服务订单开始抽佣;飞书产品团队与豆包合并,猛攻桌面 Agent。
更大的模型、更强的技术基础,以及从架构到业务都重新整合的商业闭环,当字节 AI 不再强调 " 追赶 " 之后,它开始尝试讲一个更慢、但更有想象力的故事。
字节 AI,继续 " 大力出奇迹 ",只是这一次," 出力 " 的方向变了。
01 张一鸣 " 拒绝蒸馏 "
字节跳动创始人张一鸣,自从在 2021 年退居幕后,一直非常低调。但近日,他却罕见地在 Seed 全员会上露面,明确表态 " 拒绝蒸馏 "。
随后在 8 月 5 日的字节全员会上,字节 CEO 梁汝波进一步定调:" 字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。"
两位大佬同时发声,为何字节会如此态度鲜明地反对 " 蒸馏 "?
先看看何谓 " 模型蒸馏 "?就是用更强大的前沿模型生成的输出,来训练自己的模型。
就像在复习时坐在学霸(教师模型)旁边,向他反复提问,得到答案;再用这些 " 题目和答案 " 来训练自己(学生模型),以快速提高成绩。
但需要明确的是,蒸馏不是抄袭,它无法直接获得另一个模型的权重和完整训练数据,它只是一种相对 " 更快 " 的学习方式。
在国内 AI 圈,蒸馏几乎是一种心照不宣的 " 常规操作 "。
比如在 2025 年初,DeepSeek 发布推理大模型 DeepSeek-R1,其还同时发布了六个小尺寸的蒸馏模型,它们的 " 教师模型 " 都是 R1 本身。
但在海外 AI 圈,蒸馏却引发了舆论风暴。
今年初,美国 AI 公司 Anthropic 指控 DeepSeek、Kimi 和 MiniMax 三家大模型厂商,对其 Claude 模型发起工业级 " 蒸馏 " 攻击,但这三家企业均未作出正面回应。

主流的观点是,对于第一梯队的大模型企业而言,仅仅通过蒸馏,很难真正建立起技术壁垒。况且,大规模展开蒸馏也是一个比较复杂的系统工程,也需要计算投入回报比。
蒸馏技术本身并非原罪,但至少在字节这里,其对蒸馏的警惕,几乎贯穿了整个 AI 叙事。
早在 2023 年,模型团队内部就明确,不得将 GPT 生成的数据加入训练数据集。
2025 年 1 月,DeepSeek R1 横空出世,以有限的训练成本展现出强大的推理能力,给国内大模型企业带来很大的竞争压力,包括字节 Seed 团队。
对此,Seed 内部曾有过讨论,是否要采用蒸馏方式,引入美国头部模型的生成结果,但最终这个提议被管理层否决了。
不过,面对国内外大模型不断跃升的智能水平,蒸馏一直是 Seed 内部无法回避的选项。
一直到 Kimi K3 出现,这个同样来自国内的大模型,能力已非常接近国外闭源旗舰模型,让 Seed 内部偏向蒸馏的声音更多了。
这一次,张一鸣终于站出来表态 " 不接受蒸馏 "。据 36 氪报道,这次全体会之后,Seed 内部出台了新的政策,明确要求禁止蒸馏 K3 等开放权重模型,并追溯排查疑似蒸馏的行为。
对字节来说," 拒绝蒸馏 " 不仅仅是口号,还是已经落到实处的动作。
02 打自己最擅长的牌
但问题是,一向信奉 " 大力出奇迹 " 的字节,这次为何一反常态,宁愿慢下来?
或许可以回到字节自身的基因里去找答案。
2012 年,字节跳动推出第一款产品 " 今日头条 ",从产品模式来看并不算非常创新。当时,搜狐、网易、腾讯等大厂均推出了类似的资讯 APP。
但 " 今日头条 " 的特别之处在于,它尝试用技术手段来影响哪些内容能被用户看到,依靠算法推荐这一技术,字节走出了一条区别于门户的新闻资讯模式,并沿用至今。
如此,也就不难明白为何张一鸣选择对 " 蒸馏 " 说 NO。蒸馏本质上是在复制别人已有的能力,沿着这条路走,最多只能不断逼近对方,很难真正实现超越。
只有颠覆行业已有的经验,才能走出属于自己的赛道,这是字节从打造第一款产品就学会的经验,在 AI 大模型领域更是如此。
2024 年,牛津、剑桥等机构的联合研究登上《Nature》封面,指出如果模型反复用 AI 生成的数据训练,原始数据分布中的尾部信息会逐渐消失,最终产生不可逆的能力退化。
更重要的是,字节的核心战场从来不是纯文本大模型,而是原生多模态,它要求模型从零构建对物理世界的多维度感知,建立文本、图像、视频、音频之间的深层对齐机制。
如果选择蒸馏别人的模型,就相当于继承了别人的编码地基,字节就会失去从零定义多模态模型规则的能力。
那么,拒绝蒸馏的字节,靠什么来让模型变得更强?答案是数据。
近日,字节跳动成立了一个新的一级部门 "AI 数据与安全 "。这个部门的前身之一,是由 TikTok 创始团队成员傅越成立的数据团队 Global Data,同时还整合了多个此前分散的 AI 数据部门。
据《智能涌现》报道,接近该部门人士表示,这一部门将会是一个横跨基座模型到业务团队的庞大数据团队,其核心职能是为字节所有大模型,提供跨模态的数据服务。
在这之前,字节对大模型的训练数据一直不吝投入。2026 年,字节的数据预算已超过千万美元级别,并且是 " 可以随时追加预算 " 的状态。
" 数据 " 为什么越来越重要。如今,整个 AI 行业正在经历一场结构性转变,大模型能力正在快速同质化,算法架构带来的能力提升趋缓,数据逐渐成为决定模型能力上限的变量。
但越是高质量的数据,越是稀缺。据独立研究机构 EpochAI 的最新测算,语言模型的训练将在未来五年耗尽人类公开的文本数据,高质量语言数据的枯竭甚至可能提前至 2026 年。

然而,数据恰恰就是字节最擅长的牌。
过去十年,字节已经积累了一套极其成熟的数据飞轮:全球用户每天在平台上产生海量的行为数据,帮助字节绘出更细致的用户图谱,同时不断完善平台的推荐算法。
这些沉淀下来的图文、视频、直播和互动数据,不仅量大,而且真实、带有上下文,也成为了字节大模型最稀缺的训练材料。
在通往 AGI 的路上,字节已经握着比别人更多一点的底牌。
03 赌一个 " 不同的未来 "
可是," 靠自己 " 注定会是一条更难的路,甚至会造成暂时落后。
梁汝波也坦承,豆包在 C 端应用上保持了竞争力,视频生成模型 Seedance 保持了 SOTA,但大语言模型被海外领先模型拉大了差距。
但字节愿意接受这个代价。
因为它在赌一个跟当下其他 AI 大厂不一样的未来——不是只追求参数和规模的超级大模型;也不是只贩卖模型的技术供应商,而是让 AI 数据飞轮带动整个生态转动。
字节的目标,在它最近的商业化动作中可以看得清清楚楚。
在 C 端,豆包开始尝试收费模式。
根据 QuestMobile 发布的 2026 年 6 月 AI 原生 APP 月活榜单,豆包以 3.82 亿月活断层第一,且用户规模还在持续增长,同比增速达 172.1%。

在 B 端,豆包也开始 " 收税 " 了。自 8 月 10 日起,经豆包入口跳转至抖音来客并成交的部分订单开始执行独立费率,酒店订单的综合费率约 12%;部分生活服务类订单约为 18%。

过去,字节以抖音为流量引擎,嫁接广告与电商;现在,豆包已被列为单独渠道,字节开始为这类由 AI 带来的交易单独计价。
字节的收费模式只是刚刚开始,比起收多少钱,重要的是其已经打通了以 AI 助手为入口所带来的一整条交易链路,可以用 AI 重写本地生活、工作职场两大最高频场景的入口规则。
国内大模型行业的商业化,字节暂时跑在了最前面,核心正是由底座模型、C 端和 B 端所组成的统一战线:
C 端豆包在前端 " 蓄水 ",作为统一的落地载体,不断丰富应用场景圈住用户;B 端则在中端 " 开闸 ",通过深入本地生活、办公、影视等不同场景,为企业客户提供服务,并收费;
Seed 和火山引擎则在底层 " 筑基 ",以模型能力和算力基建托举整个飞轮的持续运转,以上三层打通,字节 AI 从流量到变现的路就通了。
所以,字节不需要用别人的输出来快速补课 AI,它更需要的是用时间去打磨场景、积累数据,像以往孵化 APP 那样,将大模型当成一个能长出商业模式的实体,服务好用户。
相较于快速拿到好成绩,字节更需要的是时间。
在这场激烈的 AI 竞争中,每一家大厂都有自己的技术优势和生态能力,字节也有自己的长板——那就是一个更契合的 AI 生态闭环。
当然,字节赌的这个 " 未来 ",是 AI 最终会成为下一代的超级入口。
但在 AI 时代,变化总比想象中来得更快,字节这只 " 慢龟 ",最终能不能更快跑到终点,还要看其他竞争对手如何发力。
文章封面首图及配图,版权归版权所有人所有。若版权者认为其作品不宜供大家浏览或不应无偿使用,请及时联系我们,本平台将立即更正。