关于ZAKER Skills 合作
钛媒体 2小时前

字节 AI,先慢后快?

文 | 伯虎财经(bohuFN),作者 | 楷楷

一向低调的字节跳动创始人张一鸣,却在近日高调发声。

他在 7 月底的 Seed 全员会上罕见现身,明确表示 " 字节跳动不会把蒸馏当作提升 AI 模型能力的捷径,即便 Seed 的模型能力暂时落后于国内主要的竞争对手。"

话音未落,字节又干了一件大事。据 36 氪报道,其成立了一个新的一级部门 "AI 数据与安全 ",整合超千人的数据团队,与 Seed、Flow、抖音等部门平行。

此外,据《晚点 LatePost》报道,字节正在讨论训练一个参数规模超 5 万亿的模型,如果落地,将会是目前国内已知参数规模最大的模型。

同一时间,豆包的商业化也开始全面加速: 68、200、500 元三档包月正式上线;豆包针对生活服务订单开始抽佣;飞书产品团队与豆包合并,猛攻桌面 Agent。

更大的模型、更强的技术基础,以及从架构到业务都重新整合的商业闭环,当字节 AI 不再强调 " 追赶 " 之后,它开始尝试讲一个更慢、但更有想象力的故事。

字节 AI,继续 " 大力出奇迹 ",只是这一次," 出力 " 的方向变了。

01 张一鸣 " 拒绝蒸馏 "

字节跳动创始人张一鸣,自从在 2021 年退居幕后,一直非常低调。但近日,他却罕见地在 Seed 全员会上露面,明确表态 " 拒绝蒸馏 "。

随后在 8 月 5 日的字节全员会上,字节 CEO 梁汝波进一步定调:" 字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。"

两位大佬同时发声,为何字节会如此态度鲜明地反对 " 蒸馏 "?

先看看何谓 " 模型蒸馏 "?就是用更强大的前沿模型生成的输出,来训练自己的模型。

就像在复习时坐在学霸(教师模型)旁边,向他反复提问,得到答案;再用这些 " 题目和答案 " 来训练自己(学生模型),以快速提高成绩。

但需要明确的是,蒸馏不是抄袭,它无法直接获得另一个模型的权重和完整训练数据,它只是一种相对 " 更快 " 的学习方式。

在国内 AI 圈,蒸馏几乎是一种心照不宣的 " 常规操作 "。

比如在 2025 年初,DeepSeek 发布推理大模型 DeepSeek-R1,其还同时发布了六个小尺寸的蒸馏模型,它们的 " 教师模型 " 都是 R1 本身。

但在海外 AI 圈,蒸馏却引发了舆论风暴。

今年初,美国 AI 公司 Anthropic 指控 DeepSeek、Kimi 和 MiniMax 三家大模型厂商,对其 Claude 模型发起工业级 " 蒸馏 " 攻击,但这三家企业均未作出正面回应。

蒸馏确实是提升大模型能力的一条 " 捷径 ",但 " 更快 " 是不是等于 " 更好 ",则一直留有争议。

主流的观点是,对于第一梯队的大模型企业而言,仅仅通过蒸馏,很难真正建立起技术壁垒。况且,大规模展开蒸馏也是一个比较复杂的系统工程,也需要计算投入回报比。

蒸馏技术本身并非原罪,但至少在字节这里,其对蒸馏的警惕,几乎贯穿了整个 AI 叙事。

早在 2023 年,模型团队内部就明确,不得将 GPT 生成的数据加入训练数据集。

2025 年 1 月,DeepSeek R1 横空出世,以有限的训练成本展现出强大的推理能力,给国内大模型企业带来很大的竞争压力,包括字节 Seed 团队。

对此,Seed 内部曾有过讨论,是否要采用蒸馏方式,引入美国头部模型的生成结果,但最终这个提议被管理层否决了。

不过,面对国内外大模型不断跃升的智能水平,蒸馏一直是 Seed 内部无法回避的选项。

一直到 Kimi K3 出现,这个同样来自国内的大模型,能力已非常接近国外闭源旗舰模型,让 Seed 内部偏向蒸馏的声音更多了。

这一次,张一鸣终于站出来表态 " 不接受蒸馏 "。据 36 氪报道,这次全体会之后,Seed 内部出台了新的政策,明确要求禁止蒸馏 K3 等开放权重模型,并追溯排查疑似蒸馏的行为。

对字节来说," 拒绝蒸馏 " 不仅仅是口号,还是已经落到实处的动作。

02 打自己最擅长的牌

但问题是,一向信奉 " 大力出奇迹 " 的字节,这次为何一反常态,宁愿慢下来?

或许可以回到字节自身的基因里去找答案。

2012 年,字节跳动推出第一款产品 " 今日头条 ",从产品模式来看并不算非常创新。当时,搜狐、网易、腾讯等大厂均推出了类似的资讯 APP。

但 " 今日头条 " 的特别之处在于,它尝试用技术手段来影响哪些内容能被用户看到,依靠算法推荐这一技术,字节走出了一条区别于门户的新闻资讯模式,并沿用至今。

如此,也就不难明白为何张一鸣选择对 " 蒸馏 " 说 NO。蒸馏本质上是在复制别人已有的能力,沿着这条路走,最多只能不断逼近对方,很难真正实现超越。

只有颠覆行业已有的经验,才能走出属于自己的赛道,这是字节从打造第一款产品就学会的经验,在 AI 大模型领域更是如此。

2024 年,牛津、剑桥等机构的联合研究登上《Nature》封面,指出如果模型反复用 AI 生成的数据训练,原始数据分布中的尾部信息会逐渐消失,最终产生不可逆的能力退化。

更重要的是,字节的核心战场从来不是纯文本大模型,而是原生多模态,它要求模型从零构建对物理世界的多维度感知,建立文本、图像、视频、音频之间的深层对齐机制。

如果选择蒸馏别人的模型,就相当于继承了别人的编码地基,字节就会失去从零定义多模态模型规则的能力。

那么,拒绝蒸馏的字节,靠什么来让模型变得更强?答案是数据。

近日,字节跳动成立了一个新的一级部门 "AI 数据与安全 "。这个部门的前身之一,是由 TikTok 创始团队成员傅越成立的数据团队 Global Data,同时还整合了多个此前分散的 AI 数据部门。

据《智能涌现》报道,接近该部门人士表示,这一部门将会是一个横跨基座模型到业务团队的庞大数据团队,其核心职能是为字节所有大模型,提供跨模态的数据服务。

在这之前,字节对大模型的训练数据一直不吝投入。2026 年,字节的数据预算已超过千万美元级别,并且是 " 可以随时追加预算 " 的状态。

" 数据 " 为什么越来越重要。如今,整个 AI 行业正在经历一场结构性转变,大模型能力正在快速同质化,算法架构带来的能力提升趋缓,数据逐渐成为决定模型能力上限的变量。

但越是高质量的数据,越是稀缺。据独立研究机构 EpochAI 的最新测算,语言模型的训练将在未来五年耗尽人类公开的文本数据,高质量语言数据的枯竭甚至可能提前至 2026 年。

过去一年,各大模型厂商都加大了对数据的投入。2025 年,Anthropic 为 RL 数据拨出了超 10 亿美元预算;OpenAI 全年数据开销约 10 亿美元,内部预测 2030 年将涨到 80 亿美元。

然而,数据恰恰就是字节最擅长的牌。

过去十年,字节已经积累了一套极其成熟的数据飞轮:全球用户每天在平台上产生海量的行为数据,帮助字节绘出更细致的用户图谱,同时不断完善平台的推荐算法。

这些沉淀下来的图文、视频、直播和互动数据,不仅量大,而且真实、带有上下文,也成为了字节大模型最稀缺的训练材料。

在通往 AGI 的路上,字节已经握着比别人更多一点的底牌。

03 赌一个 " 不同的未来 "

可是," 靠自己 " 注定会是一条更难的路,甚至会造成暂时落后。

梁汝波也坦承,豆包在 C 端应用上保持了竞争力,视频生成模型 Seedance 保持了 SOTA,但大语言模型被海外领先模型拉大了差距。

但字节愿意接受这个代价。

因为它在赌一个跟当下其他 AI 大厂不一样的未来——不是只追求参数和规模的超级大模型;也不是只贩卖模型的技术供应商,而是让 AI 数据飞轮带动整个生态转动。

字节的目标,在它最近的商业化动作中可以看得清清楚楚。

在 C 端,豆包开始尝试收费模式。

根据 QuestMobile 发布的 2026 年 6 月 AI 原生 APP 月活榜单,豆包以 3.82 亿月活断层第一,且用户规模还在持续增长,同比增速达 172.1%。

用户规模跑起来之后,豆包开始推出专业版会员(68/200/500 元三档);同一时间,飞书产品团队已全盘并入豆包,以后一个豆包,就能打通生活和办公两大场景。

在 B 端,豆包也开始 " 收税 " 了。自 8 月 10 日起,经豆包入口跳转至抖音来客并成交的部分订单开始执行独立费率,酒店订单的综合费率约 12%;部分生活服务类订单约为 18%。

还有 Seedance,据《晚点 LatePost》了解,字节 Seedance 2.0 视频生成模型当前年化收入(ARR)已达 20 亿美元(约 143 亿元人民币)。

过去,字节以抖音为流量引擎,嫁接广告与电商;现在,豆包已被列为单独渠道,字节开始为这类由 AI 带来的交易单独计价。

字节的收费模式只是刚刚开始,比起收多少钱,重要的是其已经打通了以 AI 助手为入口所带来的一整条交易链路,可以用 AI 重写本地生活、工作职场两大最高频场景的入口规则。

国内大模型行业的商业化,字节暂时跑在了最前面,核心正是由底座模型、C 端和 B 端所组成的统一战线:

C 端豆包在前端 " 蓄水 ",作为统一的落地载体,不断丰富应用场景圈住用户;B 端则在中端 " 开闸 ",通过深入本地生活、办公、影视等不同场景,为企业客户提供服务,并收费;

Seed 和火山引擎则在底层 " 筑基 ",以模型能力和算力基建托举整个飞轮的持续运转,以上三层打通,字节 AI 从流量到变现的路就通了。

所以,字节不需要用别人的输出来快速补课 AI,它更需要的是用时间去打磨场景、积累数据,像以往孵化 APP 那样,将大模型当成一个能长出商业模式的实体,服务好用户。

相较于快速拿到好成绩,字节更需要的是时间。

在这场激烈的 AI 竞争中,每一家大厂都有自己的技术优势和生态能力,字节也有自己的长板——那就是一个更契合的 AI 生态闭环。

当然,字节赌的这个 " 未来 ",是 AI 最终会成为下一代的超级入口。

但在 AI 时代,变化总比想象中来得更快,字节这只 " 慢龟 ",最终能不能更快跑到终点,还要看其他竞争对手如何发力。

文章封面首图及配图,版权归版权所有人所有。若版权者认为其作品不宜供大家浏览或不应无偿使用,请及时联系我们,本平台将立即更正。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容