关于ZAKER Skills 合作
36氪 14分钟前

继 Seed、Flow 后,字节又成立一个 AI 一级部门,直指「数据」

《智能涌现》从多个独立信源处获悉,字节跳动近期成立了一个新的一级部门—— AI 数据与安全,与 Seed、Flow、抖音等部门平行,负责人为王赢磊(Adam Wang)。

这是继 2023 年底成立 Seed 和Flow两个 AI 一级部门后,字节围绕 AI 业务成立的又一个一级部门。负责人王赢磊此前为 TikTok 平台责任负责人和 TikTok 直播负责人。" 王赢磊负责的直播业务曾是 TikTok 最主要的营收来源之一,在字节内部有过赫赫战功。" 一位接近字节的人士表示。

《智能涌现》就上述消息向字节求证,截止发稿,暂无回复。

在模型、产品之后,字节这一次直指 AI 数据。

据《智能涌现》了解,这个新部门的前身之一,是由 TikTok 创始团队成员傅越(花名 Yuyi)于 2023 年成立的数据团队 Global Data,原来的规模在百人左右。这个精干的团队起初为 Dola(豆包海外版)、TikTok 等国际业务服务,而后负责为 Seed 的模型训练做数据采购和质量管控。团队内部设有产品经理、数据工程、采购、质检运营、安全合规等多个职能。

除 Global Data 之外,AI 数据与安全部门还整合了多个此前分散的 AI 数据部门,包括集团数据中台 DMC,以及 Flow 下属的 AI 数据平台 AIDP 等团队人员。

多位知情人士对我们表示,这一部门的整合和正式成立从 2026 年 6 月初开始,而由于涉及多个部门整合,这些部门之间业务又多有重叠,当前字节还在不断梳理架构,优化人员。

数位接近该部门的人士告诉我们:整合后的新部门,会是一个横跨基座模型到业务团队的庞大数据团队,其核心职能是为字节所有大模型,提供跨模态的数据服务团队的职责也覆盖数据生产全流程:标准制定、寻源采购、合成清洗、质量评测等。

在 7 月底的 Seed 全员会上,久未露面的张一鸣表态:字节在大模型攻坚上 " 坚决不蒸馏 "。而在 8 月 5 日的字节跳动全员会上,CEO 梁汝波也表示:" 字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。" 这些决定必将导向,在字节的大模型攻坚中,数据的重要性不断上升。

跳出字节,我们也看到全球 AI 行业正在发生结构性变化:当公开互联网数据被穷尽,模型竞争的核心变量正从算法和算力,转向真实世界的高质量数据。

字节的庞大数据帝国

字节在 AI 数据上的投入,在国内大厂中一直是最坚决的。

一个重要原因是,Seed 从成立之初就定下了 " 不做蒸馏 " 的原则。字节在几乎所有模型上的目标都是达到全球第一梯队甚至 SOTA,这是通过蒸馏难以达到的。如果所有数据都要靠自己合成、采买、清洗,势必需要一个庞大的团队来支持。

这个团队有多庞大?《智能涌现》曾独家报道,在字节内部,仅为 Seedance 做模型数据评测的团队就有上千人。每一位 Seedance 算法工程师的背后,往往都配着十余位数据同事做支持。

与之形成对比的是,很多视频领域赛道的头部创业公司,内部评测团队达到数十人就已经算比较大的投入。而 Seedance 2.0 的成功,也被多位从业者称为 " 一场数据的胜利 "。

这让字节更加坚定了对数据的投入。

首先是预算层面。《智能涌现》曾独家报道,在世界模型和 Coding 模型的训练上,字节 2026 年初的数据预算已超过千万美元级别,并且 " 如果觉得不够,可以随时追加预算 "。

《智能涌现》还了解到,目前字节数据团队也已经采取赛马机制,团队内部按方向划分——世界模型、代码、高难学科等。在如今模型的商业逻辑日渐清晰的背景下,字节的每个数据项目,也需要核算 ROI。

字节之外,各大厂都在加强数据投入。从去年开始真正发力大模型的腾讯,近半年来频繁以高达三倍的薪资从字节的数据团队挖人。

阿里、腾讯在数据采购上的预算都有明显增长,且不断加码投资。一位数据行业人士告诉《智能涌现》,大厂目前都有一定的数据排他策略,比如设定数据集独家期限、或阶段性买断供应商核心人员。

" 数据是当下大模型竞争中最具决定性的变量。" 这已经成为大语言模型、具身智能、世界模型、AI4S 等几乎所有明星细分方向上的共识。

但是,2026 年的数据市场现状是,AI 公司需求旺盛,从预训练到后训练,都面临高质量数据供给稀缺的瓶颈。

对字节而言,接下来的挑战是如何让一个千人规模的数据组织,仍然能够快速响应模型前沿的变化。毕竟,在模型能力边界还在快速变化的阶段,今天最稀缺的数据,在半年后可能就会失去价值。

全球模型竞争都走向数据军备赛

过去一年里,全球的大模型攻坚都面临一个趋势:在推理范式缓慢收敛的前提下,算法架构带来的能力提升趋缓。数据已经成为决定模型能力上限最重要的变量,甚至没有之一。

跟字节等中国大厂相比,海外大模型公司对于数据的投入还要高出数倍。硅谷头部大模型公司的外部数据预算正在以每年数十亿美元的量级快速膨胀。比如 Anthropic,仅在 2025 年就为 RL 数据拨出了超过 10 亿美元的预算。

这使得数据成为了 2026 年硅谷增长最快的赛道之一。最典型的是硅谷明星公司 Mercor,年化收入从去年的 5 亿美元涨到今年年中的 20 亿美元,其中 91% 来自 OpenAI、Anthropic 等头部模型公司,估值则飞涨至 200 亿美元,这家公司成立仅三年。

为什么数据突然变得如此重要?根本原因在于,互联网上的公开数据几乎已经被穷尽。

过去三年,模型训练所需的数据经历了从公域到私域的转变。公开的互联网中有大量的报告、文档,但缺少人类如何产出这些结果的过程,比如如何理解模糊的意图、寻找上下文、犯错和修正。

比如,在 Coding 之外,还有医生、律师、科研等高精尖领域任务,通用模型还没有解决得很好。当模型要提升能力,像真实专家一样工作时,它还需要大量自然产生的 " 过程数据 "。这些数据往往藏在真实的工作流程里,比如企业内部沉淀的代码库、员工日常操作留下的痕迹等等。

AI 所需的数据,正在从公域转向了私域。而大量私域数据的采集,成了大模型公司新的争夺点。

36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容