关于ZAKER Skills GEO服务 合作
钛媒体 25分钟前

世界模型入口战:字节向左,京东向右

文 | 新博弈,作者丨祝卿安

九月的两场产业动作,把 " 世界模型 " 这个原本停留在学术圈与技术讨论中的概念,推到了中国科技产业的舞台中央。

一边是字节跳动基于 Seedance 开发实时空间视频生成模型,创始人张一鸣亲自跨部门协调模型、算力与硬件资源;另一边是京东在 JDD 大会上发布 JoyAI-EchoWM 世界模型,同时宣布规划建设 10 万卡国产 GPU 集群。

两件事相隔不过数日,看似都是大厂跟进 AI 新赛道,实则指向同一个更本质的命题,当大模型的参数竞赛进入瓶颈期,下一代计算的入口,正在从 " 文本对话 " 转向 " 空间交互 "。

过去两年,国内 AI 行业的竞争始终围绕大语言模型展开,拼参数、拼上下文窗口、拼推理速度,最终落点都是 " 更好地回答问题 "。但世界模型的出现,正在把竞争的坐标系彻底扭转:它不再是生成一段文字、一张图片或一段视频,而是生成一个可以走进、可以交互、可以随人的行为实时变化的空间。

这不是大模型的功能升级,而是计算范式的迁移,从 " 信息检索与生成 ",走向 " 空间理解与体验 "。字节和京东几乎同时落子,却选择了完全不同的切入路径,背后是两家公司对 " 空间计算时代入口 " 的两种判断,也折射出中国科技产业在下一代技术浪潮中的路线分化。

世界模型不是 " 会动的大模型 ",而是空间计算的入口

要理解这场竞赛的分量,首先要跳出 " 世界模型是高级视频生成 " 的认知误区,很多人把实时空间视频生成等同于 "AI 视频的升级版 ",但两者的核心逻辑完全不同。

传统视频生成是 " 输入指令、输出片段 ",本质是内容生产工具;而世界模型是 " 输入行为、输出实时空间 ",本质是交互系统。它的核心能力不是生成画面,而是理解空间规律、预测物理变化、响应用户动作,并持续生成连贯的视觉体验。

从技术指标上看,字节跳动正在研发的实时空间视频生成模型,目标端到端延迟约 50 毫秒,生成帧率约每秒 20 帧。这个数字的意义远不止 " 流畅 ",人类视觉感知的交互延迟阈值大约在 50-100 毫秒,50 毫秒意味着用户几乎感受不到画面与动作的时差,虚拟空间会被大脑判定为 " 真实存在 "。

这也是过去几十年 VR 产业始终没能跨过的门槛。传统 VR 依赖预渲染内容和本地算力,要么内容生产成本极高,要么设备笨重昂贵,始终无法突破小众市场。而云端实时生成的世界模型,相当于把渲染和计算全部放在服务器端,终端只负责显示和采集动作,本质上是把 VR 从 " 硬件设备 " 变成了 " 云服务 "。

这也是为什么张一鸣要亲自下场协调资源。这件事的难度从来不是模型本身,而是跨体系的工程协同,模型团队要解决空间理解和实时生成,云团队要保障低延迟算力调度,Pico 团队要适配终端交互,内容团队要落地直播、短剧、游戏等场景。任何一环掉链子,50 毫秒的体验就无从谈起。

字节的优势在于,它已经用 Seedance 完成了视频生成的技术积累,从早期版本的多镜头叙事,到 2.5 版本的 30 秒长视频生成、多模态参考和编辑能力,模型已经具备了稳定的视觉生成能力;再加上 Depth Anything 3 的空间重建能力、Seed3D 的三维资产生成能力,字节实际上已经搭好了从 " 生成画面 " 到 " 生成空间 " 的技术阶梯。

放眼全球,这条路线并非孤例。Meta 前首席 AI 科学家杨立昆多次提出,仅靠语言模型无法让机器真正理解物理世界,世界模型将成为下一代 AI 的主流架构;李飞飞创办的 World Labs、谷歌的 Genie,也都在布局实时可交互的虚拟空间。

但国内玩家的特殊之处在于,海外巨头更多是从底层技术和通用能力切入,而中国公司从一开始就绑定了具体的场景和商业闭环。字节没有选择做一个通用世界模型平台,而是直接锚定内容消费和 VR 终端,本质上是想用世界模型解决自己的核心问题,即抖音的内容形态如何从二维屏幕走向三维空间,Pico 如何摆脱硬件内卷找到差异化体验。

换句话说,世界模型从来不是一个独立的产品,而是空间计算时代的 " 操作系统 "。它的价值不在于模型本身有多强,而在于它能承载多少应用、多少内容、多少用户。过去 PC 时代的 Windows、移动时代的 iOS,本质上都是定义了人机交互的入口和生态规则。而今天的世界模型,正在争夺的就是下一代空间计算的入口定义权。

字节的 " 内容闭环 "把人送进虚拟世界,先从消费端破局

字节跳动的世界模型路线,从一开始就带着鲜明的 " 内容基因 "。它的逻辑链条非常清晰,用 Seedance 的视频生成能力打底,向上延伸出实时空间交互能力,再通过 Pico 头显和抖音生态完成落地,最终形成模型、算力、硬件、内容的闭环。

张一鸣亲自协调资源的核心目的,就是把这四条原本相对独立的业务线拧成一股绳,让技术能力快速转化为用户体验。这条路径的第一个支点,是抖音庞大的内容生态和用户规模。字节没有把世界模型定位成 to B 的技术服务,而是直接指向 C 端消费场景,互动直播、互动短剧、沉浸式游戏。

这些场景的共同特点是,用户对视觉体验的要求高、对交互延迟敏感,同时有成熟的付费和商业化模式。

过去 AI 视频生成更多服务于创作者,降低内容生产成本;而实时空间模型直接服务于消费者,改变的是内容的消费方式,用户不再是坐在屏幕前看视频,而是走进视频里,成为场景的一部分。比如在互动短剧中,用户的选择会实时改变场景走向;在直播中,观众可以走进主播的虚拟空间,实现真正的 " 在场感 "。

第二个支点,是 Pico 硬件的终端卡位。字节在 2021 年收购 Pico 后,一直在 VR 硬件领域持续投入,原定于 9 月发布的 Pico Space Pro,已宣布推迟到 2026 年第四季度,官方表述为 " 对软件体验进行一次重大升级 ",市场普遍认为与适配世界模型的体验有关。

这背后的逻辑是,VR 硬件的竞争已经从 " 参数内卷 " 转向 " 体验内卷 "。过去 VR 头显拼分辨率、刷新率、重量,但如果没有足够的内容和交互,硬件再好也只是个 " 观影设备 "。而世界模型相当于为 Pico 提供了 " 无限内容生成器 ",用户不需要等待厂商制作 VR 内容,只要有需求,模型就可以实时生成对应的虚拟空间。

这种 " 云端生成 + 终端显示 " 的模式,还能大幅降低头显的硬件成本,让更多用户不需要高端显卡就能体验沉浸式空间,这对 VR 的普及至关重要。

但这条路径也有明显的边界。字节的优势在消费互联网和内容分发,短板在物理场景和产业数据。它的世界模型更多服务于虚拟体验,比如娱乐、社交、内容消费,而很难深入到工业、物流、机器人等真实物理场景。

这也决定了字节的世界模型,本质上是 " 内容消费的升级 ",而不是 " 物理世界的改造 "。它能重新定义视频和 VR 的形态,却很难直接切入产业端的巨大市场。同时,内容消费场景对模型的要求更偏向视觉效果和创意表达,而对物理规律的准确性、任务执行的可靠性要求相对较低,这和产业端的需求完全是两个方向。

从行业视角看,字节选择内容端切入,是最符合自身禀赋的路径。它不需要从零搭建场景,只需要把已有的内容生态和用户流量迁移到空间计算时代,就能快速形成商业闭环。但这条路的挑战在于,内容消费的天花板相对清晰,而空间计算真正的长期价值,远不止于娱乐。

京东的 " 产业闭环 "让 AI 走进物理世界,用供应链换入场券

和字节的消费端路线形成鲜明对比,京东的世界模型从一开始就锚定了物理世界。在 JDD 大会上,JoyAI-EchoWM 的发布只是冰山一角,真正的底牌是 10 万卡国产算力集群规划、1000 万小时真实场景数据采集,以及覆盖物流、工业、健康的产业落地场景。

京东的逻辑是,世界模型的终极价值不是生成虚拟空间供人娱乐,而是仿真物理世界,让 AI 和机器人在进入真实场景前先在虚拟环境中训练、验证、试错,最终实现虚拟仿真、物理执行的闭环。

这条路径的第一个核心,是用真实场景数据构建模型的护城河。和大语言模型依赖互联网文本不同,世界模型和具身智能需要的是人类在真实世界中操作的第一视角数据,分拣包裹、装配零件、整理货架,这些看似简单的动作,恰恰是 AI 最难理解的物理规律。

京东的优势在于,它拥有国内最完整的供应链场景:仓库里的分拣机器人、运输路上的无人车、配送环节的无人设备,每天都在产生海量的真实物理数据。在此基础上,京东启动了千万小时级的人类操作数据采集,首批开源数据集 EgoLive 已经开放,覆盖 346 项真实世界任务。

这些数据不是从网上爬取的公开内容,而是来自真实产业场景的一手数据,这是纯互联网公司很难复制的壁垒。

第二个核心,是算力和场景的深度绑定。京东规划建设 10 万卡国产 GPU 集群,不是为了比拼算力规模,而是为了满足物理 AI 对低延迟、高可靠性的特殊要求。物理世界的 AI 和大语言模型不同:大模型生成一段错误文本,成本可以忽略;但机器人在仓库里走错一步、无人车判断失误一次,就可能造成实际损失。

这就要求算力不仅要大,还要稳、要快,能够支撑大规模的实时仿真和并行调度。同时,京东的算力集群并非只服务自身,而是面向全行业开放,本质上是想把自己在供应链场景中验证过的 AI 基础设施,变成产业端的公共服务。

第三个核心,是从仿真到落地的产业闭环。JoyAI-EchoWM 在 WBench Navigation 评测中以 81.6 分位列全球第一,但对京东而言,模型跑分只是起点。它的真正落点,是物流、工业、健康等垂直场景:物流超脑 3.0 把亿级包裹的路径规划从分钟级压缩到秒级,具身智能在物流多任务场景下执行成功率达到 96.7%;工业领域用自然语言就能完成机械设计并直接输出 3D 打印原型;健康领域用模型辅助医学影像和问诊。

世界模型在其中扮演的角色,是 " 虚拟训练场 ",机器人和 AI 先在虚拟世界里反复练习,验证方案的可行性,再部署到真实场景中,大幅降低试错成本。

这条路径的优势在于产业壁垒高、长期价值大,但短板也同样明显。京东缺少 C 端入口和内容生态,很难像字节那样快速触达海量用户,模型的迭代速度和体验优化会受到场景的限制。同时,产业场景的落地周期长、定制化程度高,很难像消费互联网那样快速形成规模效应。但换个角度看,也正是因为落地难,一旦形成闭环,护城河也会更深。

两条路径,一场关于入口的长期竞赛

字节和京东的两条路线,没有高低之分,只是禀赋不同、选择不同。字节从内容消费切入,试图把空间计算变成下一代娱乐和社交的入口;京东从产业场景切入,试图把世界模型变成物理 AI 的基础设施。两者看似赛道不同,实则都在争夺同一个东西,空间计算时代的生态主导权。

过去的大模型竞赛,本质是 " 能力竞赛 ",比拼的是谁的模型参数更大、效果更好;而世界模型的竞赛,本质是 " 生态竞赛 ",比拼的是谁能把模型、算力、数据、场景、终端串联成闭环。模型本身不再是壁垒,真正的壁垒是模型背后的场景和数据。

字节有内容和用户,但缺物理场景;京东有产业和数据,但缺 C 端入口。两家公司都在沿着自己的长板延伸,试图用自己最擅长的领域,定义下一代计算的规则。

值得注意的是,这场竞赛才刚刚开始。目前国内的世界模型还处于技术验证和场景落地的早期,无论是字节的实时空间视频,还是京东的物理世界仿真,都还没有真正实现大规模商业化。

海外的 Google、Meta 等巨头也在加速布局,技术路线和商业模式都还没有定型。对中国厂商而言,真正的机会不在于跟随海外的技术路线,而在于依托自身的场景优势,走出一条适合中国市场的路径。

从更长远的视角看,世界模型带来的不仅是技术变革,更是人机交互方式的根本转变。当 AI 能够理解空间、生成空间、交互空间,我们使用计算机的方式就会从 " 对着屏幕操作 ",变成 " 在空间中行动 "。这是继 PC、智能手机之后的第三次计算范式迁移,而入口的争夺,往往决定了一个时代的产业格局。

字节和京东的两条路,只是这场大迁徙的开始。接下来的三到五年,会有更多玩家入局,也会有更多场景被重新定义。而最终的胜负,从来都不是模型参数的高低,而是谁能先让空间计算真正走进普通人的生活,走进产业的每一个角落。

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容