关于ZAKER Skills 合作
游戏研究社 13小时前

B 站的 AI 视频工具,正在补上 AI 视频的最后一环

最近这段时间,AI 视频模型的进步速度,可能已经快到让人有些麻木的地步了。

更短的生成时长、更稳定的人物、更复杂的运镜,以及过去很容易产生割裂感的连贯镜头,如今都在迅速变成 AI 视频模型的基础能力。

打开各大社媒平台,爆火的 AI 视频总是挤占着每个版面。从精心打磨的完整短片,到脑洞大开的实验作品,再到几句话就能生成的电影级镜头,AI 视频的玩法几乎每天都在刷新。

很多平台也在积极推流 AI 视频

然而在这些令人惊艳的样片之外,真正使用过 AI 视频的人,大概都遇到过同一个问题:

AI 确实可以给你惊喜,但却不一定愿意听你的。

文字与视觉模型之间始终存在信息损耗。每经过一次转换,信息都有可能发生偏移。你输入的提示词,无法让 AI 准确无误地输出你想实现的效果。评估现阶段的 AI 视频,或许不得不考虑这些成功的样片背后,到底失败了多少次。

很多时候,完全随机的 AI 抽卡才是最消磨创作者热情的环节

而这,正是 updream 在尝试解决的问题。

updream 是 B 站自研的 AI 视频创作产品,主要面向 B 站广大 UP 主设计。就在这几天,updream 上线了一项名为 " 预演台 " 的新功能,支持参考图生成 3D 白模,可任意控制镜头和人物运动,生成可供 AI 参考的具体场景。

从 " 抽卡碰运气 " 到 " 确定性创作 ",AI 视频创作中最难处理的那部分,或许即将成为过去式。

1

updream 的预演台很容易被概括成 " 一键生成 3D 白模 ",但如果只把它理解成简化版的建模工具,可能低估了它真正想解决的问题。

按照官方提供的工作流,用户可以先上传一张场景参考图,由系统生成一个具有空间结构的 3D 白模场景。进入场景后,创作者可以调整人物位置、运动路线和摄影机角度,再将预演结果作为参考交给视频模型生成。

整个过程有点像是正式拍摄前的镜头排演,所以这次我选择了一个多镜头、多机位切换的场景进行测试:

这个视频里至少包含人物走位、摄影机路径和镜头切换三组变量。如果只是依照传统使用提示词对 AI 进行描述,任何一组变量没有被模型正确理解,最后的结果都会偏离原本设计。

比如下面这个片段,仅依赖提示词,就失去了多镜头快速切换带来的沉浸感与紧迫感:

而在预演台里,一切都变得格外简单。有白模的预演结果作为参考,视频模型就能免去瞎猜用户心理的环节,直接生成可复现的效果。

创作者脑海中的镜头通常是具体的:人物离桌子多远,摄影机处于什么高度,主角在什么时候转身,这些都是明确的视觉信息。

可当镜头被写成提示词时,它首先要经历一次从画面到文字的转换;模型收到文字后,还要再次把它翻译成画面。

这其中的细节,很容易在多次的转换过程中逐渐流失,最后偏离创作者的原始意图。

实际上,即便是像 Seedance 这样的当前 AI 视频生成行业的领头模型,官方也更加推荐使用白模事先构建你想象中的画面。

而且,ControlNet 等技术路线也已经反复证明,边缘、深度、姿态等视觉条件可以为扩散模型提供更加明确的空间控制。

白模遵循的也是相似思路:它不需要拥有精细材质,却能够交代场景结构、人物位置、运动方向和摄影机关系。

但是在过去,创作者如果想制作白模作为参考,往往只有两种选择。

第一种是在 Blender 等 3D 软件中搭建场景、放置人物,再设置摄影机运动。效果足够专业,只是学习建模、动画和摄影机系统本身就需要相当长的时间。

通常需要几十个小时的前期学习和数百个小时的经验积累

第二种是在 ComfyUI 中搭建 ControlNet 等节点工作流,控制生成结果。这条路线同样也有较高的上手门槛,要求使用者理解节点逻辑、模型选择和参数调整。

而 updream 预演台所做的,是把这套专业流程压缩到一个更直观的控制台里。

预演台本身并不会消除 AI 视频中的所有随机性。白模主要提供空间和运动层面的约束,人物细节、材质表现、动作自然度以及复杂物理互动,仍然取决于模型本身的能力。

不过对于生产流程来说,能够提前固定镜头的基本结构,已经能带来明显的变化。

这种区别,在简单镜头中或许并不明显。一个人物站在原地说话,可能没有必要专门搭建白模。但当镜头涉及多人调度、复杂场景、空间穿行或长距离运镜时,预演台的价值就会被迅速放大。

2

对于基本已经全面接纳 AI 工具的游戏行业来说,updream 预演台的使用场景,或许还会变得更加广泛。

在游戏开发的前期制作环节,很多问题都不能简单地通过文字进行沟通。比如,角色从哪里出现,攻击该落在什么位置,摄影机什么时候绕到侧面……这些细节都是决定成败的关键。

当然,这部分内容其实都可以画成具体的分镜。但一旦镜头涉及多人移动、空间位置关系和连续运镜,二维分镜就很难完整表达人物与摄影机之间的关系。

如果直接进入正式制作,成本又显得太高。而且在正式动画完成后才发现镜头穿帮,很多岗位都可能需要返工。

游戏演出一直是一项高度依赖协作的工作。导演、动画、特效、音频、关卡等岗位需要围绕同一段时间线工作,任何模糊的信息都会在后续环节被放大。

于是,许多团队会先用简单模型、基础动作和临时场景制作一版白模预演在动画、特效和角色资产投入开工之前,帮助团队验证这个镜头到底能不能拍。

updream 预演台的出现,就能很好地解决这个问题。高级动画师仍然可以使用他们熟悉的 Maya、Blender 等工具,不过对于策划、制作这类以决策为主的成员,能以一种低学习成本的方式打通不同岗位之间的交流,显然也能大大提升效率。

不仅如此,很多团队最头疼的宣发环节,也能通过 updream 预演台搞定。

不少独立游戏和中小团队,往往没有预算制作高规格 CG,却要持续为商店页、版本更新、社交媒体和买量广告生产内容。

AI 视频固然降低了宣发的门槛,但生成结果的不确定性,又让制作成本转移到了反复试错上。

在 AI 视频融入游戏宣发之后,行业讨论的重点,通常集中在 " 成本降低了多少 "。然而对于小规模团队来说,每次生成消耗的积分可能还只是小事,更严重的是筛选废片、反复沟通、重新编辑和等待交付的时间成本。

如果 updream 能让一套镜头设计被稳定复用,那么它降低的就不只是生产成本,还包括围绕不确定结果产生的管理成本。

当模型可以执行更明确的镜头参考后,开发者就能把更多精力,放在真正需要考虑的部分:这个角色应该如何登场,怎样的镜头最能表现玩法,以及不同受众会被什么样的内容打动。

updream 的这套工作流,既能帮助到更多不熟悉专业 3D 软件的群体,也能实打实地减轻开发者的压力,AI 视频扩大了他们能够尝试的范围,而预演台则帮助所有 updream 用户进一步让这些尝试变得更有计划、更加可控,也更有效率。

3

从更大的行业视角来看,AI 视频工具正在经历一次重心变化。

早期的 AI 模型,首先解决的是能不能生成、怎么生成的事。此后,竞争逐渐转向清晰度、时长、动作稳定性和视觉表现。

如今,当生成质量不断接近可用标准,创作者便会自然而然地开始提出更具体的要求。能否保持角色一致,能否只修改局部,能否精确控制动作,能否按照既定镜头执行,都是值得考虑的重点。

一套可以反复使用、稳定修改和持续协作的生产流程,在当下的 AI 时代已经变得愈发关键。

updream 预演台体现的正是这种变化。目前的它显然还无法替代 Blender,也很难覆盖专业 3D 软件的完整能力。对于成熟影视或动画团队而言,精细建模、绑定、动画和灯光流程依然有其不可替代性。

" 正宗老建模 " 只会越来越少

但 updream 预演台的出现,提供了一个介于纯提示词与专业 3D 制作之间的新选项,创作者与 AI 模型之间的沟通成本,正在大幅降低。

以前,一个镜头出现问题,创作者很难判断究竟是提示词没有写清楚,还是模型没有正确理解。

而现在,创作者可以先在预演阶段确认构图、走位和运镜,再把问题拆分得更加具体,先确定空间结构,再检验模型执行。

当然,updream 最终能否成为稳定的创作工具,还是需要观察它未来的整体表现。

不过至少从方向上看,AI 视频创作的门槛,正在以另一种方式降低——创作者不必为了表达一个镜头,先把自己训练成提示词工程师、3D 建模师和视频剪辑专家。

技术门槛越低,并不代表创作本身会变得简单。相反,当工具不再成为阻碍,真正决定作品质量的,将更加集中在创意、审美和表达上。

这大概也正是 AI,在这个以人为本的时代最大的意义。

游戏研究社

游戏研究社

每天发点儿有意思的内容,基本都和游戏有关

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容