关于ZAKER Skills 合作
爱范儿 1小时前

Wan 3.0 有了自己的镜头美学

1941 年,格雷格 · 托兰德为《公民凯恩》设计了一套深焦镜头:小孩在窗外的雪地里玩雪橇,屋内的大人正在替他签下往后一生的去处。

深焦镜头是托兰德用来说话的方式,他说:技术服务于意图。

今年夏天,一批 AI 生成的「天宫」视频陆续刷屏社交媒体。评论里有网友这样问:为什么以前这么多仙侠神话电视剧都想不到把天宫做成这样?

去年这个时候,AI 生成的视频还主要在讨论「它能做到吗」,今年的问题已经变成了「如何更好」。技术已经足够好,同时人们愿意用它去完成一个具体的美学目标,而不仅仅去展示技术能做到什么。

阿里的视频生成模型 Wan 3.0 今天也开启公测,其中大的两个升级是:可以一次生成 30 秒单段视频了,以及,你不仅能输入文本、图片、音频、视频,还能直接把 PPT 这样的多种格式文档扔给它。

APPSO 也第一时间进行了体验,比起参数的变化,Wan 3.0 的画面美感更让我惊喜,五官和皮肤细节刻画得更精细,参考生视频模式下,角色、道具、声音、空间关系、风格这些细粒度维度都能稳定保持,这让视频的工作流也变得更流畅,而持续完善的编辑能力也减少了反复抽卡的情况。

立即体验:

阿里云百炼:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/wan3.0-video

万镜一刻:https://www.yikeai.com/

万相官网:http://wanxiang.aliyun.com

千问创作 PC 端:https://c.qianwen.com/

IF STUDIO:https://ifs.iconfont.cn/

堆友:https://d.design/

让叙事成为可能

Wan 3.0 把单次生成拉长到了 30 秒,还配了个智能时长功能,按提示词自动推荐一个合适的长度,要是不够再往下续。

目前单次可生成 30 秒视频的只有两家。

30 秒可以开始承载一段相对独立的叙事,不用抽卡无数条「高光片段」再后期拼接。

我拿它做了一支 20 秒左右的电影级 One-Take MV,整体风格定位为「西海岸街头流行主义」,要求在一镜到底完成从开场到高潮的完整叙事。

在青春活力的唱跳场景中,面对多位舞者的走位与复杂肢体交叠,模型能保持每个人物面部特征、服饰褶皱以及相对空间位置的绝对同一性,摄像机的推拉摇移也能够契合音乐节拍。

我们还制作了名为《末班电车》的日式动漫短片,要求其参考《你的名字》《铃芽之旅》《比宇宙更远的地方》的动感镜头语言。

故事是这样的:黄昏 17:58,高二少女若菜在教室发现自己快要错过一班「再也见不到他」的末班电车,一路狂奔穿越校园、老街、石阶,书包中的旧照片在最后关头飞散——而站台上,有一只手替她接住了它。

这个时长让镜头调度也有了更大空间,连续运镜、一镜到底、复杂的机位变化都可以在一次生成里完成。

按照这个思路,我们又试着做了真人电视剧片段。

Wan 3.0 有了自己的镜头美学

Wan 3.0 在风格统一性上有相当明显的效果。运镜逻辑更接近有意图的摄影语言,用光方式有明显的导演视角,而不是泛化的好看。

以日式手绘风 2D 动画为例,模型精准还原了赛璐璐风格的锐利线条与高对比度色彩,赋予了屹立于废墟之上的执剑少年极强的光影张力,甚至连战损服饰的微小细节都带有浓厚的悲壮感。

而在东方仙山秘境的刻画上,Wan 3.0 捕捉到了水墨与奇幻交织的古典气韵,驮着楼阁的巨龟穿梭于云海,大气的散射透视效果与神龟粗糙的生物肌理融合得恰到好处,没有生硬感。

在湖光山色间两人切磋武术的长镜头中,远景的壮丽峡谷风光与近景流畅的肢体互动形成了稳定的时空场域,动作的延续性没有丝毫卡顿。

我们还用 Wan 3.0 复刻最近爆火的中国仙境系列,虽然没有垫图,但输出效果还不错。

云海翻涌,道人立于山巅,身后是玉阶琼台。看到画面,你就能明白中国人对仙境的迷恋是有道理的。

虽然今天还没人把 AI 生成的视觉影像作品用于「审美积累」,但 AI 无疑越来越懂视觉美学了。

抽卡是赌博,迭代才是工作

生成一段带角色的叙事短片,一个做法是反复调整提示词等待运气好的结果;另一个做法是先用参考图锁定角色形象,确认视觉基调,生成之后找到有问题的时间段做局部修改。Wan 3.0 的升级,主要是让后者变得更可行。

对于大部分叙事内容,出问题的往往只是某几秒,其余的完全可以保留。能精准定位问题区间、只替换那一段,是把 AI 视频纳入正常创作工作流的必要条件,也是让创作者愿意在一个项目上持续投入时间的前提。

Wan 3.0 的视频编辑能力也有大幅提升,支持修改画面、剧情与台词,创作者可以定位到某个时间区间,只改出问题的那一段,保留其余的部分。

而更值得表扬的是,在文本、图片、音频、视频四种基础模态之外,Wan 3.0 首次支持 doc、xls、ppt、pdf、md 等格式输入,这在日常很多商用场景来说方便了不少。

想要做一条商业广告片,上传一张产品图和一份介绍 word,搭配提示词,就能得到一个完整的形象片。

我们还尝试让虚拟人做自媒体博主,做一条分享自己做短视频的经验的视频。对于不爱露脸或者想保护个人隐私的自媒体创作者来讲,生成一条虚拟人出镜的视频确实更方便。

不过同一段提示词的输出结果是不同的,如果要长期运用起初选定的那个最满意的面孔,可以在下次生成视频时把参考图给模型。

我们给模型参考图作为首帧,要求它生成一段视频。人物设定为锋利英俊骨相、短黑发、身穿黑色长款警察大衣,要求模型在场景中严格保持参考图人物的视觉身份,不能发生换脸或服装漂移。

测试结果显示,脸部特征与服装款式的保持是实质性的,至于情绪表现如何,下面是我们给模型的情绪设定,大家可以自行判断。

情绪设定:他刚从画面右侧外的人口中得知妻子已经死亡,并且妻子曾怀孕。这个信息不能用旁白、字幕、台词、闪回解释,只通过他的表情和身体反应呈现。情绪不是单纯愤怒,而是不可置信、痛苦失守、强行压回、愤怒回涌、理智断裂、最后开枪。

当然, Wan 3.0 也有一些可以提升的空间。声音质感与画面之间偶尔会出现贴合度的问题,尤其是环境音的空间感。

像「天宫」那样打动人的画面背后,一定有很多次没有被看到的尝试,有人在一大堆生成结果里选出了那几秒。

AI 视频行业当前最常见的讨论是哪个模型更强、生成的东西更好看。而之后的讨论可以预想的到,那就是:哪个模型更容易被用来完成一个具体的创作目标。

工具越来越好,决定仍然是人做的。门槛在降低,创作的天花板却没有随之降低。真正好的工具不替你做决定,它只是让你的决定更容易落地。

Wan 3.0 的 API 接口将于近期全量开放,价格非常优惠,480P/720P/1080P 的价格分别为 0.3/0.6/1.2 元 / 秒。从最常用的 720P 来看,0.6 元 / 秒,相当于主流模型的六折。

爱范儿

爱范儿

发现创新价值的科技媒体

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容