

这套制度听起来苛刻,但它能筛的是电影里最贵的东西,演技。一个眼神给不给得到位,一场情绪转不转得过来,几十秒就能见分晓。整部片子上亿的投资,最后都压在这几十秒的判断上。
所以试镜的本质,就是在用最低的成本,验证最贵的能力。
最近我们拿到一个视频模型的预览版,和这个逻辑一样,他想用更低的成本,让 AI 视频生成就有那些最贵的演技。试拍一条视频,0.09 元 / 秒起。

我们提前拿到了 Vidu Q4 Preview 的访问权限,把它当成一个来试镜的演员,一场一场来考验它的「演技」。

Vidu Q4 Preview 给我们的第一感觉,其实还挺「Vidu」的。
它似乎一直不太满足于把一段视频安安稳稳地生成出来。能打起来,就尽量让它打起来;能让摄影机从不同角度捕获画面,就不只站在原地拍;能做一场爆炸,也能把火光、烟雾和人物一起安排进镜头里。
这种偏爱大动作、复杂镜头和强情绪的创作倾向,在 Vidu Q4 Preview 上变得更明显了。只不过这一次,它开始更在意人物有没有戏、镜头为什么要动,以及这些东西最后能不能共同组成一段好看的视频。

我们可以在 Vidu 官网体验最新的 Vidu Q4 Preview 模型。这是 Q4 面向创作者推出的首个预览版本,目前它的参考生视频支持最多 15 张参考图、3 段参考音频以及可选 2K、4K 超清输出等配置。
体验链接:https://www.vidu.cn/home/recommend
另外,大家还可以输入 APPSO 的专属邀请码 APPSOQ4,登录 vidu.cn,新用户注册就能获得 500 积分。
一个眼神,比一场爆炸更难
如果说构成一个好的表演有最小单位的话,那它一定是「反应」。
我们听到一句台词只需要两秒,但角色脸上那半秒钟的变化,从听到、消化、到决定回应,这一段反应才是我们判断「这人是真是假」的依据。
那些说 AI 无法取代真人演员的人,也认为这些「反应」是 AI 永远学不会的东西。AI 能做出「悲伤」的表情,却做不出「正在变得悲伤」的过程。


我们还找了一段被北电纳入教材的电影片段,《喜剧之王》里的「我养你啊」那段。尹天仇在雨后的街上喊住柳飘飘,柳飘飘回头笑着回一句「你先养好你自己吧」,转身离开,独自在出租车后座崩溃。
这段戏的难点,大概全在后半段张柏芝从笑到哭,演绎出溃堤的过程。

这也符合 Preview 的定位:先把模型交到创作者手里,在真实使用里暴露问题、收集反馈,再继续往正式版迭代。
不过,当表演不需要经历这么剧烈的情绪转折时,Q4 Preview 对人物状态的把握会稳定不少。
在另一段《沙丘》的案例里,伤兵回答完「not my vision」之后,镜头停在他一张疲惫而警觉的脸上,眼周的缝合伤痕在多个取样点都可辨认。

毕竟相比安安静静地让两个人坐着对话,Vidu 一贯更有辨识度的那一面,还是那些有点中二、有点热血、恨不得把摄影机一起扔进战场里的大动作。
所以我们干脆把《黑神话:悟空》的天命人和《影之刃零》的魂,塞进一座暴雨中的破古寺,让他们打一场。

比较意外的是它没有靠频繁切特写来隐藏双方的位置,毕竟这是过去 AI 打戏最常用的「作弊」手法。
而生成视频的效果,大概就是很典型的「Vidu 式」玩法,先有一个足够抓人的设定,再把动作、镜头和特效全部推上去。
运镜应该为叙事服务
如果说高燃和大动作是 Vidu 很容易让人记住的一面,那么摄影机怎么跟着这些动作一起运动,大概就是另一半「Vidu 味儿」。
烂片和好片的运镜数量常常一样多,区别只在一件事,那就是镜头知不知道自己在拍什么。
就像跟拍是为了让观众追上那个人,环绕是为了让我们看清这段关系,推进是为了让情绪逼近顶点。AI 视频过去的问题常常是相机确实会动,但动着动着,人没了,空间也乱了。

而另一个模仿了《奥德赛》里,一条古船从独眼巨人手下逃出的那条视频。Vidu Q4 Preview 则有了更多细节,巨物的存在会真实地影响场景的光照,视频结尾从遮天手臂切到开阔金色海面,也让观众能清楚了解危险已解除。

跟拍、环绕、升降一次集齐,三条巨型机械沙虫冲锋,镜头从逃散人群的胸口高度,绕到主虫侧面,再升高追上顶部的骑手。

爆炸之后,世界的变化
到了特效这里,Vidu 那种眼前一亮的高燃表现力就更明显了。
巨浪、黑洞、冰裂谷、爆炸、机械沙虫……我们这次挑的案例几乎没有一个是平平无奇的。但 Q4 Preview 真正有意思的地方,也不是它终于学会了往画面里塞更多火花,而是这些东西开始真的影响周围的世界。
我们还是用一个 FPV 的视频,在落日海面上一道千米级潮汐巨浪,第一视角沿着水壁爬升,右绕翻卷水帘,越过浪尖,沿浪背另一侧下降。

另一个包含爆炸、宇宙黑洞等特效的空间站逃生视频同样干净利落。


搭配 2K、4K 等画质选项,我们能看到火光可以照到人物,烟雾也会影响视线,特效的出现很好地和世界进行交互。
我们体验下来,最直观的感受就是 Vidu Q4 最值得期待的地方,或许就是那些需要人物可以在一个近景里经历表情变化,以及大量的动态镜头能围绕目标推进,还有能接上后续动作的复杂特效。
这些成片也并非只靠一句提示词生成。参考图在这里的作用可以说是非常大,它像开拍前的一叠工作照片,人物长什么样,门开向哪里,镜头最后要停在哪个位置,都得提前交代。
Vidu 是最早提出「参考生」能力的视频模型之一,而到了 Q4 Preview,这项能力也在继续往更精细的控制方向迭代。
Vidu Q4 Preview 官方支持最多 15 张参考图,但我们实际体验起来,比数量更重要的,是让每张图清楚自己各自负责什么。

多图参考的能力,让我们的创作要求变得更具体的同时,也让视频验收有了依据。
试镜通过之后,开始谈薪酬
从手里小小的一块屏幕,到家里墙上的大电视,再到院线的巨幕,AI 生成的视频几乎已经霸占我们全部的视野。
我们对 AI 视频模型的期待越来越像是一个真实演员,在能力之外,我们还要考虑这个「演员」的片酬、流量、演技等等。
这些对模型的体验,和开头提到的试镜一样。而试镜这个环节最诚实的地方在于它是双向的:演员在试镜,剧组也在试镜。我们在判断这个角色值不值得签,角色背后的团队也在判断这个剧组值不值得来。
Vidu Q4 Preview 这个版本,本质上也是这么一场双向试镜。生数科技把这个「高表现力的旗舰模型」提前交给创作者,看它在真实工作流里的表现;而创作者也在用这几天的时间判断,这个「演员」值不值得放进自己未来的剧组名单里。

而 0.09 元 / 秒在改变的,还让这种「劲儿」不再需要一次生成就押中,我们可以大胆地玩、去不断尝试,去多生成几版。
更重要的是,从「分」时代的低成本试镜,到「角」时代的高清交付,不同画质档位都进一步降低了创作门槛。创作者可以先用低成本反复试镜,再用更高规格完成最终成片,把钱花在真正满意的镜头上。
正如电影拍摄里,真正昂贵的从来不只是最终留下来的那几秒,而是为了找到这几秒,前面试掉的几十条、上百条素材。
AI 视频也是一样,生成成本足够低之后,创作者才能真的像导演一样,多试一个表情、多换一个机位、多拍一条,再从里面挑出最好的那个。

五十多年前,马龙 · 白兰度往嘴里塞了两团棉花,用几十秒试镜换来了柯里昂。
今天,视频模型也在争取自己的下一场戏。试镜结束,真正的拍摄才刚刚开始。