视频模型沉寂了大半年,最近突然热闹了起来。
一天内,Seedance 推出 2.5,升级新版本,而 MiniMax 也发布了新模型 H3。
这操作属实不常见,世超看了看 Articifial Analysis 的三个视频榜,发现 MiniMax H3 直接凑了个 1,2,3。
好家伙,隔这儿收集奖杯呢?
而且更牛的是,这模型还是开源的,在海外创作者里也引起了不小的讨论,大伙儿纷纷下场测试。
有说它指令遵循精准的,视频模型终于能在黑板上正确写字了。
还有说它一致性出色的,电影叙事和商品广告的效果很好。
搞这么热闹,那我得尝尝味道如何了。
搓了一堆视频后,先省流一波,这模型确实有点东西,2k 画质下,细节和稳定性都很在线。
尤其是它 AI 后期的效果,美术风格确实带感,一度让我惊讶这种文字加排版的复杂视频,居然是模型搓出来的。
还有定价,768P 分辨率五毛一秒,2K 则是八毛,大概是之前一些旗舰模型三分之一的价格,性价比这块儿相当能打了。
话不多说,咱先跑一下刚刚的案例验验货,只给一句话,让它写个欧拉公式看看成色。
这任务听着简单,就画几个符号的事儿,但实际上无数视频模型都翻过车,不是不晓得公式为何物,就是还没落笔,字儿就凭空出现了。
这次 MiniMax H3 的表现不赖,你不能说它完美,但这物理因果基本是对的。
起码手,粉笔,字迹看上去合理,不漂移,粉笔写出来的质感和敲击黑板的配音也都没毛呲。
接下来再瞅瞅光影表现,甩给它一张 3A 射击游戏的截图,让它还原一下战场氛围。
看这效果,你不说我以为又开了一把了呢,这光追我平时搁自己电脑上都舍不得开。。。
大伙儿也可以关注一些细节,比如左上角的小地图,在人物转动视角的时候,它是会跟着一起转的。还有开枪的时候,枪声和抛壳的频率也是一致的。
这就是原生多模态的好处了,它能更逼真地模仿物理世界,画面声音和物理规律会相对统一,不容易穿帮。
不过右下角的备弹数量还是漏了点马脚,这些小纰漏或许等模型能力再迭代几轮才能搞定。
当然,多模态还有个好处,就是生视频的时候,你有啥素材只管往里丢就行,什么图片,视频,音频,都能当参考。
比如这里来个大杂烩,先放个视频当运镜参考,再来点人物和分镜图,最后加俩音频当他们说的话,可以说是能喂的都喂了。
视频里它倒也能接得住,猫狗的毛发都挺有质感,一致性也稳到了最后。
尤其是指令遵循上,提示词里五花八门的要求基本都满足了,切镜,神态,以及精准卡点的一声叫,都很带感。
唯一的遗憾是我忘加背景 BGM 了,为了省点儿积分,手动加了一下,味道更足了,进军二创视频指日可待。。。
但话说回来,整活儿只是稍带的,MiniMax 更强的地方其实是视频编辑,别忘了,编辑相关的跑分它干到了 AA 榜的第一位。
我直接对着桌面来了个实拍,配合中年帕金森的轻微手抖,看看它能怎么拯救视频效果。
结果相当 Amazing 啊,虽然没什么炫酷的特效,但加的这个手绘小玩意儿还挺灵动。
它从空中飞到鼠标上,顺着镜头爬了两圈,一个蓄力跳到了键盘上,跳跃的动作跟手抖的部分正好吻合,也是让我运上镜了。
接下来我又试了试多模态的编辑,说人话就是把音频也放进来一起处理。之前可能就需要另外找个音频模型,先提取音色,然后生成配音,最后再回到视频模型这儿融合。
但 H3 处理起来要简单些,克隆声音就顺手的事儿。咱素材复用,让写公式的老教授开口念几句诗,把一段美式口音丢进去让他克隆,再换成英音朗诵。
老教授台风很稳,扎好架子就开读,声音克隆的很还原,正宗老伦敦读莎士比亚,味道就是正,口型没毛病,肢体小动作也是话剧演讲的那套,镜头一拉很专业好吧。
测试到这儿,也能感觉出来,MiniMax H3 真正值得聊的,其实不在于能不能搓个以假乱真的镜头。
因为真实感是个慢工出细活儿的差事,需要大量数据和算力喂养,一眼看不到尽头。
它或许是视频生成模型的主线,但肯定不是唯一,因为一条真正拿去用的视频,除了画面真实感,还要有文字排版,剪辑转场,乃至音效和独特的视觉风格,这些都得打磨。
而 MiniMax H3 的特别之处就在于,它试图参与到片子的后期制作当中。先是点了多模态的技能,又在文字一致性上下功夫,配合不俗的世界知识,整体的编辑可控性比起之前就强了太多。
所以接下来,我准备从基础的文字开始,一步步加码,看看它到底能把 AI 后期做到什么程度。
先看文字,直接扔一段歌曲进去,让它做一段歌词的 MV。
以前老模型做这种视频,先不说字体字形的准确性,一旦运动起来,即使前面几帧对了,后面也有可能模糊掉。
但 MiniMax H3 的处理精准的多,它提取了 Prompt 中的主要描述词,先统了一下风格,明确要搞成旧杂志拼贴的样式。
然后将歌词,人像和线条融合进报纸碎片中,文字不只是字幕,会参与进视觉设计,随着音乐缩放。背景也不是无关元素的堆砌,词里有蓝色,报纸上是真会甩几滴蓝色油漆。
再细点看的话,倒是有一处拼写错误,刚开始的「try」它拼成了「ttr」,得微调一下,不过整体文字的动态排版还是挺靠谱的。
作为歌词的 MV,这套东西完全可以批量合成,演唱的时候就能直接放大屏幕上,维持风格的同时每场还能整点花活儿。
文字站稳后,我又给他上了一张橙子汽水的静态海报。
这次,我想看它在稳定文字的基础上,能不能往专业剪辑的方向靠,给产品加动态镜头,处理好空间关系。
成片效果不错,汽水罐从平面中央逐渐靠近,罐体,冰块,水花冲出原本的海报画框。
这个前后景的对比很取巧,它不是那种简单的图片转动图,而是用线框划分开空间,突脸给你来个 3D 效果,既维持了原来的视觉特征,又能把汽水的冲击力渲染出来。
不过,一张海报再怎么冲出屏幕,本质上还是一个镜头。真正的广告片,还得会组织多个画面。
我们请出编辑部老员工火锅 ( 幼年版 ) 当模特,拿起汽水罐,做一条逻辑完整的汽水广告试试。
设计是这样的,开头让火锅打开汽水喝一小口,然后给特写,人物不断换装,然后整体的元素随主题变换。考验的是 H3 的资产调度和多镜头的连续性。
来看成片,15 秒的时间叠加了 4 套主题,但无论怎么转场,火锅以及橙子汽水罐的特征都没变形,整套橙色视觉系统也延续了下来。
特别是动效组合的不错,汽水罐旋转时有变速,周围配饰以及上方字体弹出也有惯性,配合 BGM 相当丝滑。
这种效果比起拿 AE 手搓可能差点细节,但都这个速度了,还要啥自行车。
况且我也就抽了一次,一批两个视频,第一个汽水罐是上下转的,第二个则是左右转,考虑的还挺全。。。
当然,说到 AE,比较常见的就是 MG 动画,这个其实是更偏后期的视频类型。
它比看上去要难得多,因为上面的宣传视频有角色和产品可以当现实参考,但 MG 动画里,文字怎么拆,粒子怎么飞,怎么组合都得自己来设计。
咱直接拿差评前沿部的 Logo 交给它,让 MiniMax H3 做个动画瞧瞧。
你别说,整得还挺花里胡哨,整体特效围绕粒子和线条构成,先散开延展出去,然后在三维空间中旋转,最后又收束重组回来。
21:9 的宽幅比例下,视觉重心也没跑偏,尤其中间一闪而过的黑白效果,看着还挺酷炫的。
最后,咱把前面这些东西打包塞一起,给它上个更难的任务,让它模拟一下游戏的菜单选人界面。
结果视频效果非常利索,整体街头涂鸦的风格很耐看,跟友情客串的火锅也正好匹配。
菜单文字没跑偏,光标点击也有反馈,甚至还能换装,安装不同配件,这些变化都会实时反馈在火锅本体上。
菜单到游戏的转场也很流畅,报纸糊住屏幕再撕开,火锅就蹿到了街区上。
虽然这本质还是段动画,但对于游戏制作而言,这玩意儿已经能被拿去当概念设计,或者提案的 Demo 了,应用价值非常明确。
一堆测试跑下来,MiniMax H3 的长板其实已经很清楚了,就是它非常来劲的 AI 后期能力。
除了生成漂亮的镜头,它还想帮你剪完整的片子。
虽然没强到指哪打哪,但它缩短了普通人跟成片之间的距离,你不用学太多剪辑技巧, 靠描述也能搓个及格的作品出来。
22 年的时候,Stable Diffusion 1.5 模型的开源引爆了 AI 绘画的热潮,社区里大伙儿 DIY 得火朝天,各种微调工具层出不穷。
而这次的 H3 视频模型也选择了开源,那它未来会被大家折腾成什么样子呢?
这个我是真想看看。。。
撰文 :风华
编辑:江江&面线
美编:素描
图片、资料来源 :
Artificial Analysis,X,MiniMax官网,海螺AI;
汽水转场动画灵感参考BV1QGKb6EE1d;
模特火锅友情贡献数字形象。