MiniMax H3 开箱体验
最近在 Hacker News 上看见 MiniMax 新出了视频生成模型 H3。我其实一直对视频模型没有太大的兴趣,因为想不出什么很好的应用(我看许多 YouTuber 都用视频模型来做场景重构片段,算是一个比较实用的玩法了)。不过当我看到炸裂的模型尺寸(修剪量化过后的模型合计也要 60 GB 以上),反而感兴趣拿来玩玩看了。
第一个任务,就是想测试一下许多光卖颜值,毫无演技的国内「明星」们是不是可以准备退休了,遂写了一段假装一波三折的内心戏。
富有质感的电影,刻画人物内心的特写镜头。浅景深,电影颗粒效果。人物表现细腻丰富且自然,极佳演技。
一位普通的中国年轻女性,大约 35 岁,细鼻梁,皮肤细腻。她双眼看着下方,突然好像意识到了大事,内心震惊。她眼神飘忽不定,嘴角因为内心波动而颤抖多次。她张开一点点嘴,欲言又止,两眼开始翻红,眼泪湿润眼眶。她说“为什……”,然后眨了一下眼,右眼流下一行浅浅的眼泪。她连忙拿手擦拭掉,叹了一口气镇静下来。她抬眼对着镜头,说“无所谓”。她的嘴角微微抽动一下,然后强作欢颜露出一个微笑。
运镜:固定镜头,人物特写,保留整个脸部,头发保留刘海部分。
无字幕、无音乐、无文字、无水印、无标识、无卡通形象。
效果还是挺让我震撼的:这至少也能跟现在「一线女演员」的演技打个平手了吧。不过尽管我多次强调角色的嘴角要「颤抖」、「抽动」,这个演技还是缺乏了一点张力。也许提示词加一个「患有帕金森氏病」之类的能达到这个效果?1
接下来想看看这个模型对无厘头场景的物理理解力:
一段普通的手机录像
一个 3 岁的小男孩,站在家里的木地板上,他右手拿着一辆玩具汽车。他前面放着一些层叠的物品:最底下是一支竖立的铅笔,笔头朝上站在地板上。铅笔上平衡地放着一本书,书脊上写着“天才儿童”。书上放着一颗静止的水晶球。有一只猫单脚站在水晶球上,纹丝不动。小男孩想把玩具汽车放到猫的身上,结果猫跳走了,物品倒塌在地上。于是小男孩单脚站在了水晶球的上面,另一只脚腾空,身体保持平衡。
运镜:手持镜头,包含小男孩全身和所有的层叠物品。
无字幕、无音乐、无文字、无水印、无标识、无卡通形象。
试了几次,笔头好像都会朝下。我想是模型默认我描述的那个难度系数不够拉风,自己给调过来了。天才儿童的「童」字复杂度好像超过了解析度容许范围?水晶球里的倒像感觉很酷,至少看起来跟视频的其他部分很同步。不过大问题是我让它镜头要包含男孩的全身,但实际上因为是横版视频的原因还是选择了只生成脚的部分。这要怪我不想在博客里插入一个竖版视频。
MiniMax H3 的一致性还是非常厉害的,基本上不太再需要海量抽卡2。如果生成三五个视频发现在同一个地方翻车的话,大概率就是提示词有问题,或者涉及的内容对于模型过于复杂(比如上面的演技部分)。不需要抽卡就能节约大量的电费和时间,这算是目前 AI 实用化里最重要的改进方向了。只要有想法,人人都能在家制作大片,从「自我实现」的角度看,这真是一个神奇的时代。