智能AI
morning
Seedance 级别的全模态控制,MiniMax H3 的商业视频成片新解法
2026-08-01
1 阅读
约10分钟阅读
张子豪
字号:
今天无处不在的 AI 短片,越来越酷炫的生成效果,会不会给你带来一种错觉:这年头生成视频太轻松了,一句话就行? 在 APPSO,我们尝试了很多不同的视频生成模型,发现答案并没那么简单:那些可以被当做样例展示的「AI 大片」,大多数都是拿 AI 生成一大堆素材,再到视频编辑软件里通过人工后期修剪、配乐、精细调整的结果。 AI 是做到了可以生成越来越像电影的画面,但电影之外,还有一个更大的市场。 每天都有大量广告、电商、游戏、产品发布、UI 展示、品牌包装视频正在制作,它们不一定追求奥斯卡级镜头,却更在意另外几件事:读懂创意需求,对视频进行精准编辑, 把原本分散在生成、剪辑、字幕、动效和声音等多个环节的步骤,汇合成一套完整的可交付结果。 今天 MiniMax 发布了新一代开源视频模型 MiniMax H3,有着「Seedance 级别」、「全模态精准控制」,以及「AI 原生后期」能力。 我们想看看,它到底能不能把视频生成里那些额外的工作,也一并给解决? 经过初步测试我们发现,简单的人物/背景/物体替换、基于参考视频学习风格并复制、根据文字需求直接生成一支产品概念片等,都是它的强项。尤其是针对特效剪辑包装类视频,广告、电商、UI 设计等场景,基本上都有不错的表现。 除了模型的能力,MiniMax H3 还有一个更现实的特点—— 通过技术积累,给企业客户和创作者带来更低的使用成本。 再加上解决了生成「不可控」、「离成片远」的问题,我们发现MiniMax H3 不仅作为视频生成模型本身更能打了,也对非视频专业的用户更友好了。 🔗 体验地址:hailuoai.com 或下载 MiniMax Hub 给自己 Vibe Coding 的插件做一个宣传片 和 Seedance 一样,H3 也是一款「开放通用多模态视频模型」,它支持文字、图片、视频和音频混合输入,一次最多使用 9 张图片、3 段视频和 3 段音频,混合文件上限为 12 个。 我们直接把前段时间 Vibe Coding 做的一个浏览器标签页总结扩展的截图发给它,一共 7 张图片,再加上 Google 发布的 Materail 3 设计介绍视频。提示词只有一句话,就是要求它根据这些图片内容,制作一个工具介绍视频。 H3 的速度很快,我们选择了两个视频,也不用等很久。最后出来的结果相当意外,根本不需要我们去写任何的转场以及动效,模型自己就知道最合适的呈现方式。 两个视频有不同的效果,但要表达的内容以及产品的主视觉都做到了保持一致。 视频中的主要文字也都能准确渲染,但当遇到较小和密集的文本,H3 还是会偶发乱码的问题。这也让我们发现: 大多数情况下,上传图片的画质会决定模型生成的准确性。 如果使用的截图,在这些小字部分都足够清晰,视频模型在处理时,能降低很多错误率。 此外,这两个视频都是一次性生成,完全没有抽卡。 能做类似的宣传片,也能覆盖更多场景下的包装成本。从广告、游戏、电商等行业,我们都用 H3 做了一些简单的测试,基本上都能满足最初的交付期待。 先是一个简单的 ID 片头,我们临时编了一个名叫 NULO 的 AI 设计工具,它没有真实产品,也没有现成的 Logo 和 UI。 不同于上一个案例的「无责任」极简提示词,这次我们专门测试了用更详细的提示词进行精细控制,用文字写清画面顺序:三个写着 IMAGE、VIDEO 和 AUDIO 的卡片依次出现,组合成 NULO 字标;字标随后展开为产品界面,增加 EXPORT;最后,所有组件重新收拢成 Logo,出现「MAKE IT MOVE.」。 ▲ 生成一支 10 秒、16:9 横版的虚构 AI 设计工具品牌片,品牌只叫「NULO」。这是 motion branding / UI product film,不是人物剧情片。 0–2 秒:石墨黑背景,IMAGE、VIDEO、AUDIO 三张素材卡片从画面边缘沿节拍进入,吸附并组合成 NULO 字标。 2–5 秒:字标通过形状变形展开为极简产品界面。界面只允许出现四个英文标签:IMAGE、VIDEO、AUDIO、EXPORT。卡片通过遮罩和弹性伸缩进入时间线,当前选中框变为荧光橙。 5–8 秒:界面只切换一次,变成最终海报预览;一条荧光橙色轨迹穿过各节点,每经过一个节点就同步一个清晰的点击或滑动音效。 8–10 秒:全部 UI 组件收拢回 NULO Logo,结尾标语「MAKE IT MOVE.」停留 1 秒。 要求:所有文字清晰、拼写完全正确、各只出现一次;不要新增单词、按钮、Logo 或人物;品牌色仅用石墨黑、暖灰、荧光橙;转场只用形状变形、遮罩、卡片伸缩与颜色扩散,不用淡入淡出;配原创极简电子音乐,动画节点必须与鼓点和音效同步。 这次,H3 还给生成的视频配上了动感的音乐,视频中四个英文单词都拼对了,石墨黑、暖灰和荧光橙也从头保持到尾。此外,模型还自动加了一块带节点连线的抽象界面,让卡片、字标、轨迹和片尾看起来属于同一套设计——整体上,H3 实现了全方位的一致性,令人满意。 以上都说的是非专业使用习惯。如果换成专业人士的工作习惯,不用提示词,也不让模型发挥想象,直接给它一套完整的分镜图,效果又会怎样呢? 我们先用 GPT Image 2 生成了一张机车的图片,然后根据这张机车图,生成一张机车的 TVC 15s 分镜。 分镜版其实比较模糊,而且图片是横着展开的,不符合一般的分镜设计,但MiniMax H3 还是读取到了应该要呈现的信息,对画面进行了重新布局。 同时,该显示的文本信息,在做到了字体的完整还原之外,H3 还会进一步理解文字与画面的关系,将文字作为视觉设计元素融入场景,而不仅是简单叠加、生硬地照搬。 就像这里,把机车的名称和 Logo 等文字,没有简单地照搬分镜放在左边,而是放在了机车下方,更符合视频的观看体验。 同样的方式,我们也让 H3 给 iPhone Fold 做了一个 10s 的广告视频。 这些 AI 生成的作品,基本上都能算得上一个完整的 Demo,可以用在社媒、广告或游戏里—— 这也是我们在测试后认为 H3 最大的优势:它不但兼容专业视频工作者的工作流,更让非视频专业,但要经常跟视频打交道的那些用户,能够以极低的门槛,制作出优秀的 demo 和提案素材,并且在后续的工作中显著降低非专业用户与专业用户协作时的沟通障碍。 如果说过去用 AI 生成视频,是在给剪辑师「增加找素材的工作量」;那么 H3 给人的感觉,很像是内置了一个懂设计的「AI 后期组」。 我们继续用它来生成一段虚构的时尚品牌片,这次指定了模特、背景甚至还有音乐。 如果去掉视频右下角的水印,很难发现这个视频是由 AI 制作的。MiniMax H3 把我们指定的人物、包袋、汽车和荒漠公路都做到了完美结合,最后还用了一个快速的平移,准确展示所有文本。 随着模型多模态理解、指令遵循等多项能力的提升,H3 可以更好的理解视频内容、用户意图,自动完成特效包装和视觉设计的增强。这些特性的存在,让 H3 在我们的测试中所生成的结果,往往更接近一条成片,而非简单的片段或素材。 除了融合产品 UI 和动态包装,H3 还能生成具备视觉融合度的游戏 HUD 界面。我们用 GPT-Image-
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱