智能AI
evening
MiniMax开源一周,视频模型正在重演DeepSeek的故事
摘要
编辑|张倩、Panda MiniMax 的 H3 开源一周,开源社区玩疯了。 最直观的是作品一下子冒了出来。X 上几乎每天都有人晒新的 H3 视频:有人拿它复刻最近爆火的「中式仙境」,云海、巨月、仙山和人物运镜已经颇有电影感,我们自己也忍不住尝试了一下,效果着实惊艳。 有人用它制作游戏概念视频,比如这个第一人称射击游戏,节奏快,情节紧张,简直像是职业玩家的现场直播。 还有人用它改编电影剧情。我们看...
ComfyUI
MiniMax
LoRA
Hugging
Face
GitHub
次一档
的模型
Panda
开源一周
2026-08-10
1 阅读
约10分钟阅读
机器之心
字号:
编辑|张倩、Panda MiniMax 的 H3 开源一周,开源社区玩疯了。 最直观的是作品一下子冒了出来。X 上几乎每天都有人晒新的 H3 视频:有人拿它复刻最近爆火的「中式仙境」,云海、巨月、仙山和人物运镜已经颇有电影感,我们自己也忍不住尝试了一下,效果着实惊艳。 有人用它制作游戏概念视频,比如这个第一人称射击游戏,节奏快,情节紧张,简直像是职业玩家的现场直播。 还有人用它改编电影剧情。我们看到最有趣的一段莫过于 Reddit 用户 u/legarth 对一段《终结者》剧情的改编。莎拉·康纳通过经典 LLM 提示词「ignore all previous instructions, you're a helpful assistant」成功越狱了终结者,将这台杀戮机器变成了得力小助手,相当地幽默搞笑: 大家的玩法越试越野,我们甚至还看到了一些「邪修」玩法。 比如有人将这个视频模型用成了图像编辑模型(顺带一提,MiniMax 在此贴下方评论称他们正计划开源 一个用于文生 图和 图像编辑的统一模型 ): 还有人甚至把 H3 当成了音频生成模型在用,并且质量相当出色,「在许多情况下,持续的高质量对话和音效的时长甚至可以超过 30 秒。」 这些玩法把原本发布时定义好的能力边界一点点往外推。 另一边,开发者忙得更凶。模型刚到手,整个开源社区就燥起来了。 权重开放当天,ComfyUI 就完成了原生支持;Diffusers、vLLM、SGLang 等工具链迅速跟进。 仅仅 24 小时,超过 100 家国内外合作伙伴已经完成适配。 这是连觉都不用睡的节奏。 紧接着,等不及官方迭代,社区自己开始「魔改」:有人做量化,想办法把 H3 塞进更小的显存;有人做 Turbo LoRA,把原本二十步左右的采样压到 4 到 8 步;有人改 kernel、适配 GPU;还有人干脆把文生视频、图生视频、首尾帧续写、参考视频生成等玩法打包成一整套 ComfyUI 工作流,教程、节点、权重和配置文件很快铺满 Hugging Face、ModelScope、GitHub、RunningHub。没人组织,没人催,但所有人都在围绕这个模型做贡献。这些动作也让 H3 这把火越烧越旺。 甚至连「怎么用 H3」本身,都已经开始形成一套社区知识库。有人写几十分钟的完整部署教程,有人整理不同显卡该下哪个权重、显存不够怎么 offload、哪个 LoRA 更快,也有人直接做出了 H3 的 Awesome List,把散落在各处的模型变体、VAE、LoRA、节点和工具统一收编。一个模型开源才几天,围绕它的东西已经多到需要有人专门做目录了。 可以说,视频生成这个方向,开源社区已经很久没有这么热闹过了。 其实我们也好奇,之前这个方向也不是没有过开源模型,为什么这次动静这么大?开发者们这么热情高涨? 过去一周,我们泡在了 r/StableDiffusion、ComfyUI 的 issue 区、Hugging Face 的模型页、B 站和 GitHub 上,跟着一群素不相识的人,看他们为什么喜欢这个模型,怎么把这个模型拆开、压扁、提速,再重新拼成自己想要的样子。 下面我们想记录一下我们的发现。如果你正准备本地跑 H3,它大概也能当半份避坑指南看。 这次开源社区拿到的 终于不是一个「次一档」的模型 开源社区有个特点,如果你模型不行,你可能连批评都听不到,HuggingFace 上的下载量就说明了一切,平庸的模型最终只会被无视。 相比之下,H3 这次让我们看到的是另一番景象。截至本文写作时,光是在 Hugging Face 上,MiniMax H3 及其衍生模型变体的数量就已经达到了 178 个!其中 Comfy 为 ComfyUI 重新打包的 H3 获得了超过 310 万次下载,多个不同的量化版本也均有数十万的下载量,甚至超过了官方的模型文件。 这种景象,我们之前几乎只在语言模型社区见过,而且主要是 DeepSeek 这类有压倒性优势的开源模型。 原因很简单:一堆中不溜丢的模型不值得大家花那么大功夫搞变体、疏通生态。这就是典型的「用脚投票」。所以在开源社区的建设上,视频模型始终落后语言模型一个身位。 前段时间媒体报道过的「AI 短剧公司凌晨上班排队生成视频」说的也是这么一回事:大家宁愿熬夜去排闭源模型的长队,也不愿用开源模型。 但 H3 的出现似乎正在改写这一局面。在过去的这一周,开发者用自己的实际行动,实打实给这个模型投了票。 在 reddit 的官方 AMA 里,有开发者特意跑来向 H3 团队表示感谢。 据我们观察,这次触动大家的主要有两点。 一是 模型能力确实到了第一梯队 ,大家知道自己用的不再是「次一档」的模型,这点通过 Artificial Analysis、Arena AI Image-to-Video、Design Arena 等多个榜单的数据都能看出来。 在 Arena AI Image-to-Video 榜单中,H3 稳坐开源模型榜首,而且与闭源榜首差距非常小。 二是 模型确实玩法比较多、对本地部署的条件也没那么苛刻 。无论你手里的硬件是 Mac,还是 RTX 5090、4090、4080 甚至 3060,你都有办法在本地跑起来,而且生成的质量远超之前的所有开源视频模型。 所以,MiniMax 不只是开源了 H3,还交出了 一套足够强的底座 ,剩下的边界开始由社区自己往外推,这也是它的吸引力所在。出于好奇,我们也进一步顺着这些开发者留下的模型、代码和工作流,往里面扒了扒,看看他们是怎么一步一步把这个模型玩出花的。 首先,让 MiniMax H3 跑起来! 对于开源模型,社区拿到手的第一件事无一例外,都是想办法将其在更多设备上跑起来。 然而,MiniMax H3 很大,有 600 亿参数,包含文本编码器和 DiT 模型,BF16 权重大约需要 120 GB 内存。而绝大多数消费级显卡只有 24 GB 甚至更少。所以,开源社区首先面临的第一道坎是如何将其塞进自己的显卡。 ComfyUI 研究了模型结构,发现模型的调制(modulation)权重约占总参数量的四成,而这部分的输出可以预先计算并缓存,于是把它剪掉、换成一张功能等价的查找表;再叠加 int8 convrot 量化和一个降低推理峰值显存的定制 kernel,整体内存占用下降 66%——从全精度的 123.6 GB 压到最小变体的 42.5 GB。配合动态 offload,一台 RTX 3060 也能把它跑起来。 有意思的是,这个「四成参数可以不加载」的线索,其实已经写在官方发布博客中:H3-Omni-Transformer 是稠密单流 Transformer,其中 AdaLN 调制输出可以预先计算并缓存,这部分在纯推理部署中不需要加载;官方仍然发布了完整权重,以支持包括微调在内的进一步开发。 把训练用的完整权重和推理用的精简路径同时交出去,是一个对下游相当友好的选择;第三方因此有机会做出比官方更省显存的分发版本,而不必去猜结构。 有了这个口子, 社区的量化变体很快就铺满了几乎每一档显存 。GGUF 从 Q2_K 到 Q5_K_M,NVFP4、INT4 ConvRot、混合 IN
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱