首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

ComfyUI 中的 MiniMax H3 Day-0 支持:开放权重、原生音频和 2K 视频

2026-08-04 1 阅读 约3分钟阅读 vblanco
分享:
字号:
MiniMax H3 今天发布了开放权重,并且从今天早上开始就在 ComfyUI 中得到原生支持。零日。这是下一代开放权重视频模型。向其输入文本、图像、视频或音频,它会生成具有真实立体声的视频,最高可达 2K,每个剪辑最长可达 15 秒。这是MiniMax继Hailuo 01和Hailuo 02之后的第三代视频模型,也是该公司发布的第一个开放权重的视频模型。尝试使用 Comfy Cloud 文本转视频 — 仅提示。图像转视频——让图像栩栩如生。第一个和最后一个帧 - 控制开始帧、结束帧或两者,并让模型填充其余部分。视频参考 — 提供参考图像、视频或音频,并在剪辑中包含主题、动作或声音。输出可达 2K,持续时间长达 15 秒。音频与视频在同一通道中以立体声方式生成,而不是事后附加。这是 MiniMax 所具有的领先能力,它将五个独立的任务合并到一个模型中。真正的工作很少采用一种模式。 H3 将图像、音频和视频结合在一起,并根据解释它们如何关联的提示来解析它们。描述您的输入和您想要的镜头之间的关系,模型会自行处理跨模式工作。音频是模型的属性,而不是后期处理。每个音频输出都是原生立体声。运动传输对于图形工作来说是最重要的一项。参考视频可以提供动作——摄像机移动、表演、剪辑节奏——而主题和风格来自其他地方。与就地编辑相结合,这意味着对镜头进行迭代。让 H3 在消费类硬件上良好运行需要大量的机器学习工程。我们发现模型的调制权重(总参数的 40% 左右)可以被修剪并替换为功能等效的查找表,从而显着缩小内存占用,而不会损失输出质量。最重要的是,权重具有准确且高效的 int8 转换量化,并且自定义内核减少了推理过程中 VRAM 的使用峰值。结果使总内存占用量减少了 66%,从全精度的 123.6 GB 减少到最小型号变体的 42.5 GB。将此与我们的动态 VRAM 卸载相结合,使下一代 2K 视频模型能够在 RTX 3060 等 GPU 上本地运行。将 ComfyUI 更新到最新版本 0.30.0 或转到 Comfy Cloud 下载下面的工作流程,或在模板库中找到它们。下载 MiniMax H3 I2V 工作流程 下载 MiniMax H3 R2V 工作流程 下载 MiniMax H3 T2V 工作流程 按照工作流程中的说明下载模型并将其保存在正确的模型目录中。编写提示,连接任何框架或参考输入,然后运行。模型权重:🤗 Comfy-Org/MiniMax-H3 一如既往,享受创作!
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱