开发者生态
morning
MiniMax H3团队Reddit被问爆:2K要开源,图像模型在路上,Apache-2.0也考虑了
摘要
MiniMax H3 开放权重之后,开发者最关心的几个问题,终于有了官方回应。 8 月 7 日晚上 10 点,MiniMax H3 团队来到 Reddit 的 r/StableDiffusion 社区举行 AMA(Ask Me Anything)。 MiniMax H3 团队公开回应一切 参与此次交流的包括 H3 研究负责人 dacongya,研究员 Luigi、Nero、Kiro,系统工程师 R...
MiniMax
Attention
Sparse
Token
Reddit
Kiro
MSA
AMA
研究员
开发者关系负责人
2026-08-08
1 阅读
约10分钟阅读
李冬梅
字号:
MiniMax H3 开放权重之后,开发者最关心的几个问题,终于有了官方回应。 8 月 7 日晚上 10 点,MiniMax H3 团队来到 Reddit 的 r/StableDiffusion 社区举行 AMA(Ask Me Anything)。 MiniMax H3 团队公开回应一切 参与此次交流的包括 H3 研究负责人 dacongya,研究员 Luigi、Nero、Kiro,系统工程师 Reynor,以及 MiniMax 开发者关系负责人 Ryanlee。团队表示,讨论范围将涵盖模型架构与训练、视频生成、图生视频与参考生成、推理优化以及未来计划。 这场讨论受到相当高的关注。 截至发稿时,帖子已经积累超过 300 条评论,目前已经在 Reddit 页面被标记为“Finished”。 而从整个讨论看,社区关注的重心已经从 H3 在某个 Benchmark 上超过了谁,换成了一些更实际的问题,比如 2K 能不能本地跑?Sparse Attention 什么时候开放?有没有 4 步版本?为什么 Ref2Vid 比 I2V 糊?能不能拿它直接生成图片?Context-IR 怎么在本地复现?MiniMax 以后还会不会继续开放模型? 这些问题,也恰好指向一个开放模型发布之后真正困难的部分——开放权重只是第一步,围绕训练、推理、工具链和模型能力边界的东西,到底能开放到什么程度,才真正决定一个模型最终能形成多大的开发者生态。 H3 是 MiniMax 7 月 31 日正式发布的全模态视频生成模型,可以同时理解文本、图像、视频和声音组成的上下文,并生成最长 15 秒、最高 2K 分辨率、带原生双声道的视频。MiniMax 当时表示,会在符合法律法规的前提下开放模型权重。 而在这次 AMA 中,MiniMax 第一次比较具体地回应了开放之后的下一步。 InfoQ 整理了 Reddit 社区中讨论热度比较高的提问和H3团队的回答,以飨读者。 一些关键问题 用于最终 2K 输出的模型会不会发布? 社区最集中的问题,首先指向 H3 的 2K 能力。 H3 发布时,MiniMax 将 2K 输出背后的方案称为 In-context Regeneration。按照官方此前的解释,它没有走传统视频模型常见的独立超分路线,而是让模型结合原有的多模态上下文,对低分辨率结果再次生成高分辨率版本。这样做的目的,是让模型重新“生成”文字、纹理等信息,而不仅仅依赖超分算法从低分辨率像素中猜测细节。 但开放权重后,社区拿到的版本还无法完整复现线上 2K 能力。 于是有开发者直接询问:用于最终 2K 输出的模型会不会发布? MiniMax 开发者关系负责人 Ryanlee 先给出了一个非常简短的肯定答复:“会,而且不会太久。” 随后,H3 研究员 Kiro 给出了更完整的技术解释。 他表示,H3-Regenerate-2K 本质上是第二阶段的条件生成过程,但并不是简单地把目前发布的 H3 Base Checkpoint 再运行一遍,更不是传统意义上的 Upscaler。 这个阶段实际上使用了一个专门面向更高目标分辨率的 latent-space DiT regeneration checkpoint。基础模型此前生成的内容会作为额外上下文输入,同时部分参考输入也会以更高分辨率提供给模型。 H3 是否直接沿用了 M3 上的 MSA? 第二个高频问题是速度和显存。 H3 在训练后期已经使用稀疏注意力,但目前开放版本仍然以 Full Attention 推理。随着视频分辨率和时长提高,Attention 的计算和显存开销会快速膨胀,因此 Sparse Attention 被不少开发者视为 H3 后续最重要的本地推理优化之一。 有人询问:H3 是否直接沿用了 MiniMax M3 大模型上的 MSA,也就是 MiniMax Sparse Attention? Kiro 给出了明确答案:H3 没有使用 MSA。 H3 的方案更接近 MoBA-style block selection。其基本思路是利用相邻视觉 Token 高度相关的特征,将一组 Token 进行 mean pooling 得到 Block Representation,再利用这些表示判断哪些 Block 更重要,从而减少不必要的 Attention 计算,同时不需要额外训练一个 learned indexer。 目前,这套方案只针对视频 Token 做了三维稀疏化,图片和文本 Token 尚未进入同样的稀疏路径,不过团队正在研究进一步扩展。 MiniMax 表示,计划近期给社区提供一个相对保守的 Sparse Attention 参考实现,第一目标不是追求一个夸张的加速数字,而是做到没有可感知的质量损失。真正针对不同 GPU 获得最大加速,还需要进一步的硬件适配和社区参与。 如果这一实现最终如期开放,那么现在社区基于 Full Attention 测得的 H3 本地运行成本,很可能还不是它最终能够达到的效率水平。 会不会推出官方 4-step 或 8-step 版本? 比 Sparse Attention 更直接的问题是:能不能少跑几步? H3 开放后,第三方 Turbo LoRA 很快就出现了,因此网友直接询问 MiniMax,会不会推出官方 4-step 或 8-step 版本。 Kiro 首先解释,目前发布的 H3 Checkpoint 本身已经包含 CFG Distillation,最终训练阶段也采用了一种特殊策略,因此模型本身已经具有一定低步数推理能力。 但它并不是一个专门针对极低步数蒸馏出来的模型。 在最初的回答中,Kiro表示团队仍在研究进一步的 Step Distillation,但没有正式公布固定的 4/8-step 目标;随后在回答另一名网友关于 Turbo 版本的问题时,团队把路线图说得更具体了一些:MiniMax 正在积极考虑 4-NFE 或 8-NFE 这样的低步数版本。 但团队仍然强调,暂时无法承诺近期提供。默认目标首先是降低推理成本,同时尽量不产生用户能够明显感知的质量下降。 这与社区现在正在进行的尝试形成了有意思的反差。 目前第三方 H3 Turbo LoRA 已经迅速出现,LightX2V 甚至发布了 4-step Turbo LoRA 预览版本。 但社区测试同样发现,激进减少步数之后,人体结构、运动质量甚至音频都可能明显受损。有用户测试 Turbo 版本后直接评价,运动和 Anatomy 出现了明显退化;LightX2V 4-step 版本的早期测试中,也有人遇到音频质量严重下降。 所以 MiniMax 暂时不急着宣布一个“4 步 H3”,背后的问题并不是做不到,而是如何把加速和质量损失之间的账算清楚。 如何生成完美无像素化的片段,现在H3 在这方面有 Bug 吗? 还有Reddit 用户提到,生成的画面中,远处的角色总是会出现像素化和变形,无论是图生视频、文生视频还是参考图生视频都是如此。即便他使用了2K分辨率和25步采样,问题依然存在。他问道,要生成完美无像素化的片段,推荐的步数(Steps)、采样器(Sampler)、调度器(S
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱