首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GitHub 热门项目: 扩散管

2026-09-02 1 阅读 约5分钟阅读 GitHub Trending
分享:
字号:
GitHub 项目:扩散管 仓库地址:https://github.com/tdrussell/diffusion-pipe 明星:2013 | 作者:特德鲁塞尔 项目描述:扩散模型的管道并行训练脚本。 =================================================== 自述文件内容: # 扩散管 用于扩散模型的管道并行训练脚本。 支持的型号:SDXL、Flux、LTX-Video、HunyuanVideo (t2v)、Cosmos、Lumina Image 2.0、Wan2.1(t2v 和 i2v)、Chroma、HiDream、Stable Diffusion 3、Cosmos-Predict2、OmniGen2、Flux Kontext、Wan2.2、Qwen-Image、Qwen-Image-Edit、HunyuanImage-2.1、AuraFlow、 Z-Image、HunyuanVideo-1.5、Flux 2(Dev 和 Klein)、Anima、Ernie-Image、LTX 2.3、Ideogram4、Krea 2、MiniMax H3。 ## 特点 - 管道并行性,用于训练大于单个 GPU 所能容纳的模型 - 记录到 Tensorboard 的有用指标 - 在保留的评估集上计算指标,用于测量泛化性 - 训练状态检查点并从检查点恢复 - 高效的多进程、多 GPU 预缓存潜在和文本嵌入 - 无缝统一支持图像和视频模型 - 通过实现单个子类轻松添加新模型 ## 最近的变化 - 2026-08-08 - 为 MiniMax H3 添加 CFG 增强训练。您需要启用它,请参阅示例 TOML 文件。您可能总是想使用这个或培训适配器。 - 2026-08-06 - 支持MiniMax H3。仅 T2I 和 T2VA 培训。 - 修改数据集代码以支持视频中的音频。 - 允许直接在量化模型上训练 LoRA。理论上,这应该适用于任何基于 ComfyUI 的模型(Z-Image 及更高版本,不包括 Anima)。 - 简化了一些潜在的缓存代码。如果训练 Z-Image、Flux2 或 Ernie-Image,请确保“--regenerate_cache”,因为潜在缩放现在是在缓存阶段而不是在模型中完成的。 - 2026-06-24 - 支持韩国2。 - 2026-06-07 - 从 Flux2 中移除注意力屏蔽。即使有填充,该模型也应该采用完整的 512 长度文本嵌入。 - 这给出了稍微较低的起始损失,但似乎对最终的训练结果几乎没有影响。不过,理论上现在应该更好了。 - 删除缓存文件夹或使用“--regenerate_cache”,否则您可能会从旧的缓存文件中得到张量形状错误。 - 对于基于 ComfyUI 的模型(Z-Image 及更高版本),支持直接从 Comfy 量化权重进行训练,例如fp8_scaled。 - 支持表意文字4。 - 2026-05-15 - 初始 LTX 2.3 支持。目前只有 T2I 和 T2V 培训,没有音频。 - 2026-04-23 - 支持厄尼图像。 - 2026-02-04 - 支持阿尼玛。 - 2026-01-16 - 支持 Flux 2,Dev 和 Klein 均支持。 - 更新了 DeepSpeed 版本。也许应该更新所有要求:`pip install -rrequirements.txt -U`。 - 2025年12月20日 - 支持混源视频-1.5。目前仅支持 T2I 和 T2V 训练。 - 使用 GenericOptim 时添加梯度标准记录。 ## Windows 支持 在本机 Windows 上进行培训将很困难或不可能。这是因为 Deepspeed 仅具有[部分 Windows 支持](https://github.com/microsoft/DeepSpeed/blob/master/blogs/windows/08-2024/README.md)。 Deepspeed 是一项硬性要求,因为整个训练脚本都是围绕 Deepspeed 管道并行性构建的。豪
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱