开源推荐
morning
GitHub 热门项目: 扩散管
2026-09-02
1 阅读
约5分钟阅读
GitHub Trending
字号:
GitHub 项目:扩散管
仓库地址:https://github.com/tdrussell/diffusion-pipe
明星:2013 | 作者:特德鲁塞尔
项目描述:扩散模型的管道并行训练脚本。
===================================================
自述文件内容:
# 扩散管
用于扩散模型的管道并行训练脚本。
支持的型号:SDXL、Flux、LTX-Video、HunyuanVideo (t2v)、Cosmos、Lumina Image 2.0、Wan2.1(t2v 和 i2v)、Chroma、HiDream、Stable Diffusion 3、Cosmos-Predict2、OmniGen2、Flux Kontext、Wan2.2、Qwen-Image、Qwen-Image-Edit、HunyuanImage-2.1、AuraFlow、 Z-Image、HunyuanVideo-1.5、Flux 2(Dev 和 Klein)、Anima、Ernie-Image、LTX 2.3、Ideogram4、Krea 2、MiniMax H3。
## 特点
- 管道并行性,用于训练大于单个 GPU 所能容纳的模型
- 记录到 Tensorboard 的有用指标
- 在保留的评估集上计算指标,用于测量泛化性
- 训练状态检查点并从检查点恢复
- 高效的多进程、多 GPU 预缓存潜在和文本嵌入
- 无缝统一支持图像和视频模型
- 通过实现单个子类轻松添加新模型
## 最近的变化
- 2026-08-08
- 为 MiniMax H3 添加 CFG 增强训练。您需要启用它,请参阅示例 TOML 文件。您可能总是想使用这个或培训适配器。
- 2026-08-06
- 支持MiniMax H3。仅 T2I 和 T2VA 培训。
- 修改数据集代码以支持视频中的音频。
- 允许直接在量化模型上训练 LoRA。理论上,这应该适用于任何基于 ComfyUI 的模型(Z-Image 及更高版本,不包括 Anima)。
- 简化了一些潜在的缓存代码。如果训练 Z-Image、Flux2 或 Ernie-Image,请确保“--regenerate_cache”,因为潜在缩放现在是在缓存阶段而不是在模型中完成的。
- 2026-06-24
- 支持韩国2。
- 2026-06-07
- 从 Flux2 中移除注意力屏蔽。即使有填充,该模型也应该采用完整的 512 长度文本嵌入。
- 这给出了稍微较低的起始损失,但似乎对最终的训练结果几乎没有影响。不过,理论上现在应该更好了。
- 删除缓存文件夹或使用“--regenerate_cache”,否则您可能会从旧的缓存文件中得到张量形状错误。
- 对于基于 ComfyUI 的模型(Z-Image 及更高版本),支持直接从 Comfy 量化权重进行训练,例如fp8_scaled。
- 支持表意文字4。
- 2026-05-15
- 初始 LTX 2.3 支持。目前只有 T2I 和 T2V 培训,没有音频。
- 2026-04-23
- 支持厄尼图像。
- 2026-02-04
- 支持阿尼玛。
- 2026-01-16
- 支持 Flux 2,Dev 和 Klein 均支持。
- 更新了 DeepSpeed 版本。也许应该更新所有要求:`pip install -rrequirements.txt -U`。
- 2025年12月20日
- 支持混源视频-1.5。目前仅支持 T2I 和 T2V 训练。
- 使用 GenericOptim 时添加梯度标准记录。
## Windows 支持
在本机 Windows 上进行培训将很困难或不可能。这是因为 Deepspeed 仅具有[部分 Windows 支持](https://github.com/microsoft/DeepSpeed/blob/master/blogs/windows/08-2024/README.md)。 Deepspeed 是一项硬性要求,因为整个训练脚本都是围绕 Deepspeed 管道并行性构建的。豪
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱