智能AI
morning
全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图
摘要
机器之心发布 先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。 先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到 53.53 和 53.38 ,在技术报告列出的开源模型...
Image
LLaDA
DiT
caption
SFT
inclusionAI
https
先学会画
再学会听话
image
2026-09-08
1 阅读
约10分钟阅读
机器之心
字号:
机器之心发布 先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。 先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到 53.53 和 53.38 ,在技术报告列出的开源模型中拿下双榜第一。 Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。 榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。 下面这组图里,哪些是真实照片? 人物、动物、食物与风景等 LLaDA-Image 生成样例。 答案是: 一张也没有 。 更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件: 2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督 。 从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果: LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。 这套模型来自 Inclusion AI,名为 LLaDA-Image 。其核心是一套从零训练的 6B 参数 Diffusion Transformer(DiT) ,一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需 2—4 个采样步 。 真正让这项工作显得不一样的,是它重新回答了一个基础问题: 训练高质量文生图模型,图文对一定要从预训练第一天就上场吗? LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说, 先学会画,再学会听话 。 这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理 约 2.2 亿个样本 ,最终交出了开篇榜单所示的中英文双榜开源第一成绩。 GitHub:github.com/inclusionAI/LLaDA-Image 模型:https://huggingface.co/collections/inclusionAI/llada-image 魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image arxiv:https://arxiv.org/pdf/2609.03796 后端和生成都是扩散模型 LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用 LLaDA2.0-mini ,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。 图文对,可能并不是生成训练的 “入场券” 传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。 LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。 在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。 纯图片负责建立视觉世界,图文对负责把语言接入这个世界。 尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。 这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。 完整流程可以概括为六个阶段: 1. 先对理解骨干进行思维链监督微调(CoT SFT); 2. 在 像素预算下进行纯图像预训练; 3. 在约 像素预算和多宽高比桶上进行纯图像中期训练; 4. 依次在约 和 像素预算下引入图文对,完成文本对齐与高分辨率迁移; 5. 以文生图(T2I)和图像编辑(I2I)1:1 混合训练,得到统一的 LLaDA-Image; 6. 使用 TwinFlow 蒸馏,得到 2—4 步推理的 LLaDA-Image-Turbo。 这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。 一张图,同时提供 “题目” 和 “答案” 给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。 换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个 从局部视觉线索恢复完整图像的任务 。 条件和目标来自同一块实际训练图像,两者天然对齐; 随机遮挡确保模型需要根据上下文推断完整内容; 恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律; 冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。 由于条件直接从裁剪后的图像提取,团队可以从高分辨率原图中随机截取原生分辨率为 或适度更大的局部区域,只做温和缩放后用于 训练,从而在低分辨率预训练中保留更多局部细节。 到了中期训练,像素预算提升到约 ,训练仍沿用图像自条件和遮挡补全,并开始采用多宽高比桶。模型先适应更高分辨率与不同画幅,再切换到文本条件,将分辨率适配和条件模态转换分成两个阶段,过渡也更加平滑。 技术报告给出的 SFT 加权数据分布估计。训练内容覆盖自然、设计、人物与少量合成数据;图像预训练和中期训练只使用真实图像。 这条 “视觉优先” 的路线让真实图像的优势随着训练推进逐步显现。报告称,以真实图像为主的配方能够持续提升生成真实感,并展现出更高的长期能力上限。SFT 阶段因此一直让真实图像占绝对多数,同时在后期定向增加文字密集图像与人像数据。 从统计口径看,报告所说的 2.2 亿样本是图像生成管线各阶段的 累计样本处理量 ;理解骨干的 CoT S
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱