首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

不靠CFG、DMD、GAN、Drifting和MeanFlow,如何训练一步生成模型?

摘要

只做一次生成器前向,就能得到一张图,这是一步生成追求的效率。但想把采样步数降到 1,难题其实在训练端:怎样用足够稳定、简单的监督信号,让生成分布靠近真实分布? 现有路线各有结构性取舍: 自回归、扩散 和 流匹配(Flow Matching)模型扩展性强 ,但前者需按顺序或尺度解码,后两者沿噪声 — 数据路径反复调用网络,都会增加推理时间。 生成对抗网络(GAN)天然支持单次前向推理 ,但学习信号来...

Tracker TBSM Models Fake Real Matching DMD Drifting 一条描述配一张图 https
2026-08-10 1 阅读 约10分钟阅读 机器之心
分享:
字号:
只做一次生成器前向,就能得到一张图,这是一步生成追求的效率。但想把采样步数降到 1,难题其实在训练端:怎样用足够稳定、简单的监督信号,让生成分布靠近真实分布? 现有路线各有结构性取舍: 自回归、扩散 和 流匹配(Flow Matching)模型扩展性强 ,但前者需按顺序或尺度解码,后两者沿噪声 — 数据路径反复调用网络,都会增加推理时间。 生成对抗网络(GAN)天然支持单次前向推理 ,但学习信号来自同步训练的判别器,极小极大优化较敏感。 一致性模型( Cons istency Models)和分布匹配蒸馏(Distribution Matching Distillation,DMD)可以压缩采样步数 ,但通常需要噪声 — 时间监督、一致性约束、教师或辅助估计器;DMD 同时依赖固定扩散教师与在线生成分布的 score(对数密度梯度),扩展到较大模型时还需要更多稳定化技巧。 Drifting Models 等分布动力学方法绕开传统蒸馏, 但监督常来自批级分布场或统计量;若一个批次包含 个样本,批内全配对需要 次交互,同时还要求同一条件下提供多张真实样本,因而不天然适配“一条描述配一张图”的文生图数据。 这些路线各有优势,TBSM 并不是要简单否定它们。它把问题改写成了一句更直接的话: 能不能训练一个小模型,直接告诉每个生成样本 “该往哪里走”? 论文标题: THREE-BODY SCATTERING FOR GENERATIVE MODELING 论文链接: https://arxiv.org/abs/2607.18198 项目主页与代码:https://github.com/sp12138/TBSM 具体来说,TBSM 在线训练一个轻量级 Tracker,学习从当前生成分布到真实分布(Fake-to-Real)的转移场。对每个生成样本,Tracker 都会 独立地 给出一个移动方向,生成器只需回归样本沿该方向移动后的位置。 面对约 800M 的 像素扩散 Transformer 模型 PixelDiT-XL/16 ,单个 Tracker 仅有 30M 参数不到,且只在训练时使用。ImageNet-256 上,TBSM 的潜空间和像素空间模型在推理时前向次数(number of function evaluations,NFE)为 1 时,分别达到 Fréchet Inception Distance(FID,越低越好)1.63 和 2.23。 TBSM 方法介绍视频:三样本散射事件产生 Fake-to-Real 局部方向,Tracker 学习这些方向的期望,引导生成器最终实现 NFE=1。 TBSM 一步生成样例 从左到右依次为 MNIST、Fashion-MNIST、CIFAR-10、像素空间 ImageNet-1K,以及 20B 文生图模型的生成结果。 Fake-to-Real 转移场 (即 Tracker 的学习目标)从哪里来? 先说结论: Tracker 的学习目标不是教师给出的,而是由一个真实样本 和两个生成样本 、 当场算出来的(即一个三体散射事件)。 真实样本指出数据分布所在的方向,另一个生成样本补上生成分布内部的自交互,Tracker 再从大量即时观测中学习平均规律。 在给定某个生成条件 (例如一条提示词 Prompt)时,从噪声分布 独立抽取 和 。一次事件包含三个角色:由参数为 的生成器 产生、并保留梯度的生成投射体 ;从数据集中抽取一个与 配对的真实源 ;以及由另一份噪声产生并停止梯度的生成源 ,本文用 表示停止梯度。把瞬时散射方向记为 : 其中, 表示欧氏范数。第一项是朝真实源的单位方向,第二项带负号,因此会让投射体远离另一生成样本。两项分别对应能量距离中的真实 — 生成吸引与生成 — 生成自交互。 在有限一阶矩下,能量距离非负,且只在两分布一致时为零。在独立采样等条件下,瞬时散射方向的条件期望 ,就是总体转移场在 处给出的方向。含 个投射体的批次只需 次源交互,而非批内全配对的 (例如 Drifting Models);方向范数也不超过 2,且上界不随图像维度增长。这种接口天然适合 “一条描述配一张图” 的数据。 训练时把投射体 移动后的位置冻结为回归目标: 算法 1:基础三体散射回归 算法 1:三样本事件现场给出移动方向,即瞬时三体散射方向,生成器回归冻结后的目标位置。 不使用 Tracker 时,这就是 瞬时散射 (Instant Scattering)。严格来说,冻结回归在当前参数处的期望梯度与能量距离梯度一致,但单个即时方向只是该条件期望的一个带噪估计。使用 Tracker 的 跟踪散射 (Tracked Scattering)则把瞬时散射方向作为在线标签,学习更稳定的方向场。 Tracker 如何学习稳定的 Fake-to-Real 转移场? 单个三样本事件很便宜,但方差较大;换一组真实源和生成源,同一投射体可能收到不同方向。Tracker 学习的正是这些随机观测在给定位置和条件下的平均方向,而不是像 GAN 判别器那样判断真假。 完整 TBSM 使用两个取值在 0 到 1 之间的权重 。 混合即时方向与 Tracker 输出; 同时控制生成源自交互的权重和 Tracker 的查询区间。生成器与 Tracker 都用普通回归更新,不进行极小极大对抗训练。 算法 2:完整 TBSM 训练循环 算法 2:完整 TBSM 训练循环。图中, 是加权即时方向; 是从相应区间均匀抽取的连线位置比例, 表示均匀分布; 是 Tracker 查询点;参数为 的 Tracker 输出 ;最终方向为 。同一批事件分别更新生成器参数 和 Tracker 参数 。 在 时,Tracker 在投射体位置查询;在论文假设下,这对应精确能量距离场。若 ,查询点进入生成 — 真实样本之间的连线,学到的是实践中的代理场。ImageNet 最好的结果是采用 ,因此不能把这些指标视为 理论的直接验证。 两个参数组成的方法设计图 下图横轴为 Tracker 权重 ,纵轴为生成源自交互权重 。 四个角点把(1)瞬时能量距离散射、(2)完整跟踪的散射、(3)仅真实吸引和(4)Tracker仅学习 Fake-to-Real 插值放进同一张图中。 TBSM 的 rho-lambda 设计图 像素空间图像 Transformer JiT(Just image Transformers)的 B 规模配置 JiT-B 短程实验。Drift 是 Drifting Models 的图中简称;图中 Inception Score(IS)越高越好。四个角点依次对应类 Drift、Tracked Scattering、扩散相关和类 GAN 的结构联系。扩散式训练还需要配对噪声输入、时间条件和相应目标。 两个端点的 FID 为 4.71 和 5.05, 两个端点为 10.31 和 38.65,这说明 Tracker 汇总方向可能有帮助。另一个有趣现象是 (即完全没有生成—生成自交互项)时也得到很好的性能,下面展开分析这个 GAN-like 点。 算法 3:一个直观的视角去看 TBSM 能学到什么 算法 3:TBSM 的
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱