首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

文生图Scaling新变量,被字节Seed团队发现了

摘要

文生图模型一直在扩展模型、数据和算力, 但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究 。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。 基于这一发现,团队提出 Structured Prompt,并从 Diffusabil...

Caption https Prompt token heheyas context scaling ByteDance Seed GPG
2026-08-12 1 阅读 约10分钟阅读 机器之心
分享:
字号:
文生图模型一直在扩展模型、数据和算力, 但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究 。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。 基于这一发现,团队提出 Structured Prompt,并从 Diffusability 与 Promptability 两侧共同提升文本条件,最终在复杂组合、推理和世界知识生成任务上取得显著提升 。 论文 Figure 1|自然语言长度很快饱和;结构化条件持续增加图像信息,并沿统一关系降低扩散训练损失。 过去几年,文生图模型的进步几乎沿着一条熟悉的路线展开:更大的模型、更多的数据,以及更高的训练算力。 但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习;文生图模型则依赖图像与 Caption 的配对,学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才能作为文本条件监督传递给模型。 于是,一个基础问题出现了:除了继续扩大模型、数据和算力,我们能否通过增加 Caption 所携带的图像信息,让生成模型学得更好? 在这项新工作中,ByteDance Seed 团队研究了这一问题。核心结论可以概括为一句话: 真正随文本条件扩展的,不是 Caption 的 token 数量,而是其中可被模型利用的图像信息 。 论文标题: Scaling Properties of Text Conditioning in Visual Generation 作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 机构: ByteDance Seed 论文:https://arxiv.org/abs/2607.29679 项目主页:https://heheyas.github.io/context-scaling 代码:https://github.com/heheyas/context-scaling 模型:https://huggingface.co/collections/heheyas/context-scaling 在线 Demo:https://heheyas-context-scaling.hf.space/ Hugging Face Paper:https://huggingface.co/papers/2607.29679 Prompt 变长了, 为什么模型没有变强? 一个直觉做法,是把训练 Caption 或用户 Prompt 写得更长、更详细。更多 token 看起来应该意味着更多监督,也应该帮助模型生成更复杂的图像。 实验却给出了不同答案。在多种现有开源文生图系统上,自然语言 Prompt 随长度增加很快饱和,最终输出甚至低于各自最短 Prompt 的表现。即使专门在同一套长文本 Caption 上训练扩散模型,收益也十分有限。 为了把这个现象看得更清楚,团队设计了一个固定骨干网络的图像重建实验。对于同一张参考图像, 团队 从同一份完整标注出发,生成四个详细程度逐渐增加的自然语言 Caption,再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述相同的实体和关系,后续版本主要通过补充和展开自然语言表达来增加长度。 令人意外的是,Caption 虽然显著变长,图像重建质量却几乎不再提高。新增的 prose 更多是在解释、改写或连接已经出现的内容,并没有持续增加新的、可稳定使用的视觉变量。 论文 Figure 3|固定骨干重建实验:NL Caption 继续变长后重建趋于饱和,逐步恢复 SP 字段则持续改善。 这说明,Caption 长度只是一个很弱的代理变量。一个文本可以写得很长,却仍然没有清楚说明:某个属性属于哪个物体、两个物体是什么关系、各自位于哪里,以及它们在画面中的前后层次。 如何衡量 Caption 里真正的图像信息? 如果 token 数量不足以衡量监督强弱,就需要直接测量 Caption 中与图像绑定的信息。为此, 团队 从已有工作中改造了两个互补指标:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。 GPG:图像让 Caption 变得 “更可预测” 多少 。 GPG 是一个需要读取模型 token 概率的白盒指标。对于同一句 Caption, 团队 分别让一个冻结的视觉语言模型看到和看不到配对图像,并计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 中包含大量与该图像紧密绑定的信息,看到图像应当显著提高模型对这些 token 的预测能力。 ED:Caption 覆盖了多少可靠的图像属性 。 ED 是一个不依赖 token 概率的黑盒语义指标。它分别从图像和 Caption 中提取带有实体上下文的属性,再计算 Caption 属性的准确率与图像属性的召回率。最终采用更重视准确率的 F0.5,对 Caption 中没有图像依据的描述施加更强惩罚。 两个指标从不同角度刻画同一个问题:GPG 关注图像与文本之间的统计依赖,ED 关注 Caption 是否准确覆盖了可验证的视觉内容。 论文 Figure 6|GPG 与 ED 的定义及测量趋势。 Caption 信息量可以预测扩散模型的训练损失 接下来, 团队 固定图像、模型架构、初始化方式、优化配置和训练预算,只改变训练 Caption。整个实验包含 15 种 Caption 配置:三个不同长度的自然语言版本、六个逐步恢复字段的 Structured Prompt 版本,以及六个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发,独立训练一个扩散模型。 结果显示,自然语言 Caption 的 token 数与训练结果并不存在统一关系;但当横轴换成 Caption 信息量后,不同格式和详细程度的配置落在了高度规律的曲线上: 收敛后的 diffusion loss 与 GPG 近似呈线性关系,Pearson r = -0.984; 收敛后的 diffusion loss 与 ED 呈幂律趋势,log-log 空间中的 Pearson r = -0.971; GPG 与 ED 对不同 Caption 配置的排序也高度一致,Spearman ρ = 0.96。 团队 将其称为 text conditioning 的 scaling properties。它不是一个对所有模型都成立的理论定律,而是在固定架构与训练 recipe 下得到的经验标定。但它带来了两个直接价值。 第一,它把 Caption 信息量从一个模糊的 “数据质量” 概念,变成了可以控制和测量的训练变量:在模型、图像和算力不变时,信息量能够预测模型
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱