开发者生态
morning
从中文到小语种都能无痕修改,美图影像研究院(MT Lab)提出全新场景文本编辑方案 | ICML 2026
2026-08-20
1 阅读
约6分钟阅读
美图影像研究院(MT Lab)
字号:
“把这几个字改下,其它的什么都别动。”——这个需求看似简单,实则很难完成,因为经常会出现文字抠不出来、找不到字体,背景有修改痕迹等等问题,即使是专业设计师,也很难做到“看不出来改过”。 目前,基于扩散模型的图像修复实现了“无需分层文件,即可修改文字”,但文字修改只要有一点瑕疵,就容易暴露破绽,所以如何实现真正的“无痕”改字有很高的难度。 当前主流的两个方法分别是“依赖图像修补”和“依赖OCR或固定字表”的建模方式,但前者容易丢失原始文本区域关键信息,导致字体细节和风格一致性下降;后者则容易限制模型在多语言和开放词汇场景下的泛化能力。 对此,美图影像研究院(MT Lab)提出了一种面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,通过直接从输入图像中提取风格信息,并结合目标文本生成高保真的字形提示,将二者与原图进行统一建模,从而实现无需额外编码器的端到端编辑。该成果近期已被机器学习领域三大顶级会议之一的ICML 2026录用。 论文链接:https://arxiv.org/abs/2605.15523项目主页:https://hongxiii.github.io/mstedit/ 借助多模态扩散Transformer的上下文学习能力,该方案能够在保持原有字体风格、颜色和纹理的同时,实现跨语言、跨场景的高质量文本替换,为多语言场景文本编辑提供了一种统一且可扩展的解决方案,也为真实复杂环境中的风格一致性编辑奠定了重要基础。 △Self-Prmpting方法V.S.OCR方法 该方案在输入构建阶段,首先通过渲染目标文本生成高保真的字形图(glyph prompt),用于提供精确的结构约束;同时,从原始图像的目标文本区域中提取像素级风格信息(style prompt),以编码字体的颜色、纹理和排版特征。再将字形提示、风格提示与完整输入图像在像素空间进行拼接,并通过单次编码输入多模态扩散Transformer,使模型能够在统一表示下进行细粒度对齐与生成。 △方案流程示意图 在训练策略上,该方案采用两阶段训练范式,以同时兼顾模型的泛化能力与风格一致性。 △两阶段训练的数据对比 自监督预训练阶段: 该阶段让模型基于大规模图文数据进行训练,主要学习文本生成与图像修复的基础能力。通过冻结编码器与解码器,仅优化Transformer主干,使模型能够在统一的多模态表示空间中建立字形结构与视觉语义之间的对应关系。在该阶段不引入特定风格约束,从而避免模型过拟合于有限的字体或语言分布,为后续开放词汇和多语言场景提供良好的泛化基础。 冷却(cooldown)训练阶段: 在该阶段,模型从预训练权重出发,使用约4000对人工筛选的高质量配对数据进行微调,每对数据包含原始图像及与其风格一致的编辑结果。 首先将原始文本区域视为一种“元信息”,通过风格提示引入模型。同时,为避免模型简单复制原始文本(即同时保留原字形与风格的退化现象),设计面向目标区域的训练目标,仅在局部文本区域上施加学习约束,显式解耦“内容生成”和“风格保持”,即在潜空间中对原图与目标图进行插值,并学习从源表示到目标表示的变化方向,从而实现对文本内容的准确替换,并保持原有视觉风格的一致性。 定量实验结果表明,在中英文基准AnyText上,该方案在编辑准确性和风格一致性的各项评估指标中均取得了最优性能。 △中、英、韩、俄、日、泰语上的文本编辑可视化对比 在包括阿拉伯语、法语、德语、韩语、日语、意大利语、孟加拉语、印地语、俄语、泰语、斯瓦希里语在内的多语种测试集MSTEdit中,该方案也整体优于已有方法的性能。 △在MSTEdit数据集上的多语种性能 在包括长尾字符、手动设计及现实中不存在的字符等OOV(Out-Of-Vocabulary)中,该方案也表现出良好的鲁棒性。 △长尾字符的可视化编辑结果 △手动设计符号字符的可视化编辑结果 在消融实验中,该方案证明了不同的自我提示策略以及两阶段训练下,对于文字准确性和风格一致性的效果影响。其中,预训练阶段以及字形提升主要作用于提升文字准确率和泛化性,冷却阶段以及风格提示主要作用于提升风格一致性。 △冷却阶段的消融实验可视化对比 △中英文下不同提示策略在两阶段训练中的消融实验 目前,该方案已应用于美图秀秀“无痕改字”功能,突破了传统改字预设词表的限制,支持日、俄、韩、泰等小语种的文本编辑,并能保持字体风格与画面质感一致。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱