首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AI改图,终于懂点「用户心理学」了

摘要

机器之心发布 一张电商图片,既要准确展示商品,也要契合用户喜好,更承载着价值转化的商业期待。当图像编辑开始读懂用户偏好,模型能否将不同的创作意图转化为合心意、可使用的电商素材,进一步激发商业价值潜能? 快手技术团队推出 KwaiMind,一套面向真实电商内容生产的图像编辑基座模型。 融合通用图像编辑与电商专项能力,在保留商品细节、准确呈现文字的同时,满足多样化创作需求,并配套构建电商任务评测体系,...

KwaiMind Ecom Bench Agent DiffusionOPD CTR 背景替换 180 万对高质量训练样本 SFT
2026-09-25 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 一张电商图片,既要准确展示商品,也要契合用户喜好,更承载着价值转化的商业期待。当图像编辑开始读懂用户偏好,模型能否将不同的创作意图转化为合心意、可使用的电商素材,进一步激发商业价值潜能? 快手技术团队推出 KwaiMind,一套面向真实电商内容生产的图像编辑基座模型。 融合通用图像编辑与电商专项能力,在保留商品细节、准确呈现文字的同时,满足多样化创作需求,并配套构建电商任务评测体系,形成从数据生产、模型训练到效果评估与业务反馈的完整闭环。 据技术报告披露,KwaiMind 在多项通用图像编辑基准上取得参评开源模型综合得分第一;在自建电商评测 Ecom-Bench 中,视觉总分位居参评开源模型第一。 线上商品主图素材优选 A/B 实验中,KwaiMind 带来实际点击率相对提升约 2.44% ,展现了电商图像编辑的商业应用潜力。 图 1 Ecom-Bench 视觉总分与 Ecom-CTR 排名比较。CTR 为预测排名累计计数。 从通用编辑到定向修复 覆盖真实素材生产需求 KwaiMind 将增删、替换、构图调整和局部问题修复纳入同一套指令式编辑能力,支持服装试穿、商品细节展示、配饰佩戴、背景替换、动作调整等任务。商家可以围绕已有素材提出展示需求,也可以针对文字、背景等局部问题进行定向修改。 图 2 KwaiMind 编辑案例,涵盖服装、配饰、商品场景和通用图像编辑。 以电商卖点图为例,模型需要根据商品图与编辑指令调整背景和构图并进行文字的渲染,在突出商品视觉表现的同时,保持其外观、材质与关键细节的一致性。这些要求也考验模型的通用编辑能力。KwaiMind 在适配电商场景的同时,也展现出较强的通用编辑能力,在多个通用基准测试中均优于本报告中其他参评的开源模型。 图 3 KwaiMind 在四组通用编辑评测中均取得参评开源组最高总体得分。 四项智能体协作 维护约 180 万对高质量训练样本 电商素材规模庞大、来源多样,既需保障质量,也需适配不同任务。传统流程依赖反复筛选、修改和复核,成本高、效率低,标准也难统一。为此,KwaiMind 构建了多智能体数据引擎,将质量过滤、样本修复、定向补充与指令标注整合为统一流程,实现任务自动流转、样本状态可追踪。四类智能体分工如下: Filter Agent :预筛输入图像,复筛编辑结果; Generation Agent :根据诊断修复可恢复样本,补充覆盖不足的任务数据; Caption Agent :生成不同粒度的编辑指令; Coordinator Agent :维护样本状态与分布,统筹任务调度、流程衔接及重试。 系统同时引入 Human-in-the-Loop 机制,将低置信、高分歧样本交由人工审核,审核结果回流数据生产流程,兼顾处理效率与数据质量。 图 4 精选 SFT 数据的任务构成及代表性样本。 多智能体数据引擎从约 2,620 万对候选数据中构建并维护约 180 万对高质量训练样本,供 Continued Fine-tuning 阶段使用。进一步精选约 23.49 万对数据用于 SFT 阶段,包括 11.5 万对通用编辑样本和 11.99 万对电商样本。通用数据夯实模型的基础编辑能力,电商数据则围绕服装细节、商品展示和文字编辑等强化专项能力,共同提升模型的指令遵循度与图像美观度。 专项优化与多教师蒸馏 整合为统一基座 真实电商任务往往要求模型同时做好多件事:执行编辑指令、保留商品细节、写对文字,并生成更能吸引用户关注的画面。这些目标的优化难度和收敛节奏并不相同,直接混合训练可能产生干扰,依次优化又可能遗忘已有能力。 KwaiMind 为此采用了一套结合 专项能力优化与多教师蒸馏 的训练方案:在通用编辑能力之上,模型进一步强化视觉质量、商品一致性、文字准确性以及商业点击吸引力。再通过 DiffusionOPD 将不同专家的能力汇聚到统一模型。 图 5 训练框架与 DiffusionOPD 多教师蒸馏。专项教师在学生自身的去噪轨迹上提供指导。 DiffusionOPD 是一种在线蒸馏策略,由教师沿学生的去噪轨迹逐步指导,使能力迁移更贴近学生实际的生成过程。KwaiMind 将通用编辑、文字处理、商品细节保留与用户偏好整合到同一模型中,让一次编辑兼顾多项要求,例如更换背景时保留包装细节与文字,同时生成更符合用户偏好的展示效果。 Ecom-Bench: 系统定义电商任务与评测体系 电商图像编辑需要明确的任务边界,也需要一套能够判断素材是否可用的评价标准。 为此,团队构建 Ecom-Bench ,包含 11 项任务、1,100 个案例,每项任务 100 个案例。这些任务包含了虚拟试穿、服装细节、姿态调整等模特穿戴任务,背景替换、商品提取、卖点展示等海报相关任务,以及文字编辑、宣传语去除等文字任务。 围绕这些任务,Ecom-Bench 建立了由 6 个通用维度和 8 个电商专项维度 组成的综合评价体系: 通用维度关注指令遵循、融合自然度、物理与光照合理性、非编辑区域保留、图像质量及整体美感; 电商维度关注检查商品身份、文字准确性、面料纹理、模特与姿态、服装合身度、抠图边缘、卖点传达及商品展示完整性。 每项任务选取 2 个通用维度和 2 个电商维度,按任务需求确定评价重点。下表是具体的任务测评维度分配: 表 1 Ecom-Bench 各任务的评价维度分配(对应技术报告 Table 5) 评分时,评审模型会结合参考图、编辑指令和生成结果,按照明确的评分标准,对四个维度分别给出 1-5 的整数分。 单个案例的综合分采用几何平均计算,使文字出错、商品身份偏移等关键缺陷更明显地影响综合得分,降低单项高分所掩盖的素材可用性问题。各任务得分为该任务 100 个案例综合分的平均值,总分再对 11 项任务等权平均。 如图 1 所示,在报告的评测设置及参评模型范围内,KwaiMind 的 Ecom-Bench 视觉总分位居开源模型第一。除了视觉质量,团队还通过 Ecom-CTR 评估生成素材的预测点击偏好。不同模型的输出进行排序,各模型进入前三名的次数累计为 CTR 分数,以衡量相对商业吸引力。KwaiMind 在这一指标上表现优越,体现了模型对素材可用性与用户偏好的兼顾。 下面是一些可视化对比素材,覆盖卖点展示、服装细节、服装展示和虚拟试穿。结合参考图与编辑指令,可以直观看到不同模型在商品素材生成方面的差异。 图 6 服装展示 图 7 服装细节图 图 8 卖点图 图 9 虚拟试穿 业务验证: 素材生成到真实点击提升 为了验证 KwaiMind 在实际业务里的应用价值,团队启动了商品主图素材优选线上 A/B 实验。在实验中, KwaiMind 带来了约 2.44% 的实际点击率的相对提升。 在离线评估中,对于随机质量采样的商品图,KwaiMind 生成图的预估 CTR 高于原始商品图的比例,由训练前的 12.16% 提升至 37.41%;相较于未经优化的基线生成图,其预估 CTR 胜率达到 91.89%。 总结 KwaiMind 的推出,让我们看到图像编辑模型进入电商实际工作流程的更多可能。从试穿展示、背景调整到商品细节保留与文字修改,模型需要理解的不只是 “画
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱