首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

摘要

机器之心发布 过去两年,AI 生成图片、视频的能力不断刷新人们的认知。 今天,生成一张图片、一段视频,已经变得很容易。 但真正困难的,是另一件事情: 让 AI 理解并按照创作者的真实意图完成创作。 比如: 修改一行文字,同时保留字体、排版和视觉风格。 消除图片和视频的冗余元素,但不能看出破绽。 自由变换发型、服饰、光线、场景,但要保持人物一致性。 修改视频中的局部内容、调整光影效果,不要影响整体连...

MiVE CFT Lab 美图影像研究院 https 2026 ICML ECCV 论文链接 arxiv
2026-08-13 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 过去两年,AI 生成图片、视频的能力不断刷新人们的认知。 今天,生成一张图片、一段视频,已经变得很容易。 但真正困难的,是另一件事情: 让 AI 理解并按照创作者的真实意图完成创作。 比如: 修改一行文字,同时保留字体、排版和视觉风格。 消除图片和视频的冗余元素,但不能看出破绽。 自由变换发型、服饰、光线、场景,但要保持人物一致性。 修改视频中的局部内容、调整光影效果,不要影响整体连续性。 让模特试穿试戴,同时准确保留材质、纹理和光泽。 Prompt 的后半句都是为规避模型误差添加的限制,「保持一致、避免失真、不要改变」等等一长串的提示词,是 AI 创作流程中的「惯用套路」。但理想状态下,我们对 AI 的期望是需求能够被理解,并直接执行,而不是先要学习如何正确使用提示词。 AI 在视觉创作能力的进化,实则是视觉理解、空间建模、时序一致性、美学表达等多个方向的持续突破,这很难通过一次模型升级来实现,而是需要围绕视觉技术的长期积累。 过去几年,作为 AI 影像领域的「长期玩家」,美图影像研究院(MT Lab)围绕高频创作场景的真实痛点,持续展开研究。2026 年以来,美图影像研究院(MT Lab)共有 11 篇论文被 ICLR、CVPR、ICML、ECCV、ACM MM 等国际顶会接收,覆盖视频编辑、人像编辑、智能交互、视觉理解等多个方向。 更重要的是,这些研究成果不断通过产品落地,转化为服务真实创作场景的 AI 影像能力。 让 AI 实现更强大的编辑 在专业的创作中,生成其实只是起点,人们往往需要经过多次的尝试和调整,才能不断接近「理想效果」。因此,无论是视频中的背景、光线、人物身材、妆造,还是图片中的文字、服饰配饰,模型都需要同时兼顾一致性、真实性与可控性,这也是 AI 影像从「能生成」迈向「能创作」最关键的能力之一。 在 ICML 2026 上, 美图影像研究院(MT Lab) 提出了参考帧引导视频编辑统一框架 Multiscale Vision-language features for reference-guided video Editing(MiVE),核心由多层级视觉 - 语言上下文提取、参考帧感知潜空间编码和统一自注意力主干三大部分共同组成。MiVE 旨在以多尺度 VLM 条件与统一多模态融合,解决当前视频编辑在指令理解与空间精度上长期存在的结构性短板。 论文链接:https://arxiv.org/abs/2605.14664 项目主页:https://mivepaper.github.io/ MiVE 在大幅度运动、复杂遮挡、跨帧风格一致性等高难度场景下,能够保持原视频运动结构,并将参考帧的编辑信息自然扩展至整个视频;在身份特征、细节锐度、色彩一致性保持及新增遮挡区域外观恢复上,MiVE 也表现出更强的稳定性与更高的精细度。 结合 MiVE「改一帧即改全片」的 V2V 编辑工作流,和针对人像场景精细化的创意编辑能力,目前已经实现包括改变发型、变换服装、妆容造型、重新打光、更换背景、天气变换、局部优化等在内的视频编辑能力。 MiVE 在细腻发丝的处理、服饰的贴合度、材质光影层面都拥有良好表现力,能够精准还原对人物、发丝、衣服材质、光线等细节。 例如在视频打光场景中,相比主流模型,MiVE 在人物与环境一致性维度均有较为明显的优势,据悉该能力即将上线美图秀秀 APP 与 Wink APP 的「氛围光」功能。 对光影变化的控制能力同样延伸到了静态图片创作场景,在 ECCV 2026 中,美图影像研究院(MT Lab)提出了一致特征传输重打光新方案 Consistent Feature Transport(CFT)。 由于目前的 AI 重打光方案容易出现光照不稳定、阴影方向错乱,甚至把脸「修成另一个人」的问题,因此换光效作为常见的视频编辑需求,实现难度却很高。 CFT 通过将人像重打光表述为「光照一致的特征传输问题 」 ,在 Rectified Flow 框架上显式学习源图与目标图分布之间的光照变换,并结合大规模人像重打光数据集,实现在复杂光照场景下,人物身份、姿态、背景的超强一致性。 论文链接:https://arxiv.org/abs/2607.17833 项目主页:https://github.com/Dixin-Lab/CFT CFT 对光线的方向、角度、强弱具备更强的可控性,可以实现各种不同类型的打光效果。对比主流模型,CFT 在光照效果上有更佳的稳定性和合理性,即使是在复杂的场景下,也表现出高一致性的打光效果。例如在晨光场景中,CFT 能准确区别晨光与夕阳光,呈现更好的整体氛围感和光线真实性。 结合 CFT 方案,你不需要输入冗长的提示词,就可以玩转各种不同的光线效果。 全新的「图片打光」功能已经上线美图主打人像修图 Agent 与「学我修图」的全新 AI 产品 Picchi,海外可以通过 AirBrush 与 BeautyPlus 进行使用。 自去年推出「AI 闪光灯」全球爆火后,美图影像研究院(MT Lab)目前已经研发超过 50 种不同的打光效果,帮助「手残党」拯救废片。 图像编辑除了修改、增加内容,还有另一项至关重要的能力 —— 消除。无论是日常的拍摄,还是专业的创作,乱入的路人、被遮挡的背景、五花八门的杂物都很常见,「AI 消除」的关键是既要精准消除目标,又要合理补全原本被遮挡的区域,在动态的视频场景中,还必须保证连续帧之间的稳定性。 对此,美图影像研究院(MT Lab)在 ICML 2026 上提出了 基于随机桥模型的新框架 ——BridgeRemoval, 首次将「视频目标移除」定义为「视频到视频的翻译任务」,通过构建基于随机桥(VP-SDE Bridge)的直接生成路径,在背景保真度与生成灵活性之间取得更好的平衡,显著提升了视频目标移除的精准度及时序一致性,实现了从 AI 图像消除向 AI 视频消除的拓展。 论文链接:https://arxiv.org/pdf/2601.12066 项目主页:https://bridgeremoval.github.io/ 不同于标准扩散模型从随机高斯噪声起步,BridgeRemoval 采用基于方差保持随机微分方程(VP-SDE)的桥模型,能够选择性地只对被遮罩区域进行变换,并实现对背景内容中未被遮挡区域最大程度的保真。 结合 BridgeRemoval 在目标移除、背景保真度、时序一致性的显著优势,Wink APP 推出了「视频身材美型保护」功能,解决了平常瘦脸、瘦身等视频美型任务中,容易出现的栏杆变弯、背景形变等尴尬问题。 基于 BridgeRemoval 的优势,也为视频消除能力带来了显著提升,相比主流模型的整体性能,缩短了约 80% 的处理时长,且区别于 10 秒的视频处理限制,BridgeRemoval 可以支持无限时长的视频消除。 尤其在文字场景,BridgeRemoval 对各类型文字均表现出极佳的消除效果,即使是特殊的发光字幕也能实现无痕消除。 目前该能力即将上线开拍 APP「智能全消」功能,能够自动识别与消除视频文字,支持最长 5 分钟视频输入,实现画面无损效果,相较主流模型最长
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱