首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

ACM多媒体2026口述|从「转述痕迹」到「证据」:伪造VCR用视觉中心推理图像取证范式

摘要

随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。 近年来,多模态大模型凭借视觉理解与推理能力,逐渐成为图像取证的重要技术路线。现有主流方法采用文本中心的推理范式:先用自然语言描述异常,再根据这些描述判断图像是否被篡改。...

ForgeryVCR https MLLM 深圳大学 youqiwong github CoT SFT ELA NPP
2026-09-22 1 阅读 约10分钟阅读 机器之心
分享:
字号:
随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。 近年来,多模态大模型凭借视觉理解与推理能力,逐渐成为图像取证的重要技术路线。现有主流方法采用文本中心的推理范式:先用自然语言描述异常,再根据这些描述判断图像是否被篡改。然而,图像篡改的关键证据通常隐藏在细微的低层视觉痕迹中,既难以被偏重高层语义的视觉编码器准确感知,也难以通过语言完整表达。当模型被迫先把「看到了什么」转述成文字、再据此判别图像真伪时,信息损失与语义偏见便可能使描述偏离真实痕迹,甚至将无关的场景内容误认成伪造证据。 针对这一问题, 腾讯优图实验室 与 深圳大学 的研究者提出了 ForgeryVCR :一个将取证工具箱、视觉中心推理与策略性工具学习统一到同一闭环的取证智能体框架,推动图像篡改检测与定位从「依赖文本描述取证痕迹」转向「基于显式视觉证据推理」的新范式。相关论文已被 ACM Multimedia 2026 录用,并入选 Oral Presentation 。 论文标题:ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization 论文链接:https://arxiv.org/abs/2602.14098 项目主页:https://youqiwong.github.io/projects/ForgeryVCR 代码链接:https://github.com/youqiwong/ForgeryVCR 论文机构:腾讯优图、深圳大学 一、研究背景 从「文本推理」到「视觉推理」 在图像取证任务中,SAFIRE、TruFor 等传统深度取证网络擅长捕捉频域、噪声残差中的低层统计异常。不过,真假分数或掩码本身很难解释「为什么假」,对固定特征分布的依赖,也限制了它们对未见篡改方式的泛化。FakeShield、SIDA 等方法尝试借助多模态大模型改善这些问题,但采用的仍是文本中心的 Chain-of-Thought(CoT):模型需要先用自然语言写出推理过程。对于像素级的细微不一致,文字很难保留完整的低层信号。再加上现有 MLLM 架构更关注高层语义,对低层取证特征不敏感,模型便可能依赖场景内容做判断,出现把无关上下文误认作伪造证据的语义幻觉。 四种推理范式对比 :(a) 取证特征驱动缺乏可解释性与泛化性、(b) 文本中心 CoT 易产生语义幻觉、(c) 视觉 - 文本混合描述仍模糊、(d) ForgeryVCR 的视觉中心范式同时得到显式视觉证据与无幻觉判决 因此,ForgeryVCR 通过「视觉中心推理」的范式将低层取证感知能力引入到鉴伪智能体框架里,具体包括三个方面: (1)痕迹可见化。把不可见痕迹物化为显式视觉证据: 模型执行轻量代码,调用空间域、频域、噪声域算子以及局部裁剪工具。压缩历史、噪声残差和频域能量中原本难以察觉的不一致,由此变成视觉编码器能够处理的中间图像。 (2)判决可溯源。让结论直接建立在视觉证据之上: 工具生成的证据以图像形式返回模型,直接参与后续判断,减少低层信号转述为文字时的信息损失。读者也可以查看这些中间图像,核验结论所依据的痕迹。 (3)调用自适应。只在能带来决定性证据时才调用工具: 增益驱动的轨迹合成为 SFT 冷启动提供训练数据,GRPO 阶段再通过工具效用奖励训练调用策略。模型据此学习按样本复杂度安排工具链:简单样本直接判断,需要更多证据时再调用有帮助的工具,减少冗余操作。 二、方法设计 1. 取证工具箱: 现有 MLLM 视觉编码器的预训练与对齐主要关注物体、场景及其语义关系,篡改留下的细粒度异常并不容易被识别。为弥补这一缺口,ForgeryVCR 引入混合取证工具箱,将难以被视觉编码器直接捕捉的隐蔽取证线索转化为显式视觉中间表征,并将其重新输入 MLLM,为后续取证推理提供可感知、可核验的视觉证据。 在工具选择上,我们同时考虑取证线索的覆盖性、视觉响应的可感知性以及不同工具间的互补性。候选工具包括 ELA、NPP、PSCC、SRM、CFA、FFT、DCT、VAE 重建残差和 Zoom-In。我们通过轻量级 SFT 分别评估单个工具和工具组合的收益,最终保留 ELA、FFT、NPP 与 Zoom-In,形成覆盖压缩、频率、噪声与局部细节信息的必要且具有较强正交性的工具组合。 候选取证工具在多类篡改与真实图像上的可视化对比 2. 轨迹合成:增益驱动的工具选择与多样化推理路径 要让模型学会「该不该调工具、调哪个、按什么顺序调」,关键在于训练轨迹如何构造。我们在冷启动训练集上设计了如下流程: (1)Gain-Driven Tool Selection(增益驱动的工具选择): 先在冷启动训练集上分别训练「无工具基线」和 ELA / NPP / FFT / Zoom-In 对应的「单工具专家」,再逐个样本比较表现。工具结果只有同时超过基线性能与固有质量下限,才会被保留,并按性能增益从高到低排成工具链。没有工具满足条件时,工具链为空,模型直接用原始图像进行判别。 (2)Multi-Trajectory Synthesis(多轨迹合成,MTS): 为给模型提供不同的调用选择,我们从排序后的工具链中保留 top-K,构造不调用工具、调用单个工具和通过多个工具累积证据的推理路径,并平衡 SFT 阶段各类路径的数据。 (3) Intractable Sample Removal(难解样本剔除,ISR) : 剔掉所有模型都判不对的疑难样本,提升冷启动数据质量。 轨迹合成 Pipeline:增益驱动的工具选择 → 多轨迹生成 3. 策略性工具学习:让模型自己决定「该用哪个工具」 ForgeryVCR 采用两阶段训练策略: (1)阶段一(SFT 冷启动) :以上述增益驱动得到的工具链与多轨迹合成数据做监督微调,让模型学会按样本复杂度选择「不调工具 / 单工具 / 多工具累积证据」的推理路径。 (2)阶段二(GRPO + 工具效用奖励) :继续在 GRPO 框架下进行强化学习。奖励包括分类奖励 Rcls、定位奖励 Rloc 和工具效用奖励 Rtool。工具效用奖励针对工具提取有效痕迹、帮助模型正确判断的调用给予正向反馈,以减少冗余调用。 ForgeryVCR 整体框架:SFT 冷启动 → GRPO 强化学习 → 工具调用推理链 RL 训练初期,模型会尝试较多工具。随着训练推进,模型从早期「盲目尝试工具」快速收敛到「按需调用关键工具」,工具调用轮数逐渐下降,检测与定位精度则继续提高,模型开始更有选择地调用工具。 RL 训练动态:奖励持续上升,工具调用轮数同步下降,工具调用策略从「盲目尝试」收敛到「按需调用」。 三、实验结果 1. 主流基准泛化性测试 我们在 9 个图像取证公开基准上对比了 ForgeryVCR与专用取证网络、其他 MLLM 取证方法的性能,评估图像级检测
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱