首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

摘要

图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,难以表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。 近年来,随着多模态大模型的发展,视频理解领域已经可以对视频的内容进行详尽的描述。 然而随着多参考图视频生成与编辑的发展,除了对视频本身的理解,通常还需要模型经...

RefCaptioner caption https SFT HCD GRPO 对于这个问题 VLM huggingface TengfeiLiuCoder
2026-08-11 1 阅读 约10分钟阅读 机器之心
分享:
字号:
图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,难以表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。 近年来,随着多模态大模型的发展,视频理解领域已经可以对视频的内容进行详尽的描述。 然而随着多参考图视频生成与编辑的发展,除了对视频本身的理解,通常还需要模型经常同时处理人物、服装、场景等多张参考图,建立参考图和视频的对应关系。而我们通过实验发现一个几乎所有多模态大模型都存在的问题: 模型虽然可以将简单的视 频主体和参考图主体对 应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。 这正是现有视频描述范式的盲区。普通 Caption 只要求文本忠实于视频;多参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。问题因此从 “生成一段好的描述”,变成 “在生成描述的同时建立可用的视频对象 - 参考图对应关系”。 这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容? 对于这个问题,我们将多参考图场景下的视频 caption 问题进行梳理。首先。多参考图里可能有真正出现的主体和场景,也可能混入外观相似的干扰项,现有的 VLM 要么过于自信全部引用,要么过度保守又会漏掉有效信息。其次,很多 VLM 在识别参考图片时,对于同一个人或物体可能由多张不同视角图片,模型也会识别成不同的人或者物体,然而这种情况,模型需要把这些图片归到同一实体,而不是拆成多个对象。 对于这个问题,我们提出了 RefCaptioner ,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的 caption 进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化 caption 格式,并通过 SFT 强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。同时我们建立了双层自适应奖励函数 HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。 团队核心成员包括北京大学博士生刘腾飞、史阳以及可灵团队多模态理解负责人张远行。 论文链接:https://arxiv.org/abs/2607.28509 代码链接:https://github.com/pkucs-Ltf/RefCaptioner 模型开源链接:https://huggingface.co/TengfeiLiuCoder/RefCaptioner 开源数据集链接:https://huggingface.co/datasets/TengfeiLiuCoder/MRVBench RefCaptioner: 让视频 caption 与参考图完成端到端绑定 图 2:RefCaptioner 方法概览。左侧为保持通用描述能力的混合数据监督微调;右侧为 HCD-GRPO,通过两个奖励分支分别约束事实描述与多参考图 grounding。 RefCaptioner 以 Qwen3-VL-8B-Instruct 为基座,为了在训练参考图识别能力的同时不丢失视觉模型对视频的感知和描述能力。在 SFT 阶段,我们将多参考图数据与通用的视频 caption 训练数据按 1∶1 均衡采样。前者包含人工核验的图像标签描述,用来教授参考图选择和局部绑定;后者用于保留事实性、覆盖度与细节表达能力。这样的混合方式避免模型为了学习标签格式,退化成一个只会「贴参考图」的系统。 同时,仅靠 SFT,模型可以学会输出格式,却未必能在复杂样本中兼顾事实描述、参考图召回和错误抑制。HCD-GRPO 因此把奖励拆成两个互补分支:一边检查描述是否忠实、完整,另一边检查参考图是否选对、绑定正确,并对可观测错误进行折扣。 事实描述奖励 :先去掉回答中的图像标签,再从主体、外观、动作、背景、镜头和风格六个维度检查关键事实是否覆盖,并借助视频问答库识别事实错误。 正确绑定覆盖奖励 :只有被正确选择、且放在正确局部短语后的参考图,才能贡献正向覆盖信号。单纯增加标签数量不会获得额外收益。 Distractor-Aware Evidence Suppression(DAES) :训练样本会在正常参考图中随机插入无关图片,但模型不知道哪些是干扰项;一旦引用视频中没有对应内容的图片,就会受到额外惩罚。 Cross-Reference Semantic Coherence(CRSC) :对于同一实体的多张不同视角图片,评估器从回答中抽取 “事件 — 实体 — 参考图组” 关系,检查这些图片是否被聚合到同一局部描述,而不是被错误拆分。 通过上面的奖励函数设计,从而使得模型无法依靠 “多贴图像标签” 提高覆盖率,也不能靠 “少贴图像标签” 规避错误,而是使得模型在有效绑定的基础上,提高对干扰图的识别能力。 MRVBench: 把 “描述正确” 与 “图文对应” 分开评测 现有视频描述基准通常只判断文本是否覆盖视频内容,却无法回答模型有没有选对参考图、标签是否落在正确短语后,以及是否误用了干扰项。为此,研究团队构建了 MRVBench,用统一协议同时评估视频事实性与多参考图 grounding。 图 3:MRVBench 数据构建流程。从真实视频和 AIGC 视频出发,依次完成关键帧提取、六维 Caption 标注、参考图池整理与干扰项注入、局部标签绑定和人工专家核验。 MRVBench 与训练语料覆盖了从简单对应到复杂多图映射的多种情况: 训练语料包含 20,000 个视频和 171,354 张参考图。 公开的 MRVBench 测试集包含 462 个与训练语料完全隔离的视频,其中 185 个为 AIGC 视频、277 个为真实视频,共配有 3,831 张候选参考图。 单个样本最多包含 22 张参考图;约 60% 的样本具有多图对应同一主体或视觉单元的复杂映射,约 40% 的样本包含人为注入的干扰图。 冻结评测库包含 5,846 个视频关键事实和 2,172 个短答案问题,覆盖主体、外观、动作、背景、镜头和风格。 不只看 Caption 是否流畅,MRVBench 如何评测? MRVBench 将评测拆成五个方面:视频事实覆盖与正确性、参考图选择、局部短语绑定、干扰图鲁棒性,以及同一主体多参考图的一致性。所有模型接收相同的视频、任务指令和有序参考图,评分依赖冻结的关键事实、问答库与结构化标注,尽量把 “写得像” 与 “对应得准” 区分开。 实验结果: 参考图越多,优势越明显 论文将 RefCaptioner 与多种 7B–38B 开源模型进行比较,并加入 Gemini-3.1-Pro 和 GPT-5.4 作为闭源参考。 8B 参数的 RefCaptioner 在所有多参考图 grounding 指标上取得了开源模型最佳表现,综合结果接近 Gemini-3.1-Pro,并高于 GPT-5.4。 图 4:MRVBench 上不同模型的视频事实理解与多参考图
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱