智能AI
morning
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理
摘要
在迷宫里规划一条路径、想象 3D 物体旋转后的状态、持续追踪物体的位置…… 图像和视频不只是模型需要理解的输入,更是可以推理的 “工作空间 “。近年来,原生视觉推理受到越来越多的关注,语言不再是模型推理的唯一途径,模型可以直接理解、探索和更新视觉空间来解决问题。 但目前,还缺少一套完整的基础设施。用什么任务训练模型视觉推理能力?怎么评估模型输出的图片或视频是否正确?图片、视频或图文交错哪一个更适合...
Pro
VBVR
300
VLM
100
Judge
Verifiable
https
benchmark
Bench
2026-09-20
1 阅读
约10分钟阅读
机器之心
字号:
在迷宫里规划一条路径、想象 3D 物体旋转后的状态、持续追踪物体的位置…… 图像和视频不只是模型需要理解的输入,更是可以推理的 “工作空间 “。近年来,原生视觉推理受到越来越多的关注,语言不再是模型推理的唯一途径,模型可以直接理解、探索和更新视觉空间来解决问题。 但目前,还缺少一套完整的基础设施。用什么任务训练模型视觉推理能力?怎么评估模型输出的图片或视频是否正确?图片、视频或图文交错哪一个更适合视觉推理?为了回答这个问题,来自 NTU、CMU、Berkeley 等多家高校研究员联合推出 VBVR-Pro(A Scalable and Verifiable Suite for Native Visual Reasoning)。 论文、数据、模型与代码均已公开。 VBVR-Pro 官方网站: https://video-reason.com/?v=pro VBVR-Pro arXiv 论文: https://arxiv.org/abs/2608.26105 VBVR-Pro 将视觉推理构建成一个闭环:首先定义了 300 个视觉推理任务,然后利用 100 任务构建 benchmark,并对每一个任务提供可验证的打分器。在相同数据情况下,训练和测试 30 + 图像、视频和图文交错模型,探索不同视觉推理范式的能力差异, 同时我们还验证了这些可验证打分器可以直接作为大规模强化学习中的 Verifiable Reward,进一步提升模型的视觉推理能力 。 VBVR-Pro 整体框架:从 300 项视觉推理任务出发,连接多模态模型训练、可验证评测与 RL 优化,构建视觉推理的完整闭环。 视觉推理不只需要更多数据,还需要更广泛任务 VBVR-Pro 专门设计 300 个覆盖不同能力和复杂度的视觉推理任务,构建 125 万条高质量训练数据。更重要的是,每一条数据都被渲染成视频和图文交错两种模式。这意味着,我们同时给视频和图像模型准备了两套不同的数据,能够让不同模态的模型在相同配置下进行比较。 VBVR-Pro 包含 300 项视觉推理任务,覆盖感知、空间、变换、抽象和知识五类核心能力。 尽管这 300 项任务着重关注于抽象视觉场景,但经过 VBVR-Pro 数据训练后,模型所获得的能力并没有局限于这些抽象任务,进一步展现出了良好的跨场景泛化能力。我们将训练后的模型在 RISE-Video、V-ReasonBench、RULER-Bench、MME-CoF-Pro、和 BabyVision 等 7 个 Benchmark 上测试,在真实世界场景和具身推理等未见任务上。依然观察到了最高超过 20 百分点的性能提升。 VBVR-Pro 训练带来的能力可以迁移到真实场景和具身推理等未见任务。这些测试样例在训练集中并不存在高度相似的对应样本,说明模型学到的并非是简单的视觉记忆。 不再让模型 “凭感觉打分”,给 100 项任务配上可验证打分器 有了 “训练场”,下一个问题是:谁来当裁判?目前大部分视觉推理 benchmark 都采取 VLM-as-a-Judge 模式:将结果交给多模态大模型,让它给一个评估分数。尽管这种方式很方便,但存在很多问题。我们测试了多个当前领先的多模态大模型,发现 VLM-as-a-Judge 会反复出现的几类问题:无法精细评估视觉属性、容易忽视关键的局部错误、甚至会误解任务规则。而且它们不仅可能判错,还存在成本高、结果不稳定的问题。 VLM-as-a-Judge 的三类典型失误:无法精细判断视觉属性、忽视决定性的局部错误,以及误解任务本身,从而给出不准确的评 因此,针对这些问题,VBVR-Pro-Bench 为其中的 100 项任务逐项实现了专门的可验证打分器。 这些打分器首先抽取真正与任务相关的语义信息,例如物体的颜色、形状、位置以及运动轨迹等,然后根据精心设计的评分规则进行打分。例如在迷宫的例子中,会显式检查路线是否正确,是否存在穿墙情况,每一项分数都可以被具体解释。 可验证打分器如何评分:它会逐项检查任务相关的关键条件,例如融合过程是否正确、最终状态是否符合要求,以及运动轨迹是否有效,最终汇总得到可解释的任务得分。 为了验证这些打分器是否准确,我们进行了大规模的人类偏好实验。我们对 8 个视频模型产生的 4000 段视频进行评估,并请标注员对生成视频的质量进行多轮评估。结果显示,打分器与人类判断的一致性超过 60%,高于论文中测试的所有 VLM,例如 GPT-5.5 为 0.54,Gemini-3.1-Pro 为 0.52。与此同时,人类自身之间的一致性上限约为 0.77,意味着这套打分器已经十分接近人类一致性上限。 因此,VBVR-Pro 不仅搭建了 “训练场”,更提供了可靠的评估体系。它还为下一步留下了一个更重要的可能:既然分数可靠,是不是也能应用于强化学习训练模型? 图像、视频还是图文交错?30 + 模型同场测试 我们测试了超过 30 个开源和闭源生成模型,并进一步使用 VBVR-Pro 数据统一训练了其中 9 个开源模型。训练后,所有模型均取得明显提升。不同模态也展现出了各自的优势。 单图更适合以最终状态为主、无需展示复杂中间过程的任务;当离散状态已经足以表达推理过程时,图文交错是一种高效且具有竞争力的视觉推理形式;而当任务依赖连续的状态变化时,视频则表现出更加明显的优势 。 这表明,不同视觉载体可能适合不同类型的推理问题。 更有意思的是,我们发现模型并不一定需要依赖显式的 “文字思维链”。当移除或扰动中间文字时,模型仍能保持较强的推理能力;相比之下,一旦中间视觉状态被移除或破坏,性能会显著下降。这说明,对于这些视觉问题, 中间视觉状态并不只是展示推理结果,而是模型组织和推进推理过程的重要载体。 进一步,我们观察到模型生成过程中展示出明显的 Chain-of-Step (CoS) 现象。例如在路径规划中,模型会先探索多条候选路线,再逐步找到可行的最短路径。部分任务中多个可能状态会在中间阶段同时出现,最后收敛到唯一解。 视频和图文交错模型都呈现出明显的 Chain-of-Step 现象:模型会在中间去噪阶段探索多个可能的视觉状态,并逐步收敛到最终答案。 从 “裁判” 到 “教练”:打分器还能直接作为 RL Reward 前面提到的可验证打分器,补上了 VBVR-Pro 闭环中的最后一块拼图:用于强化学习训练。VBVR-Pro 打分器能准确判断任务是否完成且计算成本低,非常适合作为模型强化学习训练中的 reward。我们以 VBVR-Pro-Wan2.2-TI2V-5B 为 baseline,原始模型在 VBVR-Pro-Bench 上的分数为 0.470;使用 5 万条数据 SFT 后得分达到 0.503;使用 VBVR-Pro 可验证评分器 RLVR 后进一步提升至 0.548。 在相同数据预算下,使用可验证打分器的 RLVR 取得最佳表现,并同时提升了未参与训练的 Out-of-Domain 任务表现。 除了最终得分的提升,我们还观察到,经过 RLVR 训练后,模型的视觉推理过程本身也发生了明显变化。例如在颜色序列补全任务中,RL 前的模型很早就 “认定” 了一个错误答案,
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱