智能AI
morning
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励
摘要
核心结论:V-Rubrics 将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让图像中的事实、推理步骤和任务要求分别参与奖励计算。基于同一 SFT 起点和同一批 RL 数据,rubric GRPO 在通用与知识评测中的 Overall Avg. 达到 68.04。 多模态模型给出的推理过程即使连贯,也可能读错图表数字,或写入画面中不存在的物体。如果最后的答案恰好正确,按结果评...
Rubrics
rubrics
rubric
https
GRPO
Visual
Faithfulness
shulin16
github
Essential
2026-09-26
1 阅读
约10分钟阅读
机器之心
字号:
核心结论:V-Rubrics 将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让图像中的事实、推理步骤和任务要求分别参与奖励计算。基于同一 SFT 起点和同一批 RL 数据,rubric GRPO 在通用与知识评测中的 Overall Avg. 达到 68.04。 多模态模型给出的推理过程即使连贯,也可能读错图表数字,或写入画面中不存在的物体。如果最后的答案恰好正确,按结果评分的训练方式就可能把这些“看似结果正确”但“实际推理错误”的情况也一并奖励。 反过来,最终答案错了,也不意味着此前的观察都错了。那些有依据的正确观察,仍然是有价值的训练信号:保留并强化这些观察,可以帮助模型在此基础上修正后续推断。但这也引出了一个关键问题: 当正确的观察 与错误的推断交织 在同一段回答中,reward 应当如何分配,才能鼓励做 对的 部分,并引导模型纠正出错的环节? 来自南洋理工大学 S-Lab、A*STAR 和 UIUC 的研究团队提出了 V-Rubrics ,用逐项评分(rubrics)来处理“信用分配”(credit assignment)问题。视觉事实、推理步骤和任务要求分别列为评判的准则,而这些单项的得分则会被用于后续的 GRPO 强化学习。该论文已被 EMNLP 2026 主会接收,代码与数据现已开源。 论文标题:V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 作者团队:Shulin Tian、Minglun Li、Yuhao Dong、Hao Ding、Jiarui Yao、Haiwen Diao、Jingkang Yang、Hongyuan Zhu、Ziwei Liu 论文地址:https://arxiv.org/abs/2608.25580v1 项目主页:https://shulin16.github.io/v-rubrics/ 代码仓库:https://github.com/shulin16/v-rubrics 数据集:https://huggingface.co/datasets/v-rubrics/v-rubrics-50k 正确的观察与错误的推断 为什么要分别评价? 论文给出了一个直观例子。面对“图中有多少人出生于二战结束之后”的问题,答案级 GRPO 模型准确识别出 4 个人,却随后凭其中一名男子的外貌估计其年龄超过 70 岁,并据此断言他出生于 1945 年以前,最终回答 3 人。人数识别本身没有出错,问题出在后续的年龄与出生年份推断上。 如果只按最终答案计分,训练只能知道整道题没有答对,却得不到更具体的判断:识别出“4 人”是有图像依据的,后续推断则需要修正。对于图表、几何题或文档问答,这类混合情况同样常见,一处错误读数或不成立的推导,就可能改变最终结果。而 V-Rubrics 将人数识别、出生年份推断和最终作答分别列为检查项,训练时再使用这些逐项判断。 把视觉证据写进奖励 围绕一条视觉回答的形成过程,V-Rubrics 将准则分为三个维度: 视觉忠实性(Visual Faithfulness,VF) 检查事实依据。回复中提到的物体、属性、关系、数量、可见文字和图表数值,都应能在图像中找到支持。 推理一致性(Reasoning Consistency,RC) 检查推导是否成立。即使图像信息读取正确,后续结论也需要能够从这些事实中推出。 指令遵循(Instruction Following,IF) 检查任务是否完成,包括回答形式、题目要求和其他明确约束。 同一个视觉问题被拆成 VF、RC、IF 三类原子准则,每条准则均可独立判断并带有权重。 rubric 的设计也很重要:每条 rubric 都只检查一个原子项,同时要求表述尽量简短,单独拿出来也能看懂,并配有重要性标签和相应权重。Essential、Important、Optional 分别对应必须答到、重要但非必需,以及可作为补充的内容;Pitfall 则专门标出常见的幻觉和推理错误。这样一来,模型答对了什么、又在哪一步出了错,都可以分别计分。 怎样让自动评分有据可查? 以几何题为例,“回答应当正确”并没有给评分器提供多少额外信息;如果分别写明应读取的边长、适用的公式和目标面积,检查对象就明确了。论文要求 rubric 指向具体可见的事实,并在单条准则中写清对象和成立条件,同时覆盖关键观察与中间推理。 这些检查项也有重要程度之分。视觉问答采用 VF ≫ RC > IF 的优先级,将视觉事实放在首位,再考虑推理与指令约束;Essential、Important、Optional 的正向权重为 1 到 5,Pitfall 则标记为 -1 或 -2。 生成准则时,模型读取原图、指令和参考回答,将需要核查的事实写入 rubric;训练时,verifier 只读取生成回复与这些自包含准则(self-contained criteria), 不直接读取原图 。 5 万道题 如何提供 35 万条具体反馈? V-Rubrics 50K 从 17 个公开视觉数据源中选取样本,涵盖图表与文档问答、示意图、视觉数学、计数、教育问答和通用视觉推理,并按有效性、内容质量与重复性进行了初步筛选。 为判断题目是否还有训练价值,团队让监督微调(SFT)后的模型对每个候选样本回答 8 次:全部答对的题目会被剔除,因为最终答案奖励已难以在这些回答之间提供区分;其余样本则根据答对比例划分难度。这里衡量的是模型的实际表现,难度标签用于组织固定的训练数据组合。 最终保留的 50,248 个样本中,hard 级别的问题占 36.1%,medium 占 50.4%,simple 占 13.6%。 随后,Gemini-3-Pro 按照统一的图像条件化协议(image-conditioned protocol)生成 VF、RC、IF 准则,共得到 352,938 条 rubric。其中,VF 为 209,436 条(59.3%),RC 为 101,369 条(28.7%),IF 为 42,133 条(11.9%)。接近六成准则用于检查视觉事实,使“是否准确理解图像”成为最主要的监督内容。 每个样本都包含图像、题目、参考回答和对应准则,训练时可以分别检查各项要求的满足情况。 V-Rubrics 50K 的数据来源与 VF、RC、IF 准则分布 评分拆开之后 怎样进入强化学习? 逐项打分还只是第一步。如果立即把所有准则合成一个总分,再用这个分数更新整段回复,各项判断之间的区别仍会在信用分配时被压缩。为了解决这个 reward 的坍缩问题,V-Rubrics 因而同时调整了奖励内容与信用分配方式。 在主实验中,答案正确性和 rubric 满足度各以 0.5 的权重计入语义奖励,同时保留标准格式奖励。答案奖励检查任务是否完成,rubric 奖励检查回答是否满足各条准则,后者逐项给出“满足”或“不满足”的判断。 对于同一道题,系统分别比较多条生成回复的最终答案和各条 rubric 得分。例如,一组回答可能都没有得到正确结论,但只有部分回答准确读出了图表数值;逐项比较
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱