首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

2026-08-05 1 阅读 约10分钟阅读 机器之心
分享:
字号:
01|视觉,为什么是一条闭环? 人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。 这套闭环有长期的心理学基础。经典著作《眼动与视觉》(1967)发现,同一幅画在不同问题下会引发截然不同的眼动轨迹:观看并非由图像单向决定,任务目标和中间假设会持续重定向注视。《视觉与视觉意识的感觉—运动理论》(2001)进一步把「看见」理解为掌握视觉输入如何随观察行为而变化;《自然行为中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。《破解视觉知觉的「真正」谜题:作为外部记忆的世界》(1992)将这种策略概括为把外部世界当作可以反复查询的「外部记忆」,而不是把所有细节一次性存入大脑。 这种能力和真实应用息息相关。车间工作需要在一桌相似的零件中找到目标、检查差异;医生要在整张影像中逐区搜索并统计可疑病灶;旅行者要沿地图跨过一个个岔路,持续确认自己仍在正确路径上。每一次新发现都会改变下一次查看的区域,下一次观察又会反过来修正判断;只看懂大意远远不够。 基于以上动机,我们发布了 ActiveVision——一个专门测量这种「主动观察」能力的视觉推理基准。ActiveVision 包含 17 个任务和 3 类能力: ● 全局扫描(distributed scanning):在整张图里找全、数全 ● 顺序追踪(sequential traversal):沿一条结构一步步走到底 ● 属性迁移(visual attribute transfer):跨区域记住并比较细微视觉属性 ActiveVision 的三类任务也直接对应心理学中已知的基础视觉操作。《视觉数量辨别》(1949)和《为什么少量与大量目标的计数方式不同?》(1994)表明,少量目标可以被快速「瞬时计数」,数量增加后则需要逐项扫描;《曲线追踪:空间关系知觉的一种可能的基本操作》(1986)将沿轮廓追踪视为串行的注意过程;《视觉工作记忆对特征及其组合的容量》(1997)说明,跨区域比较受到视觉工作记忆容量限制,需要在目标与参照之间反复切换。《视觉程序》(1984)进一步指出,这类基础操作需要由注意力逐步执行。ActiveVision 将这些经典实验中的基础操作转化为可以直接测量模型的三类任务。 图 1|主动观察的真实应用与 ActiveVision 任务设计。 02|一道接近 9 倍的鸿沟 评测结果很明确:在没有使用外部工具的情况下,GPT-5.5 在所有模型中取得最高分 10.6%(9/85);而 3 位人类参与者的平均准确率为 96.1%(94.1%~97.6%)。两者之间存在接近 9 倍的差距。 即使是这个最高分模型,也在 17 个任务中的 11 个上拿到 0 分。 图 2|纯 CoT 模型与人类的准确率对比:最高分模型与人类仍相差近 9 倍。 提高推理强度也无法缩短差距。GPT-5.5 从不思考、直接回答,到使用最高推理强度,每题成本增长了超过两个数量级,其准确率仅从 2.4% 提升到 10.6%;Fable 5 在最高推理强度下的准确率只有 3.5%,反而在更低推理强度时达到 5.9%。 「还想得不够久」解释不了这些结果。更直接的迹象是,正确的视觉证据没有被稳定地带回推理过程。 从错误模式看,问题也很一致:全局扫描时漏数,顺序追踪时从起点直接猜终点,属性迁移时用语言先验替代真正的跨区域比较。模型能生成一段听起来合理的解释,却无法稳定完成「获取证据—保存中间状态—回到图像验证」的闭环。 模型看到了图,却未能持续观察其中的物体。 图 3|纯 CoT 模型的准确率与每题成本。 03|给它代码,能不能替它看? 那如果给模型代码、裁图、测量和其他视觉工具呢? 我们把同一套题交给 3 个工具型 Coding Agent 进行测试,得到的分数明显上升:Fable 5 + Claude Code 为 50.6%,GPT-5.5 + Codex 为 37.6%,Opus 4.8 + Claude Code 为 24.7%。不过,和人类的 96.1% 相比,仍有很大差距。 Agent 擅长把「看」改写成「算」:通过阈值分割、连通域、路径追踪等方法拆分题目,试图解决它们。不过,一旦真实纹理导致分割结果破碎,或追踪器在交叉处串线,Agent 往往无法察觉这些工具输出错误。 而且,这些提升并不均匀。3 个 Agent 在容易通过裁图、模板匹配或几何测量解决的属性迁移任务上达到了 43%~66%;到了必须准确穿过交叉点、持续跟踪方向和当前位置的顺序追踪任务,Codex 只做对 1/25,Opus 4.8 只做对 3/25,而 Fable 5 也只有 10/25。工具只有在「看」能被可靠地改写成一套计算时,才真正有效。 瓶颈没有消失,只是从「看图」转移到了「检查自己有没有看错」。 而且,使用 Agent 的代价不小:每题平均花费 12~15 分钟,API 等价成本达到 2.74~7.63 美元;人类平均约 34 秒,且不依赖任何工具即可完成。 工具会计算,但不会替你保持注视。 图 4|工具型 Agent 成绩与典型失败案例。 04|怎样造出一场「看不完就答不对」的考试? 为了避免结论依赖几张手工挑选的「刁钻图」,ActiveVision 的每道题都先由确定性程序生成:位置、形状、曲线、拓扑和标准答案全部已知;再用 GPT-image-2 将其重绘成照片级场景,同时保持决定答案的结构不变。这样,每个任务都可以从新种子继续生成,答案精确、可复现,又不会让模型靠熟悉的卡通模板取巧。 例如,闭合区域可以变成航拍视角下的田野与河流,箭头链可以变成由脚印连接的彩色石块,曲线可以变成漂流木上的绳索。生成器负责把已知结构「翻译」成材质、光照和纹理;解题者却必须反过来从像素中恢复全局结构。 同时,为了避免模型看一次图就记住全部内容、不再看图,ActiveVision 中的所有元素均出现在连续采样的任意位置,形状逐题重新生成,路线沿随机曲线展开。模型无法依赖网格坐标、命名形状或固定路径,只能在推理过程中反复回到图像,逐步寻找、追踪并核验视觉证据,而不能只看一眼、压缩成摘要后直接作答。 ActiveVision 把重点放在感知能否持续参与推理;描述一张图只是起点。 论文:https://arxiv.org/abs/2607.16165 AlphaXiv:https://www.alphaxiv.org/abs/2607.16165 项目主页:https://activevision.dev 数据集:https://huggingface.co/datasets/activevisionai/ActiveVision 评测代码:https://github.com/saccharomycetes/ActiveVision 图 5|ActiveVision 数据生成流程:确定性程序、精确答案与真实照片重绘。 作者介绍 张家瑞是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科毕业于清华大学,研究方向包括多模态感知与推理及 AI-for-Science。主页:https://sac
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱