智能AI
morning
智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」
摘要
新智元报道 当大模型逐渐掌握对话、推理、编程和工具调用之后, 自主研究被视为人工智能领域的「The Next Big Thing」。 自主研究意义在于,AI的发展将不再受制于人类知识边界,形成一种面向智能生产的全新Scaling Law——「投入多少能源,就将转化多少智力」。自主研究正是衡量智能体自主研究能力重要维度之一。 普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件...
https
arex
Loop
新智元报道
当大模型逐渐掌握对话
编程和工具调用之后
自主研究被视为人工智能领域的
The
Next
Big
2026-08-11
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 当大模型逐渐掌握对话、推理、编程和工具调用之后, 自主研究被视为人工智能领域的「The Next Big Thing」。 自主研究意义在于,AI的发展将不再受制于人类知识边界,形成一种面向智能生产的全新Scaling Law——「投入多少能源,就将转化多少智力」。自主研究正是衡量智能体自主研究能力重要维度之一。 普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。自主研究的核心难题并不是「搜索得还不够久或者证据难找」,而是: 智能体能不能知道当前答案到底已经成立了什么、还缺什么,以及下一步最应该研究什么, 是如何让智能体在复杂约束中持续接近正确答案。 智源研究院发布的AREX正是围绕这一核心问题提出的。 它抓住了自主研究中的关键突破口——「发现—验证不对称性」:完整答案往往难以一次性生成,但一旦形成候选解,便可以通过针对关键约束的逐项验证,快速定位不足并指导后续探索。 验证的意义并非仅仅判断答案是否正确,更重要的是帮助智能体理解「已经知道什么、还缺少什么,以及下一步应该研究什么」,从而让每一轮研究都更加精准、更具方向性。 这一思想的前瞻性在Jeff Dean近日创立的Discovery Loop公司得到印证:未来的人工智能不仅需要更强的推理能力,更需要通过持续的实验、反馈和修正形成自主发现能力。 AREX对「求解—验证」双循环的探索,体现了智源研究团队在自主研究方向上的前瞻性,也反映出通过闭环迭代推动智能持续进化,正在成为人工智能发展的重要趋势。 项目主页: https://vectorspacelab.github.io/arex-model/ 模型权重: https://huggingface.co/collections/BAAI/arex 体验链接: https://arex-research.com AREX旨在训练能长期运行、 自我验证、持续修正的研究型智能体 AREX的目标,不是让模型在单轮回答中写出一个「看起来更完整」的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在「研究→验证→再研究」的循环中不断接近完整解,让模型真正具备持续改进当前解的能力。 面对复杂任务,智能体可以先给出一个阶段性答案;随后,它会逐项检查约束是否满足,保留已经验证的证据,定位尚未解决的主张,再发起更有针对性的后续研究。当新的证据到来后,智能体会再次更新答案、重新验证,并判断是继续深入,还是结束研究并输出最终结论。 这一过程可以递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的「自我改进」,并不是指模型在执行任务时在线更新参数,而是指智能体对自身研究状态和当前答案进行持续修正。 它不再只是一个「搜索后回答」的工具,而更像一个会反复检查研究进度、修正研究路径、沉淀有效证据的研究助手。AREX通过双循环框架打通「找到答案」与「改进答案」的闭环 AREX的整体方法,可以概括为 一套双循环递归求解框架。 内层循环负责「研究」,外层循环负责「改进」。 二者协同,让智能体不只是向前搜索,而是在每一轮中继承已有进展、修正错误方向,并不断接近更可靠的答案。 内层循环Research Loop:内层循环负责完成一轮相对完整的研究。 在这一阶段,智能体会围绕当前研究问题搜索信息、调用工具、收集证据、比较候选,并构造一个暂定答案。它的目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可以被审计的当前解。 如果这是第一轮研究,智能体面对的是用户提出的原始问题。如果已经经过外层验证,那么它面对的就是一个被重新定义过、更聚焦的新问题。例如:补齐某项缺失证据,消解两个来源之间的矛盾,或者替换一个无法满足全部条件的候选答案。 这意味着,每一轮研究都不是简单重复,而是在更清晰的问题上继续推进。 外层循环Self-Improvement Loop:外层循环负责判断当前答案究竟走到了哪一步。 AREX会依据任务中的各项约束,对暂定答案进行逐项审计,并形成约束级别的置信判断:哪些条件已经获得充分支持,哪些仍然不确定,哪些关键主张缺少证据,哪些结论需要重新研究。 如果所有必要条件都得到足够支持,智能体就结束研究并输出答案。如果仍有条件没有解决,验证结果就会被转化为下一轮内层循环的研究目标。因此,外层循环不是简单地说「答案还不够好,再试一次」,而是明确告诉内层循环: 已经解决了什么,接下来只需要解决什么。这让每一轮递归都能继承已有成果,而不是从头开始。 机制分析: 长程研究状态维护带来的性能提升 AREX的推理机制包含两个循环:内层研究循环负责搜索、访问网页、验证证据、更新上下文并生成暂定答案;外层自我改进循环根据答案、证据和置信度,决定接受、继续细化或重新开始。 其中, 自主上下文更新(ACU)是关键。 它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。BrowseComp上的分析显示,AREX通常会主动更新上下文,而不是等到128K上下文窗口被塞满后才被动压缩。 受控实验显示, AREX完整系统在BrowseComp上达到82.5,比关闭ACU和外层循环的版本高出22.9个百分点。 训练消融也表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。 训练消融进一步说明,AREX的提升来自多个环节共同作用。渐进式多轮能力训练先建立稳定的工具交互能力,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、关键上下文更新等转折点,步骤感知强化学习则继续优化长程决策策略。 这也解释了AREX的核心思想:长程研究中真正难的不是例行搜索和访问网页,而是 在关键时刻做对决定, 什么时候相信一个证据,什么时候放弃一个候选,什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。 AREX让自主研究智能体 在长程任务中持续自我进化 长程研究不「失忆」:将「历史包袱」转化为「进度路标」。 长程研究中的核心挑战,并不只是信息检索是否充分,更在于模型能否在持续延展的研究过程中稳定记住当前进展。随着交互轨迹不断变长,历史记录中会同时包含已验证的证据、被推翻的假设、中途放弃的计划以及大量重复信息。全盘保留这些内容容易让模型迷失方向,而简单截断又可能丢掉关键线索。 AREX的做法,是让模型在研究过程中主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态。这种更新并不是普通摘要,而是一份「研究进度表」,帮助模型明确:当前研究到哪了?什么已经成立?什么已经被排除?接下来最该查什么?通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。 构造可验证的训练数据:从确定答案出发,生成可验证的研究轨迹。 自我改进不是靠延长搜索轨迹就能堆砌出来的。AREX需要的是那种能真正教会模型如何发现线索、交叉验证、推翻错误候选、调整方向并继续前进的数据。 为此,AREX设计
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱