智能AI
morning
艾里斯:攀登搜索前沿
摘要
arXiv:2609.04304v1 Announce Type: new Abstract: We present Iris-mini and Iris-pro, two search agents trained at the 35B-A3B and 397B-A17B scales, together with the data pipeline and training recipe be...
the
and
with
from
two
search
agents
training
are
Iris
2026-09-07
1 阅读
约2分钟阅读
Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang, Xu Chu, Shaowei Chen, Yuantao Gu, Mu Chuan
字号:
arXiv:2609.04304v1 公告类型:新 摘要:我们介绍了 Iris-mini 和 Iris-pro,这两种在 35B-A3B 和 397B-A17B 尺度上训练的搜索代理,以及它们背后的数据管道和训练配方。任务是从网络语料库的超链接结构反向构建的:我们在从种子页面及其外链接提取的实体图上编写多跳链,将每个非答案实体重写为描述性参考,以便通过字符串匹配无法解决任何线索,并且只承认参考模型在闭卷中失败但一旦提供支持证据就解决的问题。然后将这些问题转化为轨迹,并在 SFT 之前在轨迹和转弯级别上进行过滤。然后,RL 针对实时搜索优化策略,奖励法官和观察总结器在训练集群内提供服务,超长的部署会在请求级别中断,并在下一步从其提交的前缀恢复。我们在称为 SFT-RL 攀爬的过程中交替使用这两个阶段,将每轮 RL 中最难解决且最有效的推出返回到下一个监督通道。由于推理时间上下文管理在这些基准测试中比大多数报告的系统之间差异更有价值,因此我们评估每个基准测试,无论是否有它,都保持工具集、上下文限制和判断固定。所有结果都来自单个 ReAct 代理,没有子代理,也没有测试时验证。启用管理后,在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE 上,这两个模型达到 82.2/84.8/86.9/52.3$ 和 88.6/85.1/92.9/56.4$,是各自参数范围内开源搜索代理中最强的整体结果。我们计划发布模型权重以及数据构建、训练和评估的完整配方。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱