首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

SearchAuditor:审核和归因长期搜索代理中的故障

摘要

arXiv:2608.05212v1 Announce Type: new Abstract: Deep search agents tackle challenging questions through long-horizon web interactions, a process that is both complex and fragile: small reasoning error...

and search that the end through long failures with agents
2026-08-07 1 阅读 约1分钟阅读 Zhixiang Liang, Yifei Liu, Yidan Huang, Haozhe Zhao, Beichen Huang, Jiaqi Wang, Nan Duan, Qiong Cao
分享:
字号:
arXiv:2608.05212v1 公告类型:新 摘要:深度搜索代理通过长期网络交互来解决具有挑战性的问题,这是一个既复杂又脆弱的过程:小的推理错误可能会通过长而嘈杂的轨迹传播为流畅但不正确的答案。诊断此类故障很困难,需要手动检查极长的执行轨迹,这可能超出了人类的能力。因此,我们引入了SearchAuditBench,这是一个评估LLM审核员是否能够定位、归因和修复这些故障的基准,从而减轻人力负担。 SearchAuditBench 包含 1,243 个失败轨迹,平均 73.1 条消息和 65.1K 个令牌,从五个深度搜索基准的八个开放权重模型中收集,每个专家都注释了关键错误步骤、特定于搜索的根本原因以及带有评分标准的参考修复。我们进一步提出了 SearchAuditor,这是一种多视角审计框架,可以通过基于证据的裁决有效地定位、归因和修复搜索代理故障。实验结果表明,即使是最强的基线,在 GPT-5.5 这样的前沿模型的支持下,也只能获得 26.6% 的端到端通过率。相比之下,我们的 SearchAuditor 始终优于不同前沿模型的所有基线,实现了 32.3% 的端到端通过率,并且通过修复恢复失败的运行使代理能够更好地从错误中恢复。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱