首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

根本原因归因是一个搜索问题:持续搜索长期代理故障

摘要

arXiv:2609.13463v1 Announce Type: new Abstract: The increasing deployment of AI agents in long-horizon tasks yields massive execution logs. Diagnosing failures within these records is crucial for reli...

the execution for RCA from traces massive scale attribution Continual
2026-09-15 1 阅读 约2分钟阅读 Harsh Raj, David Lee, Anas Mahmoud, Renxiong Wang, Razvan-Gabriel Dumitru, Chenguang Wang, Tong Zhao, Yunzhong He, Darvin Yi, Vipul Gupta
分享:
字号:
arXiv:2609.13463v1 公告类型:新 摘要:在长期任务中越来越多地部署人工智能代理会产生大量执行日志。诊断这些记录中的故障对于可靠性至关重要,因为它将结果级信号转化为可行的干预措施。数据的庞大规模使得人工审查变得不切实际,从而推动了对自动根本原因归因 (RCA) 的需求。然而,使用 LLM 的自动化 RCA 方法的诊断准确性较低,尤其是当执行轨迹变大时。他们之所以陷入困境,是因为相关信息往往稀疏,分布在遥远的行动中,并且与可见的失败脱节,从而减少了大规模搜索问题的根本原因。现有的 RCA 方法通常依赖于一次性 LLM 判断来从执行跟踪中诊断故障。虽然对于较短的轨迹有效,但这些法官往往会尽早做出合理的诊断,从而留下未经检查的较长轨迹中的关键证据。我们引入了持续搜索,这是一个迭代框架,可以推动法官在连续的轮次中不断寻找未解决的诊断证据。我们通过四个现有的 RCA 基准评估持续搜索。认识到当前基准测试中缺乏大量执行跟踪,我们引入了 MegaRCA-Mix 来大规模评估 RCA。 MegaRCA-Mix 提供了一个具有挑战性的测试平台,其中包含 50 项人工注释的故障试验,涵盖长期、执行繁重的任务。在多个基准套件和模型系列中,持续搜索持续提高归因性能。例如,在 MegaRCA-Mix 上,它将 GPT-5.5 的 F1 分数提高了 40% 以上,从 0.349 美元提高到 0.498 美元。更有趣的是,在同一模型系列中,较低级别的模型甚至可以超越较高级别的模型,这表明有效的搜索取代了原始模型规模。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱