智能AI
morning
学习代理工作流的组合元路由:可执行基准
2026-08-04
1 阅读
约1分钟阅读
Natan Vidra, Alina Kapanova, Arun Kanhai, Spurthi Setty
字号:
arXiv:2608.00106v1 公告类型:新摘要:代理系统不仅必须决定生成什么答案,还必须决定在其之前应进行哪些推理和执行操作。控制器可以直接回答、分解请求、检索证据、执行代码、委托给专家或验证中间结果。现有的路由工作主要是孤立地选择模型端点、检索深度或工具。我们引入了一个可执行的基准测试和一个预算感知元路由器,它从原始任务文本组成异构操作。该基准包含 216 项训练、72 项开发、108 项保留测试和 108 项锁定词汇转换挑战任务,涉及数据分析、冻结语料库研究和文档处理。操作执行后,结果由机器检查。独立的正则化逻辑头根据单词和字符特征预测操作概率,根据开发数据进行温度缩放,并根据路线成本和动作计数预算贪婪地组成。在持续测试中,学习策略取得了 100% 的成功,而强静态和固定工作流程的成功率为 93.5%,成本比静态策略低 43%;匹配的学习一次性路由器达到 56.5%。在未触及的挑战赛中,学习成功率下降至 75.9%,落后于静态路由的 93.5%,同时仍便宜 49%,比一次性路由高 34.3 个百分点。这一差距将词汇泛化(而不是路线执行)视为主要限制。这些结果建立了一个可重复的测试平台和有限的概念证明,而不是现场法学硕士表现的证据。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱