首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

MetaRoute-Bench:评估代理工作流路由的元决策策略

2026-08-04 1 阅读 约1分钟阅读 Natan Vidra, Alina Kapanova, Arun Kanhai, Spurthi Setty
分享:
字号:
arXiv:2608.00107v1 公告类型:新摘要:代理系统必须反复决定是否直接应答、分解任务、调用工具、执行代码、委托给专家、验证中间结果或从故障中恢复。这些元决策不仅影响任务成功,还影响运营成本和延迟,但它们通常嵌入编排框架内,并且仅通过聚合任务准确性进行评估。我们提出了 MetaRoute-Bench,一个开放的、可检查的框架,用于比较共享执行模型下的元决策策略。初始基准测试包含 180 个涵盖数据分析、研究和文档处理的综合任务配置文件、八个路由策略和 30 个配对随机种子。在 43,200 个跟踪中,任务感知组合策略取得了 79.4% 的成功率,而强大的特定于工作负载的静态策略为 76.7%,一次性任务路由为 67.4%,直接应答为 52.9%。相对于静态策略,这提高了 2.7 个百分点,配对 95% CI 正负 2.0 个点,平均成本高出 4.7%,延迟高出 6.4%。当路线组成仅限于一项操作并且删除验证时,消融显示出最大的损失。这些结果是由种子离线执行模型而不是实时部署生成的;因此,主要贡献是可重复的评估方法和对路线政策权衡的分析,而不是生产有效性的证据。我们发布任务生成、策略、跟踪、测试和分析工件以支持实时系统验证。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱