首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AhaBench:特工会从之前的经验中学习吗?长期持续学习的基准

摘要

arXiv:2609.05435v1 Announce Type: new Abstract: Modern language agents are expected to operate over long horizons: they ask follow-up questions, reuse worked examples, handle tool feedback, and adapt ...

and the Aha delayed Euler Vending Score models that new
2026-09-09 1 阅读 约2分钟阅读 Zerui Cheng, Jiawei Xu, Huacan Chai, Jiayang Sun, Pramod Viswanath, Maxm Pan
分享:
字号:
arXiv:2609.05435v1 公告类型:新摘要:现代语言智能体预计将长期运行:它们提出后续问题、重用工作示例、处理工具反馈并适应延迟的后果。大多数评估仍然会在提示后重置代理或仅对一条轨迹的最终状态进行评分。 AhaBench 提出了一个更具操作性的问题:当一个固定模型获得有用的经验时,在明显的支持被删除、改变或延迟的相关评估条件下,其后来的行为是否会有所改善?该套件包含三个组件。 Aha-Puzzle 在解决隐藏状态谜题后测试无提示探索; Aha-Euler 将 Project Euler 风格的数学思想转化为具有精确验证器的生成的教学/保留任务; Aha-Vending 是一个受 Vending-Bench 启发的开源实现,测试模拟自动售货代理在处理延迟反馈和操作事件时是否保持盈利。 AhaBench 报告了一个由三部分组成的记分卡:初始分数衡量开始能力,体验后分数衡量后来的经验结果,学习提升是它们的差异。这种分解是主要的经验信息:充分利用可见支持的模型、达到高体验后分数的模型以及在跑步过程中改进最多的模型并不总是相同的。在常见的八模型面板上,Claude Opus 4.6 的体验后总得分为 64.3,总学习提升为 +25.8,Gemini 3.1 Pro 紧随其后,为 63.4。组件结果解释了这种分裂:谜题痕迹提高了受支持的分数,但通常无法成为无提示的探索行为; Aha-Euler完全教学达到78.6-100.0%,而纯答案迁移范围为0.0-73.9%; Aha-Vending 将有利可图的事件处理与破产和无订单失败分开。我们发布了用于评估新代理的基准任务、评分标准、验证器、模拟器代码和接口。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱