开发者生态
morning
编码代理线束设计的实证研究
摘要
Computer Science > Artificial Intelligence arXiv:2609.20804 (cs) [Submitted on 17 Sep 2026] Title: An Empirical Study of Harness Design for Coding Agents Authors: Run-Ze Fan , Zihao Zhang , Simin Ma ,...
and
context
models
for
the
with
management
Coding
accuracy
bash
2026-09-18
1 阅读
约7分钟阅读
wek
字号:
计算机科学 > 人工智能 arXiv:2609.20804 (cs) [提交于 2026 年 9 月 17 日] 标题:An Empirical Study of Harness Design for Coding Agents 作者:Run-Ze Fan、Zihao Zhang、Simin Ma、Yebowen Hu、Shouju Wang、Kaiqiang Song、Fei Liu、Hamed Zamani、Xiaoyang Wang 查看标题为 An 的论文的 PDF编码代理的线束设计实证研究,作者:Run-Ze Fan 和其他 8 位作者 查看 PDF HTML(实验) 摘要:编码线束塑造了自主编码代理如何将模型功能转化为长期软件工程性能,但现有的工作通常将线束作为整体系统进行评估,从而使各个组件的有效性不清楚。为了实现组件级比较,我们使用轻量级编码工具来研究这个问题,该工具的执行循环是固定的,而三个组件是不同的:规划、操作空间和上下文管理。在 SWE-Bench Verified 和 Terminal-Bench 2.1 上评估的四个模型中,我们评估了 176 个匹配的设置,涵盖五种情境管理策略、四种情境窗口预算以及规划和行动空间的有针对性的消融。我们发现:(1)随着上下文窗口预算的收紧,上下文管理变得越来越有价值,其大部分好处来自于防止上下文溢出故障。 (2) 在基于 LLM 的摘要之前进行基于规则的省略可提供上下文管理策略中最强的整体效率,而使省略的内容可恢复会增加模型很少使用的机制,并且不会产生任何准确性增益。 (3) 规划从较弱模型的准确性支架转变为较强模型的成本节省器,而准确性几乎没有变化。 (4) 预定义工具可以提高 bash 熟练程度较弱的模型的性能,而支持 bash 的模型可以通过仅 bash 的界面有效运行,并显着降低成本,尤其是在以命令行为中心的任务上。轨迹级分析解释了这些影响:上下文管理扩展了执行轨迹,而不会显着改变代理行为,计划更改轨迹停止的位置,并且操作空间改变了代码编写的粒度。这些发现为模型和预算意识线束设计提供了信息,并为评估未来线束组件提供了模块化框架。评论:43页主题:人工智能(cs.AI);计算和语言(cs.CL);机器学习(cs.LG);软件工程 (cs.SE) 引用为:arXiv:2609.20804 [cs.AI](或此版本的 arXiv:2609.20804v1 [cs.AI]) https://doi.org/10.48550/arXiv.2609.20804 arXiv 通过 DataCite 发布的 DOI(待注册) 提交历史记录 来自: Run-Ze Fan [ 查看电子邮件 ] [v1] Thu, 17 Sep 2026 17:58:07 UTC (6,713 KB) 全文链接: Access Paper:查看标题为 An Empirical Study of Harness Design for Coding Agents 的论文的 PDF,作者为 Run-Ze Fan 和其他 8 位作者 查看 PDF HTML(实验性) TeX 源代码 查看许可证 当前浏览上下文: cs.AI < 上一页 | 上一页 | 下一页下一页 > 新 |最近 | 2026-09 更改为浏览方式:cs cs.CL cs.LG cs.SE 参考文献与引文 NASA ADS Google Scholar 语义学者正在加载... BibTeX 格式的引文正在加载... 数据提供者: 书签 书目工具 书目和引文工具 书目浏览器 切换书目浏览器(什么是浏览器?) 已连接论文 切换已连接论文(什么是已连接)论文? ) Litmaps 切换 Litmaps(什么是 Litmaps?) scite.ai 切换 scite 智能引文(什么是智能引文?) 与本文相关的代码、数据、媒体 代码、数据和媒体 alphaXiv 切换 alphaXiv(什么是 alphaXiv?) 代码链接 切换 CatalyzeX 论文代码查找器(什么是 CatalyzeX?) DagsHub 切换 DagsHub (什么是 DagsHub?) GotitPub 切换 Gotit.pub (什么是 GotitPub?) Huggingface 切换拥抱面 (什么是 Huggingface?) ScienceCast 切换 ScienceCast (什么是 ScienceCast?) 演示 演示 复制 切换复制 (什么是复制?) Spaces 切换拥抱面 空间 (什么是空间? ) 空间 切换 TXYZ.AI(什么是 TXYZ.AI?) 相关论文推荐器和搜索工具 链接到 Influence Flower Influence Flower(什么是 Influence Flowers?) 核心推荐器切换 CORE 推荐器(什么是 CORE?) 作者地点 机构 主题 关于 arXivLabs arXivLabs:与社区合作者的实验项目 arXivLabs 是一个允许合作者开发和共享新 arXiv 的框架直接在我们的网站上提供功能。与 arXivLabs 合作的个人和组织都接受并接受了我们开放、社区、卓越和用户数据隐私的价值观。 arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。您有一个能为 arXiv 社区增加价值的项目想法吗?了解有关 arXivLabs 的更多信息。这篇论文的哪些作者是认可者? |禁用 MathJax(什么是 MathJax?)
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱