智能AI
morning
线束还是模型?使用污染控制的私人套件隔离代理编码中的利用效应
2026-09-15
1 阅读
约3分钟阅读
Mohsen Arjmandi
字号:
arXiv:2609.11987v1 公告类型:新 摘要:代理编码系统将语言模型与工具耦合起来:将聊天模型转变为自主软件工程师的工具、提示和控制流。供应商提供针对自己模型进行调整的线束,而从业者则认为供应商与本地的配对可以解决更多任务。我们通过在包含 256 个存储库和截止后竞赛任务的私人、污染控制套件中配对的相同模型对比来衡量这一假设。同样的 80 个任务在 claude-agent-sdk 和 claude-opus-4-8 上的 deepagents 下运行,以及在 gpt-5.5 上的 openai-codex SDK 和 deepagents 下运行,并以 gemini-3.5-flash 和 deepseek-v3.2 作为侧单元。 800 次计划运行中的 792 次由孤立的预言机评分。这两种对比都无法解决任一工具的平均优势:Opus 4.8 为 -1.25 pp(48.8% vs 50.0%,任务引导 95% CI [-10.0, +7.5]),GPT-5.5 为 +1.25 pp(55.6% vs 54.4%,CI [-4.4, +6.9])。 Opus 平均值结合了相反的层次:原生 Harness 在 61 个存储库任务上落后 9.0 个百分点,在 19 个竞赛任务上领先 23.7 个百分点(标签排列 p = 0.003)。分区是在看到数据后选择的,需要设计复制。正确性和完成度也是分开的:在挂钟上限取消的 81 次运行中,有 22 次产生了通过补丁。根据冻结标价的原始每回合使用量重新定价,中性线束的成本是 Opus 4.8 上每个已解决任务的 1.3 至 1.6 倍,是 GPT-5.5 上的 1.2 倍。这些是观察到的使用情况估计值。在 Anthropic 帐户上,58 次运行没有留下任何使用记录,并且将该支出分配给任一单元将使 Opus 比率在 0.7 和 2.3 之间移动,因此计费排序未解决。此修订更正了 2026 年 8 月的手稿,其成本数字取决于我们自己的遥测技术中的使用语义缺陷(第 5.1 节)。我们发布了协调器、分级预言机、重新分析代码和派生聚合。任务保持私密。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱