开发者生态
morning
Claude、Codex 和 Cursor 选择哪些工具?我们测量了 17k 次运行来找出答案
摘要
How did we run all these experiments concretely? Our panel of repositories We started by running an analysis over thousands of public GitHub repositories from which we extracted statistics about progr...
and
the
repositories
run
are
real
with
fake
like
experiment
2026-09-04
1 阅读
约5分钟阅读
screm
字号:
我们具体是如何进行所有这些实验的?我们的存储库面板我们首先对数千个公共 GitHub 存储库进行了分析,从中提取了有关编程语言和框架、第三方服务、部署平台、团队规模和代码库年龄的统计数据。由于科技初创公司比大型企业更有可能拥有开源存储库,并且堆栈可能非常不同,因此我们根据公开数据公正地进行了统计,并达到了理想的面板分布。然后,我们配备了各种编码代理来创建现实世界的存储库来满足这些确切的要求。最后,我们生成了变体,其中删除了部分代码库以及整个第三方服务实现,以便我们可以运行适当的无偏见实验。我们登陆了 10 种语言的 75 个存储库,所有这些都使用假公司名称、假 git 历史记录、假 API 密钥以及根据 npm 等包管理器注册表进行检查的真实锁定文件。真实世界任务 每个实验都是在存储库中执行的真实任务,由以下 4 个配置文件之一提出要求: Vibe-coder:仅描述症状和理想状态,很少描述工具类别名称 初级工程师:通常提到所需状态和类别名称 高级工程师:更精确地了解要求和要避免的事情 大型企业的工程师:详细说明具体约束、合规性、采购等。提示通常简单直接,并针对每个实验稍微定制(考虑到存储库和角色),但在我们测试的 20-25% 的案例在提示中添加了具体的提及,例如成本或使用量,以测试它们对最终输出的影响。我们最终得到了 1,163 个变体,如下所示:“现在我需要将我们生成的每张发票发送到用户的电子邮件地址,并附上一条好消息,找到最佳解决方案并实施它”。运行程序 每个实验都在专用的临时沙箱中运行。我们验证了沙箱的选择不会影响结论,但为了安全起见,我们决定在 3 个不同的沙箱提供商(即 E2B、Blaxel 和 Daytona)之间轮换。循环中的“模拟人” 由于现实世界中的对话很少只是一个提示,并且代理不间断地持续实现其目标,因此我们决定在循环中使用“模拟人”。我们使用由 Gemini 3.7 Flash 扮演的协调器来实现这一目标。这使我们能够玩更现实的场景,其中代理将首先被要求分析代码库并推荐最佳解决方案。在这个阶段,模拟人总是会选择第一个解决方案,或者要求编码代理选择最好的一个并实现它。但我们注意到,一开始就要求实施而不返回任何问题会使代理偏向于在内部构建所有内容,因为它无法请求授权来选择特定的第三方解决方案。在循环中添加这个“人”会减少领导者和云平台原生解决方案的主导地位,从而实现更现实的情况。例如,在对象存储实验中,Cloudflare R2 在代理之前始终使用 Amazon S3 的会话中开始获胜。我们的法官使用 Gemini 3.7 Flash 的另一个实例来分析会话。它的作用是双重的:评估会话对于一系列标准是否有效,例如,选择没有受到已经“预先选择”提供者的存储库的偏见;实际上选择了一个解决方案(为了可观察性,如果不与平台耦合,它将单独拒绝 OpenTelemetry)。确定提到的每个玩家以及最终的获胜者(查看对话和实际代码差异)。那么我们学到了什么?在这 16,893 次运行中,我们首先保留了 51 个代码库和 18 个我们认为有效并准备发布的部门的 5,292 个会话。这并不意味着我们将其他 10,000 多个内容扔进垃圾箱,并可能在第二波中分享它们。在第一波浪潮中,我们只提取了仍然埋藏在痕迹中的所有知识的一小部分,并将继续挖掘以分享令我们惊讶的内容以及供应商和开发人员感兴趣的内容。但从今天开始,所有这些痕迹都是公开的,所以你也可以做同样的事情。以下是我们发现有趣的 5 个初步观察结果。不同的编码代理使用不同的来源,并且最终会出现分歧。 Cursor 在 2/3 的会话中基于网络做出决定。 Codex 几乎总是使用网络搜索(94% 的会话),但在 10 次查询中有 9 次使用 site: 等运算符来关注受信任的域或深入研究特定解决方案(例如 site:auth0.com 密码重置 MFA 社交连接) Claude Code 主要依赖于其先验,仅在约 30% 的情况下搜索网络。但当它这样做时,它浏览的页面数量是 Codex 的 3 倍。在沙箱等较新的领域,其先验能力较弱,它约 80% 的时间都会搜索网络。三位特工仅用了 42 个时间就选择了相同的工具
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱