首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

AI能够独立完成的最大软件项目是什么?

2026-08-04 1 阅读 约5分钟阅读 yusufozkan
分享:
字号:
过去几年,人工智能在软件工程基准上取得了快速进步。然而,大多数此类基准测试往往侧重于较短的任务,例如修复错误或实现单个功能。 MirrorCode 是我们与 METR 共同开发的基准测试,用于在长期编码任务上测试 AI 模型。在 MirrorCode 任务中,AI 模型的任务是端到端重新实现整个程序,而无需访问原始源代码。人工智能生成的解决方案必须在端到端测试(包括保留测试)中与原始程序的输出完全匹配。 MirrorCode 的 25 个目标程序涵盖不同的计算领域:Unix 实用程序、数据序列化和查询工具、生物信息学、解释器、静态分析、密码学和压缩。 MirrorCode 有何不同 规模感知评估 至关重要的是,我们提供了足够大的推理预算来认真尝试 MirrorCode 任务。许多现有的软件工程基准将推理支出限制在 1-10 美元左右,即使这项任务需要人类花费数周时间才能完成。例如,最大的 MirrorCode 任务之一单次运行成本为 2,600 美元,并且需要人工智能在没有人工干预的情况下工作 19 天。困难,但公平 重新实现整个程序对于人类软件工程师来说极具挑战性。我们相信,没有人工智能的人类工程师需要花费数月的时间才能解决最复杂的 MirrorCode 任务。不过,MirrorCode 任务也是可行的;我们知道有足够的信息来保证任务的公平性。防作弊设计 我们对人工智能模型进行沙箱处理,要求它们在无法访问互联网、无法访问原始代码库的情况下进行工作,并且无法在任务中作弊。模型在开发代码时从未见过一些端到端测试,因此它们不能简单地创建一个查找表来模仿原始程序的输出。人工智能已经可以执行一些长期编码任务人工智能已经可以解决长期 MirrorCode 任务,尽管它们很困难。例如,Claude Opus 4.7 重新实现了 gotree:一个包含约 16,000 行 Go 和 40 多个命令的生物信息学工具包。 1 我们认为,在没有 AI 帮助的情况下,人类工程师需要 2 至 17 周才能完成同样的任务。 Opus 4.7 在 14 小时内解决了这个问题,花费了 251 美元。这些结果的一个重要警告是数据污染。由于 MirrorCode 任务涉及重新实现开源程序,因此 AI 模型很可能在预训练中看到了原始代码库。这可能会导致基准测试的性能夸大。然而,人工智能成功地重新实现了几个通过我们记忆屏幕的目标程序,并未能重新实现屏幕显示记忆证据的程序。这表明结果并非由记忆主导,但我们不能排除记忆有助于人工智能表现的可能性。总的来说,我们期望 MirrorCode 测量的功能能够推广到一个看不见的代码库。我们在本文中进一步讨论了这一点,以及有关基准构建的更多结果和细节。排行榜 MirrorCode 尚未完全解决。对于我们定期更新的排行榜,我们报告 MirrorCode (ML、+Private、2L) 。这意味着我们运行中型和大型桶中的 15 个目标程序,并删除小型桶。每个目标程序都用两种实现语言(通常是 Go 和 Ada)进行评估,给出 30 个任务。我们将每个任务运行 3 次,每次尝试的预算为 100 亿个代币。 2 启用 JavaScript 以查看交互式可视化。启用 JavaScript 以查看交互式可视化。启用 JavaScript 以查看交互式可视化。开源代码 我们将脚手架和 25 个 MirrorCode 目标程序中的 22 个(跨六种支持的编程语言总共 132 个任务实例)作为开源发布,其他三个目标作为私有测试集。这项工作是与 METR 共同开发的,并得到了 METR 的资助。 MirrorCode 的作者是 Tom Adamczewski、David Owen 和 David Rein。 Florian Brand、Giles Edkins、Allen Hart 和 Daniel O’Connell 贡献了其他目标计划。 Rasmus Faber-Espensen 进行了重要的基础设施改进并提供了工程建议
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱