开发者生态
morning
GPT-5.6 Luna 与 GPT-6 Astra:1.20 美元的型号是否足以进行代码审查?
2026-09-15
1 阅读
约8分钟阅读
theanonymousone
字号:
GPT-5.6 Luna 每百万个输入代币的成本为 0.20 美元,每百万个输出代币的成本为 1.20 美元。 GPT-6 Astra 的售价为 10 美元和 50 美元。对于相同的拉取请求,一次 Luna 审核的费用为 0.0041 美元,一次 Astra 审核的费用为 0.113 美元,相差 28 倍。我们的上一篇文章将 Astra 与 GPT-5.6 Sol 进行了比较。这次我们想知道如果每个拉取请求都通过最便宜的模型,您会放弃什么。简短的回答 Luna 在 50 个拉取请求中发现了 69 个经过验证的错误。 Astra 找到了 92 个。Luna 整个运行花费 0.20 美元,Astra 花费 5.66 美元。 Luna 的错误频率更高,其 93 个发现中的 24 个未能与 Astra 的 96 个发现中的 4 个进行验证,并且它发现了 24 个安全漏洞中的 9 个,而 Astra 发现了 19 个。我们的解读是:Luna 足以以这个价格处理日常正确性错误,我们不会让它自行审查身份验证或权限代码。我们如何运行它 我们重复使用了 Astra 与 Sol 帖子中的设置,以便数字对齐。 Pull 请求是 AI-Code-Review-Evals 组织中的 50 个公共基准 PR,其中各 10 个来自 Cal.com、Sentry、Discourse、Keycloak 和 Grafana。每一个都会针对干净的基础分支引入缺陷。 Luna 和 Astra 在相同的差异上得到了相同的提示。该提示询问正确性、安全性、并发性、资源和错误处理错误,并排除样式、命名、文档和测试建议。每个模型都返回结构化的结果。验证的工作方式与以前相同。对于每一个拉取请求,Astra、Sol、Luna 和公共 Entelligence 审阅者评论的调查结果都会进入一个匿名列表。 GPT-6 Astra 和 GPT-5.6 Sol 分别根据差异判断列表,对重复项进行分组并确定每个问题是否是真正的错误。只有当两个法官都认为该问题是真实的时,该问题才被视为已得到验证。他们对 91% 的调查结果达成一致,并且 143 个不同的错误通过了两项调查。添加卢娜的发现改变了评委们看到的池子,所以一切都被重新评判。 Astra 的验证数量从上一篇文章中的 91 增加到这里的 92,Sol 的验证数量从 107 增加到 108。Astra 也是两位评委之一,这可能会稍微偏向它。限制部分涵盖了这一点。结果 GPT-5.6 Luna GPT-6 Astra 已验证的错误 69 92 调查结果提高了 93 96 精度 74% 96% 总成本,50 个 PR $0.20 $5.66 每个已验证错误的成本 $0.0030 $0.061 每次审核的平均时间 23s 36s 每次审核的平均输出代币 2,104 688 Luna 发现已验证数量的 75%作为 Astra 的 bug,花费 3.6% 的钱。每个经过验证的错误,Astra 的成本要高出 20 倍。 Luna 每次评论写入的输出代币数量是 Astra 的 3.1 倍,但价格仍然便宜得多,因为它的输出价格低 42 倍。它的速度也更快,每次审核时间为 23 秒,而每次审核时间为 36 秒。您的团队会首先感受到精度差距。 Luna 的评论大约有四分之一是错误的,而 Astra 在 96 条评论中有 4 次是错误的。已经浏览过 AI 评论评论的开发人员会更加仔细地浏览,因为其中四分之一是噪音。 Luna 落后的地方 上一篇文章的读者要求我们按代码库和错误类型划分结果,因为总体得分可能会隐藏在一个存储库上表现良好而在另一个存储库上表现不佳的模型。在此数据上,分割显示了 Luna 缺失的 bug 的来源。在 Sentry、Discourse 和 Grafana 中,Luna 遇到了 Astra 的两个已验证错误。 Cal.com 的差距更大,为 21 比 30。Keycloak 的差距最大:Luna 发现了 6 个已验证的错误,而 Astra 发现了 14 个,并且 Keycloak 的发现只有 50% 成立,而 Astra 的这一比例为 93%。 Keycloak 是一个身份和访问管理服务器,其大多数基准 PR 都更改了身份验证和权限逻辑。 bug 类别的分割点也是同样的。我们按根本原因标记了每个已验证的错误。 GPT-5.6 Sol 不是此处比较的两个模型之一,它根据书面定义一次性标记了所有 143 个错误。这些标签与基准数据一起提交,因此任何人都可以检查它们。在数据和逻辑错误(最大的一组)方面,Luna 发现了 39 个,而 Astra 发现了 47 个。在并发性方面,它发现了 10 到 13 个。在安全性方面,Luna 发现了 24 个中的 9 个,而 Astra 发现了 19 个。Astra 发现了 Keycloak 错误,而 Luna 没有发现两个:联合恢复代码从未标记为已使用,因此恢复代码可以多次使用。全局查看权限会覆盖对各个客户端设置的拒绝。任何一行看起来都没有问题。您只能通过计算更改后权限模型允许的内容来看到它们。卢娜(Luna)发现了阿斯特拉(Astra)错过的东西 卢娜(Luna)也发现了阿斯特拉(Astra)错过的错误。在 143 个已验证的错误中,两个模型均发现了 44 个错误,仅 Astra 发现了 48 个错误,Luna 仅发现了 25 个错误。在 25 个仅 Luna 的错误中,16 个是数据和逻辑错误,4 个是并发错误。在 Discourse 中,重复取消订阅请求会不断降低用户的通知级别。在 Sentry 中,并发错误替换了不健康的工作线程,但没有停止旧的工作线程。在每个拉取请求上运行这两个模型将发现 143 个已验证错误中的 117 个 (82%),总共花费 5.86 美元。 Luna 的价格为 0.20 美元,而 Astra 的价格为 5.66 美元,还有 25 个已验证的错误。读者要求我们检查的内容 模型是否只记住了修复?一位读者指出
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱