开发者生态
evening
代码审查中的 GPT-6 Astra:收益、隐私和成本
2026-09-05
1 阅读
约6分钟阅读
cebert
字号:
代码审查中的一些最艰巨的工作发生在更改的行之外。单独的更改可能看起来是正确的,但仍然会破坏系统中其他地方的代码。这就是我们对 OpenAI 的 GPT-6 Astra 的早期结果最感兴趣的原因。在我们的评估中,Astra 通过可操作的发现发现的标记错误比 GPT-5.6 Sol 多大约 4%,比 Opus 5 多 22%。最大的跳跃来自于更严格的跨文件审查,其中 Astra 的收益比 Sol 提高了 20%,比 Opus 5 提高了 33%。在客户规模上使用该功能还意味着保护客户数据并评估模型的公共 API 定价。 Astra 在代码审查中添加的内容我们在这里的衡量标准是可操作的错误覆盖率,这意味着模型通过开发人员可以采取行动的发现捕获了多少标记的错误。覆盖范围四舍五入至小数点后一位;相对收益使用未四舍五入的值。在第一个评估措施中,相对于 GPT-5.6 Sol 的总体增益似乎不大。此评估还包括更简单的评论,其中可能没有更强大的模型来区分自己的空间; Astra 的更大优势出现在更难的跨文件子集上。这是一个早期的、有方向性的结果。覆盖范围四舍五入至小数点后一位;相对收益使用未四舍五入的值。比较此图表中的模型,因为其审核难度与整体评估不同。越难的跨文件比较就越令人鼓舞。 Astra 的相对优势比 Sol 增长到 20%,比 Opus 5 增长 33%。这表明将变更的意图与分布在代码库中的后果联系起来是有价值的。这些结果描述了审核绩效的一部分。他们不会建立审查质量的总体排名,预测团队的缺陷率,或承诺每个拉取请求都会获得相同的收益。让上下文发挥作用 大型上下文窗口为信息提供了空间。有用的推理需要模型识别哪些部分重要,将它们连接起来,并得出有证据支持的结论。我们的解释是,Astra 最有趣的进步在于连接正确的信息。它在更严格的跨文件审查方面取得的更大进展表明相关信息分发工作取得了进展。它们并没有孤立出进步的原因,也没有证明更多的上下文本身就可以提高模型的性能。 OpenAI 将 Astra 定位为跨代码、浏览器和专业软件的多步骤工作。对于使用模型构建的团队来说,有用的问题是额外的推理在哪里足以改变结果以证明其成本是合理的。证据分散的困难任务比成本较低的模型已经可靠处理的常规任务更值得调查。这并不意味着将每个会话都切换到 Astra,最大限度地发挥推理能力,然后让它撕裂。更强有力的推理需要溢价 根据 Astra 公布的定价,Astra 的标准 API 费率为每百万个输入代币 10 美元,每百万个输出代币 50 美元。尽管缓存价格不同,《神鬼寓言 5.1》具有相同的基本输入和输出速率。 Anthropic 的定价文档提供了完整的详细信息。为了将这些价格放在上下文中,请考虑使用 100,000 个未缓存的输入令牌和 10,000 个可计费输出令牌(包括推理令牌)的说明性任务。保持代币使用量不变可以使公布的费率更容易比较;实际任务成本因使用情况而异。所有数据均使用公开列出的标准 API 价格,检查日期为 2026 年 9 月 4 日。OpenAI 数据使用短上下文费率。 Sol 的公开促销定价至少在 2026 年 11 月 21 日之前有效。该示例不包括缓存、缓存写入、工具、重试、区域提升和服务级别调整。实际任务可以使用不同数量的令牌。在该固定使用量下,Astra 的成本是 Sol 的 2.5 倍,Terra 的约 4.7 倍,Luna 的约 47 倍。这些都是有意义的溢价。它们不是对每项已完成任务的成本差异的预测。需要更少代币或更少尝试的模型可以缩小差距。 OpenAI 在自己的一些评估中报告称,尽管代币价格较高,但 Astra 的估计任务成本较低。这使得每个成功结果的总成本值得在你的工作中进行衡量,而不是假设令牌价格或能力得分来决定决定。阅读 OpenAI 的效率指南。代码审查之外可能转移的内容可转移的想法是对不同来源之间的关系进行推理。我们的研究结果表明了几种值得评估的用途;我们还没有在以下任务上衡量 Astra: 研究综合:协调相互矛盾的报告,将主张与其证据联系起来,并找出每个文件的摘要可能遗漏的差距。操作调查:从日志、事件记录和操作手册中收集连贯的解释,同时将观察结果与假设分开。需求和政策分析:跟踪规范、内部政策和实施计划之间的拟议变更,以标记不一致之处以供专家审查。文档和电子表格工作:ch
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱