开发者生态
morning
为什么 Opus 5 使用起来感觉更糟糕?
2026-08-14
1 阅读
约2分钟阅读
numeri
字号:
在我和与我交谈过的同事看来,与 Opus 4.7、Opus 4.8 和 Fable 相比,使用 Opus 5 感觉像是降级。我并不是说功能上有所倒退——它是一个比 Opus 4.7 和 Opus 4.8 更强大的模型,甚至在基准测试中可以与 Fable 相媲美,但其他模型感觉更好用。我相信这是因为他们:如果我的意图不清楚,请停下来提出问题;未经检查,不要做出假设;未经询问,不要重新解释或更新我的计划。正因为如此,它们不需要 Opus 5 那样的细心照顾。我怀疑这是 Anthropic 以及当前前沿实验室中两种力量共同作用的结果。首先,希望创建一个自我改进的人工智能,能够递归地将自身引导至 AGI/ASI。其次,在基准测试中获得高分的压力。尽管许多基准测试任务定义不明确、不公平、可破解或以其他方式被破坏,这是一个公开的秘密,但一个好的基准测试任务是独立的。是可以解决的。它不需要提示、读取任务创建者的想法或传递外部信息。这并不意味着一项好的任务只能有一个正确答案,只是它应该对所有明确正确的答案进行同等评分。选择在基准测试中表现良好的模型(实际上是对它们进行训练或一般的 RLVR 任务)本质上是选择在面对模糊性时做出大胆且通常正确的假设的模型。它会惩罚那些倾向于停下来寻求澄清或指导的模型。不幸的是,这正是我们大多数人希望从编码代理那里得到的。尽管您尽了最大的努力,但几乎不可能获得完整的上下文、意图、业务影响、预算限制以及您写下的内容并可供编码代理访问。总会有歧义和需要做出的选择,很高兴知道代理会在需要时停下来询问。现实生活并不是一个基准。每个问题都没有保证正确的答案,甚至也没有一组正确的答案,而且在现实生活中的后果悬而未决的情况下,我不希望代理采取最好的猜测!
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱