首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

寓言 5 – 八月中位数思维下降

摘要

【HN用户评论摘要】 I have no hard data but I have a strong feeling this morning that something's wrong with Fable 5 compared to Friday evening.Just an hour ago I had Fable correctly identify an unused method ...

the that and week for have with Fable now like
2026-09-22 1 阅读 约2分钟阅读 espeed
分享:
字号:
【HN用户评论摘要】 我没有确凿的数据,但今天早上我有一种强烈的感觉,与周五晚上相比,《神鬼寓言 5》有问题。就在一个小时前,我让《神鬼寓言》正确识别了一个可以删除的未使用方法。然后我立即得到一个精确重复方法的差异,然后 Fable 输出,“我不小心重复了 而不是删除它。现在删除两个副本。”剩下的早上抱怨让人感觉有些不对劲,因为它会做很多“思考” 有趣的是,我也发现了同样的情况。我花了很多时间研究这些前沿模型、集思广益等,从第一周到第八周,性能下降通常很大。一开始,它看起来像是一个能干的研究助理,到了第 8 周左右的时候,它开始表现得像一只小狗,渴望让它的“主人”开心一些。 我似乎记得 Anthropic 曾公开表示,他们没有对性能进行任何建模来扩展其计算能力。有趣的是,我注意到每周的表现都会出现巨大的高峰和低谷(尽管是 Opus,而不是 Fable)。我想知道他们对这种行为的官方解释是什么。 现在我很清楚,Anthropic 一直在努力寻找一种“自动”降级,也许是为了在它认为不需要高度推理的工作上节省资金。我总是使用最大推理,我可以清楚地看到模型发布时和 3-4 周后之间的差异。我认为它们也为新帐户提供了一种智力提升。 就在昨天,我还在考虑 gpt-5.6-luna。在爱马仕推出的第一周,我就将其设为我的默认型号。它和我之前的默认值 5.5 一样好。但在过去的两三周里,我发现现在的做法是多么愚蠢。我必须对此非常明确。例如,我曾经能够提示“检查<服务器>上的系统日志......”,它就会弄清楚。昨天我问“<服务器>上的<服务>是否完成了通宵工作”,它只说“该服务是 原始链接:https://twitter.com/Lon/status/2101793422487204027
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱