首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Fable 5.1 正式发布:性能翻倍、Agent成本下降45%,Anthropic 把顶级模型送进真实世界

2026-09-02 1 阅读 约10分钟阅读 李冬梅
分享:
字号:
三个月前,Anthropic发布Fable 5时,试图回答一个问题:当模型需要连续工作数小时甚至数天,它能否一直记住目标、调用工具、检查结果,并在无人监督的情况下把任务做完? 现在,Anthropic带着Fable 5.1回来了。 Fable 5.1 和 Mythos 5.1 正式发布 当地时间9月1日,Anthropic 正式发布 Claude Fable 5.1 和 Claude Mythos 5.1。 按照官方定义,两者使用相同的底层模型,区别不在“智力”,而在安全保护级别:Fable 5.1 面向普通用户和企业全面开放,Mythos 5.1 则只通过受信任访问计划,向部分网络安全和生命科学机构提供。 从版本号看,这只是一次“.1”升级。但从实际变化看,Anthropic显然不只是在修补 Fable 5。新模型在智能体科学研究测试中的成绩超过前代两倍,在编程、知识工作、电脑操作和长时间任务中全面提升;与此同时,Agent工作负载的实际调用成本最高下降约 45%。 更重要的是,Anthropic这一次没有只谈模型跑分。价格、缓存、数据留存、安全误判、漏洞研究权限和企业部署架构,几乎占据了发布内容的一半。 Fable 5.1 和 Mythos 5.1 之间的关系,是理解这次发布的第一把钥匙,它们是同一个模型的两种部署形式。 Fable 5.1 加入了面向公众和企业环境的网络安全、生物安全保护机制。当请求触发风险规则时,一部分任务会被阻止,另一部分则会被路由到能力相对较弱的 Opus 模型。Mythos 5.1 则保留了更多原始能力,但只能由经过审核的机构访问。 换句话说,Anthropic正在尝试将“模型能力”和“模型开放程度”拆开管理:不再为了降低风险,直接削弱整个模型,而是根据用户身份、任务类型和使用环境,提供不同层级的能力。 核心亮点是啥? 那这两款“神级”模型,亮点是什么? 事实上,Fable 5.1 的核心变化,可以概括为:能力上限更高、缓存读取更便宜,但把推理强度拉满,完成一次任务仍可能比前代更贵。 在Terminal-Bench 4.0上,Fable 5.1 得分为55.8%,而关闭部分限制的 Mythos 5.1达到60.9%。两者的能力差距,很大程度上并不是底层模型造成的,而是 Fable 的安全系统在部分网络安全任务中介入的结果。 在Anthropic公布的几组数据中,变化最显著的是智能体科学研究。 在Terminal-Bench-Science 0.1上,Fable 5.1取得52.6%的成绩,Fable 5只有24.7%,Opus 5为29.0%,GPT-5.6 Sol为22.4%。相较前代,Fable 5.1的成绩不只是小幅提高,而是达到原来的两倍以上。 Terminal-Bench-Science 0.1:每个模型的标准误差为±3.5–4.5分。公开排行榜(每个任务3次试验,使用Claude Code框架)显示Claude Opus 5的准确率为30.0%,Claude Fable 5的准确率为21.4%;我们的实验设置分别复现了这两个结果,准确率分别为29.0%和24.7%,均在噪声范围内。 这些数字表明,Fable 5.1的提升并不局限于代码生成。它在操作电脑、跨领域推理、研究任务和知识工作中,均超过了前代,也在多数官方测试中超过成本更低的Opus 5。 知识工作的成绩同样登顶,但 与Opus 5的差距并不明显。Fable 5.1 在 GDPval-AA v2 和 AA-Briefcase中的Elo评分分别达到1853和1694,较前代提高130分和122分。 不过,它在前者相对Opus 5的领先仍处于置信区间内,后者则与Opus 5的1685分基本持平。具体来看,它的优势主要集中在分析质量和评分标准符合度,呈现效果并未同步领先。 价格调整则主要针对Agent反复读取上下文的成本。Fable 5.1的缓存读取价格从每百万Token 1美元降至0.25美元,降幅75%;标准输入、输出价格仍为每百万Token 10美元和50美元,缓存写入价格维持12.5美元。上下文窗口保持100万Token,支持文本和图像输入。 但缓存降价,并不意味着所有任务都更省钱。在最高推理强度下,Fable 5.1完成一项智能指数测试任务平均花费3.76美元,比Fable 5高出约20%,原因是输出Token用量约为前代的1.7倍。即便缓存降价已为每项任务节省约1.40美元,也没有完全抵消输出增加带来的费用。 降低推理强度后,性价比会有所改善:xhigh 档位的智能指数为65分,单项任务成本降至2.72美元,但仍高于Opus 5最高档位的2.34美元,后者得分为63分。Fable 5.1同时占据了智能水平与输出Token效率的高端帕累托前沿,意味着它在高能力区间更有效率,但这不等于美元成本最低。 这次升级的价值由此变得清晰:Fable 5.1抬高了复杂任务的能力上限,却没有消除能力、推理用量与成本之间的取舍。对于开发者,真正需要判断的仍是,多花的钱,能否换来原本做不成的任务。 不再满足于“修代码”,而是追查根因 Anthropic在发布材料中反复强调,Fable 5.1会减少看似快捷、实际降低质量的“走捷径”行为,更倾向于寻找问题的根本原因。 投资机构Millennium提供了一个颇具代表性的案例。 该机构的一段内部代码存在一个约百万次运行才出现一次的崩溃问题。工程师花了四五年时间,也没有解释清楚原因,包括Fable 5在内的其他模型同样未能解决。 下图是 Fable 5.1 在各项基准测试中的对比情况: Fable 5.1 在启用其生产安全防护措施的情况下进行了评估。在这些安全防护措施介入的任务中,Fable 5.1 和 Fable 5 在 OSWorld 2.0 测试中得分均为零,Fable 5 在 AutomationBench 测试中得分也为零。在所有其他安全防护措施介入的情况下,网络安全任务由 Claude Opus 4.8 完成,生物学任务由 Claude Opus 5 完成。这很可能导致 Fable 5.1 和 Fable 5 在这些基准测试中的性能下降。 Fable 5.1分析了外部供应商提供的程序库,将反汇编结果与核心转储文件进行比对,最终把问题定位到该外部程序库中的一个缺陷。 这个案例当然来自Anthropic的早期合作伙伴,不能代替独立测试,但它说明了Fable 5.1试图建立的差异:不是更快地生成更多代码,而是能否像高级工程师一样,在复杂系统中逐层排除假设,最终找到真正的故障来源。 外部代码评审平台 CodeRabbit 的测试提供了相对冷静的观察。 在45项评审任务、105个已知问题点上,Fable 5.1找出了 64个,Fable 5找出 65个,两者召回率几乎没有变化。但Fable 5.1 最终生成的评论从 253 条减少到 166 条,琐碎意见从 265 条降至 79 条,精确率则由 32.8% 升至 37.3%。 也就是说,它没有发现更多问题,却减少了大量无效和挑剔式评论,输出变得更克制。 代价是速度。Fable 5.1完成一次评审平均需要18分38
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱