医疗健康
morning
寓言5.1来了!人类再秀被盗
2026-09-02
1 阅读
约10分钟阅读
字母AI
字号:
文 | 字母AI Fable 5.1和Mythos 5.1,凌晨突然上线。 上一代Fable 5几乎成了SOTA模型的代名词,光环未退,Anthropic已经开始自己卷自己了。 两款模型同时发布,Fable 5.1面向普通用户和企业,Mythos 5.1则把同一套前沿能力开放给“经过验证的网络安全和生命科学机构”。 定价上,基础价格不变,Fable 5.1依然是10美元/百万输入Token、50美元/百万输出Token。但缓存读取价格砍掉了75%,从1美元/百万Token降到0.25美元/百万Token。 性能提升则明显集中在长时间、多步骤的Agent任务上。Terminal-Bench-Science从24.7%涨到52.6%,AutomationBench从17.1%涨到31.4%。 比起模型本身,或许更值得注意的是模型发布的时间节点——这很可能是Anthropic公开递表前,最后一次重量级模型发布。 几天之后就是9月7日,美国劳动节,按照The Information此前披露的计划,已经秘密提交IPO文件的Anthropic可能在劳动节之后正式公开招股书,并在9月中旬举行投资者日,最快于9月底至10月初上市。 而Anthropic此前“明升实降”改额度的余波,也出现在了新模型发布的评论区里。8月29日,Anthropic宣布9月14日起将“标准周额度”提高25%,但这个数字是相对于5月以前的旧标准计算;与用户目前正在使用的临时额度相比,实际反而下降了17%。 Fable 5.1刚刚上线,就有用户追问Anthropic,能不能同时给出“更透明、更慷慨”的会话和每周额度。 Fable 5.1:把Agent推向更长任务 如果只看规格,Fable 5.1并不是一次幅度很大的升级。 它延续了Fable 5的100万Token上下文窗口和128K最大输出,基础价格也没有变化:每百万输入Token 10美元,每百万输出Token 50美元。 放到当前的旗舰模型阵容里,Fable 5.1依然属于明显更贵的一档:同样按100万输入+100万输出来算,Fable 5.1是GPT-5.6 Sol当前价格的2.5倍,GLM-5.3的10倍以上。 Anthropic官方甚至仍然建议,大多数任务优先从价格只有一半的Opus 5开始,只有面对高难度推理、长时间Agent任务,或者Opus 5在高effort下依然不够用时,再上Fable 5.1。 值得关注的变化发生在Agent持续运行的成本上。 Fable 5.1的5分钟和1小时缓存写入价格仍然分别是12.5美元和20美元/百万Token,但缓存读取从Fable 5的1美元/百万Token降到了0.25美元,相当于直接砍掉75%。 缓存读取(cache read)可以理解为:一段上下文已经被模型处理过之后,后面的请求不需要每次重新按完整输入价格读取。对于一次普通问答,这部分未必重要;但一个连续运行几个小时的Agent,会反复读取系统提示词、代码库、工具定义以及此前已经处理过的上下文,任务越长、工具调用越多,缓存读取占到的成本就越高。 Anthropic用今年8月四周的实际使用数据做过测算。在按Token计费的场景下,相同任务从Fable 5换到Fable 5.1,典型工作负载的整体成本预计下降约25%;对于上下文更重、工具调用更多的复杂Coding和高度Agent化任务,降幅最高可以达到约45%。 也就是说,虽然Anthropic没有把Fable 5.1本身卖得更便宜,但专门把“让它长时间工作”这件事做得更便宜了。 不过,便宜也只是相对于过去,基础价格摆在那里。有开发者就在发布评论区提醒,即使缓存命中率很高,成本依然可能迅速累积,一次真实的复杂Coding任务,就可能花掉20到50美元。 另外,这种降价主要发生在API和其他按Token结算的场景。对于直接订阅Claude Code的用户,另一套“额度账”刚刚引发争议。 8月29日,Claude Developers官方账号宣布,从9月14日起,Pro、Max、Team和按席位收费的Enterprise套餐,Claude Code的“标准周额度”将永久提高25%。但问题在于,此前Anthropic已经临时把这套额度提高了50%,而且这套临时额度会一直维持到9月14日。 也就是说,如果把原始额度记作100,现在用户实际拿到的是150;9月14日以后则会变成125。名义上相对旧标准“永久提高25%”,相较用户现在实际能够使用的额度,却减少了约17%。Anthropic随后也专门补充说明,确认了这一计算。 在Fable 5.1发布后的评论区里,也有用户继续追问Anthropic,能不能给出“更透明、更慷慨”的会话和每周额度。别再玩类似的文字游戏了。 不过,从性能变化来看,Fable 5.1也确实越来越像一个专为长时间任务准备的模型。 在Anthropic公布的Benchmark里,提升最夸张的是Terminal-Bench-Science 0.1。Fable 5从24.7%提高到了52.6%,直接翻倍。测试终端环境Agent能力的Terminal-Bench 4.0从42.0%提高到55.8%,面向复杂商业工作流的AutomationBench则从17.1%提高到31.4%。 但如果换到更传统的推理和Coding Benchmark,提升幅度就没有那么夸张。 Humanity's Last Exam不使用工具时,从57.8%提高到60.9%;使用工具后,从63.8%提高到65.0%。CursorBench 3.2.0从70.5%提高到73.4%,知识工作Benchmark GDPval-AA v2则从1723提高到1853。 总体来看,Fable 5.1的提升明显集中在需要模型连续调用工具、处理多个步骤、检查中间结果,再决定下一步行动的任务,而不是在所有能力“均匀分布”。 早期企业测试也在重复这个趋势。 Browserbase在其最难的浏览器Agent Benchmark中,让Fable 5.1完成了82%的任务,Opus 5为74%,Fable 5只有57%。 Ramp的一次测试里,Fable 5.1在无人干预的情况下连续运行了38个小时。它先发现此前一个机器学习实验的结果其实受到了标签伪影的影响,随后自行修正问题,同时启动6组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。在另一次开放式任务中,Ramp只让它寻找“没人负责、但最值得解决的问题”,它自己找到了一个与生产事故有关、尚未有人处理的告警,调取日志并给出了修复方案。 Canva给出的反馈则更偏向生成质量。其测试认为,Fable 5.1的文字表达更容易理解,也更能遵循写作规范;在与Fable 5的盲测中,Canva更偏好5.1的输出。并且,在Canva Code里,Fable 5.1直接做出了一个节奏游戏:不仅生成了关卡和真实音乐,还让玩法节奏与音乐拍点对应。Canva称,这是他们测试过的其他模型都没有做到的。 从Benchmark到企业测试,Fable 5.1这次最明显的提升在于,它开始更稳定地把复杂任务完整做完:既能在几十个小时的任务里持续判断
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱