首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

最强模型Fable 5.1发布,Anthropic利用降价换IPO

2026-09-03 1 阅读 约10分钟阅读 AIX财经
分享:
字号:
文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠 9月1日凌晨,Anthropic正式发布Claude Fable 5.1和Claude Mythos 5.1。 和上一代一样,两款模型共享同一套底层模型,区别主要在安全权限和开放范围。Fable 5.1面向普通用户和企业,已经上线Claude、Claude Code和API;Mythos 5.1则继续走“专业版”路线,只向经过审核的美国机构的网络安全与生命科学专业人士开放,在部分敏感任务上的限制更少。 从能力来看,在官方公布的多项测试中,新模型全面超过上一代,在科研Agent、终端编程、企业工作流和计算机操作等长链条任务上明显提升。在第三方Artificial Analysis最新综合智能指数中,Fable 5.1 Max档拿到66分,超过Opus 5的63分,排名第一。 图源 / Artificial Analysis官网 价格上,两款模型也保持一致,每百万Token输入和输出分别为10美元和50美元,与上一代Fable 5持平。不过,Max会员和部分企业高级席位可以在套餐额度内使用Fable 5.1,而Pro等部分用户则需要额外购买积分按量调用。 可以看出 ,Fable 5.1一边继续强化长程Agent能力;一边通过降低Agent场景成本、调整安全机制,让这套旗舰能力进入更多企业工作流。 当各家旗舰模型之间的能力差距越来越小,Anthropic为什么还要继续投入最贵、最强的模型?它又能不能把这份领先,变成足以支撑IPO的收入和利润? 01.新模型,强在哪儿? 我们先来看看Fable 5.1进步最明显的几个方面。 图源 / Anthropic官网 科研Agent是提升最明显的方向之一。在Terminal-Bench-Science 0.1中,Fable 5.1从上一代的24.7%提高到52.6%,成绩超过翻倍。这说明它在需要长期规划、工具调用和结果验证的科研任务中,执行能力明显增强。 类似的变化也出现在长程工作任务中。AutomationBench中,Fable 5.1从17.1%提高到31.4%;Terminal-Bench 4.0则从42%提升到55.8%。相比上一代更擅长处理步骤多、持续时间长,并且需要根据环境变化不断调整的任务。 Anthropic给出的一个案例也体现了这一点。在Ramp测试中让Fable 5.1处理一项机器学习任务,模型连续自主运行38小时。过程中,它发现原有实验受到标签问题影响,随后修正方案、重新启动实验,并继续根据结果推进任务。 相比之下,Fable原本就比较强的编程和通用推理能力,这次更多是在高位继续提升。 除了面向企业用户的Fable 5.1,Anthropic也通过Mythos 5.1展示了模型在专业领域的能力。在蛋白质设计任务中,Mythos 5.1生成的结合蛋白方案经过外部实验验证,在12个目标测试中的命中率接近50%,高于行业常见的10%至15%;在计算生物学场景中,它还优化了7个开源模型的GPU Kernel,使推理速度最高提升2.5倍,并降低30%至60%的GPU成本。 整体来看,Fable 5.1强化的是Agent执行能力,让模型能够处理更长、更复杂的任务;Mythos 5.1则进一步拓展了模型在科研等专业场景中的能力边界。 跑分之外,我们也用三道题测试Fable 5.1的实际能力如何。这三个任务分别考察复杂交互设计、大规模场景生成以及动态效果模拟。 第一个任务,我们要求它生成一个可交互的城市拆除场景,用户可以控制吊车、炸药等工具,对建筑进行破坏,并支持慢动作和时间回溯。 Fable 5.1搭建出了包含办公楼、街道、车辆和起重机的城市场景,要素比较齐全。吊车撞击、炸药爆破、慢动作和回放等我们要求的功能都能正常运行。建筑倒下时,会伴随碎片飞散、烟尘扩散等视觉效果,整体完成度比较高。 Fable 5.1生成的可交互城市 第二个任务,我们要求它生成一片覆盖大量蝴蝶的森林,并通过一个按钮触发蝴蝶从树枝上集体飞起。这个任务更考验模型对大规模场景的处理能力。 Fable 5.1的表现相对一般。它生成了森林和蝴蝶等基础元素,但没有还原“森林被蝴蝶覆盖”的效果。大量蝴蝶集中堆叠在几棵树上,视觉上更像蜂巢。 Fable 5.1生成的蝴蝶森林 第三个任务是火山喷发模拟,相比前两个场景,火山更考验模型对动态过程和物理效果的理解。我们要求它实现从喷发前烟雾积累,到岩浆喷射、碎石飞散,再到火山冷却的完整过程。成品中的火山地形、岩浆流动和爆炸效果都比较写实、自然,能够随着时间变化推进不同阶段。不过,烟雾扩散形态比较像“直筒上升”,与真实火山喷发时的扩散形态有差距。 Fable 5.1生成的火山喷发模拟 这三次测试中,Fable 5.1展现出的变化和跑分结果比较一致,它可以理解一个完整项目需要哪些组成部分,并将不同模块组合起来。不过,在涉及大量元素同时运动、复杂视觉效果控制时,稳定性不足。 02.降成本和提性能,能否兼顾? 性能继续往上走的同时,Anthropic也开始降低Fable的使用成本。 Anthropic这次选择降低长任务中更关键的Cache Read成本。模型重复读取已经处理过的上下文的价格,从每百万Token 1美元降至0.25美元。 按照官方测算,Fable 5.1在典型工作负载中的整体成本可以下降约25%,在高频调用工具的Agent任务中最高下降约45%。 原因在于,Agent任务通常需要持续读取此前的上下文。一项持续数小时的任务里,模型可能需要反复调用已有信息,Cache Read成本会随着任务长度增加。 这项调整瞄准的是Agent任务中的实际使用成本。对于需要持续调用工具、反复读取上下文的长任务来说,降低推理成本,能够降低企业使用高级模型的门槛。 Anthropic也在提高Fable 5.1被“复制”的门槛。 从Fable 5.1开始,对于8月31日之后创建的新API账户,模型生成的thinking block会与产生它的整段对话绑定。如果开发者修改此前的系统提示词、工具列表或历史消息,再把原来的推理内容放回新请求中,API默认会直接拒绝,或者根据设置丢弃已经失效的推理块。 Anthropic解释,这套机制主要用于防止模型推理过程被大规模提取,并用于训练其他模型。 过去一些开发者可以通过反复调用高级模型、获取输出结果,再用这些数据训练低成本模型,新的限制提高了这类蒸馏行为的难度。 这反映出头部模型公司正在面对的矛盾,一方面,需要开放模型能力,扩大调用量和商业收入;另一方面,也需要保护高成本训练形成的技术优势。 Anthropic想降低企业使用Claude的门槛,同时减少领先能力被快速复制的可能。 它需要把领先的模型能力变成更大的调用量,同时避免这份领先太快被同行复制。 03.冲刺IPO,Anthropic还 差 什么? Anthropic也已经进入上市前的关键阶段。 5月28日,Anthropic完成650亿美元Series H融资,投后估值达到9650亿美元;四天后,公司向美国证券交易委员会秘密提交S-1文件,进入IPO筹备阶段。 8月底,有消息称Anthropic计划在9月初公开招股书,最
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱