首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

Claude把“回忆”砍到2毛5,OpenAI的万亿参数正在失去护城河

2026-09-03 1 阅读 约10分钟阅读 硅谷Tech news
分享:
字号:
当Ramp的工程师在监控屏上看到那条38小时无人值守的机器学习任务曲线平稳收尾时,他们第一次觉得,让AI"睡着觉干活"这件事终于不再是实验室里的行为艺术。 支撑这场"睡眠实验"的,不是OpenAI那套越打越便宜的算力组合拳,而是Anthropic悄悄改动的一个小数点——缓存读取价从每百万token 1美元跌到0.25美元,一刀砍掉75%。 2026年9月,当所有人都在盯着Claude Fable 5.1那翻倍的benchmark分数时,真正让华尔街量化基金和硅谷极客彻夜难眠的,恰恰是这张价格表上最不起眼的一行字。同一套底层模型被拆成两条发布轨道,Fable 5.1面向公众与企业全量开放,Mythos 5.1只对经审核的网络安全与生命科学伙伴放行。输入输出价格分文未动,缓存读取价却打到了脚踝斩。 这一刀的位置,才是整场发布真正的题眼,也是Anthropic对整个AI行业下的一份战书。 OpenAI在卷"智商税",Anthropic在卷"租金" 长久以来,AI模型的定价叙事围绕"单次智能"展开——输入多少钱、输出多少钱,比拼的是谁的单价比谁低。OpenAI在2026年6月推出GPT-5.6家族,把旗舰Sol定在5美元输入、30美元输出,随后在7月把Luna砍价80%,8月再给Sol降超两成,一路把"每单位智能"的价格往死里压。 Anthropic却反其道而行。它没有动那根最显眼的输入输出价签,而是把降价火力集中在一个更隐蔽、却更决定Agent经济命脉的地方——缓存读取。 先看几组数字。Claude Fable 5.1的输入价仍为每百万token 10美元,输出价50美元,与上一代完全持平,普通输入甚至是自家Opus 5的两倍。表面上看,它更贵了。但缓存读取价从1美元跌到0.25美元,降幅75%,而这个0.25美元只相当于Fable正常输入价的2.5%,远低于其他Claude模型普遍采用的10%折扣系数。 这是整篇文章最反直觉的一个逻辑:Anthropic在对"新想法"收最贵的税,却在对"旧回忆"做最狠的补贴。 传统上,我们习惯把模型成本等同于"吞吐",输入和输出像水流过水表,流多少付多少。但长时域Agent的成本曲线是另一条形状。它在一个项目上跑几小时、几十小时,每一步都在往同一个上下文里叠加状态,而这些状态里真正新产生的token只占很小一部分,绝大多数是反复读取的、已经算过一遍的旧信息。缓存读取,就是为这种"重复记忆"单独开的价。 Anthropic官方给出的账本是:典型任务整体成本下降约25%,高度Agent化的任务最高下降约45%。这个数字的分母和分子都在指向同一件事—— 当一个Agent不再是一次问答,而是反复回到同一套代码库、同一批工具定义、同一段不断累积的对话历史时,成本的大头早已不是"生成一个新token",而是"把已经处理过的上下文再读一遍"。 这就好比一家航空公司,头等舱票价涨到天价,但"燃油费"突然打0.25折。因为Anthropic赌的是,未来的AI不是坐一次就下飞机的过客,而是包机飞越太平洋的常驻机长。对于机长而言,占大头的永远不是起飞那一下的推力,而是平流层里持续几十个小时的巡航油耗。 当OpenAI用Luna的80%降价、Sol的两成让利去争夺"单次智能"的性价比高地时,Anthropic把赌注押在了另一个变量上。它赌的是,Agent的下一阶段不是"更快地答对一道题",而是"连续几十小时不跑偏地做完一件事",而在那个世界里,决定账单的不是模型有多聪明,而是模型记东西、读旧东西有多便宜。 比"答对"更重要的,是"不跑偏" 降价之外,Fable 5.1的能力跃升同样值得拆开看。 最显眼的一行是Terminal-Bench-Science 0.1——一项让模型在终端里独立规划、执行并核验一套科学研究流程的评测。Fable 5.1拿到52.6%,上一代Fable 5只有24.7%,翻了一倍还多。作为参照,OpenAI的旗舰GPT-5.6 Sol在这一项上是22.4%,Anthropic自家的Opus 5是29.0%。即便把±3.5到4.5分的标准误差算进去,这个翻倍也经得起推敲。AutomationBench从17.1%涨到31.4%,Terminal-Bench 4.0从42.0%涨到55.8%,Mythos 5.1更是摸到60.9%。 一个容易被忽略的细节是,Fable 5.1的评测是在"生产级安全防护开启"的状态下完成的。 也就是说,这些分数是模型被安全网箍着跑出来的——在OSWorld和AutomationBench上,但凡防护机制出手拦截,直接记零分。这反而意味着真实的上限还要更高。 但能力的真正变化,藏在那批早期客户的只言片语里。 Jane Street的量化研究主管Craig Falls说,Fable 5.1比Fable 5和Opus 5解决了更多他们的编码难题,而且"以前的模型跑得越久越难读懂,Fable 5.1在漫长的多步任务里始终可读"。 Millennium的一位高级基金经理讲了一个更具体的案例:一段大约百万分之一概率触发的罕见崩溃,团队里没人能在四五年里解释清楚,所有他们试过的模型包括Fable 5都错过了,Fable 5.1是第一个找到的——它把外部供应商的库反汇编、和core dump对上了号,把崩溃追溯到了那个库的bug。 Ramp记录了一次38小时无人值守的机器学习任务,模型中途自行纠正了一个问题,连夜启动了六组实验,带着结果和下一步方案回来。MongoDB的工程师描述了一个三天搭建复杂原型、夜里无人值守跑数小时的场景。 把这几件事连起来,结论已经非常清晰了: Fable 5.1的"翻倍"不是靠把模型做得更大,而是靠把模型做得更"能撑"。 它不再追求在单点上多答对几分,而是追求在长链条上少崩、少偏、少让人重来。这恰恰是Agent商业化的真正门槛——一个能在三小时内答对难题的模型,和一个能连续三天不跑偏的模型,卖的是两种完全不同的东西。 最强引擎配两副刹车:安全变成了一项可调参数 Fable 5.1与Mythos 5.1的关系,是理解Anthropic战略意图的另一把钥匙。 官方表述极为克制:两者是同一模型,只是防护等级不同。Fable 5.1全量开放,Mythos 5.1只进"可信访问计划",护栏专门为网络安全和生命科学工作而调校。换句话说, Anthropic把"能力"和"护栏"做了一次解耦。 过去安全策略倾向于给不同风险场景分配不同能力的模型,而这次的做法是,让同一个能力最强的模型,以不同的安全配置出现在不同的市场。 这背后的逻辑与缓存降价是相通的。当模型能力开始跨过"能连续工作数十小时"这条线,它对现实世界能做的事就不再是可控的玩具。同一个引擎,交给公众企业和交给网络安全、生物科学这类高风险领域,需要的约束完全不同。与其造两套能力不同的模型,不如造一套能力、两套护栏——既省了研发资源,也把安全治理的成本从"能力层"下移到了"准入层"。 数据保留政策是同一思路的延伸。Anthropic同时推出的Enterprise Frontier Safeguards(EFS),让企业把监控数据存在自己控制的云基础设施里,达到"等同于零数据保留"的
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱