首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,神话级Fable 5.1来了!

2026-09-02 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 一觉醒来,Anthropic再次改写了机器智能的坐标系。 今天, Claude Fable 5.1全平台上线,人人可用 。 战力全开的Mythos 5.1,则被锁在白名单内,专供受审核的网安与生命科学团队调遣。 从重构复杂的工程代码,到攻坚战线极长的高维科研,这对孪生大脑正在重新定义什么是顶级的「赛博脑力劳动者」。 它们最擅长的,就是啃下那些过去人类专家都感到棘手的长链路复杂任务。 按老规矩先看成绩单,这一次,新模型的跑分直接拉出了断层式的代差。 科研探索(Terminal-Bench-Science 0.1) Fable 5.1直接拿下了52.6%。要知道,上一代Fable 5和OpenAI的GPT-5.6 Sol,成绩分别只有24.7%和22.4%。 代码工程(Terminal-Bench 4.0) Fable 5.1从前代的42.0%一路飙升至55.8%;在放开护栏的Mythos 5.1手中,这个数字更是被推到了惊人的60.9%。 复杂脑力与综合认知 在知识工作基准GDPval-AA中,Fable 5.1获得了1853的高分;在被称为「人类最后的考试」的高难基准上,带工具实测更是跨过了65.0%的门槛。 哪怕你把「思考程度」调至最低,它照样能以极低的Token消耗跑出超越前代的效果。 左右滑动查看 更绝的是,在能力实现跃迁的同时,算力门槛也被砸了下来。 基础定价方面,Fable 5.1和上一代一模一样:输入每百万Token 10美元,输出50美元。 但在最吃资源的「缓存读取」上, 它直接从1美元砍到了0.25美元,降幅高达75% 。 放到真实任务中,普通场景总成本能降25%;对于重度跑Agent的长战线任务,最高能省下45%。 对比之下,GPT-5.6 Sol目前的短上下文促销价是:输入2美元、输出10美元、缓存0.2美元。 跑分与降价证明了它的强悍,但这只是表象。 真正的分水岭在于,从这一代开始,AI彻底褪去了辅助工具的外衣—— 它开始亲自下场,自己做科学了。 Claude双王攻入科研 重绘金星、手搓GPU代码 为了证明这对「双王」在真实世界的杀伤力。 Anthropic直接端出了三个比榜单直观得多的前沿案例。 重绘三分之一个金星 30多年前,NASA的麦哲伦号给金星拍过一轮雷达。 但它的高程数据分辨率只有10-20公里。换算到地球上,就是一整座城市只占几个像素。 过去,人类只把其中五分之一的区域做成了高程图。 而Fable 5.1拿着这批数据,训练了一个神经网络,重新生成了覆盖金星约三分之一面积的高分辨率地形图。 新图把细节推进到2至3公里,高度估计的准确性最高提升25%。 分子与蛋白质设计,命中率50% 相比处理静态的地表数据,设计生物蛋白的难度更大。 许多现代药物的原理,是设计一个小蛋白,精准锁定体内某个目标靶点,进而阻断或激活特定反应。 结合得够不够紧密,学名叫结合亲和力。亲和力越高,药物在低剂量下见效的可能性就越大。 在调用开源设计工具后,Mythos 5.1交出的设计稿被直接送往外部机构,在真实世界里做了湿实验。 结果是目前测过的最强一档。在EGFR、Nipah G等三个靶点上,亲和力直接达到Adaptyv Bio竞赛最佳方案的10倍。 在12个靶点上的总体命中率,更是逼近50%。要知道,今天该领域的常态命中率,也就一成到一成半。 手写 GPU Kernel,生信模型提速2.5倍 第三个案例,甚至可以说是改写了科研机构的算力账单。 基因组和蛋白质研究经常要在GPU上重复运行专用深度学习模型。 一次全基因组分析,可能要测试每个基因附近的大量突变,推理会执行成千上万次。单次慢一点,累计成本就会迅速放大。 给这些模型做优化、手写GPU Kernel,通常是顶尖性能工程师的活。一个团队得干好几周,学术实验室往往根本请不起这种人。 而Mythos 5.1只拿着公开的源代码,几天就干完了。 而且,它不仅一口气为7个开源生物模型手写了GPU Kernel,速度还最高提升了2.5倍。 最关键的是,输出结果与原版完全一致, 换算成账单的话,一项扫三百万个变异的分析,用Evo 2那个大模型跑,成本从1.8万美元直接砍到了8千美元。 七个开源蛋白质与基因组学模型在NVIDIA H100上的推理加速比 ,以及优化前后的预估 GPU 成本 全球最强编程AI,实力狂飙14% Fable 5.1能亲自下场做科学,底气源自它极其硬核的代码逻辑。 现在的Agent不怕写代码,怕的是连跑数小时、调用几十个工具后忘了最初的目标,或是报错后摸不到真正的病根。 Fable 5.1强化的,正是这样一条完整的动作闭环: 读取仓库文档→拆解任务→执行修改→运行测试→检查结果→定位失败→继续下一轮。 用Anthropic的话说,Fable 5.1在遇到障碍时会明确指出卡在哪里,极少再去走那些「看似完成、实则留下隐患」的捷径。 在衡量真实IDE编码水平的CursorBench 3.2上,它以73.4%刷新了内部纪录;在商业工作流AutomationBench中,成绩更跃升至31.4%,几近翻倍 靠着这种 长程稳定性 ,它甚至帮对冲基金Millennium解决了一个潜伏四五年的天坑Bug。 面对百万次一崩的幽灵报错,它一路追到外部、反汇编了第三方库,将别人地盘里的病根连根拔起。 这一次,Fable 5.1真正做到了长链路任务的「一次完整交付」。 第一波编码实测 Fable 5.1全面上线之后,紧跟着一波实测也出来了。 Fable 5.1登顶AAAI 从AI/ML API放出的实测对比demo,还是可以明显看出Fable 5.1和GPT-5.6 Sol的差距。 都喂给它们同一个提示词,一次性输出。 Fable 5.1花费5.69 美元,GPT-5.6 Sol仅用了0.88美元。 Fable更追求写实,海浪、景深、岛屿周围的沙环更逼真。Sol则是简洁风,而且它的风格在全部5个场景中始终如一,从未崩坏。 Anthropic研究员Alex Albert在一次测试中,直接丢给Fable 5.1一张地皮的照片。 它能自主完成房屋设计、高质量渲染,甚至直接生成了一段电影级的漫游导览大片。 下面这段硬核演示中,Fable 5.1直接手搓了一个全交互式的人脑模型。 它不仅用代码精准复刻了大脑皮层的每一道沟回,还能让你亲眼看到「递一下盐」这句话在脑神经里跑通的全过程。 生成ARC生存游戏,Fable 5.1直接一把过。 能挖漏洞,拒绝蒸馏 Anthropic这次在安全上的动作,主打一个「一松一紧」。 松,是护栏不再那么「神经质」了。 以前程序员拿Claude审自家代码,动不动就被当成黑客拦截。现在Fable 5.1终于放开权限,允许去识别代码漏洞了,网络安全的误报直接降了六成。 但底线依然卡得很死:只能找漏洞,绝不许写利用漏洞的攻击代码。渗透测试这类高危操作,照样得交给管得更严的Opus。 紧,则是把护城河直接变成了 「反蒸馏机制」 。 为了彻底堵死以前那种在多轮对话里修改上下文、趁机套取Claude「思维链」的路子,Fable 5.1干脆在API底层上了锁。 从现在起,API会严查上下文。 只要你提交的提示词跟生成思维块时不一
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱