智能AI
morning
Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功
摘要
新智元报道 太卷了。 九月才过去3天,就已经有五个前沿模型发布了! Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。 就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。 小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布...
Muse
Spark
Sol
GPT
Gemini
Fable
谷歌的Gemini
Meta
Alexandr
Flash
2026-09-04
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 太卷了。 九月才过去3天,就已经有五个前沿模型发布了! Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。 就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。 小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃! Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。 他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。 Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。 跑分显示,这次 Muse Spark 1.3 的提升更大。 它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。 在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。 亚历山大王嘲讽谷歌 「吸别家模型尾气」 最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。 Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。 在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。 Muse Spark 1.3:75.4 分 Claude Opus 5:74.0 分 GPT-5.6 Sol:73.0 分 不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。 在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。 在Terminal-Bench 2.1它拿下88.8 分。 在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。 在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。 在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。 在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。 而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。 面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」 谷歌真是虎落平阳。 有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」 Less is More:1美元跑2小时的性能怪兽 跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。 Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。 正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。 它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。 针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。 它变得更聪明利落,代码风格更干净,废话更少。 而这种减法带来的直接后果,就是成本的断崖式下跌。 下面就是一个非常震撼的真实实测案例。 开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。 他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。 这两个模型都运行了大约 2 个小时,结果惊人。 Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。 而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元! 这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」 在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。 在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。) Codedamn创始人、开发者Mehul Mohan直呼: Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。 在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。 作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。 甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。 它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。 Alexandr Wang的狂飙,小扎的终极野心 Muse Spark 1.3 的横空出世,离不开其背后的操盘手。 今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。 短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。 如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。 他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。 也就是
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱