首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

摘要

新智元报道 太卷了。 九月才过去3天,就已经有五个前沿模型发布了! Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。 就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。 小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布...

Muse Spark Sol GPT Gemini Fable 谷歌的Gemini Meta Alexandr Flash
2026-09-04 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 太卷了。 九月才过去3天,就已经有五个前沿模型发布了! Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。 就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。 小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃! Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。 他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。 Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。 跑分显示,这次 Muse Spark 1.3 的提升更大。 它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。 在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。 亚历山大王嘲讽谷歌 「吸别家模型尾气」 最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。 Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。 在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。 Muse Spark 1.3:75.4 分 Claude Opus 5:74.0 分 GPT-5.6 Sol:73.0 分 不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。 在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。 在Terminal-Bench 2.1它拿下88.8 分。 在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。 在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。 在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。 在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。 而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。 面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」 谷歌真是虎落平阳。 有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」 Less is More:1美元跑2小时的性能怪兽 跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。 Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。 正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。 它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。 针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。 它变得更聪明利落,代码风格更干净,废话更少。 而这种减法带来的直接后果,就是成本的断崖式下跌。 下面就是一个非常震撼的真实实测案例。 开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。 他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。 这两个模型都运行了大约 2 个小时,结果惊人。 Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。 而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元! 这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」 在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。 在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。) Codedamn创始人、开发者Mehul Mohan直呼: Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。 在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。 作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。 甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。 它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。 Alexandr Wang的狂飙,小扎的终极野心 Muse Spark 1.3 的横空出世,离不开其背后的操盘手。 今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。 短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。 如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。 他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。 也就是
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱