首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7

摘要

新智元报道 大模型江湖变天了。 9月21日, 小米MiMo团队正式发布并全面开源新一代MiMo V2.6系列,一口气端出三款模型——Pro、Flash、Ultraspeed,直接改写全球开源模型的格局。 MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中拿下 46 分,超过Kimi K3和Qwen3.8 Max。 全...

MiMo Pro Fable Opus Sol Grok 全模态 5和GPT Flash Ultraspeed
2026-09-23 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 大模型江湖变天了。 9月21日, 小米MiMo团队正式发布并全面开源新一代MiMo V2.6系列,一口气端出三款模型——Pro、Flash、Ultraspeed,直接改写全球开源模型的格局。 MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中拿下 46 分,超过Kimi K3和Qwen3.8 Max。 全球开源模型第一、国产模型第一! 拉出AA榜单横着看:Fable 5.1得分53,GPT-6 Astra得分52.8,Opus 5得分50.7。 MiMo V2.6 Pro虽然还没追平这几位「天花板」,但已经稳稳站进全球顶尖第一梯队,把其他所有开源模型甩在身后。 更狠的是,价格维持V2.5不变。 同样的钱,智能翻倍,直接画出一条新的「智能-成本」帕累托前沿。 别人还在打「斩杀线」的价格战,小米这一刀,直接把游戏桌掀了。 正好,小米大模型负责人罗福莉也在X上发了一篇长文——《The Hard Road to Scaling Up RL》。 她说MiMo V2.6很可能是开源世界迄今最大规模的单次RL训练,几十人团队把所有算力押在一件事上: 强化学习究竟能扩展多远。 她甚至直言,这次RL的研究创新和工程挑战甚至「超过了DeepSeek R1」。 更巧的是,就在同一天,马斯克旗下 SpaceX的Grok 4.7也同步发布,马斯克兴奋转发。 但X上的风向转得比飞机还快。 AI博主Chubby(@kimmonismus)先夸了Grok 4.7,随后秒纠正—— 真正该看的是MiMo V2.6。 他改口称:Better than Grok 4.7, much cheaper, and holy moly is China back!(比 Grok 4.7 更强,价格还便宜得多,我的天,中国回来了) AA Intelligence Index上两者同为46分,但MiMo V2.6 Pro单任务成本0.13美元,Grok 4.7要3.74美元——近30倍差距。 同分,开源,全模态,便宜30倍。 社区的共识就五个字:又好又便宜。 三箭齐发:旗舰、效率、极速,各有杀招 MiMo V2.6是一个系列。针对不同工作场景,三款模型各司其职: MiMo V2.6 Pro,是整个系列的绝对旗舰。 全模态、超高性能,覆盖复杂项目、长程任务、高价值工作,甚至能啃网络安全和科研的硬骨头。 放眼开源世界,它是唯一一个同时做到 全模态和旗舰性能的模型。 AA智能指数46分,就是它交出的成绩单;在多数Agent Benchmark上,它已经能比肩Opus 5和GPT-5.6 Sol。 在Design Arena的排名更加细致地暴露了它的实力。 Chat综合场景中,MiMo V2.6位列开源模型第3、总榜第8,超过Claude Opus 5; 在Chat场景中使用频率最高的Website类别,开源第2、总榜第4,超过Opus 5、Fable 5和GPT-5.6 Sol; 在面向Agent的Web Apps前端开发场景中,开源第2、总榜第6,超过Kimi K3、Fable 5、Opus 5和GPT-5.6 Sol。 请注意,被它超越的那些名字——Opus 5、Fable 5、GPT-5.6 Sol。每一个都是各家公司几百亿美元投下去的闭源旗舰。 一个开源模型,在真实的开发者投票场景中把它们踩在了脚下。 来看一个前端设计实例。 衬线大标题、克制的留白、左侧竖排章节导航、右侧带图注的沙漠影像,整体像一本印刷杂志而不是一个模板堆出来的网页。 MiMo V2.6 懂得「什么叫好看」。 MiMo V2.6 Flash,走的是「效率怪兽」路线。 全模态、高智能、低成本,专为专业办公中的高频调用和规模化任务设计。这一代Flash,已经全面超越上一代旗舰V2.5 Pro。 如果你每天要让模型跑几万次任务,Flash就是那个不心疼Token账单的最佳搭档。 MiMo V2.6 Pro Ultraspeed,则是给「高效率」的人准备的。 它保留了Pro的旗舰级性能——注意,不做量化,不因速度牺牲智能,同时提供最高10倍推理速度,常态500 TPS,峰值可达1000 TPS。 3倍价格换10倍速度,对于强实时交互和对响应速度敏感的生产场景来说,这笔账怎么算都划算。 实战检验:不是跑分选手,是干活的工具 榜单成绩只是入场券,真正让开发者买单的是实战能力。 MiMo V2.6在几个关键场景中的表现,验证了它不是为跑分而生的「应试选手」: 游戏开发。 这是MiMo V2.6生成的一个可交互的3D开放世界—— 远处金字塔与宣礼塔勾勒天际线,近处密集的沙色民居、木质脚手架和错落屋顶铺满整个视野,镜头推拉时帧率稳定、没有明显掉帧和穿模。 它不只是「画」出了一个场景,而是把场景层级、资产复用和渲染性能一起算清楚了。 更难得的是审美的统一:整座城市在中东古城的色彩和建筑语法里保持一致,没有拼贴感。 复杂3D场景建模。 这是考验模型长程推理和细节控制能力的终极战场。 MiMo-V2.6 可以根据用户的文本描述或参考图像在 Blender 中生成 3D 对象和场景。 让它生成的一辆皮卡的线框3D模型。车身轮廓、轮毂辐条、底盘纵梁和车厢挡板全部由程序化几何体构成,旋转时各部件的空间关系严丝合缝,还在一直在变换颜色。 MiMo V2.6在这类任务上的空间推理和细节控制,已经不输旗舰闭源模型。 多模态输入生成Office文档。 这是MiMo V2.6生成的一份「关键矿产」基金路演幻灯片,封面就透着一股投行研报的克制感:大字号黑体中文标题压住版面,赭红色英文副标和一条短横线做点睛,四个议题用间隔点排成一行,底部一张智利Chuquicamata铜矿的阶梯矿坑全景图直接把主题「砸」在观众眼前。 更难得的是文字组织,说明模型不只是在排版,而是先想清楚了这份材料给谁看、怎么讲,这是一个真正懂路演逻辑的「分析师」才会有的自觉。 新材料研发「Co-Scientist」。 小米前沿材料团队用MiMo V2.6 Pro做了一件正经的科研任务:设计一种能从水中捕获PFAS(全氟和多氟烷基物质,俗称「永久性污染物」)的新型金属有机框架材料(MOF)。 注意,这是一个端到端的科研闭环——从文献与专利综述、提出设计假设并验证新颖性,到自动搭建计算模拟环境、调用开源工具进行「干法实验」,最终筛选出候选材料方案。 模型设计的A50和B50两种MOF结构,在模拟中对PFAS的吸附性能达到了参照材料的百万到千万倍。 整个流程,人类专家的工作效率提升约10倍,原本需要一个月的研发周期被压缩到2—3天。 北京大学材料科学与工程学院特聘研究员窦锦虎教授评价:「它在这次任务中展现出的研究能力,已经达到了训练有素的博士研究人员的水平。」 一个开源大模型,开始像一个真正的科研工作者那样工作了。 而且,V2.6有一个被低估的优势:单轮交付速度极快。 在复杂多步任务中,同等时间内MiMo可以完成更多迭代轮次,结果更可控。 如果你习惯了「提需求→等半天→看到一个不满意的结果→再改→再等」的工作流,V2.6的速度会让你重新定义什么叫「人机协作」
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱