汽车
morning
罗福莉压力有多大?都给小米模型训练整上直播了
摘要
文 | 字母AI 太刺激了。都知道模型训练很费钱,可亲眼看着小米“直播”里的金额往上跳,还是有点替它肉疼。 北京时间9月15日晚,小米两款新模型先后启动了这一轮训练。到17日下午,还不到两天,页面上的累计成本已经超过130万美元,而且还在涨。 好在这笔钱不用观众掏,不然看着看着,可能真得关掉网页缓一缓。 把围观地址发出来的,是小米大模型负责人、前DeepSeek研究员罗福莉。 当天凌晨,她在X上写...
MiMo
字母AI
太刺激了
都知道模型训练很费钱
可亲眼看着小米
里的金额往上跳
还是有点替它肉疼
北京时间9月15日晚
小米两款新模型先后启动了这一轮训练
到17日下午
2026-09-18
1 阅读
约10分钟阅读
字母AI
字号:
文 | 字母AI 太刺激了。都知道模型训练很费钱,可亲眼看着小米“直播”里的金额往上跳,还是有点替它肉疼。 北京时间9月15日晚,小米两款新模型先后启动了这一轮训练。到17日下午,还不到两天,页面上的累计成本已经超过130万美元,而且还在涨。 好在这笔钱不用观众掏,不然看着看着,可能真得关掉网页缓一缓。 把围观地址发出来的,是小米大模型负责人、前DeepSeek研究员罗福莉。 当天凌晨,她在X上写道:“沉寂了近半年。”随后解释,这段时间她和团队一直在研究,强化学习究竟能扩展到什么程度。 新模型MiMo-V2.6还没练完,罗福莉就先开“直播”给大家看,不得不说蛮有魄力的。 不过,钱花得快肯定不是这个“直播”透露的唯一信息。罗福莉过去几个月忙些什么,小米又能靠这轮训练往前追赶多少才是更关键的。 模型还没练完,先开直播了 “直播”页面不难看懂,MiMo-V2.6的Pro和Flash两款模型各占一栏。 截至北京时间9月17日15时47分,Pro这轮训练跑了45个多小时,累计花费约93万美元。晚几个小时开练的Flash跑了约40个半小时,花费约41.6万美元。Pro花的钱已经是Flash的两倍多。 进度上,Pro完成了第14步,正在进行第15步。Flash完成了第17步,正在进行第18步。Flash看着跑得更快,但光比步数,还不能判断谁练得更好,得看看下面的测试成绩。 页面公布了一项名叫DeepSWE v1.1的软件开发测试。它会让模型在真实的开源项目里增加功能、修复问题,再检查交上来的代码是否符合要求。新功能做出来了,却把原有功能改坏了也不算通过。 目前页面公布的通过率,Pro为65.78%,Flash为60.77%。 也就是说,在这项测试里,两款模型都能完成六成多的任务,Pro领先约5个百分点。这些成绩会随着阶段性测试完成而更新,模型还在训练,现在看到的只是中途测验的成绩。 更有意思的是,网页还兼任故障通报栏,小米连训练时出了什么岔子也写在了页面上。 页面顶部的公告写着,Pro因为一个计算节点出现显存问题,需要重启。Flash则在一组数据上遇到了某类基础设施错误,约3小时内没能正确识别,最后从第15步重新启动。 平时看模型发布,大家拿到的是一份已经整理好的成绩单,训练中出了什么问题、重来了几次,通常没机会了解。这次小米连故障通知也挂了出来,外界可以直观看到当模型的分数在往上涨的同时,团队也还在忙着排查问题、重启训练。简直是一场行为艺术。 这种“直播”很快就吸引到了同行关注。 Meta研究员、前OpenAI研究员卢卡斯·拜尔看到罗福莉介绍扩大训练规模的三个方向,忍不住替她重新“翻译”了一遍:算力、算力,还是算力。玩笑开完,他又特意称赞,小米竟然连“目前花了多少钱”都公开了。 加州大学圣迭戈分校副教授、强化学习研究者Yu-Xiang Wang也说,自己“看得移不开眼”,还专门提了个要求,希望团队把训练过程中遇到的各种问题记录下来。前面那些重启公告,恰好也是他想了解的内容。 曾任康奈尔大学教授、参与过Cursor模型研发的Sasha Rush,也拿着手机盯起了直播。他自嘲,看一项编程任务的响应长度,看出了赌徒上头的感觉,随后又对数字的变化犯起嘀咕:“从80k跳到120k,这个幅度感觉太大了。” 公开到这个程度,外界已经可以拿着具体细节讨论训练方法了。 说起来,小米今年3月还让新模型玩过一次“猜猜我是谁”。当时,一个叫Hunter Alpha的匿名模型出现在模型服务平台OpenRouter上。一周后,小米才在3月18日揭晓身份:这是MiMo-V2-Pro的早期测试版。 到了这次,罗福莉干脆提前把训练过程公开,还预告未来几周会逐步开源相关细节。至于这场训练想解决什么问题,她在推文里表示过去近半年,团队一直在研究强化学习究竟能扩展到什么程度。 半年沉寂,罗福莉到底在忙什么? 今年4月,MiMo-V2.5系列发布并开源。同月上线的《张小珺Jùn|商业访谈录》中,罗福莉谈到,国内团队正在加快探索Agent的后训练,其中一个重点就是扩大强化学习的规模。主持人追问有没有初步结果,她当时只说:“暂时还不是很方便分享。” 几个月后,小米把训练过程放到了网上。模型每天花着这么多钱,到底在学什么? 拿修网站来说。用户发现网站突然登录不上,让AI处理,它就得找到相关文件,检查哪里出了问题,修改代码,再运行测试。有时候改完依然报错,还得继续排查。用户要的是能登录,光收到一句“已经为您修复”,显然不算交差。 这类能使用工具、连续处理任务的AI,就是我们经常听到的Agent。训练时,模型会反复尝试完成任务,系统根据它的表现打分,再用这些反馈调整模型参数,让有效的做法更容易在以后出现。这是强化学习在Agent训练中的一种用法。 按照罗福莉公布的配置,小米每个训练步骤安排1568条提示词,每条对应16次尝试,合计25088条轨迹。 这里的一条轨迹,是模型从接到任务到结束的完整过程。修网站时,即使中间改了好几次代码、跑了好几遍测试,也仍然属于同一次尝试。大量这样的过程累积起来,一个训练步骤就涉及约20亿token。模型读写的文字、代码等内容,都按这种单位计量。 所以,页面上一个不起眼的“step”,里面可能已经忙活了很久。 这些练习还有个准备工作:得让模型有地方操作。 比如修网站,训练系统要提供项目文件和运行代码的工具。模型代码修改以后,程序能不能正常运行,也得把结果反馈给它。只有一句“请修复登录故障”,却没有文件可查、没有程序可运行,它也无从下手。 罗福莉在访谈中提到,团队会先让公司内部更多人使用模型,从中发现实际需求,再围绕这些场景构造训练数据。难的是,还得尽量还原使用时的环境,让模型可以在里面连续操作,并设置相应的评分标准。 这次MiMo-V2.6扩大的训练环境和执行框架,就涉及这些工作。同一次训练可以混合多类任务,模型面对的工具、操作过程和完成要求也会有所不同。 而且,模型做得好不好,也需要花算力去判断。任务复杂了,检查作业也跟着费事。 程序能不能通过测试,可以交给系统运行检查。换成让AI分析一家公司的经营情况,就得核对数据和结论。比如它把去年的营收当成今年的,后面写得再有道理,分析也站不住脚。评分系统需要能识别这些问题,否则给错了奖励,模型还可能继续照着错误的做法学。 这也是罗福莉把“评分算力”单独列出来的原因。模型尝试完成任务要花算力,判断这些尝试做得怎么样,同样要投入计算资源。 目前,编程在这场训练中占了相当大的分量。北京时间9月17日17时49分,Pro第14步的代码类提示词占67.7%,超过三分之二,此外还混合了视觉、聊天等任务。 为什么要让模型写这么多代码?罗福莉给过一个解释:软件开发往往需要连续处理很多问题,围绕它形成的规划能力、上下文管理方法,也能帮助AI完成其他复杂任务。 比如一个项目改到一半,模型得记住已经改过哪些地方,哪些办法试过但没用。事情多了,还要整理和保留关键信息,方便后面接着做。这些要求放到资料研究等需要多步处理的工作里,同样存在。 当然,代码练好了,也不意味着其他工作就能直接上手。罗福莉同样强调,想让模型在更多场景里表现稳定,还得安排相应的训练。 小米这次想继续摸清的,就是这些投入能带来多大的进
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱