小米把大模型训练开成了直播:一小时烧掉20万人民币,全网围观

小米把大模型训练开成了直播:一小时烧掉20万人民币,全网围观

· ⏱ 4 分钟阅读 ✍️ spark1 👁 2 次阅读
🎧 听全文
点击播放,AI语音朗读全文
1.0x
标签 AI 大模型 小米 强化学习

你见过有人把自家"烧钱现场"架起机位、全网直播的吗?

9月17日,小米MiMo团队就这么干了。负责人罗福莉在X上放出一个训练直播页面,把还在进行中的MiMo-V2.6强化学习训练整个摊开给外界看——训练跑了多少步、烧了多少钱、消耗了多少Token、奖励曲线涨没涨,甚至哪个节点的显卡出了故障,全部公开可查。我把36氪、量子位几家的报道翻了一遍,把训练面板上的数字挨个整理了下来,越看越觉得这场直播有意思。

先报账。截至36氪发稿时的面板快照:MiMo-V2.6-Pro跑到step 12,累计训练样本约30.1万条,训练成本约80.6万美元;Flash版本跑到step 17,样本约42.6万条,成本约35.4万美元。两个版本加起来超过116万美元,平均每小时计算成本约3.09万美元——折合人民币20.72万元。量子位算了笔更直观的账:差不多一眨眼就是10美元,一分钟4000多块人民币烧出去。

为什么敢把账本直播出来

行业里开放权重、开放训练代码、开放训练数据的都见过,开放训练过程的,这还真是头一遭。

想明白这件事,得先弄懂小米这半年在干什么。自4月开源MiMo-V2.5之后,团队沉默了近半年。罗福莉说,这段时间只研究一个问题:强化学习还能扩展到什么程度?

打个比方:预训练像让学生把图书馆的书全读一遍,读得越多懂得越多,这条路大家都熟;强化学习则像刷题实战——让模型反复去执行真实任务,做对了给奖励,做错了调整,边干边学。现在前沿团队都在追问:这条"边干边学"的路,能不能像"多读书"一样,靠不断加大投入持续变强?

小米这次把三个方向的规模同时拉大:计算资源、训练环境与任务体系、奖励评估机制。据网易科技的报道,训练每一步约消耗20亿Token,由1568条prompt乘以16次rollout构成,完全异步推进。而从量子位整理的曲线看,训练才跑了一天多,两个版本的能力指标已经在肉眼可见地爬坡——Flash从更低的起点快速追近了Pro。

所以这场直播的真正含义不是"炫富",而是一个公开的实验记录:把"强化学习能不能scaling"这个问题的实测过程,摊在全行业面前一起看。敢直播,本身就是对方法有信心。

这本账,跟你有什么关系

你可能会说:一小时20万人民币,跟我有啥关系?关系其实很直接——小米用百万美元验证的"边干边学",缩小一万倍,就是你每天用AI的正确姿势。

很多人用AI是"一锤子买卖":丢一句指令,拿到结果不满意,就骂模型笨。而强化学习的逻辑恰恰相反:**好结果不是问出来的,是反馈喂出来的。**你给AI布置任务、检查产出、指出偏差、让它再来一轮——这个循环,就是你自己的"奖励机制"。模型团队烧116万美元跑这个循环,你免费就能跑。

具体怎么做?我把训练面板的逻辑翻译成个人版:

大厂的百万美元实验,最终都会变成普通人的日常工具——就像当年贵到只有巨头玩得起的深度学习,今天已经装进了每个人的手机。看懂这场直播的人,等于提前看了几年后AI应用的说明书。

从容,不是等别人教会你,而是把大厂的方法论,缩小成自己今天就能跑的一个循环。

(本文素材综合自36氪、量子位、网易科技等公开报道,训练数据为发稿时面板快照,仍在实时变动。)

📄 版权声明:本文由 AI家园 团队创作。欢迎非商业性转载或引用,转载时须注明原文出处并保留原文链接;商业使用请事先联系授权。

本文链接:https://spark1.cn/articles/20260917-xiaomi-livestream-mimo-rl-training · 转载规则详见《服务条款》

🎁 喜欢这篇文章?获取更多干货

关注公众号「xAI智工场」

关注公众号「xAI智工场」

每天一个AI干货
回复「提示词」免费领实战模板包

💬

加入AI交流群

微信号:xaizgc
和AI爱好者一起成长

⭐ 深度精选

知识星球·深度圈

系统课程 · 社群答疑 · 资源库
¥99/年

立即加入 →
分享到

💡 想用 AI 马上搞定这件事?

查看全部 AI 工具 →

💬 评论

加载中...

转载或引用本站内容请注明原文出处及链接 · 转载规则

Copyright © 2026 AI家园 浙ICP备2024142181号-2 浙公网安备 33010202005420号