你见过有人把自家"烧钱现场"架起机位、全网直播的吗?
9月17日,小米MiMo团队就这么干了。负责人罗福莉在X上放出一个训练直播页面,把还在进行中的MiMo-V2.6强化学习训练整个摊开给外界看——训练跑了多少步、烧了多少钱、消耗了多少Token、奖励曲线涨没涨,甚至哪个节点的显卡出了故障,全部公开可查。我把36氪、量子位几家的报道翻了一遍,把训练面板上的数字挨个整理了下来,越看越觉得这场直播有意思。
先报账。截至36氪发稿时的面板快照:MiMo-V2.6-Pro跑到step 12,累计训练样本约30.1万条,训练成本约80.6万美元;Flash版本跑到step 17,样本约42.6万条,成本约35.4万美元。两个版本加起来超过116万美元,平均每小时计算成本约3.09万美元——折合人民币20.72万元。量子位算了笔更直观的账:差不多一眨眼就是10美元,一分钟4000多块人民币烧出去。
为什么敢把账本直播出来
行业里开放权重、开放训练代码、开放训练数据的都见过,开放训练过程的,这还真是头一遭。
想明白这件事,得先弄懂小米这半年在干什么。自4月开源MiMo-V2.5之后,团队沉默了近半年。罗福莉说,这段时间只研究一个问题:强化学习还能扩展到什么程度?
打个比方:预训练像让学生把图书馆的书全读一遍,读得越多懂得越多,这条路大家都熟;强化学习则像刷题实战——让模型反复去执行真实任务,做对了给奖励,做错了调整,边干边学。现在前沿团队都在追问:这条"边干边学"的路,能不能像"多读书"一样,靠不断加大投入持续变强?
小米这次把三个方向的规模同时拉大:计算资源、训练环境与任务体系、奖励评估机制。据网易科技的报道,训练每一步约消耗20亿Token,由1568条prompt乘以16次rollout构成,完全异步推进。而从量子位整理的曲线看,训练才跑了一天多,两个版本的能力指标已经在肉眼可见地爬坡——Flash从更低的起点快速追近了Pro。
所以这场直播的真正含义不是"炫富",而是一个公开的实验记录:把"强化学习能不能scaling"这个问题的实测过程,摊在全行业面前一起看。敢直播,本身就是对方法有信心。
这本账,跟你有什么关系
你可能会说:一小时20万人民币,跟我有啥关系?关系其实很直接——小米用百万美元验证的"边干边学",缩小一万倍,就是你每天用AI的正确姿势。
很多人用AI是"一锤子买卖":丢一句指令,拿到结果不满意,就骂模型笨。而强化学习的逻辑恰恰相反:**好结果不是问出来的,是反馈喂出来的。**你给AI布置任务、检查产出、指出偏差、让它再来一轮——这个循环,就是你自己的"奖励机制"。模型团队烧116万美元跑这个循环,你免费就能跑。
具体怎么做?我把训练面板的逻辑翻译成个人版:
- 给明确的任务环境:别问"帮我写点东西",而是给足背景、受众、格式要求——环境越清晰,AI的第一次输出越接近及格线;
- 看曲线不看单点:一轮不满意很正常,关键是有没有越改越近。改三轮还在原地打转,说明任务描述本身有问题,回去改提示词而不是继续磨AI;
- 沉淀你的harness:小米说算力之外还得有配套的任务环境和执行框架。你的框架就是一套跑通过的提示词和工具组合。我平时会在 spark1.cn/tools/ 里挑现成的工具链直接接进工作流,别人已经调顺的用法,省掉自己从零试错的成本。
大厂的百万美元实验,最终都会变成普通人的日常工具——就像当年贵到只有巨头玩得起的深度学习,今天已经装进了每个人的手机。看懂这场直播的人,等于提前看了几年后AI应用的说明书。
从容,不是等别人教会你,而是把大厂的方法论,缩小成自己今天就能跑的一个循环。
(本文素材综合自36氪、量子位、网易科技等公开报道,训练数据为发稿时面板快照,仍在实时变动。)
💬 评论