
小米把强化学习训练过程直播出来了一步 2.5 万条轨迹账单每秒约 10 美元TL;DR 速览事件9-17 凌晨小米 MiMo 大模型团队负责人罗福莉发文公开 MiMo-V2.6 的 RL 训练进展并上线实时训练页mimo.xiaomi.com/rl/把强化学习阶段全程公开三向扩展算力每步约 20 亿 token 1,568 prompt × 16 rollout完全异步、环境与 Harness单次运行混合多框架、Grader 算力批改本身也是算力开销规模感一步放出约2.5 万条完整轨迹直播页显示两个版本一度同时开着超过 6 万个活跃环境账单直播页实时值48 小时内累计突破111 万美元按其数据推算约每秒 10 美元Pro 每步约 7 万美元最该看的不是分数而是工程指标dynsam/passrate/zero、infra_error/seq_rate、partial/avg_staleness—— 这些决定了 RL 能不能稳定跑下去9 月 17 日凌晨小米 MiMo 大模型团队负责人罗福莉在 X 平台发文公开了 MiMo-V2.6 的强化学习训练进展并同时上线了一个实时训练页面。页面上滚动的是训练走到第几个 step、每步消耗多少 token、同时运行着多少个任务环境、模型在基准上的表现变化以及账单涨到了哪里。相关技术细节官方表示会在未来几周内逐步开源。距离上一代 MiMo-v2.5 开源已有近半年罗福莉说这段时间团队在钻研一件事强化学习还能扩多远。从直播页公开的内容看这次做的不是普通的问答式强化学习而是agentic RL—— 训练模型真正进入代码仓库、定位问题、修改文件、运行测试。用来观察效果的是 DeepSWE 这个测试它要求模型在真实仓库里干活。一、三向扩展算力、环境、批改罗福莉把这次扩展拆成三个维度这个拆法本身就值得记因为它把RL 扩不动这个模糊感受变成了三个具体的资源瓶颈。计算能力每步约 20 亿个 token1,568 个 prompt × 16 次 rollout完全异步。这两个数字相乘就是 25,088 —— 每一步训练系统会一次放出约 2.5 万条完整解题轨迹。放出去之后每条独立推进不互相等待完全异步这四个字是后面所有工程复杂度的来源。环境与工具多任务 agentic RL支持在一次运行里混合多个框架。这是模型会干活的前提 —— 干活就要有地方干。直播页的数据显示两个版本一度合计开着超过 6 万个活跃环境其中 Flash 反而比 Pro 用得多。Grader 算力给打分这件事本身加算力。团队用了带测试用例与评分标准奖励的组内信用分配agentic in-group credit assignment。这一步的意义在第 3 节展开因为它是最容易被忽略、也最反直觉的一块。二、2.5 万条轨迹同时开工难在哪单条轨迹有多长。直播页显示模型完成一项任务平均要交互40 到 50 轮处理8 万到 10 万个 token的上下文ctx_total_length/mean显示约 86.6kdynsam/agg_turn/mean约 46.9。这个量级意味着它更像坐在电脑前工作而不是在聊天框里回答问题。任务越长单条轨迹里累积的不确定性越多对环境的稳定性要求越高。采样不是简单凑数而是动态补满。直播页里有个指标叫dynsamdynamic sampler暴露了采样机制每个领域先定好配额再动态采样、不断补满直到达标。面板上能看到按来源拆分的进度例如code/dataset-mldt、code/dataset-obg8、cyber/dataset-9aui等各自accepted / target / remaining / judged的实时数字。靠这个机制每批训练数据按什么比例、怎么凑齐这种原本属于内部设计的部分在直播页上留下了可观察的轮廓。异步带来了陈旧度这个新指标。partial/avg_staleness直接暴露了完全异步的代价策略在更新而某些轨迹还在用旧策略跑。指标从 0.440 波动说明这不是理论问题而是需要持续监控的运行参数。失败率也被公开了。dynsam/passrate/zero约 14.6%一部分任务组的通过数为零passrate/one约 16.3% —— 也就是约三成的任务组只给出 0 或 1 次成功。剩下的大量算力花在了没有正样本的采样上。三、批作业比作答更贵被忽略的 Grader Compute这次公开里最有工程价值的点在这里。2.5 万份作业交上来批改本身就是大工程。小米的做法不是只看最终答案对不对而是运行测试用例。代码任务的判定要真跑。按评分标准检查。奖励来自 rubric 层面的检查而不是单一的二值判定。在同一组尝试之间比较不同解法把奖励分给真正有效的步骤 —— 这就是组内信用分配。同一组的 16 次 rollout 互为参照用来判断哪些步骤值得奖励、哪些路线以后少走。把这三件事加起来结论就很直白模型干活要算力给模型批作业同样要算力。而且批改的算力需求随着轨迹变长、判定变细而同步放大——它不像推理那样可以用更小的模型替换掉因为判定质量直接决定训练信号的质量。这一点对做 agent 训练的人是个硬提醒评估成本要和训练成本一起做预算。很多团队在估算 RL 开销时只算 rollout上线后发现 Grader 那一半把预算吃掉了。四、账单反推出来的规模直播页实时呈现成本这让一批外推成为可能。抓取时刻的值是累计111 万美元以上两个版本各自在跑版本起始时间UTC抓取时 step已花费MiMo-V2.6-Pro2026-09-15 10:3211–12约 77.6 万美元MiMo-V2.6-Flash2026-09-15 15:1616–17约 33.9 万美元几个由这些数字推出来的量以下是按直播页数据的推算不是官方口径单步成本。Pro 每步约 7 万美元Flash 每步约 2.1 万美元。单条轨迹成本。一步 25,088 条轨迹摊下来 Pro 每条约 2.78 美元Flash 每条约 0.86 美元。token 吞吐。Pro 的一个训练步骤里模型约用 58 分钟生成 22 亿个 token折合约每秒 63 万个 token。卡数。有网友按 H100 在这类任务中的常见速度往回除推测 Pro 用了约 4,000–5,000 张、Flash 约 2,000–2,500 张合计 6,000–8,000 张。这个数字是社区推测官方没有确认过引用时必须带上这句。数据构成方面代码任务占大头约三分之二其余分给通用任务、视觉、网络安全和对话。我自己的账本习惯是先把口径定死再比数字因为跨来源的成本数据几乎不可能在同一个口径上——比如这次是累计花费还是单步成本混起来看会差一个数量级。墨衍 里我把素材、选题和分发记录收在同一处免得回头核对口径时要在几个工具之间来回翻。五、直播暴露的失败面比成功面更有信息量公开训练过程最大的价值在于连故障也一起公开。直播页的 notices 里记着这样几条VRAM 问题导致 Pro 的运行重启。一个节点上的显存问题让整个 run 重新开始——在 6 千到 8 千卡的规模上单点显存故障是必然事件问题是恢复机制能不能做到不丢进度。基础设施错误率。dynsam/infra_error/seq_rate报出约 0.47%带 ±0.14 pt 的波动。这个数字看着很小但乘上单步 2.5 万条轨迹就是可观的绝对量必须靠重试补齐。离线评估结果分批放出。DeepSWE v1.1mini-swe-agent, avg3在直播页上的当前值是 Pro 63.72、Flash 60.77并标注了结果出来后持续更新。注意不同媒体转述的分数存在差异这里以直播页的数值为准且它是动态值。性能仍在爬坡。罗福莉明确说这轮 RL 处于中期模型能力还有提升空间。结合面板上只推进到十几个 step、分数增长曲线仍在上升这是可信的。一个更根本的问题没有答案分数涨了不一定等于能力真的变强了——也可能只是模型摸透了当前的训练环境和评分规则。这个质疑在社区讨论里被反复提出官方也没有给出结论。写选型建议的时候这一条不能省。六、对做 agent 的普通团队有什么可抄这套东西的规模抄不动但结构可以抄。四件事按性价比排序第一把评估成本单独列出来算。只要你的训练信号来自跑测试用例 按标准评分Grader 就是一项独立且不可压缩的开销。第二给你的采样机制加一个补满逻辑。定额 动态补齐比固定比例更抗任务难度波动passrate/zero这种指标应该进监控面板它直接对应多少算力打在了没有正样本的题上。第三把环境的稳定性当成一等指标。平均 40–50 轮交互、8–10 万 token 上下文意味着轨迹很长环境抖动会在长轨迹上被放大成噪声。第四异步跑起来之前先想清楚陈旧度怎么监控。完全异步能提高吞吐但策略与轨迹的版本差异是个持续存在的量不监控就会变成隐形的训练信号污染。最后一条是评估纪律用真实仓库里的多轮任务去评估 agent比用静态问答更接近实际使用。小米选 DeepSWE 而不是问答集本身就是这个判断的体现。