小米公开MiMo-V2.6强化学习训练细节:每小时算力成本约3万美元

2026/09/17 09:09阅读量 25

小米团队在沉寂半年后,正式公开了MiMo-V2.6系列模型基于强化学习(RL)的训练过程及核心Scaling策略。目前Pro和Flash两款模型已训练超过36小时,累计消耗超108万美元,平均每小时算力成本约3万美元。该体系通过扩展训练计算量、多任务环境框架及评分计算量,探索强化学习能力的持续扩展边界。

事件概述

小米AI团队负责人罗福莉宣布重启MiMo大模型研发,并首次公开了MiMo-V2.6系列模型的强化学习(RL)训练实时数据。自2026年4月开源MiMo-v2.5以来,团队专注于研究“强化学习的扩展极限”。目前,MiMo-V2.6的Flash和Pro两个版本已进入初期训练阶段,训练时长超过36小时,总耗资超过108万美元,折合平均每小时算力成本约为3万美元。

核心训练进展

  • 性能表现:经过一天多的训练,两款模型在RL过程中均展现出明显的能力提升。
    • Pro模型:dynsam/avg@n指标从初始的约0.565提升至0.614。
    • Flash模型:dynsam/avg@n指标从初始的约0.514快速提升至0.603,显示出更强的追赶能力。
  • 评测成绩:在最新的DeepSWE v1.1离线评测中,Pro模型得分62.24,Flash模型得分60.77。作为对比,DeepSeek-Flash v1.1在该评测中的得分为74.2%。尽管Pro目前保持小幅领先,但Flash因起点较低且训练速度较快,正在迅速缩小差距。

强化学习Scaling三大维度

小米此次公开的MiMo系统旨在解决如何将预训练的Scaling逻辑延伸至强化学习领域,主要沿以下三个维度进行扩展:

1. 训练计算量的Scaling

  • 大规模Rollout生成:每个训练Step处理约20亿Token。配置为1568个Prompt,每个Prompt生成16条Rollout(轨迹),单轮产生超过2.5万条轨迹。
  • 异步执行架构:采用Fully Async完全异步执行方式,打破传统流水线式的同步等待。生成、环境执行、评分和模型更新并行进行,不同任务处于不同阶段,形成持续运转的高效流水线。

2. 环境与执行框架的Scaling (Environments and Harnesses)

  • 多任务混合训练:支持代码、通用任务、视觉、Chat等多种类型的Agent任务混合在同一RL Run中训练。
  • 多样化环境交互:扩展模型可进入的环境类型和使用工具的种类。例如,编程Agent需具备终端操作、代码修改、测试执行能力,而视觉Agent则面对完全不同的反馈机制。直播页面展示的Batch Composition即反映了每个Step中模型获取经验的来源分布。

3. 评分计算量的Scaling (Grader Compute)

  • 精细化奖励信号:针对复杂Agent任务,仅依靠最终成败判断奖励过于粗糙。系统投入更多计算资源用于对模型行为进行细致评分。
  • 信用分配优化:引入Agentic In-group Credit Assignment机制。利用同一Prompt生成的多条Rollout轨迹及其结果,分析具体步骤(如搜索、修改、测试)对最终成功的贡献度,从而提供更准确的强化学习信号,解决长期依赖下的信用分配难题。

总结

MiMo-V2.6的强化学习体系构建了一个完整的闭环:通过扩展计算量增加经验积累,通过扩展环境丰富经验多样性,并通过增加评分计算量提高学习信号的准确性。这一尝试标志着行业开始将强化学习从单一模型优化转向系统化、规模化的工程实践。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。