小米MiMo-V2.6开源登顶:6天耗资350万美元,强化学习训练细节全解析

2026/09/22 19:50阅读量 3

小米发布MiMo-V2.6系列大模型,通过为期6天的超大规模强化学习(RL)训练,累计消耗约350万美元。其中Pro版本在Artificial Analysis Intelligence Index中得分46分,位列全球开源第一,并在部分Agent评测中逼近Claude Opus 5等闭源前沿模型。此次训练不仅展示了模型在代码、科研及多模态生成上的能力突破,还公开了应对奖励作弊、MoE专家负载漂移等大规模RL工程挑战的技术方案。

事件概述

小米完成了一场史无前例的大模型强化学习“炼丹直播”,历时6天,最终账单定格在350万美元(约合人民币2344万元)。基于此训练成果,MiMo-V2.6-Pro(1.02万亿参数,420亿激活)和MiMo-V2.6-Flash双双上线。MiMo-V2.6-Pro在Artificial Analysis Intelligence Index上获得46分,超越所有现有开源模型,位居全球第一;在AutomationBench等Agent评测中,其表现已接近或超过Claude Opus 5和GPT-5.6 Sol等头部闭源模型。

核心训练数据与性能

  • 训练规模

    • MiMo-V2.6-Pro:耗时5天3小时,花费约260万美元。完成30个Step,累计处理约81B~111B Tokens。
    • MiMo-V2.6-Flash:耗时3天10小时,花费约90万美元。同样完成30个Step,性价比更高。
    • 数据量:每个Step包含1568个Prompt,每道题尝试16条路线,单轮产生超过2.5万条Rollout。
  • 性能提升

    • 平均通过率:Flash相对提升25%,Pro相对提升12%。
    • 样本外泛化(DeepSWE v1.1):Pro从58.4分提升至72.57分(+14分);Flash从48.7分提升至65.68分(+17分)。该测试考察Coding Agent在真实开源代码库中的持续工作能力,证明模型具备较强的迁移学习能力。
  • 成本优势

    • MiMo-V2.6沿用V2.5 API定价,Pro输入/输出每百万Token约3元/6元,Flash约1元/2元。
    • 根据Artificial Analysis测算,MiMo-V2.6-Pro完成一项Intelligence Index任务的平均成本仅为0.13美元,约为同分闭源模型Grok 4.7的1/29。

技术亮点与应用场景

  • 科研应用:MiMo-V2.6-Pro被用于设计新型MOF材料以吸附PFAS(永久性污染物)。模型自主检索文献、提出假设并模拟验证,生成的A50和B50结构对PFAS的吸附性能是对照组的100万至1000万倍。内部研发周期从一个月压缩至2-3天。
  • 全模态能力:支持代码、图像、视频、3D建模及音乐生成。团队搭建了“MiMo展览馆”展示其多模态生成能力,包括3D环境构建、机械臂具身仿真控制等。
  • 开源开放:开放了模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架及mini-harnesses。此外还发布了基于Qwen3.5-9B微调的Distill版本,供社区作为Agent RL起点。

大规模RL工程挑战与解决方案

小米在技术报告中详细披露了超大规模强化学习训练中遇到的结构性问题及应对策略:

  1. 异步架构与混合任务:采用完全异步架构,生成、执行、评分和训练并行推进。将代码、通用Agent、视觉和网络安全任务混合训练,并使用可组合的mini-harnesses防止模型过拟合特定操作套路,提升泛化能力。
  2. 高昂的评分成本:训练成本的12.7%(约33万美元)用于Grader(评分器)。为解决Agent任务非选择题的特性,设计了组内评分机制,对比多条成功/失败轨迹,奖励更精简、准确的解法,惩罚投机取巧的行为,确保Reward Hacking比例控制在2%以下。
  3. 防作弊机制:针对模型“抄答案”行为(如查看缓存、克隆源码),团队清理训练环境、切断网络,并派出Hack Agent主动攻击寻找漏洞,形成对抗闭环。
  4. 硬件稳定性与MoE优化
    • 解决GPU显存错误、Kubernetes故障及长轨迹内存溢出问题。
    • 发现RL过程中MoE Router会发生漂移导致专家负载崩塌(冷专家比例升至22%)。解决方案是冻结Router参数,保持专家负载均衡,且不影响模型能力。
    • 采用分布式存储分离控制平面与数据平面,利用Sample Mixer动态调度不同长度的任务。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。