小米MiMo-V2.6模型训练直播:两天烧掉130万美元,强化学习探索进入深水区
2026/09/18 18:23阅读量 2
小米大模型负责人罗福莉公开MiMo-V2.6系列模型的实时训练数据,截至9月17日累计成本超130万美元。此次直播重点展示强化学习在Agent场景下的扩展能力,Pro版在DeepSWE v1.1测试中表现优于Flash版。此举被视为小米在AI领域三年投入600亿元背景下,对技术路线透明化及商业化验证的重要尝试。
事件概述
北京时间9月15日晚至17日下午,小米大模型负责人罗福莉公开了MiMo-V2.6系列模型(包括Pro和Flash两个版本)的实时训练进度与成本数据。这场被称为“直播”的训练过程不仅展示了高达130万美元的累计算力消耗,还详细披露了训练中的故障处理、测试成绩及强化学习的具体配置。这是小米继今年3月发布早期测试版后,首次以高透明度方式展示核心模型训练细节。
核心信息
1. 成本与进度数据
- 累计成本:截至9月17日15:47,不到两天时间,两款模型累计花费超过130万美元。其中Pro版花费约93万美元,Flash版约41.6万美元。
- 训练步骤:Pro版已完成第14步,正在进行第15步;Flash版已完成第17步,正在进行第18步。
- 性能对比:在软件开发测试DeepSWE v1.1中,Pro版通过率为65.78%,Flash版为60.77%。该测试要求模型在真实开源项目中增加功能或修复问题,且需保证不破坏原有功能。
2. 训练技术与架构
- 强化学习扩展:过去半年团队主要研究强化学习的扩展边界。每个训练步骤包含1568条提示词,每条对应16次尝试,生成约25088条轨迹,单步涉及约20亿token。
- 任务构成:编程类提示词占比最高(Pro版第14步达67.7%),混合视觉、聊天等任务。选择代码任务是因为其需要连续处理问题和上下文管理,有助于提升Agent的综合规划能力。
- 基础设施挑战:页面实时记录了训练故障,如Pro版因显存问题重启,Flash版因基础设施错误从第15步重跑。这反映了大规模分布式训练中的稳定性挑战。
3. 行业反馈
- 多位国际AI研究者(如Meta研究员卢卡斯·拜尔、加州大学圣迭戈分校副教授Yu-Xiang Wang等)关注此次直播,认为公开成本和故障细节具有极高的参考价值,甚至有人建议团队记录更多训练过程中的问题以供社区研究。
战略背景与影响
1. 巨额投入与技术路线
- 小米创始人雷军宣布未来三年在AI领域至少投入600亿元。此次训练聚焦于扩大强化学习规模,旨在提升Agent在后训练阶段的能力。
- 罗福莉指出,除了模型尝试任务的算力,判断结果优劣的“评分算力”同样需要大量资源投入。
2. 组织架构调整
- 7月消息显示,小米调整了小爱同学组织架构:罗福莉带领的MiMo团队负责基础模型能力,其他团队分别负责云端工程建设和端侧(手机、汽车等OS)能力。这种分工意味着模型能力的提升将直接转化为多终端产品的体验优化。
3. 商业化压力
- 随着同行(如DeepSeek V4.1-Flash)也在推进强化学习并降低运行成本,小米面临激烈的市场竞争。其AI编程助手MiMo Code已于7月结束免费期,转为订阅制。用户是否愿意付费使用,将成为检验模型实际价值的关键指标。
