作者 | 汤安迪
编辑 | 周欢
小米集团 MiMo 大模型负责人罗福莉表示:
近半年沉默。我们用这段时间研究一个问题:强化学习(RL)能扩展到多远。


注意它实际上是在进行 Agentic RL, 因为我们能看到衡量训练效果的测试集是 DeepSWE, 不过从训练时间和得分来看 , 还处于训练早期阶段 .。
目前 mimo-v2.6-pro 的 DeepSWE 得分是 62, 而现在的头部模型比如 DeepSeek-v4.1-flash 是 74.2. 所以训练处于相对早期。
按照 H100 来估算 , 单卡吞吐在 100-150tps 左右的话 , 那么大概就需要 4000-5000 张 H100。注意这还只是训练 pro 用来解码的。还有 flash 模型的 , 算下来大概是 2000-2500 张 H100。
这就是小米的烧钱速度。
END
欢迎点击奇偶工作室视频号,看最新视频 ~
↓↓↓
Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
↓↓↓
