关于ZAKER Skills GEO服务 合作

小米直播烧钱,罗福莉公开后训练大模型!每秒 10 美元

作者 | 汤安迪

编辑 | 周欢

小米集团 MiMo 大模型负责人罗福莉表示:

近半年沉默。我们用这段时间研究一个问题:强化学习(RL)能扩展到多远。

MiMo-V2.6 目前正处于其 RL 运行的中途。我们扩展了三件事:计算资源(每步约 20 亿 token,1568 个提示 × 16 次 rollout,完全异步)、环境和测试框架(多任务代理式 RL,在一次运行中混合多个测试框架),以及评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。我们将在未来几周逐步开源细节。

注意它实际上是在进行 Agentic RL, 因为我们能看到衡量训练效果的测试集是 DeepSWE, 不过从训练时间和得分来看 , 还处于训练早期阶段 .。

目前 mimo-v2.6-pro 的 DeepSWE 得分是 62, 而现在的头部模型比如 DeepSeek-v4.1-flash 是 74.2. 所以训练处于相对早期。

按照 H100 来估算 , 单卡吞吐在 100-150tps 左右的话 , 那么大概就需要 4000-5000 张 H100。注意这还只是训练 pro 用来解码的。还有 flash 模型的 , 算下来大概是 2000-2500 张 H100。

这就是小米的烧钱速度。

END

欢迎点击奇偶工作室视频号,看最新视频 ~

Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

↓↓↓

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容