关于ZAKER Skills GEO服务 合作
时代财经 1小时前

“天才少女”罗福莉带队登顶开源榜,小米 18 Pro 系列率先搭载,为什么小米非要重金“砸出”自己的大模型?

本文来源:时代财经 作者:赵姝婵 庞宇

9 月 23 日晚,小米 18 Pro 系列正式发布。最受关注的 AI 能力,来自由 Xiaomi MiMo 大模型驱动的超级小爱 2.0:它通过了首个全生态系统级智能体认证,支持一键记忆、自主思考、复杂执行,还能跨设备互通,在平板、PC 上直接处理手机数据。

而支撑这款智能体的底座大模型 MiMo,刚在前一天发布了最新版本。

图源:小米官方

9 月 22 日,小米正式发布大模型 MiMo-V2.6。据测评平台 Artificial Analysis 综合智能指数榜单显示,XiaomiMiMo-V2.6-Pro 以 46 分的成绩登顶全球开源大模型第一、国产模型第一,得分超越 Kimi-K3、Qwen3.8-Max。

MiMo 大模型团队负责人罗福莉在社交平台上开启近 12 小时超长直播,全程展示模型强化学习和训练过程。

这款被官方称为 " 全球开源领域唯一全模态 Pro 模型 " 的背后,是一个加入小米不足一年的 95 后 " 天才科学家 " 和一场 600 亿的 AI 投入。通过采访多位行业专家、接近小米系企业的业内人士,结合罗福莉公开发言,时代财经试图回答一个问题:小米为什么非要重金砸出自研大模型?

低成本、全模态、全面开源

要理解这次登顶的意义,首先需要看懂 MiMo V2.6 Pro 本身的产品、技术特性。

据小米官方资料,MiMo-V2.6 Pro 是全球开源领域唯一的全模态 Pro 模型——能够同时处理文本、图片、视频和音频四种模态。在多个权威评测榜单中,Pro 版在多项任务上达到或超越 OpenAI、Google 和 Anthropic 的同代模型水平。

更关键的是参数效率。训练报告显示,MiMo-V2.6 在参数量与前代不变的前提下,实现了智能水平的代际跃升。也就是说,同样的 " 体量 ",能力翻倍。

背后的原因是训练方法的改变。报告中 Pro 版的强化学习(RL)后训练仅用时 6 天,使用约 75 万条真实任务轨迹,总训练成本为 347 万美元,其中 Flash 版本为 85 万美元,Pro 版本为 262 万美元,每天烧掉约 400 万元人民币。而同等性能水平的海外前沿模型通常需要 20 至 60 倍的成本投入。

同济大学电子与信息工程学院副教授李王明卉向时代财经表示,这个数字真正值得说的,不是 " 便宜 ",而是它把大模型的强化学习后训练变成了 " 可计量的服务能力 "。她指出,这个价格 " 能否持续 " 的答案不在预算,而在环境成本能不能被摊薄," 如果环境搭建、工具执行、结果验证的边际成本继续非线性上升,347 万美元就只是一次漂亮的标杆;如果这些异构环境能被工程化、标准化、复用化,它就会变成一种新的服务定价范式。"

李王明卉所讨论的训练范式能否落地,很大程度取决于团队的工程与科研能力。而小米这套 RL(强化学习)训练范式的主导者,正是加盟小米不足一年的罗福莉。

罗福莉的技术路线和半年答卷

近日,MiMo 大模型团队负责人罗福莉在社交平台开启近 12 小时直播,完整对外展示模型强化学习的全过程,这也是她加入小米后,首次公开回应外界对 MiMo 大模型的技术关注。直播中她直言:" 沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。"

公开资料显示,1995 年出生的罗福莉,本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言研究所计算语言学专业,后任职阿里巴巴达摩院算法专家、DeepSeek 核心研究员。2025 年 11 月正式加盟小米,全面负责 MiMo 大模型业务。外界将她称为 " 天才少女 ",对于这个称呼,罗福莉曾在朋友圈坦言:" 我不是天才少女,被捧得多高,摔得多重。"

强化学习路线正在被验证为有效路径。据公开信息,OpenAI 在今年也大幅提升了 RL 在模型训练中的权重,这与罗福莉团队押注的技术方向一致。

罗福莉的公开帖文中提到,在开源模型阵营中,如果以计算量衡量,MiMo V2.6 是规模最大的单次强化学习模型。在算力资源紧缺的现状下,几十人团队长期聚焦于强化学习方向,既需要科研信念,更离不开攻坚克难的勇气。该模型在训练中期挖掘潜力,再通过强化学习释放能力,最终登顶开源模型榜单。在她看来,MiMo V2.6 背后的研究创新与工程难度,甚至超过自己曾参与部分工作的 DeepSeek R1。

针对行业关注的 MixRL(混合强化学习)与 MOPD(多教师在线策略蒸馏)的技术路线之争,罗福莉解释二者并非对立。团队在代码、智能体等中等难度可验证任务上使用 MixRL,收获了优异的泛化效果;而在长周期、高难度、难以核验的任务上,则单独训练后,再通过 MOPD 整合能力,避免拉低推演效率、产生过拟合。

她半开玩笑地提到,小米团队架构扁平,没有厚重的组织壁垒,落地 MixRL 的阻力很小,跨领域成员紧密协作,直面各类强化学习瓶颈,密集的每日研讨会议见证了模型能力的实时涌现。

生态越大,自研越贵,不做的代价更大

依靠这套强化学习的工程与科研能力,MiMo 拿到了开源榜单的头部位置。但技术跑分之外,更值得讨论的问题是:对以硬件为根基的小米而言,为什么必须自研基础大模型,而不是直接采购第三方成熟模型?

核心答案或许藏在小米的全场景硬件生态与技术战略布局中。

到 2026 年,小米的业务版图已经覆盖手机、汽车、智能家居三大消费硬件生态。AI 能力正在渗透到每一条产品线——从手机端的智能助手,到汽车端的智能座舱,再到智能家居的场景联动。如果这些产品的 AI 能力全部依赖外部模型,意味着小米把最关键的技术层交给了别人。

据公开数据,小米未来三年计划在 AI 相关业务投入不低于 600 亿元,这笔资金将投向 AI 全链条。今年 7 月,小米对 AI 相关业务完成一轮内部组织架构调整:AI 技术链路被拆分为基座模型层、云端工程层、端侧能力层;其中基座模型层由 MiMo 团队负责,端侧能力下沉到手机、汽车等各终端业务线。调整的核心逻辑,是将基础模型打造为集团统一 AI 底座,向全集团各产品线输出 AI 能力。

一位接近小米生态链企业的人士向时代财经透露,在 MiMo-V2.6 发布之前,金山云、金山办公等雷军相关企业已在密切关注小米模型的进展。" 这些企业本身就有大量的 AI 调用需求,现在采取多模型模式,但 MiMo 模型一旦成熟,token 消耗量自然是能起来的。" 随着小米自有大模型逐步走向商用," 生态内优先适配 MiMo,是大概率的事 "。

同济大学电子与信息工程学院副教授李王明卉告诉时代财经, MiMo-V2.6 开源的核心价值,不在于公开模型权重,而是对外释放了一套完整的硬件适配运行体系。

" 小米把手机、车机、家居设备在算力、时延、连接质量、传感器噪声上的巨大差异,一并暴露给了训练系统。" 在她看来,小米庞大的终端生态是一座天然的异构 RL 环境生成器,让模型跳出理想实验室环境的最优解,学会在存在网络抖动、设备断连等突发状况的真实场景中稳定完成任务,这也是 MiMo 模型实用性突出的原因。

不过,优秀的数据并不等同于终局。深耕大模型领域的从业者刘文松(化名)告诉时代财经,在亮眼的开源成绩之下,小米大模型的发展仍面临不容忽视的行业风险与挑战。

首先,榜单跑分第一不等同于实际体验最优,评测数据与真实用户场景体验存在明显差距。多位业内人士坦言,在超长链路逻辑推理、复杂专业运算等高阶任务中,GPT-5、Claude4.5 等闭源顶级模型依旧保持绝对领先优势,MiMo 的综合能力仍有追赶空间。

其次,行业技术竞争日趋白热化,国内 MiniMax、智谱、月之暗面等头部 AI 企业均在加码强化学习技术,纷纷对标前沿 RL 赛道,小米当前的差异化技术优势窗口期正在不断缩短,能否持续维持技术领先性仍未可知。

李王明卉也表示,从分布式调度的角度看,中国 AI 公司在算力利用率上的提升空间,在于让分散、异构、跨域的算力在调度器眼里不再被当成同质资源。她指出,当前很多调度器的隐含假设是 "GPU 小时等价 ",但同样一块 GPU 在不同场景下的有效产出可能差出数倍,调度目标应从 " 最小化完成时间 " 转向 " 最大化有效算力价值 "。

罗福莉说,她想知道 " 强化学习到底可以走多远 "。刘文松认为,这个问题,或许现在是小米自己的问题。347 万美元、6 天训练,换来了全球开源第一的入场券。但入场券也只是开始,从 " 评测第一 " 走到 " 用户觉得好用 ",从 " 开源领先 " 走到 " 商业闭环 " 的路还有很长。

相关阅读

最新评论

没有更多评论了
时代财经

时代财经

企业第一财经读本

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容