关于ZAKER Skills GEO服务 合作
手机中国 12分钟前

小米正式发布并开源全新一代 MiMo 大模型 国产第一

【CNMO 科技消息】小米正式发布并开源 Xiaomi MiMo-V2.6 系列。这是小米探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中不断拓展智能边界。MiMo-V2.6 系列包含 Pro 和 Flash 两个原生全模态模型。

Xiaomi MiMo-V2.6

得益于 RL 算力的扩展,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强的开源模型;但与最强的闭源模型 Claude Fable 5.1 和 GPT-6 Astra 相比,仍有差距。

MiMo-V2.6 系列沿用 V2.5 系列的 API 定价。智能提升,价格不变," 智能 - 成本 " 的帕累托前沿由此再度向外推进。MiMo-V2.6-Pro 刷新了国产模型的性价比纪录:在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。

大规模扩展 RL 并全面开源

在 RL 训练阶段,MiMo-V2.6 可能是目前国产开源模型中投入算力最多的模型之一。经过大规模、多任务强化学习训练,MiMo-V2.6-Pro 在多数 Agent Benchmark 上取得了比肩 Claude Opus5 和 GPT-5.6 Sol 的效果,MiMo-V2.6-Flash 则全面超越 MiMo-V2.5-Pro。

历时不到 6 天,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 训练成本分别约 85 万与 262 万美元,各完成 30 步,累计约 75 万条轨迹;训练任务平均通过率分别相对提升 25% 和 12%,样本外的长程软件工程评测基准 DeepSWE v1.1 分别提升约 17 分(48.8 → 65.68)和约 14 分(58.4 → 72.57),体现出 RL 较高的样本效率、持续改进能力和样本外的泛化能力。

本次训练主要从三个维度扩展 RL 算力:更大的 Batch 与更高吞吐,结合大 Batch 和全异步架构,单次更新使用 1,568 个样本,支持 1M 上下文长度训练,单步训练 Token 达 2.7 至 3.7B;更多任务与复杂环境,构建覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系,并混合多个 Harness;更大的 Grader 算力,通过 Group 内相对比较,为 Long-Horizon RL 任务提供更精准、多样的奖励信号,形成模型自我改进闭环。

随着训练规模扩大,小米冻结 MoE Router 以抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的 Reward Hacking 防线。为支撑大规模混合任务的智能体强化学习,团队设计了统一的轨迹表示与惩罚机制,支撑多种智能体框架的高并发交互,解耦控制面与数据面以支持海量轨迹的迁移,在混合批次中稳定各任务的样本配比,并优化训练与推理引擎的效率及一致性。小米已开源上述技术成果及配套资源,包括完整技术报告、训练环境与 RL 代码。

从 Vibe Coding 到 Vibe World

MiMo-V2.6 融合了 3D 空间推理、多模态感知与计算机操作(CUA)能力,进一步拓展了编程所能触及的边界,可将自然语言驱动的编程任务拓展为面向交互世界构建的 "Vibe World"。

在 3D 开放世界游戏中,用户输入图片、视频或文字后,MiMo-V2.6 会将需求拆解为多个任务,由多智能体协作完成游戏 3D 场景搭建、交互逻辑编写与视觉验证,并根据渲染结果不断修正,最终生成符合用户意图的可运行交互世界。在 Blender 3D 建模中,MiMo-V2.6 能够根据用户的文字描述或参考图片,在 Blender 中完成物体与场景的三维建模,生成可用于动画制作、3D 打印与游戏开发的 3D 资产。在具身智能方面,MiMo-V2.6 在具身仿真环境中可直接以多视角相机画面为输入,持续进行推理与决策,并通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配与精准放置。在 Computer Use Agent 方面,MiMo-V2.6 将多模态感知与原生训练的行动能力相结合,可理解复杂图形界面,使用常见办公与生产力工具,完成信息检索、编辑和数据处理等任务,并根据视觉反馈检查结果、排查问题、调整后续行动。

推动前沿科学研究

未经针对科研任务的专项强化学习训练,MiMo-V2.6 已在多个研究领域展现出应用潜力。在材料科研方面,MiMo-V2.6-Pro 协助研究人员完成材料设计与计算筛选,提出了数种金属有机框架(MOF)材料的设计方案,目标是吸附被称为 " 永久性污染物 " 的全氟和多氟烷基物质(PFAS),并调用开源计算工具开展 " 干实验 ",计算设计出的 MOF 材料与 PFAS 之间的结合强度,筛选出最有潜力的候选材料。在形式化数学证明方面,MiMo-V2.6-Pro 协助研究员在 Lean 4 中完成了 Li – Yorke 经典论文《周期三蕴含混沌》原始主定理的完整形式化,项目最终形成 6000 余行 Lean 源码,完整证明通过 Lean 内核核验,无未完成证明占位。

代码驱动的内容创作与审美表现

MiMo-V2.6 系列大幅提升了模型创建精美数字产品的能力,涵盖前端网页、Figma 设计稿、幻灯片、SVG、视频、音乐等。在设计评测榜单 Design Arena 上,MiMo-V2.6-Pro 取得了与 Claude Opus 5、GPT-5.6 Sol 相近的水平。MiMo-V2.6 可将简单指令转化为完整的前端界面和 PPT,熟练运用 Figma 和图像 / 视频生成工具;在视频创作中,能端到端完成视觉设计、镜头与动效编排、配乐合成及节奏卡点,并调用 MiMo-V2.5-TTS 合成旁白;在音乐创作中,MiMo-V2.6-Pro 根据要求创作了一首包含约十种乐器的管弦乐作品,完成乐谱生成后自主将其转换为 MIDI。

全面开源与使用方式

小米全面开源 MiMo-V2.6-Pro、Flash 模型权重与技术报告,同步开放 MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究资源。开源内容包括:7k+ 高质量 RL 任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务;端到端 RL 训练框架,基于 verl、uni-agent 和 mini-swe-agent;轻量可组合的 Harness,开源极简 mini-harnesses。

使用方面,MiMo Desktop 桌面客户端及会员订阅方案同步上线,MiMo-V2.6 系列已上线 Xiaomi MiMo 开放平台,API 价格维持不变。MiMo-V2.6-Pro 于开放平台提供 UltraSpeed 超高速模式可选,提供最高 20 倍的输出速度。

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容