【太平洋科技快讯】7 月 31 日,华为官宣,openPangu-2.0-Pro 模型及技术报告正式开源上线。

此前在 HDC 2026 华为开发者大会上,华为常务董事、终端 BG 董事长余承东正式发布了开源盘古 openPangu 2.0。该系列分为 Flash、Pro 两款模型,统一支持 512K 超长上下文窗口,两款模型参数规格存在区分:
openPangu-2.0-Pro 总参 505B、激活参数量 18B
openPangu-2.0-Flash 总参 920B、激活参数量 6B
6 月 30 日,openPangu-2.0-Flash 大模型已正式开源。
今日, openPangu-2.0-Pro 模型 ( 模型权重、基础推理代码 ) 及技术报告也开源上线了。
openPangu-2.0-Pro 为混合专家 MoE 架构大语言模型,整体参数量 505B,单Token激活参数 18B,训练数据集总量达 34 万亿 Token。模型经过多轮后处理优化,融合快慢一体化监督微调、多场景专项强化学习,并借助在线蒸馏技术统一综合能力。
该模型在底层架构完成多重技术迭代:注意力模块沿用轻量化 MLA 方案,搭配 DSA+SWA 分层混合结构,层级配比 1:2,分别处理局部文本窗口与全局稀疏信息,在保障输出精度前提下,大幅削减长文本推理阶段算力、显存占用;网络拓扑改用四分支 mHC 残差结构,增强特征表达多样性与泛化性能;新增三头 MTP 自投机模块,单次可并行预测 3 个 Token,有效提升推理吞吐;训练环节引入 Muon 优化器,加快模型收敛效率。