2026 年 9 月 19 日,华为全联接大会 2026" 携手业界主流开源社区,解锁昇腾创新新动能 " 专题论坛在上海圆满举行。本次论坛汇聚了 Linux 基金会、PyTorch 基金会、vLLM 社区、郑州先进实验室、魔搭社区以及 Ascend for PyTorch 社区优秀开发者等多方社区专家,共同探讨在 AI Agent 时代,如何通过开源协作、软硬协同及训练范式演进,构建开放、可持续的 AI 产业生态。


昇腾携手 PyTorch 开源共建,开拓 AI 生态新时代
华为昇腾 AI 框架生态负责人王神迪在演讲中表示,AI 模型持续突破规模与复杂度边界,AI 生态面临新挑战,昇腾深耕 AI 产业八年,已建成中国最具活跃度和影响力的开放 AI 产业生态。自 2020 年昇腾与 PyTorch 合作起步,到今年 7 月 PyTorch 官网正式上线 Ascend NPU,成为官方支持首个中国硬件以及 9 月 9 日 PyTorch Conference China 2026 峰会联合基金会的超节点 Live Demo 首秀,都标志着昇腾正全面融入 PyTorch 官方原生生态。目前,昇腾正通过重构百万测试用例、接入官方 CI/CD 体系等,与 PyTorch 从适配对接迈向生态共建。其中 CICD 系统已实现上游 PR 可见昇腾 CI 结果,成为首个达成社区 CI 系统 L3 标准的中国硬件。Ascend for PyTorch 社区自 26 年 5 月成立以来,已汇集社区一千多位核心开发者,外部 PR 占比超过 50%,成为中国发展最快的 AI 社区,同时社区还推出了一系列课程、开源项目及社区任务,提供多种激励模式和在线算力资源,呼吁广大开发者可以一起参与开源共建。

开放系统加速 AI 演进,共建统一 AI 框架生态
Linux 基金会中国区总监、PyTorch 基金会亚洲区总监 李昊阳进行了《OPEN SYSTEMS LEARN FASTER》议题分享。演讲指出,当前 AI 时代从硬件、基础设施到训练推理及 Agent 层,均有重要开源技术支撑,国内 AI 硬件虽呈现百花齐放的多样化态势,但若软件栈各自为战将导致严重碎片化,因此需要开放系统促进开发者协作共建统一工作流。同时强调,模型、框架与硬件相互牵动,形成持续演进的循环,开放系统能让金融、电信等不同领域共享反馈、协同迭代。PyTorch 基金会采用 Ecosystem 到 Hosted 的两级孵化体系,现已托管 vLLM、DeepSeep、Ray 等项目,并且由昇腾团队主导的 Accelerator Integration Working Group,正在推动 "PyTorch 跑在任何云、任何加速器上 " 的战略。PyTorch 2.14 发布、昇腾 CI 达到 L3 水平等,均是开放协作的成果。

vLLM Ascend 突破长序列 KV Cache 存储瓶颈
vllm-ascend Maintainer 雷超分享了《KVPool 与 DSA KV Offload 在 vLLM Ascend 中的进展与规划》议题。在 KVpool 方面,面对混合注意力、混合架构带来的缓存语义异构与前缀缓存规则不统一等挑战,实现了 Multi KV Group 支持,存储上支持 SSD 卸载,传输上支持超平面内存语义,链路更短、带宽更大,优化 Layerwise 后,在 GLM-5.2 TP16 上使 TTFT 降低 21%-30%。在 DSA KV Offload 方面,针对长序列下片上内存容量不足的问题,长期选择 KV Offload 方案,使用冷 KV 卸载至 CPU DRAM、异步加载、叠加两层 Overlap 等技术,吞吐达 DCP 方案的 2.8 至 3.8 倍。未来将持续优化 Layerwise、构建跨超节点的大规模内存池、开发融合算子,并与 vLLM 社区探索动态方案。

基于 AscendNPU IR 打造 ACAGEMMs 算子自动生成系统
郑州先进实验室 - 编译实验室技术部部长 吴昊 在《ACAGEMMs:基于 AscendNPU IR 的算子自动生成 》介绍了 ACAGEMMs 算子自动生成系统。议题指出,大模型生成 Kernel 只是起点,真正交付还需经过编译、正确性验证、性能优化与泛化测试。
ACAGEMMs 系统以涵盖语义、输入域、边界条件、验收标准和运行环境的任务契约贯穿生成、验证、测量与交付全过程,依托候选树、证据链、经验树三大机制管理搜索、验证与经验复用,并设置编译、正确性、性能三层 Gate 对候选做静态预检与归因筛选,失败证据反向约束下一轮搜索,避免浪费真机资源。在昇腾 A2 上的测试表明,该系统能有效筛选高质量候选,加速比达 1.42,Token 消耗降低 55%。团队作为 FlagGEMS 等项目的核心贡献者,致力于通过开源分享降低算子开发门槛,推动编译器技术进步。

从预训练到训练服务化,ms-swift、Tinker 助力高效训练
魔搭社区技术专家 胡景涵发表《模型训练范式:从微调到自进化和训练服务化》演讲,首先回顾大模型训练技术从 2018 年 BERT/GPT 开启预训练时代一直到 2026 年自进化训练兴起的演进历程,随后指出开发者仍需训练模型,原因包括私有领域知识注入、行为可控性与安全对齐、大模型能力蒸馏到小模型、基模知识持续更新。为降低训练门槛,魔搭社区推出 ms-swift 框架,覆盖训练、推理、评估与量化部署,支持多种模型与算法;并提出服务化训练框架 Tinker,开发者无需本地显卡即可远端训练。社区还提供 NPU 支持文档与镜像,并持续进行框架底层重构,欢迎开发者共建。

Ascend for PyTorch 的开发之旅,从代码使用者变为上游贡献者
Ascend for PyTorch 社区开发者 王贝琦在《从 " 支持 " 到 " 共建 ":我的 Ascend × PyTorch 开源实践》议题中分享了参与昇腾社区贡献的经历与心得。通过 PyTorch 原生 API 的 NPU 验证工作和上游社区测试用例解耦任务体会到 " 能跑通只是起点 ",真正的目标是行为与生态完全对齐,共建 NPU 生态并非为 NPU 添加特殊分支,而是帮助上游实现特性设备无关。议题中将 " 从支持到共建 " 总结为四步:代码跑通、在 NPU 上正确运行、API 测试与文档生态完全对齐、将通用能力回馈上游。开发者可以从小处着手,一个 API、一条测试、一个 Issue 或 PR 都能成为开源协作的起点,从代码使用者变为上游贡献者。

本次论坛充分展示了昇腾与开源社区紧密合作的成果,以及各方在 AI 基础设施、框架生态、推理优化及训练范式上的最新进展。面向未来,昇腾与业界开源社区持续深入协作,共建 AI 产业繁荣开放新生态。