关于ZAKER Skills 合作
雷锋网 59分钟前

Qwen3.8 首日可用,助力存量算力长期有用:智源 FlagOS 开源开放生态共享

阿里巴巴开源超大规模 Mo E 模型 Qwen3.8-2.4T-A95B, 众智 Flag OS 社区同步完成 Day0 多芯片适配。Qwen3.8-2.4T-A95B 已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、隧原等 9 家 AI 芯片上完成基于 Flag OS 统一开源技术栈的多芯适配、精度对齐与部署验证 , 针对不同芯片情况提供包括 BF16FP8INT8 等多种精度的版本 , 开发者可直接获取对应芯片的开箱即用方案。

从今年 2 月首次开展 MiniCPM4.5-o 模型的多芯片 Day0 适配 , 到今天实现 Qwen3.8-2.4T 模型在 9 款芯片上的 Day0 适配 ,Flag OS 已累计完成来自 7 大头部模型团队、12 款主流开源模型、覆盖多达 10 款芯片的跨芯 Day0 适配 , 向 AI 芯片与大模型产业验证了 : 基于统一、开放的系统软件栈 , 实现前沿模型 " —次开发、多芯快速适配 " 已具备规模化落地能力。

本次发布的 Qwen3.8-2.4T-A95B 是阿里巴巴开源模型系列中规模最大、能力最强的一代 , 首次将 Qwen-Max 级别的模型开放出来。主要特性 :

超大规模 Mo E 架构 , 总参数 2.4T, 激活参数 95B, 纯文本模型

编程、专业工作、科研、长程智能体任务能力显著提升 ; 支持 reasoning_effort 调节推理深度,preserve_thinking 保留历史推理

原生 262,144 tokens, 可扩展至 1,010,000; 提供 BF16/FP8 权重 , 兼容 vLLM、SGLang、Token Speed

在 Coding Agent 相关基准测试中 ,Qwen3.8-Max 相比 Qwen3.7-Max 有明显提升 :Terminal Bench 2.1 从 74.5 升至 86.6,SWE-bench Pro 从 60.6 升至 67.7, 接近 Opus 4.8 ( 69.2 ) ,Paper Bench 从 64.8 升至 93.0, 并超过 Opus 4.8 ( 80.3 ) 。

本次 Qwen3.8-2.4T 模型的适配 , 虽然相比 Qwen3.5/Qwen3.6 模型主体结构变化有限 , 但最重要的挑战是模型参数规模比 Qwen3.5-397B 扩大了 6 倍。为了让当下已经部署的主流 AI 芯片能跑起来,Flag OS 需要解决因参数规模巨大带来的一系列系统优化问题。为了解决超大规模参数问题 , 本次 Flag OS 技术栈新增了面向多款 AI 芯片的统 INT8 量化支持 , 通过 Flag OS-Compressor 多芯片模型量化工具链 , 实现了对 Qwen3.8 的 FP8/BF16 原生权重到 INT8 的两条量化压缩路径 , 并完成量化推理算子的在多款 AI 芯片的适配。量化迁移后的权重 , 在多种 AI 芯片上评测 , 与英伟达原生基于 CUDA 的 FP8 版本对照 , 误差平均分偏差均在对齐区间内 , 保证了量化 + 跨芯迁移后的模型质量。基于众智 Flag OS 建立的从编译器、算子库、多芯片框架统一 plugin 等技术 ,Flag OS 团队得以快速完成了模型压缩量化、跨芯适配及验证、精度对齐评测、开源版本发布等重要步骤。

—、从 Day0 适配到规模化验证 : 打通前沿模型与多元算力的 " 首日可用 "

Qwen3.8-2.4T 的多芯片 Day0 适配 , 是 Flag OS 紧跟前沿模型发布节奏、实现新模型 " 首日多芯可用 " 的又一次实践。自今年 2 月首次开展 Day0 适配以来 ,Flag OS 技术团队已在 6 个月内完成 10 余款

这一能力回应了国产 AI 算力产业化落地的两项核心需求 : 一方面 , 使云服务与应用生态能够第一时间部署最新模型 ; 另一方面 , 让既有算力基础设施持续承接模型演进 , 延长使用周期、释放存量算力价值。

1、为国产 AI 算力云服务抢占新模型 " 首发窗口 "

对国内云厂商、智算中心和新兴 Token 算力服务商而言 , 每一次大模型发布 , 都意味着一次新的模型迁移与底层适配。用户希望第一时间在各种国产 AI 算力上使用最新模型 , 但不同芯片的适配链路相对独立 , 往往需要重复投入大量工程资源。上线速度因此不仅是技术能力 , 也直接决定云服务商能否抓住新模型发布后的市场窗口。

这一痛点对中小型 Token 算力服务商尤为突出。由于采购规模和技术资源有限 , 它们往往难以推动芯片厂商针对单一模型开展专项适配 , 也难以长期维持完整的底层适配团队 , 因此更加需要 Flag OS 这样的开源第三方平台提供公共技术支撑。

Flag OS Day0 适配将新模型从发布到多芯可用的周期压缩至 24 小时以内 , 使中小型算力服务商能够基于国产芯片快速上线推理 API 和 MaaS 服务 , 无需重复投入大量人力进行底层开发。

目前 , 腾讯云 HAI 社区、超算互联网等多个云平台已将 Flag OS 适配的模型纳入其容器镜像中心。开发者可直接拉取镜像并部署至云端加速卡 , 快速构建面向自身业务的 MaaS 推理服务。这表明 Flag OS Day0 适配正在从技术验证进一步走向云服务交付 , 缩短国产算力从 " 支持新模型 " 到 " 形成可用服务 " 的最后一公里。

2、让存量算力持续承接前沿模型 :Flag OS 释放硬件投资的长期价值

大模型规模持续增长 , 正在加快 AI 芯片的迭代节奏。对于以多年周期规划和建设的 AI 算力集群基础设施 , 能否持续承载最新模型 , 直接关系到智算中心 AI 服务器的利用率和产业投资的可持续性。Flag OS 希望通过量化、算子优化和跨芯适配 , 为来自多个芯片厂商的存量 AI 算力继续运行前沿模型拓展空间。

以 Qwen3.8-2.4T 为例 ,Flag OS-Compressor 已支持 W8A8 量化 , 将权重和激活由 BF16 压缩至 INT8, 显著降低模型的显存占用与访存压力 , 同时也解决了当下 80% 以上存量 AI 算力不能支持 FP8 的问题。为了让模型在不同代际的国产 AI 芯片上部署 , 通过 Flag OS 技术栈进一步针对量化后的权重规模、单卡显存、卡数、内存带宽以及并行通信方案进行全栈优化 , 让存量的当代和上一代 AI 算力也有机会继续承载最新的超大规模 Mo E 模型。

对智算中心重资产场景而言 , 这不仅是延长设备服役周期的问题 , 更关系到算力投资的长期回报。通过量化与系统软件优化弥补部分硬件代际差距 , 可以提高存量设备利用率 , 缓解因模型快速演进带来的硬件更新压力。其目标并非让旧硬件获得与新一代硬件相同的性能 , 也不是无条件延长所有设备的生命周期 , 而是在部署条件、模型精度和性能表现均可验证的前提下 , 为国产算力持续承接前沿模型提供可持续经济的选择。

相关阅读

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容