关于ZAKER Skills GEO服务 合作
雷锋网 2小时前

为了智能体 AI,高通「新造」了第六代骁龙 8 超级至尊版

" 我们正在从以手机为中心的模式,转向以智能体为中心的新体验。手机、PC、眼镜、可穿戴设备以及汽车,都将成为智能体的终端入口。"2026 骁龙峰会上,高通公司总裁兼 CEO 安蒙说。

过去二十年,智能手机围绕 App 运转。智能体则需要持续感知、理解上下文、调用工具,并在用户没有操作手机时代表用户执行任务。

" 这是一次令人兴奋的技术变革,智能体 AI 会创造一种全新的终端工作流程。" 安蒙表示," 我们需要重新思考计算引擎的设计。CPU 需要更强的性能来完成智能体编排,NPU 加速器负责高效的 AI 推理,GPU 负责高度并行的计算,连接能力也比以往任何时候都更加重要。"

高通为智能体 AI 首次同时推出两款 2nm 制程移动旗舰平台——第六代骁龙 8 超级至尊版和第六代骁龙 8 至尊版。

高通技术公司高级副总裁兼手机业务总经理 Chris Patrick 解释说:" 单一标准,已经无法定义旗舰。保持领导力需要不止一条前进道路。"

两款平台共享多项核心技术,第六代骁龙 8 超级至尊版位于产品组合顶端,拥有高通最顶级的配置,包括业界首个最高主频达到 5GHz 的移动 CPU、GPU 中首次加入的 Matrix Cores(矩阵核心),以及可以运行 300 亿参数 MoE 模型的 NPU。

这些升级背后,藏着一个核心问题,智能体全天运行,到底需要怎样的计算平台?高通给出的答案,是从智能体 AI 需求出发重新设计 SoC。

高通到底如何围绕 AI," 新造 " 第六代骁龙 8 超级至尊版?

智能体撞上「内存墙」,高通给 CPU、GPU、NPU 同时「动刀」

第六代骁龙 8 超级至尊版最醒目的数字是 5GHz。

但 Chris Patrick 强调," 速度只是其中一部分,CPU 还需要快速访问数据。"

这指向 AI 难以绕开的内存墙。" 端侧智能体的主要问题其实还是内存和续航的限制,而非性能的限制。" 高通公司产品技术专家朱元堃对雷峰网表示。

模型推理需要持续读取模型权重、上下文、KV-cache 和中间结果。当数据在系统内存与片上存储之间频繁往返,数据搬运所需的时间和电量也会影响实际性能。

内存墙的挑战同时存在于 CPU、GPU 和 NPU,第六代骁龙 8 超级至尊版如何打破内存墙?

最高主频达到 5GHz 的 Oryon CPU 引入全新 Oryon FlexCache,让 8 个核心访问同一个共享 L2 缓存池,并根据工作负载动态分配资源。智能体处理一连串任务时,数据不必在每次任务交接时都从系统内存重新加载,从而减少任务切换和等待时间。

这也解释了 5GHz 对智能体的真正价值。CPU 不仅要快速完成单个任务,还要缩短整条决策链中每一次调度和交接的等待时间。频率决定计算速度,缓存则决定高频率有多少时间真正用于计算。

Adreno GPU 拥有第二代 18MB 独立高速显存 HPM,用于保存渲染瓦片、帧缓冲和中间结果,减少图形管线对系统内存的反复访问,可实现功耗降低 12%。

高通 Hexagon NPU 的共享内存增加 50%,让模型状态、上下文和 KV-cache 更多留在片上,降低外部 DDR 的访问频率。

第六代骁龙 8 超级至尊版还采用 LPDDR6 内存和 UFS 5.0 闪存。片上空间无法容纳全部模型和长期数据,模型权重可以保存在闪存中,再根据任务加载到内存。

从片上缓存、系统内存到闪存,高通正在从系统维度解决内存墙挑战。但减少数据等待,只解决了智能体计算的一半问题。

什么是为智能体而生的移动计算平台?

智能体需要持续完成 " 感知—理解—规划—执行 " 的循环,在模型、应用服务、终端设备与云端资源之间选择路径,无法由单一计算单元完成。

全天运行的智能体,需要系统级协同。

" 在智能体时代,骁龙平台的每个模块各司其职。"Chris Patrick 说。需要调用云端 API 时,由 CPU 完成调度和路由。多个模型在终端同时运行时,NPU 与 GPU 可以共同承担推理。

在第六代骁龙 8 超级至尊版上,Oryon CPU 负责规划智能体循环,管理控制流程、任务调度和数据移动;Hexagon NPU 运行主要模型,完成推理、内容生成和复杂决策;GPU 中的 Matrix Cores 让 AI 直接进入图形管线;高通传感器中枢则以较低功耗持续处理语音、活动和个人情境。

值得关注的是,高通 Hexagon NPU 加强了对 Transformer 的支持。Hexagon Element Accelerator 针对 Transformer 关键运算,与向量和标量计算单元共同处理数学计算、逻辑判断与专家路由,让全新旗舰平台支持最高 32K Token 上下文,在部分模型上的预填充性能提升最高 80%。

传感器中枢的双 Micro NPU 在性能提升 85% 的同时,功耗降低 20%,可以在不频繁唤醒主应用处理器的情况下,持续处理环境语音、用户活动和个人情境,降低智能体始终在线的功耗成本。

第六代骁龙 8 超级至尊版搭载的 Adreno GPU 性能最高提升 44%,能效最高提升 40%,是高通迄今幅度最大的 GPU 代际跃升,也是高通首次在 Adreno GPU 中加入 Matrix Cores。

过去,图形管线调用神经网络时,数据通常需要离开 GPU 交给 NPU 处理,再把结果送回。Adreno Matrix Cores 让超级分辨率、帧生成等 AI 任务留在图形管线中,也可以加速更通用的 AI 负载。

当 AI 工作负载不再只由 NPU 承担,CPU、GPU 和 NPU 的分工也开始改变。游戏开发者可以调用 GPU 中的 AI 能力,大型、持续运行且对能效敏感的模型更适合使用 NPU,CPU 则承担智能体编排、任务调度以及部分 AI 计算。

" 真正的突破,不在于某一项技术,而在于这些技术如何协同发挥作用。"Chris Patrick 说。

这套为智能体 AI 革新的计算平台是否有效,最终仍要回到手机上的实际体验。

300 亿参数 MoE 上手机,端侧 AI 从单次问答走向智能体工作流

第六代骁龙 8 超级至尊版能够在端侧运行 300 亿参数 MoE(混合专家)模型,是最直观的证明。

这一模型每生成一个 Token 只需激活约 30 亿个路由参数。300 亿参数决定模型能够容纳多少知识,30 亿激活参数则影响一次推理实际需要多少计算,让模型能力与手机有限的内存、功耗之间出现新的平衡点。

但让 300 亿参数模型真正运行在手机上,仍然需要芯片、推理引擎、模型和存储厂商共同配合。

正如安蒙所说," 高通始终相信强大的合作伙伴关系,我们坚信单一公司无法独自构建这样的未来。智能体体验将催生新的合作伙伴关系,也会带来新的机遇,这需要合作伙伴的力量。"

高通与阶跃、无量火、江波龙合作,将 StepEdge-Omni 30B-MoE 完整部署到手机端。通过推理引擎、CPU、GPU、NPU 异构调度和存算协同,模型运行内存需求较常规方案降低超过 50%,预填充速度超过 330 Token/s,解码速度超过 28 Token/s,可以在本地完成邮件理解、行程规划、日历同步、航班酒店推荐和邮件草拟等连续任务。

其中,NPU 与 GPU 双引擎协同的预填充吞吐性能,相比仅使用 NPU 的通用推理方案提升超过 30%。

这组数字更关键的意义,是端侧 AI 开始从一次问答进入完整的智能体工作流。

传感器中枢可以在主应用处理器不必频繁唤醒的情况下持续处理环境信息。个人记录功能可以在获得用户允许后整理对话和重要信息,形成个人知识图谱。Adreno Neural Fusion 让 AI 参与游戏的超级分辨率和帧生成。Spectra ISP 则把图像和视频转化为多模态模型能够理解的上下文。其第二代 AI-ISP 架构将视频吞吐能力提升 2 倍,并首次在搭载骁龙移动平台的智能手机上支持 8K 60fps 视频拍摄。

这些横跨办公、游戏和影像的体验,都指向同一个方向,AI 逐渐成为设备持续运行的一部分。

手机既要完成用户主动发起的工作,也要在用户没有操作时代表用户运行。这比跑出一次漂亮的 AI Benchmark(基准测试)更难,因为每一项能力都要放进有限的电量和散热空间中。

" 智能手机是唯一能够以如此大规模将随身、情境感知和连接这三个要素融为一体的终端。"Chris Patrick 说。

所有任务都留在本地并不现实,但与个人情境、隐私和即时响应有关的部分,距离用户越近,体验就越自然。手机不是最大的计算中心,却是最靠近用户的个人 AI 入口。

从手机到 PC,高通开始围绕「智能体 AI」造芯片

智能体不会只存在于一部手机里。PC、耳戴式设备、眼镜、手表和汽车承担不同任务,也需要共享对用户的理解,让智能体在设备之间保持连续。

手机仍是这套体系的枢纽,它始终随身,汇集最多个人情境,又连接着应用、其他设备和云资源。

不同终端需要的算力规模不同,但对高通而言底层问题一致,如何用异构计算完成不同任务,又如何通过连接让智能体在终端和云端之间保持连续。

高通的计算产品组合正从手机扩展至 PC、汽车等智能体终端,并通过连接云端计算资源,拥有混合 AI 的完整部剧。

而混合 AI 的关键,是让用户感知不到任务在不同计算资源之间的切换。这使高通的角色从提供移动计算平台,进一步延伸到搭建智能体 AI 的计算底座。

" 最好的 AI,不是向你索取更多,而是替你完成更多,并且它是属于你的 AI。" 安蒙说。

从 App 时代进入智能体时代,旗舰 SoC 的竞争标准也在改变。过去,旗舰 SoC 的竞争常由 CPU 和 GPU 的峰值性能主导。未来还要看一颗芯片能否在内存、功耗和散热限制之下,让智能体保持感知、持续推理并完成复杂任务。

5GHz 和端侧运行 30B MoE 模型,是最容易被看见的结果。藏在这些数字背后的数据搬运、异构调度与系统能效,才是第六代骁龙 8 超级尊版真正被重新设计的部分。

AI 手机下一阶段的竞争,不只是谁能把更大的模型装进手机,还要看谁能让智能体在手机有限的内存和功耗中全天运行,并与其他终端和云端保持连续协同。第六代骁龙 8 超级至尊版,就是高通对下一代旗舰标准的回答。

相关阅读

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容