
过去二十年,智能手机围绕 App 运转。智能体则需要持续感知、理解上下文、调用工具,并在用户没有操作手机时代表用户执行任务。
" 这是一次令人兴奋的技术变革,智能体 AI 会创造一种全新的终端工作流程。" 安蒙表示," 我们需要重新思考计算引擎的设计。CPU 需要更强的性能来完成智能体编排,NPU 加速器负责高效的 AI 推理,GPU 负责高度并行的计算,连接能力也比以往任何时候都更加重要。"
高通为智能体 AI 首次同时推出两款 2nm 制程移动旗舰平台——第六代骁龙 8 超级至尊版和第六代骁龙 8 至尊版。

两款平台共享多项核心技术,第六代骁龙 8 超级至尊版位于产品组合顶端,拥有高通最顶级的配置,包括业界首个最高主频达到 5GHz 的移动 CPU、GPU 中首次加入的 Matrix Cores(矩阵核心),以及可以运行 300 亿参数 MoE 模型的 NPU。

高通到底如何围绕 AI," 新造 " 第六代骁龙 8 超级至尊版?
智能体撞上「内存墙」,高通给 CPU、GPU、NPU 同时「动刀」
第六代骁龙 8 超级至尊版最醒目的数字是 5GHz。

这指向 AI 难以绕开的内存墙。" 端侧智能体的主要问题其实还是内存和续航的限制,而非性能的限制。" 高通公司产品技术专家朱元堃对雷峰网表示。
模型推理需要持续读取模型权重、上下文、KV-cache 和中间结果。当数据在系统内存与片上存储之间频繁往返,数据搬运所需的时间和电量也会影响实际性能。
内存墙的挑战同时存在于 CPU、GPU 和 NPU,第六代骁龙 8 超级至尊版如何打破内存墙?
最高主频达到 5GHz 的 Oryon CPU 引入全新 Oryon FlexCache,让 8 个核心访问同一个共享 L2 缓存池,并根据工作负载动态分配资源。智能体处理一连串任务时,数据不必在每次任务交接时都从系统内存重新加载,从而减少任务切换和等待时间。

Adreno GPU 拥有第二代 18MB 独立高速显存 HPM,用于保存渲染瓦片、帧缓冲和中间结果,减少图形管线对系统内存的反复访问,可实现功耗降低 12%。


从片上缓存、系统内存到闪存,高通正在从系统维度解决内存墙挑战。但减少数据等待,只解决了智能体计算的一半问题。
什么是为智能体而生的移动计算平台?
智能体需要持续完成 " 感知—理解—规划—执行 " 的循环,在模型、应用服务、终端设备与云端资源之间选择路径,无法由单一计算单元完成。
全天运行的智能体,需要系统级协同。

在第六代骁龙 8 超级至尊版上,Oryon CPU 负责规划智能体循环,管理控制流程、任务调度和数据移动;Hexagon NPU 运行主要模型,完成推理、内容生成和复杂决策;GPU 中的 Matrix Cores 让 AI 直接进入图形管线;高通传感器中枢则以较低功耗持续处理语音、活动和个人情境。
值得关注的是,高通 Hexagon NPU 加强了对 Transformer 的支持。Hexagon Element Accelerator 针对 Transformer 关键运算,与向量和标量计算单元共同处理数学计算、逻辑判断与专家路由,让全新旗舰平台支持最高 32K Token 上下文,在部分模型上的预填充性能提升最高 80%。
传感器中枢的双 Micro NPU 在性能提升 85% 的同时,功耗降低 20%,可以在不频繁唤醒主应用处理器的情况下,持续处理环境语音、用户活动和个人情境,降低智能体始终在线的功耗成本。
第六代骁龙 8 超级至尊版搭载的 Adreno GPU 性能最高提升 44%,能效最高提升 40%,是高通迄今幅度最大的 GPU 代际跃升,也是高通首次在 Adreno GPU 中加入 Matrix Cores。

当 AI 工作负载不再只由 NPU 承担,CPU、GPU 和 NPU 的分工也开始改变。游戏开发者可以调用 GPU 中的 AI 能力,大型、持续运行且对能效敏感的模型更适合使用 NPU,CPU 则承担智能体编排、任务调度以及部分 AI 计算。
" 真正的突破,不在于某一项技术,而在于这些技术如何协同发挥作用。"Chris Patrick 说。
这套为智能体 AI 革新的计算平台是否有效,最终仍要回到手机上的实际体验。
300 亿参数 MoE 上手机,端侧 AI 从单次问答走向智能体工作流
第六代骁龙 8 超级至尊版能够在端侧运行 300 亿参数 MoE(混合专家)模型,是最直观的证明。
这一模型每生成一个 Token 只需激活约 30 亿个路由参数。300 亿参数决定模型能够容纳多少知识,30 亿激活参数则影响一次推理实际需要多少计算,让模型能力与手机有限的内存、功耗之间出现新的平衡点。
但让 300 亿参数模型真正运行在手机上,仍然需要芯片、推理引擎、模型和存储厂商共同配合。
正如安蒙所说," 高通始终相信强大的合作伙伴关系,我们坚信单一公司无法独自构建这样的未来。智能体体验将催生新的合作伙伴关系,也会带来新的机遇,这需要合作伙伴的力量。"

其中,NPU 与 GPU 双引擎协同的预填充吞吐性能,相比仅使用 NPU 的通用推理方案提升超过 30%。
这组数字更关键的意义,是端侧 AI 开始从一次问答进入完整的智能体工作流。


手机既要完成用户主动发起的工作,也要在用户没有操作时代表用户运行。这比跑出一次漂亮的 AI Benchmark(基准测试)更难,因为每一项能力都要放进有限的电量和散热空间中。
" 智能手机是唯一能够以如此大规模将随身、情境感知和连接这三个要素融为一体的终端。"Chris Patrick 说。
所有任务都留在本地并不现实,但与个人情境、隐私和即时响应有关的部分,距离用户越近,体验就越自然。手机不是最大的计算中心,却是最靠近用户的个人 AI 入口。
从手机到 PC,高通开始围绕「智能体 AI」造芯片
智能体不会只存在于一部手机里。PC、耳戴式设备、眼镜、手表和汽车承担不同任务,也需要共享对用户的理解,让智能体在设备之间保持连续。
手机仍是这套体系的枢纽,它始终随身,汇集最多个人情境,又连接着应用、其他设备和云资源。
不同终端需要的算力规模不同,但对高通而言底层问题一致,如何用异构计算完成不同任务,又如何通过连接让智能体在终端和云端之间保持连续。
高通的计算产品组合正从手机扩展至 PC、汽车等智能体终端,并通过连接云端计算资源,拥有混合 AI 的完整部剧。
而混合 AI 的关键,是让用户感知不到任务在不同计算资源之间的切换。这使高通的角色从提供移动计算平台,进一步延伸到搭建智能体 AI 的计算底座。
" 最好的 AI,不是向你索取更多,而是替你完成更多,并且它是属于你的 AI。" 安蒙说。
从 App 时代进入智能体时代,旗舰 SoC 的竞争标准也在改变。过去,旗舰 SoC 的竞争常由 CPU 和 GPU 的峰值性能主导。未来还要看一颗芯片能否在内存、功耗和散热限制之下,让智能体保持感知、持续推理并完成复杂任务。
5GHz 和端侧运行 30B MoE 模型,是最容易被看见的结果。藏在这些数字背后的数据搬运、异构调度与系统能效,才是第六代骁龙 8 超级尊版真正被重新设计的部分。
AI 手机下一阶段的竞争,不只是谁能把更大的模型装进手机,还要看谁能让智能体在手机有限的内存和功耗中全天运行,并与其他终端和云端保持连续协同。第六代骁龙 8 超级至尊版,就是高通对下一代旗舰标准的回答。