关于ZAKER Skills GEO服务 合作
雷锋网 1小时前

从「算得快」到「干得了活」:AI 推理时代,CPU 如何重塑算力版图

记者:郭思

编辑:包永刚

" 善弈者谋势,不善弈者谋子。" 这句古老的智慧,正精准地映射出当下 AI 产业的演进轨迹。

当行业狂热于大模型训练阶段的算力军备竞赛时,一场更为深刻的重心迁移正在悄然发生,AI 已经从回答问题走向解决问题,从单纯的模型训练走向复杂的智能体推理。这种转变对底层算力架构的冲击,远比表面看起来要深远得多。

如果说训练阶段是 GPU 闷头计算的大兵团作战,那么推理时代则是一场需要精密调度的现代化战争。

在这场变革中,英特尔在 9 月 22 的 Connection 大会上给出了一个明确的判断:推理时代,CPU 正从 " 配角 " 蜕变为整个系统的 " 控制中枢 "。当 AI 真正开始干活,算力的定义正在被重写。

01、数字 AI:当智能体规模化,CPU 为何重回 C 位?

想要理解 CPU 的 " 逆袭 ",核心是厘清智能体执行与传统模型训练的本质差异。模型训练是标准化、可并行的批量任务,核心目标是极致提升整体吞吐量;而智能体是典型的串行状态机,每一步任务执行都依赖上一步的输出结果,任意环节的微小延迟,都会沿着任务链路层层放大,最终影响整体智能体验。这也意味着,传统 CPU 一味追求平均吞吐的优化思路已然过时,稳定、可控、超低的端到端延迟,成为智能体规模化落地的核心硬性约束。

不仅如此,智能体场景的硬件负载矛盾愈发突出。高并发工具调用与高带宽 AI 推理任务需要在单芯片内混跑,二者对内存资源的需求相互冲突,叠加多租户场景下的安全隔离、资源独占需求,传统 CPU 架构的短板彻底暴露,架构革新与系统重构势在必行。

对于这一难题,英特尔并没有选择惯用的单点堆砌参数,而是从系统层面重新划分数据中心的架构。

大会现场,英特尔数据中心集团副总裁、中国区总经理陈葆立表示," 未来的数据中心将被拆分为三类集群:负责智能体执行和任务编排的 CPU 集群、负责模型推理计算的 GPU 集群,以及承载长对话、文档等持续新增业务数据的存储集群。这三类集群之间的数据调度,全部由 CPU 完成。"

落到产品上,采用 Intel 18A 制程、最高拥有 288 个能效核的至强 6+ 处理器配合智能体套件,单颗即可部署近千个智能体。

英特尔表示,这一优势并不是凭空想象,而是有着实测数据支撑:

在 SWE-bench 测试中,其单智能体性能领先竞品 15%;在云端沙箱场景下,面对 10 分钟内批量启动上万沙箱、单沙箱延迟 200ms 以内的严苛要求,至强 6+ 支持 350 个沙箱并发,性能约为竞品的 1.46 倍。结论显而易见:在智能体场景下,性能和响应速度缺一不可。

而另一方面,CPU 在三个具体环节上的价值也十分突出。首先是异构数据预处理,智能体需要抓取网页、视频、PDF 等素材并做文本提取,这类任务 GPU 并不擅长,而至强 AMX 加速器让向量化和重排序分别达到基准的 2 倍和 4 倍。

其次是存储调度,从 HBM 到 DRAM 再到本地 SSD,成本和延迟呈反向变化,CPU 作为核心调度者,联合焱融科技基于至强 6 和 MRDIMM 的方案,在 MLPerf Storage v3.0 中拿下了 Llama3 检查点读写和 3D-Unet 训练两项全球第一,有效消除了存储瓶颈。

最后是 KV Cache 管理,面对百万 Token 上下文约 300GB 的容量,英特尔的 KV Cache 智能加速套件通过 QAT 实现无损压缩,将 300GB 原始数据压至 200GB,并借助 DSA 引擎将数据搬运最高加速 9.66 倍。

把这一系列环节串联起来,便能得出清晰结论:步入智能体时代,GPU 承载 " 智 " 的核心推理运算,而 CPU 既要承担基础计算,更要扛起全局 " 管 " 的重任。随着业务规模扩张,这套调度管控工作的复杂度呈指数级攀升,而这恰恰是英特尔长期积淀形成的独有优势。

02. 物理 AI:控制、成本与算法路线的破局

如果说数字 AI 的战场在云端,那么物理 AI 的征途则在真实的物理世界。

" 我们希望当大家提到物理 AI 时,第一个想到的厂商是英特尔。" 雷峰网 雷峰网

英特尔副总裁兼端侧计算和物理 AI 事业部中国区总经理高嵩在 Connection 大会上这样表态。

这句话说起来容易,但落地起来实际难度却不少。

物理 AI 与数字 AI 的核心差异在于,机器人必须与真实物理环境交互。行业里一个现实的痛点是:让机器人跳舞容易,做精密操作难。

这一现象的难点在于控制,对于机器人而言,动态环境下的实时感知与精准执行,目前仍是巨大的瓶颈。

第三代酷睿 Ultra 的应对方案是 " 大小脑融合 "。依托 XPU 异构架构,推理决策与实时运动执行被整合在单颗 SoC 上。其中,CPU 作为 " 小脑 ",以 4kHz 的控制频率每秒完成 4000 次动作调整,保障关节电机精准响应;GPU 承载高阶 AI 推理,在 Pi0.5 精度下推理时延仅为 78 毫秒,低于人类视觉 200-250 毫秒的平均反应时间;NPU 则面向视觉感知,YOLOv12n 推理仅需 3.55 毫秒,每秒处理约 280 帧,远超普通摄像头 60 帧的输出上限。

传统方案需要多个独立单元分工处理感知、决策和控制,不仅响应慢,还容易出现协同偏差。单芯片整合后,工程师得以将精力从底层调优转移到上层智能开发。

在成本方面,具身智能的 Token 消耗随用户量线性增长。某具身企业创始人透露,工程师一下午的训练就能烧掉数百美元。

对于这一难点,英特尔的思路是通过硬件负载整合降低底层开销,将推理决策和运动控制统一到单颗 SoC 的异构架构上,从硬件层面压缩算力冗余和能耗,把整体拥有成本拉到可商业化的区间。

而在算法路线上,具身领域目前没有统一范式,世界模型、VLA 等路线仍在并行演进。芯片架构设计周期长达两到三年,押错路线的代价极其高昂。

面对这个问题,不同于很多厂商一味强调 " 靠近客户需求 ",英特尔提供了一个更辩证的思路——不仅要倾听客户的声音,更要有自身的战略判断。" 我们也希望用我们自己内部的前瞻视角、结合自身的架构优化,与最广泛的生态进行合作,找准技术落地的正确方向,这是认知智能体发展在当下需要完成的事情。" 高嵩表示。

英特尔的差异化策略在于:不盲目追随单一算法路线,而是以开放的架构和生态,支撑多种算法范式的并行验证与快速迭代。

目前,英特尔已联合科通工业、神州数码等合作伙伴推出基于第三代酷睿 Ultra 平台的具身智能开发套件,并携手多家伙伴面向制造、建筑、医疗、智慧城市、仓储物流、酒店等多种场景推进项目从原型走向量产,以生态的广度对冲算法路线的不确定性。

此次,英特尔也正式宣布,英特尔具身套件将于 11 月份在京东上线,也意味着,开发者离触手可及的机器人又近了一步。

写在最后

正如开篇所言,在 AI 从算得快走向干得了活的今天,系统设计的重心正在向执行面迁移。

英特尔在数字 AI 侧的判断是:推理和智能体部署放大了 CPU 侧的系统工作,而 x86 在控制面、生态适配和基础设施软件上的存量优势,正好能接住这个需求;在物理 AI 侧,则用异构 SoC 缩短机器人的感知 - 决策 - 控制闭环,靠生态广度对冲算法路线的不确定性。

不一定完全会用到所有的算力,但提供一个最优的系统级选择,也许便是生产力提高的关键。

当 AI 真正开始解决现实问题,算力的版图,已然重塑。

相关阅读

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容