
与 x86 竞争对手相比,Vera 在设计上呈现三大显著差异:采用 " 空间多线程 "(spatial multi-threading)技术、搭载 LPDDR5X 内存子系统,以及使用单体计算芯片(monolithic compute die)而非计算芯粒(chiplets)架构。
专为代理式 AI 打造
英伟达表示,Vera 专为代理式 AI 工作负载设计。尽管该类别的性能基准测试尚在定义中,且完整代理链的测量复杂不一,但英伟达称代理式 AI 是 " 历史上最复杂的计算工作负载 "。
通过无头浏览器(headless browser)示例,英伟达展示了 Vera 的优势。在与拥有 96 核心的 AMD EPYC 9655P 对比中,随着浏览器实例规模扩大,Vera 的运行速度提升了 24%。此外,通过剔除 GUI 渲染等非必要环节,智能体浏览工作流速度可提高 4.5 倍。
代码编译是另一项关键参考指标。数据显示,在使用原生 AArch64 目标编译 Linux 内核时,Vera 比 EPYC 9655P 快 22%;在交叉编译为 x86 架构时,速度快 14%。
空间多线程与低功耗内存
Vera 内置的 Olympus 核心具备大型分支预测单元(BPU)、神经分支预测器及 10 宽度指令解码能力。其采用的 " 空间多线程 " 技术将核心资源分离到两个流水线中,允许数据和缓存在线程间移动。SPEC CPU 2017 测试显示,相比传统 SMT 导致资源时间片分割,Vera 的空间多线程能更确定性处理相邻线程需求,减少 " 噪音邻居 " 效应带来的性能波动。
系统层面,Vera 选用 LPDDR5X 而非传统 RDIMM 内存,并通过 SOCAMM2 设计提升可服务性。每个 Vera CPU 主板包含 8 个 SOCAMM2 插槽,提供高达 1.5 TB 容量和 1.2 TB/s 带宽。美光数据显示,其 LPDDR5X 功耗约为传统 RDIMM 的三分之一。英伟达指出,满载 Vera 内存系统功耗仅为 30W 至 40W,而同等配置下 RDIMM 功耗易超过 100W。
市场部署与竞争格局
尽管 Grace 服务器已部署数十万台,Vera 标志着英伟达在代理式 CPU 市场的首次重大举措。该产品已开始大规模部署,英伟达昨日宣布在 SpaceX AI 中启用 Vera。
在归一化单核性能对比中,Vera 在总分上以 3% 优势领先 AMD EPYC 9755。然而,Vera 的真正对手并非 Turin,而是 AMD 于 6 月推出的 Venice,以及 Intel 近期公布的 Diamond Rapids。未来几代产品中,英伟达是否会加倍投入代理式工作负载或进行产品细分,仍有待观察。
【星途科讯 图文丨踢三脚 首发于 ZAKER 科技,转载请注明出处】