关于ZAKER Skills GEO服务 合作
全天候科技 49分钟前

英伟达副总裁 Ian Buck:从 Vera Rubin 平台看 Agentic AI 时代的算力演进

AI 时代的硬件降本逻辑重构

" 降低词元成本最有效的方式,绝非降低 GPU 售价或使用低成本网络,而是每一代都交付大幅提升的算力性能。如果将节点或机架的性能提升 10 倍到 30 倍,这种性能提升会直接作用于计算公式的分子,从而降低整个数据中心每个词元的成本。"

解析

传统 IT 采购习惯通过压低硬件单价来控制成本。然而在 AI 工厂时代,算力性能的提升呈指数级(10 倍至 30 倍),对 TCO 的拉动作用远超芯片单价的微调。因此,通过提升性能来摊薄单位算力成本,远比单纯采购低价硬件更为高效。

Agentic AI 排除人工干预,引发算力消耗剧增

" 智能体让人类退出了这个交互循环,计算资源的消耗速度完全取决于智能体自我转折与思考的速度。以前服务设计者可以依赖‘人类阅读和打字需要时间’这一间隙来调度算力,而现在智能体自我提问和转折极快,在 AgentX 基准测试中,算力需求在纯数值层面直接提升了 100 倍。"

从 Chat 模式跨越到 Agentic AI,算力需求迎来了范式转变。过去云服务调度的底层假设建立在人类反应与输入速度受限的基础上,而 Agent 移除了 Human-in-the-Loop 的缓冲,使算力进入无缝且高频的满载状态。

评价 AI 芯片的核心指标发生转移

" 对于每一代算力产品,我们考虑的不只是绝对词元性能,唯一关键的指标是每兆瓦(MW)的总词元吞吐量。提高这一指标,就能提升 AI 工厂产生营收的能力。"

AI 硬件评价体系正在发生重塑。行业评估标准已从追求单芯片 FLOPs 或单卡跑分,转向评估数据中心的电能转换效率(Tokens per Megawatt)。算力的核心价值不再局限于峰值性能,而是体现为将电能转化为实际营收的效率。

通过软件挖掘数据中心 40% 的隐性产能

" 通过软件在机架与固件层面动态管控功耗,确保其永不超出阈值,可以在完全相同的预留电力包络下部署多达 40% 的机架,直接将吞吐量提升至每秒 12 亿词元。"

数据中心按照硬件最大峰值功耗预留电力的静态部署模式已被打破。在电力供应受限的客观条件下,利用 MaxLPS 等软件定义电力技术,无需新建数据中心或增加电力配额,即可在原有电力包络内提升 40% 的 GPU 部署密度。

Ian Buck:从 Vera Rubin 平台看 Agentic AI 时代的算力演进

目录

引言:二十五载计算演进与数据变换的力量

范式转变:从 2023 年的 Chat 基准测试到智能体 AI 工作负载

认识 Vera Rubin:面向智能体计算的全栈架构

极致延迟与吞吐量:Groq LPU 集成与 Olympus 核心

生态系统与扩展:NVLink Fusion、智能存储与 MaxLPS 功率管理

展望未来:按年度节奏交付 AI 基础设施路线图

引言:二十五载计算演进与数据变换的力量

Ian Buck: 今天我将分享如何面向智能体 AI 时代推进基础设施建设,这本质上代表了推理含义的新时代。我会从我的工作视角分享一些看法,并介绍我们正在研发的创新技术,让这里的社区了解我们正在构建的产品。同时,我也会详细介绍 Vera Rubin,说明过去几年甚至仅在过去一年中发生的巨大变化,以及我们在高层面采取的应对措施。

我认为计算的领域极其广阔。Ian 和 Patterson 博士解释过计算如何改变了他的视角,从早期的磁芯存储一直延伸到今天与未来。这切实展示了计算基础设施与计算能力的重要性:将数据进行变换,获取信息后施加计算并输出结果,再反馈回来重新变换。这就是价值创造的本质。存储信息很重要,传输信息也很重要,但价值是在计算以及将实际数据变换为计算的过程中产生的。

从我们的角度来看,这个平台规模巨大。我在 NVIDIA 工作了近 26 年,这一切显然始于将一种全新的计算平台上线,即 CUDA。从那时起,它的应用范围得到了极大扩展。这张图展示了使用我们 GPU 的人群多样性,涵盖超大规模云服务商、AI 原生企业、初创公司、各大 AI 实验室、企业客户以及边缘端。这融合了 AI 模型与传统模拟计算,或者说是两者的结合,因为它们如今在相互支持。

现在 Hugging Face 上已有超过 300 万个模型,其中约 3000 个模型占据了约 90% 的下载量。模型的多元化在持续扩展,工作负载正从计算机视觉扩展到物理科学、生命科学、语音、自然语言以及机器人技术。我们拥有用于量子计算和模拟的 AI 模型,也有正在探索全新架构的多模态与前沿模型。在此之上,还有一整套用于计算的模拟库和应用,覆盖计算光刻、决策制定、医学成像、天气分析到基因组学等各个领域。

计算已成为科学研究、工业生产、消费者互动和企业计算不可或缺的能力,横跨 AI 与模拟计算。我们目前有超过 8000 个主要的 CUDA 应用运行在这些平台上,而我们构建这个平台已经有大约 25 年了。

范式转变:从 2023 年的 Chat 基准测试到智能体 AI 工作负载

现在的状况如何?这就是 Vera Rubin。它的设计初衷是成为下一代推理与智能体平台。显然,我们继续支持大规模训练,这也是我们能够提供的能力。但让这一切落地生根的是 AI 工厂,而 Vera Rubin 就是为此而设计的。

它建立在丰厚的生态系统之上。我们在全球可追踪到有超过 1000 万名开发者在 NVIDIA GPU 上进行开发。它涵盖云服务商、网络服务商、OEM 和 ODM。有超过 300 家主要公司构建了供应链来协助交付这个平台,看着这一切发生令人惊叹。

它具有极高的通用可替代性。我认为这也是它能够为全球带来巨大价值和帮助的原因之一:你提供了一个可以运行所有工作负载和每个模型的计算平台,无论是开源模型、闭源模型还是前沿模型。它可以支持预训练、后训练、推理、智能体 AI 以及加速计算,所有这些都在智能体工作负载中同时调用。

此外,它具有很强的耐用性。David 提到 GCP 中的 GPU 仍在提供最初的 Voltas,那可以追溯到很久以前,几乎有十年了。你仍然能看到我们十年前发布的 GPU 在创造价值。事实上,如果你追踪我们在 COVID 初期发布的 A100 的每小时实例租用价格,就会发现它随时间推移不降反升,且需求依然强劲。

那么软件层面发生了什么变化?变化最显著的是工作负载。最初的大量基准测试是基于 Chat 进行的,那是 2023 年突破性的工作负载,后来成为 MLPerf Inference 等基准测试的基础。它当时大约有 1K 的输入词元数量,用于系统提示词和其他用户数据的 KV Cache 大小可能在 4K 左右,人们以多轮对话的方式与它交互。你提出问题,它给出回复,然后你可能再追问,平均大约三轮对话。这是一种人机回环(Human-in-the-Loop)模式,当时还没有智能体,但这成为了基准测试和理解我们价值的基础,即运行此类工作负载的效果如何,无论是 DeepSeek 模型还是类似于 ChatGPT 的闭源接口。

如今,智能体 AI 已截然不同,它带来的挑战超乎想象。它的需求极其严苛,在纯数值层面提升了 100 倍。这是来自 AgentX 基准测试的数据,虽然不能说代表所有人,但对比我们今天的基准测试与以前的推理,平均输入规模达到了 142000 个词元。而且它是动态的,你需要支持从 1K、10K、100K 一直到 142K、200K 甚至更长的短输入。每一种输入长度都需要一整套全新的算子内核优化、调优和数学计算调整,这极大增加了软件优化的复杂度。

KV Cache 的规模变得异常庞大。模型开始支持多达 100 万个词元。你开始时规模可能很小,但随着智能体进行多轮交互(现在不再是人在回路中,而是智能体在不断自我提问),上下文会持续累加。现在所有这些 KV Cache 都需要在整个数据中心范围内进行管理。

最后,交互轮数呈爆发式增长。以前服务设计者可以依赖这样一个事实:人类需要花时间阅读答案然后再给出下一个提示词,这使得任务调度相对容易。现在智能体让人类退出了这个循环,计算资源的消耗速度完全取决于智能体自我转折的速度,这种速度非常快。

在 AgentX 基准测试中,他们只设置了大约四个子智能体,而我们在商业服务中拥有成千上万个智能体,但它们都需要进行智能路由。模型现在必须做出决策,并在整个平台中调用所有这些不同的子智能体,且 KV Cache 需要在所有环节中得以保留。

如果审视工作负载的结构,会发现它复杂得多。过去只是词元输入、运行模型、词元输出,现在则涉及调度 CPU 通过 Helm Charts 管理动态 Kubernetes 容器。我们有 LLM 负责处理上下文和观察数据,另一层负责推理,还有一层负责决定在下一轮中调用哪些子智能体或工具。

最后,我们还要运行所有这些工具:有些基于 CPU,有些需要 GPU,有些是模拟计算,有些则是加速计算。在此之上,我们有 CPU 集群在管理和监控安全与治理。我们不希望智能体发生幻觉、产生错误想法或浪费时间和词元营收资金,因为那会导致系统崩溃。所有这些都需要在内存上下文窗口中进行管理,而作为模型工作知识库的上下文窗口也因此发生了爆炸式增长。

认识 Vera Rubin:面向智能体计算的全栈架构

这就是 Vera Rubin 的设计初衷。当我们发布它时,我们谈论的不是推出单芯片,也不是降低单个 LLM 模型的成本,而是要能够运行整个工作负载。

在基础平台方面,Vera Rubin NVL72 建立在我们为 Grace Blackwell 所做的基础之上,并扩展了其能力。当我们希望从用户词元角度实现更快速度时,我们还加入了基于 Groq LPU 技术的加速包。对于这些高价值工作负载,我们可以进一步提升平台性能。

在此之上,智能体 CPU 至关重要。我们必须能够快速、高效、满载地完成所有工具调用和计算,从而将结果快速返回给用户。我们绝不希望 CPU 拖慢整个技术栈的运行速度。

最后,所有 KV Cache 都需要在智能存储中进行管理。随着系统内部流动着各种上下文,所有数据都需要被管理、治理并集成到软件定义网络中,同时在后台进行优化时对 KV Cache 执行索引和向量检索。这就是为什么我们针对存储推出了 BlueField,与所有构建这些系统的存储合作伙伴合作,由我们向他们提供 SmartNIC 和计算平台。

再来看规模化网络。这些模型非常庞大,单个 GPU 根本装不下。事实上,目前所有人都在做解耦推理。我们去年讨论过 Dynamo 软件,如今它已经广泛应用。每个人都在将 Prefill 阶段与 Decode 阶段分离运行,并在其上管理所有 KV Cache,从而获得最佳的词元速率和吞吐量。要连接所有这些组件,需要网络基础设施的支持。当然,所有这些设施也可以用于 RL 和后训练阶段的训练过程。

这些是刚刚发布的 SemiAnalysis 智能体基准测试在 Vera Rubin 上的运行结果。通过与整个生态系统在开源和闭源模型上的全栈协同设计,它在智能体工作负载上实现了 30 倍的 AI 工厂吞吐量提升。事实上,根据你在帕累托曲线上观察的位置不同,部分场景下的性能提升甚至高达 60 倍。

左侧是每兆瓦(MW)的总词元吞吐量。所有这些数据中心都受到兆瓦(MW)功耗的限制。对于每一代产品,我们考虑的不只是绝对词元性能,关键指标是每兆瓦(MW)的总词元吞吐量。提高这一指标就能提升 AI 工厂产生营收的能力。

如果你在运行像 DeepSeek v4 这样的模型,你会希望思考速率达到每秒 100 个词元以上,以便计算出答案并快速返回。事实上,你可能希望进一步提升到每秒 200 至 250 个词元,这样智能体就可以进行更深度的思考,并在 65 轮交互中更快给出答案,无需让用户等待太久。

此外,我们还必须降低每百万词元的成本。这张图展示了对比 Grace Blackwell 与 Vera Rubin 生成词元的成本。可以看到,由于性能提升,成本大幅下降。我们降低成本最有效的方式就是每一代都交付更强的性能。如果我只是降低 GPU 芯片的售价,或者采用成本更低的网络,我只是改善了这个庞大数据中心里的一个细小环节。如果我将那个节点或机架的性能提升 10 倍或 30 倍,这种性能提升会直接作用于公式分子,从而降低整个数据中心每个词元的成本。

极致延迟与吞吐量:Groq LPU 集成与 Olympus 核心

如果我们希望思考得更快、更积极,并能够执行快速交互,该怎么做?在许多应用场景中智能体举足轻重,我们希望将它们置于关键路径上,用于实时业务分析或前沿计算。我们可以进一步提升 Vera Rubin 的性能。从 Blackwell 到 Vera Rubin,我们提升了整体用户交互体验。但如果我们想追求极致,从每秒数百个词元提升到单用户每秒数千个词元,我们可以借助 Groq 技术进一步释放性能。

这些是最新出来的测试数据。对于像 Gemma 4 或 Qwen 3.8 这样拥有 100K 长上下文的模型,我们在 Gemma 4 上可以实现每用户每秒 3400 个词元,在 Qwen 3.8 上可以实现每用户每秒 2529 个词元。在大上下文场景下这个速度非常惊人。上下文越长,模型为了生成每个新词元就越需要检索整个对话历史,这增加了计算量,但这也是智能体应用场景所必需的。

工具调用极为关键。全球不仅缺乏数据中心和 GPU,也同样缺乏 CPU。虽然此前人们使用连接到 Blackwell 的 Grace CPU 来进行工具调用,但我们现在看到了对用于智能体计算的高效快速专用 CPU 的需求。我们提取了原本连接到 Rubin GPU 上的 CPU,构建了专用的 Vera CPU 机架。

什么是 Vera?它采用了 NVIDIA 自主设计的 Olympus 核心。它的设计目标是实现高速度,在每个核心满载运行的同时,以最快的速度输出答案。我们通过定制的 Olympus 核心实现了这一点。

为了让所有核心高速运转且不产生瓶颈,核心与核心之间拥有极高的带宽。这是一个大型单片计算裸片,每个核心无需跨越 Chiplet 进行多跳传输即可访问内存,从而获得了极低的内存访问延迟。配合 LPDDR 内存子系统,它不仅功耗低,而且延迟比市面上其他方案低 40%。在 CPU 计算中,内存延迟往往起主导作用。

这与云时代之前的 CPU 表现形态有所不同。过去的 CPU 具有高单线程性能但核心数较少,导致整体吞吐量较低。而在 AI 出现前的云计算时代,衡量指标变成了每个核心的成本,这拉高了核心数量,而单线程性能则退居其次。这就是核心数量激增的原因,因为当时云服务客户主要询问的是每个核心的价格,用于运行网页托管和数据库。

Vera 的设计旨在让 188 个核心(开启 SMT 时为 176 个核心)保持高吞吐量,同时维持高单线程性能,确保词元延迟不受影响。

这些结果经由 Signal65 使用斯坦福大学的 Terminal Bench 基准测试进行了验证。我们在 80 多项测试中运行了 Terminal Bench 的 CPU 端任务,Vera 展现出了 1.6 倍的性能提升。智能体完成工具调用的速度提高了 60%,在编译代码、运行 Git 和代码验证等核心智能体任务上的处理速度最高提升了 2 倍。

客户已经开始寻求部署这款产品。Perplexity Space 发现,任务执行往往受限于创建沙盒的速度。通过引入 Vera,他们观察到沙盒启动、执行快速计算并关闭的整体速度提升了 1.5 倍。

ClickHouse 是一个被各大前沿实验室用于安全与治理的实时分析型数据库,他们在 Vera 上运行了其公开基准测试套件,结果位列榜首。

Vera 目前已正式发布,早期采用者涵盖 Oracle Cloud Infrastructure(OCI)以及多家系统厂商。

生态系统与扩展:NVLink Fusion、智能存储与 MaxLPS 功率管理

NVLink 是实现 AI 与推理高速运行的关键要素。从无 NVLink 到 8 路互连,再到完整的 NVLink 72,它显著改善了帕累托性能曲线。NVIDIA 是一家网络技术公司,我们正在通过 NVLink Fusion 计划向所有人开放 NVLink。芯片设计者只需设计自己的 XPU 加速芯片,通过与 NVIDIA 合作,即可对接我们的 NVLink Chiplet IP 和 NVHBM 技术,从而直接融入完整的 NVLink 生态系统。

早期合作伙伴包括初创公司 The Matrix,他们正在为其下一代 Raptor XPU 采用 NVLink Fusion,以连接 Vera 和 NVLink Switch 机架,构建包含 The Matrix 芯片的完整 NVLink 72 架构。亚马逊 AWS 及 Annapurna Labs 也在与我们合作,将定制 IP 集成到 NVHBM 的基底裸片中,在其定制芯片上释放出 30% 至 40% 的计算资源,同时利用 NVIDIA SerDes 实现更高的带宽和更低的延迟。

在数据中心层面,随着我们专注于提升每兆瓦(MW)或每吉瓦(GW)的推理效率,一个核心问题是数据中心内部可以容纳多少 GPU。工作负载的功耗特征是动态变化的。即便在 DeepSeek-R1 上,GPU 功耗也会根据不同阶段在 600W(瓦)到 1900W(瓦)之间波动,导致预留的电力资源未能充分利用。

为了解决这个问题,我们与生态系统合作开发了名为 MaxLPS(Max Land Power Shell)的软件。MaxLPS 能够在 Vera、Rubin 和 NVSwitch 层级动态管理并限制机架和固件层面的功耗。通过与数据中心管理软件协同,运营商可以在完全相同的电力包络内部署多达 40% 的机架(例如在吉瓦级数据中心内从 4000 个机架扩展到 5600 个机架),将词元吞吐量提升至每秒 12 亿个词元。

Lambda 验证了这一软件栈,Dave Ward 指出,在相同的兆瓦(MW)容量下,可部署的 GPU 密度得到了显著提升,B200 提升了约 25%,Vera Rubin 上则可提升高达 40% 的计算资源。

展望未来:按年度节奏交付 AI 基础设施路线图

NVIDIA 始终坚持严格按一年为周期推进路线图。在 Vera Rubin 之后,我们接下来的演讲将介绍 Vera Rubin Ultra,随后是 Feynman 架构以及 Feynman Ultra。您可以确信 NVIDIA 将保持年度发布节奏,持续推进 AI 词元工厂、推理以及数据中心规模的智能体基础设施建设。

非常感谢大家的时间。

本文来源:Andy730

全天候科技

全天候科技

提供专业快速完整的科技商业资讯

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容