《科创板日报》8 月 25 日讯(编辑 宋子乔) 英伟达硬件演进正加速驶向下一站,为智能体(Agent)打造新一代算力平台。
当地时间 8 月 24 日,英伟达宣布,推理加速器 Groq 3 LPX 机架已进入全面量产阶段。英伟达高级总监 Dion Harris 表示,Groq 机架将与 Vera 中央处理器和 Rubin 图形处理器一同部署在新型云服务商 Nebius 的数据中心,并将于今年晚些时候上线。
Groq 3 LPX 机架是英伟达专为 Vera Rubin 平台设计的推理加速扩展组件,需与 Vera Rubin NVL72 GPU 主机架搭配部署—— NVL72 负责更广泛的训练、推理以及上下文处理,LPX 专门加速输出 AI 生成结果(Token),主打超低延迟 Token 生成,两者异构协同,可大幅提升万亿参数、超长上下文智能体推理的每瓦吞吐与交互响应速度。
英伟达此前将 Vera Rubin 平台定义为专为智能体 AI 与科学计算时代设计的机架级超级计算平台。英伟达此次将 Groq 3 LPX 正式推向全面生产,核心目的并不是用专用推理芯片取代 GPU,而是为 Vera Rubin 补充传统 GPU 架构在低延迟 Token 生成方面的能力。
相比 Blackwell,Vera Rubin 在智能体工作上的效率得到了极大的提升,英伟达释出多个最新测试数据(本次测试使用的基准为 SemiAnalysis AgentX,该基准针对 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro 等各类模型)——
英伟达称,在 Artificial Analysis 测试中,搭载 Gemma 4 31B 模型、100K Token 上下文时,Groq 3 LPX 实现每秒 3400 个输出 Token,为该模型创下最高纪录;针对智能体编程等低延迟工作负载,其响应速度最高达到最近竞争平台的 4 倍。英伟达称,这种速度可以让智能体更快完成代码编写、测试、工具调用和结果验证等连续任务。
与此同时,英伟达公布 Vera Rubin NVL72 在真实智能体工作负载下的新测试结果:基于 SemiAnalysis 的 AgentX 工作负载、采用 DeepSeek V4 Pro 模型,Vera Rubin 每兆瓦(MW)吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降低 35 倍。对于运营商而言,这意味着在固定的电力和基础设施预算下,可以支持更高的交互式代理容量,或者以更低的运营成本提供相同的容量。


近期腾讯、阿里、DeepSeek 等头部厂商相继推进 AI 智能体产品迭代与生态布局,AI 应用端发展聚焦终端场景落地与生态壁垒搭建。天风国际证券最新研报称,当前 Harness 加速开放迭代,前沿 AI 竞争正向 Agent 执行框架与商业化兑现深化。
英伟达正紧随这一趋势调整硬件优化方向,当 AI 迈入智能体时代,AI 基础设施的评价体系或将随之变化,基础设施服务商的硬件迭代重心将从追求训练更大模型,转向单位能耗有效 Token 产出、单位成本任务处理能力,以及智能体复杂任务的执行时延。
(科创板日报 宋子乔)