关于ZAKER Skills 合作
科创板日报 27分钟前

英伟达新一代算力平台补齐拼图 结合 DeepSeek 模型 Token 成本可降 35 倍

《科创板日报》8 月 25 日讯(编辑 宋子乔) 英伟达硬件演进正加速驶向下一站,为智能体(Agent)打造新一代算力平台。

当地时间 8 月 24 日,英伟达宣布,推理加速器 Groq 3 LPX 机架已进入全面量产阶段。英伟达高级总监 Dion Harris 表示,Groq 机架将与 Vera 中央处理器和 Rubin 图形处理器一同部署在新型云服务商 Nebius 的数据中心,并将于今年晚些时候上线。

Groq 3 LPX 机架是英伟达专为 Vera Rubin 平台设计的推理加速扩展组件,需与 Vera Rubin NVL72 GPU 主机架搭配部署—— NVL72 负责更广泛的训练、推理以及上下文处理,LPX 专门加速输出 AI 生成结果(Token),主打超低延迟 Token 生成,两者异构协同,可大幅提升万亿参数、超长上下文智能体推理的每瓦吞吐与交互响应速度。

英伟达此前将 Vera Rubin 平台定义为专为智能体 AI 与科学计算时代设计的机架级超级计算平台。英伟达此次将 Groq 3 LPX 正式推向全面生产,核心目的并不是用专用推理芯片取代 GPU,而是为 Vera Rubin 补充传统 GPU 架构在低延迟 Token 生成方面的能力。

相比 Blackwell,Vera Rubin 在智能体工作上的效率得到了极大的提升,英伟达释出多个最新测试数据(本次测试使用的基准为 SemiAnalysis AgentX,该基准针对 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro 等各类模型)——

英伟达称,在 Artificial Analysis 测试中,搭载 Gemma 4 31B 模型、100K Token 上下文时,Groq 3 LPX 实现每秒 3400 个输出 Token,为该模型创下最高纪录;针对智能体编程等低延迟工作负载,其响应速度最高达到最近竞争平台的 4 倍。英伟达称,这种速度可以让智能体更快完成代码编写、测试、工具调用和结果验证等连续任务。

与此同时,英伟达公布 Vera Rubin NVL72 在真实智能体工作负载下的新测试结果:基于 SemiAnalysis 的 AgentX 工作负载、采用 DeepSeek V4 Pro 模型,Vera Rubin 每兆瓦(MW)吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降低 35 倍。对于运营商而言,这意味着在固定的电力和基础设施预算下,可以支持更高的交互式代理容量,或者以更低的运营成本提供相同的容量。

英伟达强调,智能体任务不同于传统聊天对话,任务上下文会随着数百个步骤不断累积,甚至达到数十万 Token。英伟达援引 OpenRouter 数据称,智能体 AI 工作负载消耗的 Token 数量可以达到简单聊天请求的 15 倍。原因在于,一个智能体可能先查询数据库,再搜索新闻和文件,调用子智能体进行分析,运行代码并反复验证,整个过程中上下文不断累积。

近期腾讯、阿里、DeepSeek 等头部厂商相继推进 AI 智能体产品迭代与生态布局,AI 应用端发展聚焦终端场景落地与生态壁垒搭建。天风国际证券最新研报称,当前 Harness 加速开放迭代,前沿 AI 竞争正向 Agent 执行框架与商业化兑现深化。

英伟达正紧随这一趋势调整硬件优化方向,当 AI 迈入智能体时代,AI 基础设施的评价体系或将随之变化,基础设施服务商的硬件迭代重心将从追求训练更大模型,转向单位能耗有效 Token 产出、单位成本任务处理能力,以及智能体复杂任务的执行时延。

(科创板日报 宋子乔)

相关阅读

最新评论

没有更多评论了
科创板日报

科创板日报

上交所科创板电报,股市行情报道

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容