
这项合作在 AMD 首席执行官苏姿丰(Lisa Su)周四发表的 " 推进 AI" 主题演讲中正式公布。此举填补了 AMD 产品组合中的关键空白。此前,英伟达曾花费 200 亿美元收购 Groq 相关人才,以弥补其在快速推理领域的短板。
SRAM 技术赋能高效推理
Cerebras 联合创始人兼首席执行官安德鲁 · 费尔德曼(Andrew Feldman)曾批评英伟达仅为 "AI 军火商 "。与依赖 HBM4 显存的 GPU 不同,Cerebras 的晶圆级引擎(WSE)采用片上 SRAM 技术,速度比传统方案高出数个数量级。凭借这一优势,Cerebras 已成为全球最快的推理服务提供商之一,输出速度经常超过每秒 2,000 个 Token。
在该联合方案中,AMD Instinct GPU 负责处理计算密集型的提示词(Prompt)操作,而内存密集型的 Token 生成任务则卸载给 Cerebras 的 WSE 加速器。双方旨在实现更高交互性,同时不牺牲吞吐量或增加成本。费尔德曼表示,这种组合结合了 Instinct 在性能和内存容量上的优势,以及 WSE 在 SRAM 和内存带宽上的领先地位,能提供无与伦比的解决方案。
尽管两家公司未透露具体数据,但预计该组合将使每瓦特电力消耗所产生的 Token 数量提升高达 5 倍。
对标 Groq LPU,效率显著优化
Cerebras 加速器在此处的角色,类似于英伟达在 GTC 大会上随 Vera Rubin 机架系统发布的 Groq LPU(语言处理单元)。然而,在服务像 Kimi K2.5 这样的万亿参数模型时,英伟达方案需要相当于 2,000 颗 Groq LPU 的 SRAM 资源,而 AMD 与 Cerebras 的组合最多只需几十个加速器即可胜任。
该联合解决方案将于今年晚些时候在 Cerebras Cloud 上线。苏姿丰在随后的新闻发布会上表示,Cerebras 的技术与 Helios 配合良好,AMD 开放生态系统的理念是与拥有有用技术的多家公司合作。她补充道,未来将继续进行更多的工作负载解耦尝试。
【星途科讯 图文丨略略 首发于 ZAKER 科技,转载请注明出处】