WAIC 开展那天,灵汐科技的展台被挤得水泄不通,凑过来的全是 AI 圈内的从业者。大伙盯着屏幕上跳出来的参数,半天没回过神—— 30kW 的功耗,居然能跑出近 100P 的 FP16 算力?这可不是靠堆 GPU 堆出来的常规操作,是类脑架构往大模型推理赛道扔出的王炸,之前全行业默认 GPU 是推理的唯一答案,现在这条共识要晃悠了。

就连英伟达都下场做 Groq 加码高速推理,说白了就是默认了传统 GPU 架构在推理场景的天生缺陷。行业找了好久,就等着一个跳出 GPU 路径依赖的新方案。类脑芯片存算一体、事件驱动、众核并行的特性,刚好戳中了推理场景最需要的低时延、低功耗痛点。这次灵汐发布的 LynAInfra128 算力柜,最让人意外的不是近 100P 的 FP16 算力,是整机功耗死死控在了 30kW 以内。换算下来,它的推理能效比比传统 GPU 方案直接涨了 3 到 10 倍,首 token 延迟直接压到了几十到百毫秒级别。

更良心的是,整套集群用的就是普通风冷散热,模块化设计完全兼容现有智算中心的机柜、供电、网络配套。客户不用花大价钱改造机房,就能直接上线用,部署门槛比大家想的低太多。之前行业算算力划不划算,都是看单位成本能买到多少 P 算力。现在灵汐这套方案,直接把衡量标准换成了单位瓦特能输出多少有效推理比特,玩起了 " 瓦特换比特 " 的全新评价体系。
这种范式切换带来的好处,一层层传下去全是惊喜。智算中心不用为了散热铺一大堆液冷管线,算力集群的碳排放直接降了一大截,刚好契合国家双碳战略的要求。企业客户的单位算力推理开销直接砍半甚至更多,大模型落地的整体拥有成本直接降了好几个档次。
往深了说,这套全链路自研的类脑算力方案,完全跳出了国外主导的 GPU 算力架构路线,给国产算力供应链补上了高速推理场景的关键一块。再也不用被海外芯片的供货节奏卡脖子,想扩产能就扩产能,想落地就落地,主动权全握在自己手里。
之前不少人都觉得,类脑芯片就是实验室里摆着的前沿概念,不知道猴年马月才能商用落地。谁能想到它这么快就完成了规模化商用,还直接做成了能对标 Groq 的高性能推理集群。这说明国产算力的创新路线,早就不是跟在海外 GPU 屁股后面追了,已经走出了一条完全不一样的新赛道。

参考资料:人民日报 国产人工智能算力创新发展观察