关于ZAKER Skills 合作

超节点、超集群、TPU 方案涌现 算力“拼系统”时代产业最关心 Token 性价比

财联社 7 月 21 日讯(记者 付静)" 我们真正关注的是 Token 性价比:在保证模型效果和服务质量的前提下,以更低的综合成本生成更多高质量 Token。"2026 世界人工智能大会(WAIC)期间,云天励飞 -U(688343.SH)方面在接受财联社记者采访时表示。

当下,模型层面训推规模迈向万卡,应用侧 C 端多款智能体涌现,AI 进化为生产生活 " 搭子 ",B 端的人工智能真实场景落地也在加速。在这些需求的带动下,产业链频频传递出 " 算力供不应求 " 信号。

财联社记者多方采访获悉,算力进入 " 拼系统 " 时代,构建超节点、超集群已经成为主流做法,且收获了下游各行业的积极反应。与此同时,TPU 路线正在同步发力,华东地区首座国产 TPU 千卡智算集群已经落成。多种方案涌现背后,产业最关心的则是 Token 性价比。

" 超节点是未来几年重点方向 " 下游已给出积极反应

WAIC 期间,华为昇腾 950 超节点(Atlas 950 SuperPoD)真机、超节点集群 Atlas 950 SuperCluster、首个全国产十万卡 AI 超集群曙光 8000(登峰)真机、燧原科技与中兴通讯(000063.SZ)联合打造的正交架构方案 " 云燧 ESL64-O" 超节点、阿里云磐久 AL128 超节点服务器、沐曦股份 -U(688802.SH)新一代 AI 超节点曦景 S600、摩尔线程 -U(688795.SH ) MTT C256 超节点、壁仞科技 ( 06082.HK)分布式解耦架构超节点方案、百度智能云超节点 " 天池 " 等格外吸睛。

华为昇腾 950 超节点 图片来源:财联社记者 / 摄

" 云燧 ESL64-O" 超节点 图片来源:受访者供图

中兴超节点方案 图片来源:受访者供图

中国电子云则发布了自研的翎枢 6020 轻量型、翎枢 6032 平衡型、翎枢 6064 性能型三款超节点产品。

中国电子信息产业集团有限公司首席科学家、中国电子云总工程师朱国平介绍,翎枢超节点将千百张 GPU 融合为单一逻辑超级单卡,通过 Tbps 级超高带宽、百纳秒级超低时延、统一内存编址提升算力释放效率。翎枢超节点覆盖 20-64 卡黄金算力区间,相比其他超节点方案,优势在于成本更低、生态开放,可兼容现有风冷、液冷机房。

云天励飞方面也告诉财联社记者,公司未来三年计划推出 DeepVerse100P、DeepVerse100D 和 DeepVerse100L 三款芯片,分别针对 Prefill、Decode Attention 和 Decode FFN 进行优化,未来在此基础上构建面向万卡异构集群的分离式 AI 推理基础设施。

财联社记者采访获悉,产业链下游已对超节点、超集群产品有了积极反应。中科曙光(603019.SH)方面提供的数据显示,曙光 8000 集群正式上线首周即需求爆满,应用满载运行,目前日均处理作业数突破 15 万个,单日处理作业峰值超过 50 万个。截至目前,曙光 8000 已完成近千项超智融合应用适配,覆盖大模型训练、高通量推理、科学计算等多个万卡级规模场景。

上线后快速满载,意味着科研机构、企业和开发者对超大规模、高质量算力的现实需求正在加速释放,也表明十万卡级算力已开始持续承接更加广泛的科研和产业任务。

据悉,曙光 8000 采用全球首创的高密度机柜结构,单个计算单元算力密度较其他超节点提升 20 倍,在有限空间内实现更高算力部署;自研 scaleFabric 类 IB 原生 RDMA 高速互连技术,实现十万卡规模稳定互连。

另据媒体报道,华为昇腾 384 超节点目前已商用落地 750 多套,规模应用于互联网、运营商、金融、教育、医疗、交通、制造等行业。

一位算力从业者告诉财联社记者,内部连接是超节点及算力集群发展面临的核心问题。" 超节点架构、超节点内部的连接,这可能是我们现在包括未来几年重点(攻克)方向,核心是要解决 GPU 或 TPU 之间高速互联的问题,通过交换芯片提供单个节点大容量,比如可以提供 64 卡、128 卡这种超大规模的连接,在这个基础上组建更大的千卡、万卡集群。"

据悉,在 AI 算力基础设施与数据中心网络架构中,Scale-Up、Scale-Out 和 Scale-Across 分别为三种不同层次的扩展模式:Scale-Up(纵向扩展)聚焦于超节点内部的紧密耦合,Scale-Out(横向扩展)侧重于集群之间的规模扩张,Scale-Across(跨域互联)则致力于数据中心之间的广域协同,旨在打破单数据中心的物理极限。

"Scale-Out 相对来说更成熟,Scale-Up 的挑战更大,这是我们要重点解决的。现在单个 GPU Scale-Up 领域的带宽都达到 TB 的级别,单交换机的交换容量可能要达到 100T 以上。解决了这个问题之后,才能组成大规模的集群。大规模集群要为芯片解决的,就是把极限带宽提高。" 前述从业者介绍。

财联社记者也从中兴通讯方面获悉,针对 AI 大模型规模化落地的网络升级要求,其构建的智能算力网络底座,主要聚焦 Scale-Out 机间网络(优化单集群内部通信效率,实现稳定降本、调优增效)与 Scale-Across 跨域互联(实现跨数据中心、跨地域的算力资源高效调度)两大核心场景。

TPU 路线同步发力 产业最关心 Token 性价比

除了近几年持续热门的 GPU 路线,财联社记者还了解到,杭州电信、中兴通讯与中昊芯英联合打造了华东地区(杭州)首座国产 TPU 千卡智算集群,该集群亦是中国电信体系内首个大规模国产 TPU 集群部署项目。

" 选择做千卡集群而不是万卡集群,是因为我们想把它做成试验田。我们先把千卡级的软件栈系统集成到千卡集群上,在 Token Factory 上能提供不错的服务,在服务逐步做透的情况下逐步开展二期、三期。未来,我们也希望逐步从千卡向万卡集群迈进,在万卡集群上运行国产模型的训练推理,而且满足所有商用需求所需要的性价比。" 中昊芯英创始人、CEO 杨龚轶凡告诉财联社记者。

谈及 GPU 与 TPU 两条路线如何选择,中国电信杭州分公司智算中心总经理王良表示," 并不见得每个芯片都是全能选手,不同芯片在不同场景下有独特的长处,比如 TPU 擅长做张量运算,我们评估推理能力是 TPU 的长处。"

王良还介绍," 上述 TPU 千卡集群落地后运行得很好,尤其是今年的 Token 风口起来以后,市场上对 Token 的需求量很大。最近(我们)和中昊芯英测试完 PD 分离,这一技术把 TPU 的优势进一步放大,已经比较满足当初的设计目标。"

据悉,该集群基于 " 泰则 " 智算平台构建,将面向大模型训练、AI 推理、科学计算等场景提供全自主算力支撑,该集群二期规划今年 9 月上线投产。"

王良进一步谈到,调优将是一项非常重要的工作。他介绍," 现在所有的大模型厂商、芯片厂商,都是拿出百米冲刺的速度在跑马拉松,芯片厂商每年都会发布一个新版本,而大模型厂商每个季度都会发一个新版本,这里面的适配工作量是很大的。我们在持续的调优工作中发现,从年初到现在,TPU 集群通过调优实现了超过 10 倍的效率提升。原来每百万 Token 的成本如果是 100 元,现在就差不多能降到 10 元以下。"

WAIC 期间,多位受访的算力产业人士均谈及了 Token 成本问题。

对于模型厂商、AI 应用企业和算力运营方而言,真正影响商业化效率的是在一定时间和成本条件下,能够稳定生成多少有效 Token。

财联社记者另从 AI 基础设施及智算云提供商九章云极方面了解到,AI 从技术竞赛迈向规模交付,主要面临四个核心卡点:算力成本高企、多芯片计价割裂、GPU 利用率困于 30% 红线、研发缺乏标准化体系。

据悉,九章智算云在全球范围内已部署 12 个数据中心,算力总规模约 22 EFLOPS,配备 6600 余张 GPU 卡,具备日产 64 亿词元(Token)的生产能力。从产出量看,DeepSeek-V4 是当前产出最大的模型,日产 24.5 亿 TOKEN,占比 38%,随后依次为 KIMI 2.5、Qwen-3.5、GLM-5、MiniMax-2.5。其弹性算力体系,已使得某头部模型厂商的项目综合成本最高节省了 82.1%。

云天励飞方面则告诉财联社记者,降低 Token 成本是一项系统工程,从底层的 IP、EDA、芯片设计和封装测试,到服务器、互联、软件栈和算力平台,再到模型及应用,各环节都会影响最终的 Token 生成效率。

据了解,目前国内主流大模型的公开 API 价格已明显分层。根据不同模型能力和服务方式,常规文本模型的输入价格大致为每百万 Token 几角钱至十余元,输出价格大致为每百万 Token 一两元至数十元。

" 现在的问题不是将百万 Token 成本价格从 2 毛降到 1 毛,更多的是提升 Token 价值,这是算力基建和模型要协力解决的问题。如果价值的问题可以解决,定价 2 块或 10 块大家都不觉得贵。" 前述算力从业者也表示。

相关标签

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容