关于ZAKER 融媒体解决方案 合作 加入

一文看懂华为最新发布的全球最快 AI 训练集群“ Atlas 900 ”

上观新闻 09-18

9 月 18 日,华为全联接 2019(HUAWEI CONNECT)大会上,华为副董事长胡厚崑发布了 Atlas 900 AI 训练集群,并称这是全球最快的 AI 训练集群。

华为 Atlas 900 AI 训练集群

那么,Atlas 900 AI 训练集群到底是什么?快在哪里?解放日报 · 上观新闻请华为的技术人员进行了解读。

Q:为什么要研发 Atlas 900 AI 训练集群?

A:在大型数据集上进行训练的神经网络架构涵盖从图像识别、自然语言处理、视频实时分析和智能推荐系统等各个方面,训练这些神经网络模型需要大量浮点计算能力。近年来单个 AI 处理器算力和训练方法上均取得了重大进步,但是在单一机器上,AI 训练所需要的时间仍然长得不切实际,因此需要借助大规模分布式 AI 集群环境来提升神经网络训练系统的浮点计算能力。

此次发布的 Atlas 900 AI 训练集群由数千颗昇腾 910 AI 处理器互联构成,是当前全球最快的 AI 训练集群,代表了当今全球的算力巅峰。其总算力达到 256P~1024P FLOPS @FP16,相当于 50 万台 PC 的计算能力。

Q:Atlas 900" 全球最快 " 的根据是什么?

A:华为已在华为云上部署了一个 Atlas900AI 训练集群,集群规模为 1024 颗昇腾 910 AI 处理器。基于当前最典型的 ResNet-50 v1.5 模型 " 和 " ImageNet-1k 数据集 ",Atlas 900AI 训练集群只需 59.8 秒就可完成训练,排名全球第一。

" ImageNet-1k 数据集 " 包含 128 万张图片,精度为 75.9%,在同等精度下,其他两家业界主流厂家测试成绩分别是 70.2s 和 76.8s,Atlas900 AI 训练集群比第 2 名快 15%。

Q:除了 " 快 ",Atlas 900 AI 训练集群还有哪些优势?

A:可以从算力、集群网络、调度平台、散热系统四方面看出 Atlas 900 的优势。

第一,Atlas 900 的 AI 算力业界领先。

Atlas 900 AI 训练集群采用业界单芯片算力最强的昇腾 910AI 处理器,每颗昇腾 910AI 处理器内置 32 个达芬奇 AI Core,单芯片提供比业界高一倍的算力(256TFLOPS@FP16)。Atlas 900 AI 训练集群将数千颗昇腾 910 AI 处理器互联,打造业界第一的算力集群。

昇腾 910AI 处理器采用 SoC 设计,集成 "AI 算力、通用算力、高速大带宽 I/O",大幅度卸载 Host CPU 的数据预处理任务,充分提升训练效率。

第二,,Atlas 900 具有最佳集群网络。

Atlas 900 AI 训练集群采用 "HCCS、 PCIe 4.0、100G 以太 " 三类高速互联方式,百 TB 全互联无阻塞专属参数同步网络,降低网络时延,梯度同步时延缩短 10~70%。

在 AI 服务器内部,昇腾 910 AI 处理器之间通过 HCCS 高速总线互联;昇腾 910 AI 处理器和 CPU 之间以最新的 PCIe 4.0(速率 16Gb/s)技术互联,其速率是业界主流采用的 PCIe 3.0(8.0Gb/s)技术的两倍,使得数据传输更加快速和高效。在集群层面,采用面向数据中心的 CloudEngine 8800 系列交换机,提供单端口 100Gbps 的交换速率,将集群内的所有 AI 服务器接入高速交换网络。

独创 iLossless 智能无损交换算法,对集群内的网络流量进行实时的学习训练,实现网络 0 丢包与 E2E μ s 级时延。

第三,Atlas 900 具备系统级调优。

Atlas 900AI 训练集群通过华为集合通信库和作业调度平台,整合 HCCS、 PCIe 4.0 和 100G RoCE 三种高速接口,充分释放昇腾 910AI 处理器的强大性能。

华为集合通信库提供训练网络所需的分布式并行库,通信库 + 网络拓扑 + 训练算法进行系统级调优,实现集群线性度 >80%,极大提升了作业调度效率。

第四,Atlas 900 具有极致的散热系统。

传统数据中心多以风冷技术对设备进行散热,但在人工智能时代传统数据中心却面临非常大的挑战。高功耗器件比如 CPU 和 AI 芯片带来更大的热岛效应要求更高效的冷却方式。液冷技术可以满足数据中心高功率、高密部署、低 PUE 的超高需求。

Atlas 900 AI 训练集群采用全液冷方案,创新性设计业界最强柜级密闭绝热技术,支撑>95% 液冷占比。单机柜支持高达 50kW 超高散热功耗,实现 PUE<1.1 的极致数据中心能源效率。

另外,在空间节省方面,与 8kW 风冷机柜相比,节省机房空间 79%。极致的液冷散热技术满足了高功率、高密设备部署、低 PUE 的需求,极大地降低了客户的 TCO。

Q:Atlas 900AI 集群可以应用在哪些场景?

A:Atlas 900 AI 集群主要为大型数据集神经网络训练提供超强算力,可广泛应用于科学研究与商业创新,让研究人员更快地进行图像、视频和语音等 AI 模型训练,让人类更高效地探索宇宙奥秘、预测天气、勘探石油和加速自动驾驶的商用进程。

Atlas 900 AI 集群也可以提供云服务,以云的方式提供充裕的、经济的算力资源,简单易用、高效率、全流程的 AI 平台,为社会各界带来极致体验的 " 易获取、用得起、方便用 " 的普惠 AI 算力。

栏目主编:任翀 本文作者:任翀 文字编辑:任翀

题图为:华为副董事长胡厚崑发表《共创智能新高度》主题演讲。(本文图片由华为提供)

以上内容由"上观新闻"上传发布 查看原文
相关标签 ai华为
上观新闻

上观新闻

站上海,观天下

订阅

觉得文章不错,微信扫描分享好友

扫码分享