0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

利用NVIDIA HGX H100加速计算数据中心平台应用

星星科技指导员 来源:NVIDIA 作者:William Tsu 2022-04-20 10:54 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

NVIDIA 的使命是加快我们的时代达芬奇和爱因斯坦的工作,并赋予他们解决社会的巨大挑战。随着 人工智能AI )、 高性能计算 ( HPC )和数据分析的复杂性呈指数级增长,科学家需要一个先进的计算平台,能够在一个十年内实现百万次的加速,以解决这些非同寻常的挑战。

为了回答这个需求,我们介绍了NVIDIA HGX H100 ,一个由 NVIDIA Hopper 架构 供电的密钥 GPU 服务器构建块。这一最先进的平台安全地提供了低延迟的高性能,并集成了从网络到数据中心级计算(新的计算单元)的全套功能。

在这篇文章中,我将讨论NVIDIA HGX H100 是如何帮助我们加速计算数据中心平台的下一个巨大飞跃。

HGX H100 8-GPU

HGX H100 8- GPU 是新一代 Hopper GPU 服务器的关键组成部分。它拥有八个 H100 张量核 GPU 和四个第三代 NV 交换机。每个 H100 GPU 都有多个第四代 NVLink 端口,并连接到所有四个 NVLink 交换机。每个 NVSwitch 都是一个完全无阻塞的交换机,完全连接所有八个 H100 Tensor Core GPU 。

The HGX H100 8-GPU represents the key building block of the new Hopper generation GPU server and hosts eight H100 Tensor Core GPUs and four third generation NVSwitch.

图 1 。 HGX H100 8-GPU 的高级框图

NVSwitch 的这种完全连接的拓扑结构使任何 H100 都可以同时与任何其他 H100 通话。值得注意的是,这种通信以每秒 900 千兆字节( GB / s )的 NVLink 双向速度运行,这是当前 PCIe Gen4 x16 总线带宽的 14 倍多。

第三代 NVSwitch 还为集体运营提供了新的硬件加速,多播和 NVIDIA 的网络规模大幅缩减。结合更快的 NVLink 速度,像all-reduce这样的普通人工智能集体操作的有效带宽比 HGX A100 增加了 3 倍。集体的 NVSwitch 加速也显著降低了 GPU 上的负载。

表 1 。将 HGX A100 8- GPU 与新的 HGX H100 8-GPU 进行比较

*注: FP 性能包括稀疏性

HGX H100 8- GPU 支持 NVLink 网络

新兴的 exascale HPC 和万亿参数人工智能模型(用于精确对话人工智能等任务)需要数月的训练,即使是在超级计算机上。将其压缩到业务速度并在数小时内完成培训需要服务器集群中每个 GPU 之间的高速、无缝通信。

为了解决这些大的使用案例,新的 NVLink 和 NVSwitch 旨在使 HGX H100 8- GPU 能够通过新的 NVLink 网络扩展并支持更大的 NVLink 域。 HGX H100 8- GPU 的另一个版本具有这种新的 NVLink 网络支持。

The HGX H100 8-GPU was designed to scale up to support a larger NVLink domain with the new NVLink-Network.

图 2 。支持 NVLink 网络的 HGX H100 8- GPU 的高级框图

使用 HGX H100 8- GPU 和 NVLink 网络支持构建的系统节点可以通过八进制小尺寸可插拔( OSFP ) LinkX 电缆和新的外部 NVLink 交换机完全连接到其他系统。此连接最多支持 256 个 GPU NVLink 域。图 3 显示了集群拓扑。

表 2 。比较 256 个 A100 GPU 吊舱和 256 个 H100 GPU 吊舱

*注: FP 性能包括稀疏性

目标用例和性能优势

随着 HGX H100 计算和网络能力的大幅增加, AI 和 HPC 应用程序的性能得到了极大的提高。

今天的主流 AI 和 HPC 模型可以完全驻留在单个节点的聚合 GPU 内存中。例如, BERT -Large 、 Mask R-CNN 和 HGX H100 是最高效的培训解决方案。

对于更先进、更大的 AI 和 HPC 模型,该模型需要多个聚合 GPU 内存节点才能适应。例如,具有 TB 级嵌入式表的深度学习推荐模型( DLRM )、大量混合专家( MoE )自然语言处理模型,以及具有 NVLink 网络的 HGX H100 加速了关键通信瓶颈,是此类工作负载的最佳解决方案。

图 4 来自 NVIDIA H100 GPU 体系结构 白皮书显示了 NVLink 网络带来的额外性能提升。

所有性能数据都是基于当前预期的初步数据,可能会随着运输产品的变化而变化。 A100 集群: HDR IB 网络。 H100 集群: NDR IB 网络和 NVLink 网络,如图所示。

# GPU :气候建模 1K , LQCD 1K ,基因组学 8 , 3D-FFT 256 , MT-NLG 32 (批次大小: A100 为 4 , 1 秒 H100 为 60 , A100 为 8 , 1.5 和 2 秒 H100 为 64 ), MRCNN 8 (批次 32 ), GPT-3 16B 512 (批次 256 ), DLRM 128 (批次 64K ), GPT-3 16K (批次 512 ), MoE 8K (批次 512 ,每个 GPU 一名专家)​

HGX H100 4-GPU

除了 8- GPU 版本外, HGX 系列还具有一个 4-GPU 版本,该版本直接与第四代 NVLink 连接。

H100 对 H100 点对点对等 NVLink 带宽为 300 GB / s 双向,比今天的 PCIe Gen4 x16 总线快约 5 倍。

HGX H100 4- GPU 外形经过优化,可用于密集 HPC 部署:

多个 HGX H100 4- GPU 可以装在 1U 高液体冷却系统中,以最大化每个机架的 GPU 密度。

带有 HGX H100 4- GPU 的完全无 PCIe 交换机架构直接连接到 CPU ,降低了系统材料清单并节省了电源

对于 CPU 更密集的工作负载, HGX H100 4- GPU 可以与两个 CPU 插槽配对,以提高 CPU 与 GPU 的比率,从而实现更平衡的系统配置。

人工智能和高性能计算的加速服务器平台

NVIDIA 正与我们的生态系统密切合作,在今年晚些时候将基于 HGX H100 的服务器平台推向市场。我们期待着把这个强大的计算工具交给你们,使你们能够以人类历史上最快的速度创新和完成你们一生的工作。

关于作者

William Tsu NVIDIA HGX 数据中心产品线的产品管理。他与客户和合作伙伴合作,将世界上性能最高的人工智能、深度学习和 HPC 服务器平台推向市场。威廉最初加入NVIDIA 是作为一名图形处理器芯片设计师。他是最初的 PCI Express 行业标准规范的共同作者,也是 12 项专利的共同发明人。威廉获得了他的学士学位,硕士学位在计算机科学和 MBA 从加利福尼亚大学,伯克利。

审核编辑:郭婷

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • NVIDIA
    +关注

    关注

    14

    文章

    5496

    浏览量

    109091
  • 数据中心
    +关注

    关注

    16

    文章

    5515

    浏览量

    74649
  • 人工智能
    +关注

    关注

    1813

    文章

    49734

    浏览量

    261514
  • H100
    +关注

    关注

    0

    文章

    33

    浏览量

    564
收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    科通技术亮相2025上海国际数据中心及云计算产业展览会

    2025年11月18日至20日,CDCE国际数据中心及云计算展在上海新国际博览中心成功举办。作为NVIDIA Networking及NVIDIA
    的头像 发表于 12-02 10:21 487次阅读

    Cadence 借助 NVIDIA DGX SuperPOD 模型扩展数字孪生平台库,加速 AI 数据中心部署与运营

    [1]  利用搭载 DGX GB200 系统的 NVIDIA DGX SuperPOD[2] 数字孪生系统实现了库的重大扩展 。借助 NVIDIA 高性能加速
    的头像 发表于 09-15 15:19 1243次阅读

    加速AI未来,睿海光电800G OSFP光模块重构数据中心互联标准

    定义数据中心互联的新范式。 一、技术实力:800G OSFP光模块的卓越性能表现 睿海光电800G OSFP光模块系列采用行业领先的PAM4调制技术,具备以下核心优势: 超高速率 :单模传输速率达
    发表于 08-13 16:38

    借助美光9550高性能SSD提升AI工作负载

    推理将成为数据中心最常见的工作负载,这一点毋庸置疑。随着数据中日益广泛采用NVIDIA H100,以及非NVL72系统开始部署NVIDIA
    的头像 发表于 07-14 15:58 1483次阅读
    借助美光9550高性能SSD提升AI工作负载

    中型数据中心中的差分晶体振荡器应用与匹配方案

    对时钟源的稳定性与抖动性能要求显著提升,差分晶体振荡器在其中扮演着核心角色。 中型数据中心典型案例 1. 大型制造企业工业数据中心 应用背景: 服务于制造集团的MES系统、IIoT平台、设备监控与调度
    发表于 07-01 16:33

    小型数据中心晶振选型关键参数全解

    边缘计算数据中心 应用背景:该数据中心用于处理来自IoT设备和远程传感器的数据,具备快速数据传输和高效存储能力。 使用设备:边缘交换机、边缘路由器、存储设备(NAS)、无线接入点等。
    发表于 06-11 13:37

    磁悬浮冷站引领绿色革命,维谛技术(Vertiv)助力中国电信江西云计算数据中心制冷系统实现PUE1.2

    ,如何让数据中心既当“最强大脑”又做“节能标兵”?在中国电信江西云计算数据中心,维谛技术(Vertiv)搭建的业界首个集成自然冷和余热回收的磁悬浮集成冷站,正在上
    的头像 发表于 05-22 14:18 731次阅读
    磁悬浮冷站引领绿色革命,维谛技术(Vertiv)助力中国电信江西云<b class='flag-5'>计算数据中心</b>制冷系统实现PUE1.2

    利用NVIDIA技术构建从数据中心到边缘的智慧医院解决方案

    全球领先的电子制造商正在利用 NVIDIA 技术,构建从数据中心到边缘的智慧医院解决方案。
    的头像 发表于 05-22 09:50 732次阅读

    GPU 维修干货 | 英伟达 GPU H100 常见故障有哪些?

    上涨,英伟达H100GPU凭借其强大的算力,成为AI训练、高性能计算领域的核心硬件。然而,随着使用场景的复杂化,H100服务器故障率也逐渐攀升,轻则影响业务进度,重
    的头像 发表于 05-05 09:03 2457次阅读
    GPU 维修干货 | 英伟达 GPU <b class='flag-5'>H100</b> 常见故障有哪些?

    适用于数据中心和AI时代的800G网络

    数据中心依赖数千甚至上万个GPU集群进行高性能计算,对带宽、延迟和数据交换效率提出极高要求。 AI云:以生成式AI为核心的云平台,为多租户环境提供推理服务。这类
    发表于 03-25 17:35

    NVIDIA加速的Apache Spark助力企业节省大量成本

    随着 NVIDIA 推出 Aether 项目,通过采用 NVIDIA 加速的 Apache Spark 企业得以自动加速数据中心规模的分析
    的头像 发表于 03-25 15:09 903次阅读
    <b class='flag-5'>NVIDIA</b><b class='flag-5'>加速</b>的Apache Spark助力企业节省大量成本

    优化800G数据中心:高速线缆、有源光缆和光纤跳线解决方案

    随着技术的飞速发展,数据中心正在从100G和400G演进到800G时代,对高速数据传输的需求与日俱增。因此,选择高效且可靠的布线解决方案对于800G数据中心至关重要。本文将深入探讨80
    发表于 03-24 14:20

    英伟达A100H100比较

    英伟达A100H100都是针对高性能计算和人工智能任务设计的GPU,但在性能和特性上存在显著差异。以下是对这两款GPU的比较: 1. 架构与核心规格: A100: 架构: 基于Amp
    的头像 发表于 02-10 17:05 1.1w次阅读
    英伟达A<b class='flag-5'>100</b>和<b class='flag-5'>H100</b>比较

    利用NVIDIA DPF引领DPU加速计算的未来

    越来越多的企业开始采用加速计算,从而满足生成式 AI、5G 电信和主权云的需求。NVIDIA 推出了 DOCA 平台框架(DPF),该框架提供了基础构建模块来释放
    的头像 发表于 01-24 09:29 1274次阅读
    <b class='flag-5'>利用</b><b class='flag-5'>NVIDIA</b> DPF引领DPU<b class='flag-5'>加速</b>云<b class='flag-5'>计算</b>的未来

    交通运输领先企业率先采用NVIDIA Cosmos平台

    支撑自动驾驶汽车开发有三个关键计算平台NVIDIA DGX 平台用于在数据中心训练基于 AI 的堆栈;运行在
    的头像 发表于 01-09 16:02 900次阅读