0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

影响存储系统性能的因素

Micron美光科技 来源:Micron美光科技 2024-11-18 10:35 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

数据是各种现代企业的生命线,而数据存储、访问与管理策略对企业的生产力、盈利能力以及竞争力会产生显著影响。随着人工智能AI)的兴起,各行各业都在经历变革,企业不得不重新思考如何利用数据来加速创新和增长。然而,AI训练和推理对数据管理和存储提出了独特的挑战,因为它们需要处理庞大的数据,同时要求高性能、可扩展性和高可用性。

存储系统的性能各异,受多种因素影响。在这篇博客文章中,我们将探讨影响存储系统在AI领域的表现的几大因素,并重点分析所选用的基础存储介质将如何影响这些性能因素。

AI工作负载的关键属性

AI工作负载具有数据密集和计算密集的双重特性,这意味着它们需要高速、低延迟地处理大量数据。存储在支持AI工作负载高效且有效地访问、摄取、处理和存储数据方面发挥着关键作用。典型AI工作负载对存储要求产生影响的几个关键属性包括:

·数据多样性:AI工作负载需要从多个来源访问数据,数据格式包括结构化、非结构化和半结构化,同时这些数据位于不同的位置(如本地、云端或边缘设备)。存储解决方案需要确保在不同环境和平台之间实现快速且可靠的数据访问和传输。

·数据速度:AI工作负载需要实时或近实时地处理数据。存储解决方案需要确保在数据摄取、处理和分析过程中,实现高吞吐量、低延迟,以及稳定一致的性能。

·数据量:由于AI模型越来越复杂、准确性越来越高,GPU集群计算能力不断增长,其存储解决方案也需要提供灵活且可扩展的容量和性能。

·数据可靠性和可用性:AI工作负载必须确保数据的完整性、安全性以及非常高的可用性,尤其是在与大型GPU集群相连时,这些集群不能容忍数据访问发生中断,因此相应的要求也越高。

影响存储系统性能的因素

存储系统性能并非单一指标,而是多个因素的组合,取决于数据、应用程序和数据中心基础设施的特性和要求。其中包括以下几大重要因素:

·吞吐量:从存储系统到网络或主机,以及从网络或主机到存储系统的数据传输速率。提高吞吐量可以改善系统性能,方法是增加带宽以及减少数据流中的拥塞和瓶颈。吞吐量通常受网络宽带或存储介质速度的影响。

·延迟:存储系统对读写请求的响应时间。低延迟可以改善性能,方法是减少GPU空闲时间以及提高系统对用户输入的响应能力。机械设备(如HDD)的延迟本质上要远高于固态设备(SSD)。

·可扩展性:存储系统对数据量、数据速度和数据多样性的适应能力。高可扩展性是确保存储系统能够随着业务需求和目标实现增长和演进的关键。在增加系统能够存储和管理的数据量方面,面临的严苛挑战是维持性能扩展,同时不触及瓶颈或存储设备的限制。

·复原力:存储系统在遭遇故障、错误或灾难时维护数据完整性和可用性的能力。更高的可靠性可以通过降低数据损坏、丢失以及恢复的频率和影响来提高性能。

其他存储介质

在数据中心应用中,机械硬盘(HDD)和固态硬盘(SSD)是两种主要的持久存储设备。HDD是机械设备,通过旋转的磁盘盘片(表面涂有一层磁性材料)来存储数据,而SSD通过固态闪存芯片来存储数据。几十年来,HDD一直都是主导的存储设备。HDD的每位成本很低,同时具有长期断电耐用性,但是在速度和可靠性方面不及SSD。SSD具有高吞吐量、低延迟、高可靠性,以及更密集的封装选项等特点。

随着技术的不断进步和计算需求的日益增加,HDD的机械性质确实让其在性能上无法与SDD比肩。系统设计可以采用以下几种方法来提升基于HDD的存储系统的有效性能,例如将热数据和冷数据混合存放(让热数据从冷数据中借用性能),在多个HDD磁盘中并行共享数据(提高吞吐量但不降低延迟),在HDD中预留冗余容量(本质上是针对IO进行预置,而不是增加容量),以及为延迟异常的请求或操作添加SSD缓存层。从成本效益的角度来看,这些系统级解决方案的能力只能在有限的范围内扩展。实际应用需要怎样的性能水平,这些解决方案就需要进行相应扩展,才能满足性能要求。对于目前的许多AI 工作负载而言,基于HDD的系统在性能可扩展性和功率效率方面存在不足。

基于SSD的大容量存储系统可以提供一种更为简洁且可扩展性更强的解决方案,并且它们正在迅速发展,在许多以GPU为中心的大型数据中心中,已成为高性能AI数据湖的存储介质。单从驱动器层面来看,SSD(基于每位成本)的成本要高于HDD。而从系统层面整体来看,如果考虑到以下改进,则与HDD相比,使用SSD构建的系统运营成本要低一些:

·更高的吞吐量

·延迟降低100倍以上

·每PB字节所需的服务器和机架数量更少

·可靠性更高,使用寿命更长

·在给定的性能水平下,能源效率更高

未来几年,SSD的容量有望突破120TB。随着容量的增加以及SSD与HDD之间价格差距的缩小,对于需要高于平均性能或在大数据集上需要极低延迟的其他工作负载(比如视频剪辑和医疗成像诊断)来说,这些SSD将是具有吸引力的替代方案。

结论

存储性能是运行AI工作负载的系统的一个重要设计标准。该性能会影响系统性能、可扩展性、数据可用性以及整体系统成本和功率要求。因此,了解不同存储方案的特性与优势,并针对AI需求选择合适的存储解决方案至关重要。选择合适的存储解决方案,助您优化AI工作负载,实现AI目标。

本文作者

Currie Munce

美光存储部门高级技术顾问和战略专家

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • AI
    AI
    +关注

    关注

    89

    文章

    38111

    浏览量

    296657
  • 存储系统
    +关注

    关注

    2

    文章

    428

    浏览量

    41776
  • 工作负载
    +关注

    关注

    0

    文章

    11

    浏览量

    2103

原文标题:为什么存储系统的性能对AI工作负载至关重要?

文章出处:【微信号:gh_195c6bf0b140,微信公众号:Micron美光科技】欢迎添加关注!文章转载请注明出处。

收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    全球前四!京东云云海AI存储跻身IO500高性能存储榜单

    存储技术,云海AI存储不采用 PMEM 硬件,具备更强通用性的同时也实现了更低存储成本。 IO500是全球高性能计算HPC领域最权威、最具影响力的
    的头像 发表于 11-27 14:51 204次阅读
    全球前四!京东云云海AI<b class='flag-5'>存储</b>跻身IO500高<b class='flag-5'>性能</b><b class='flag-5'>存储</b>榜单

    集装箱储能系统标准解析系列(二)|IEC TS 62933-3-1电能存储系统的规划和性能评估

    IEC TS 62933-3-1电能存储(EES)系统 第3-1部分:电能存储系统的规划和性能评估
    的头像 发表于 11-25 15:30 182次阅读
    集装箱储能<b class='flag-5'>系统</b>标准解析系列(二)|IEC TS 62933-3-1电能<b class='flag-5'>存储系统</b>的规划和<b class='flag-5'>性能</b>评估

    Linux系统性能优化技巧

    经过10年一线运维经验,我发现大多数工程师只掌握了Linux优化的冰山一角。今天分享的这些秘技,能让你的系统性能提升200%以上!
    的头像 发表于 08-27 14:34 634次阅读

    曙光存储支持西湖大学高性能计算中心部署完成全新存储系统

    近日,曙光存储支持西湖大学高性能计算中心部署完成全新存储系统,为AI研发、科学计算和信息化平台等提供存力支持。性能实测显示,该系统单节点带宽
    的头像 发表于 08-25 11:48 949次阅读

    NAS存储系统断电风险大?UPS电源守护数据安全刻不容缓

    在数字化时代,企业数据已成为最宝贵的资产。NAS存储系统作为企业数据存储的核心设备,一旦遭遇意外断电,轻则导致数据丢失,重则造成设备损坏,给企业带来难以估量的损失。作为专业UPS电源厂家,优比施
    的头像 发表于 08-25 10:13 656次阅读
    NAS<b class='flag-5'>存储系统</b>断电风险大?UPS电源守护数据安全刻不容缓

    Linux系统性能调优方案

    关键要点预览:本文将深入解析Linux系统性能瓶颈的根本原因,提供可直接落地的调优方案,让你的系统性能提升30-50%!
    的头像 发表于 08-06 17:49 590次阅读

    Ceph分布式存储系统解析

    在当今数据爆炸的时代,企业对存储系统的需求日益增长,传统的集中式存储已经无法满足大规模数据处理的要求。分布式存储系统应运而生,而Ceph作为开源分布式存储系统的佼佼者,以其高可用性、高
    的头像 发表于 07-14 11:15 715次阅读

    升降速曲线对直线电机系统性能影响的研究

    速曲线对直线电机系统性能影响的研究.pdf【免责声明】本文系网络转载,版权归原作者所有。本文所用视频、图片、文字如涉及作品版权问题,请第一时间告知,删除内容!
    发表于 06-17 08:48

    兆芯+图云创智—可信分布式存储系统解决方案

    图云创智分布式存储系统采用全分布式设计与先进的存储虚拟化技术相结合,由多个独立的兆芯 x86 服务器作为存储节点,联合道熵存储软件和思赞博微可信计算技术实现统一资源调度、纵向横向无缝扩
    的头像 发表于 04-23 10:29 653次阅读
    兆芯+图云创智—可信分布式<b class='flag-5'>存储系统</b>解决方案

    27MHz HCSL 差分晶体振荡器在数据中心网络存储系统中的应用方案

    相位抖动仅为0.3ps RMS,能够显著降低高速数据链路的误码率与抖动传输误差,是构建高可用、高性能存储系统的重要时钟组件。 二、产品介绍:[FCO5L02700033HDY00](FCom富士晶振
    发表于 04-14 21:19

    手动整理GB 44240电能存储系统用锂蓄电池和电池组安全测试设备

    ​GB 44240-2024是国内针对电能存储系统用锂蓄电池和电池组的强制性国家标准,旨在规范电能存储系统中锂电池的安全要求。​该标准由工业和信息化部组织制定,历时三年,将于2025年8月1日
    的头像 发表于 03-28 11:16 1153次阅读
    手动整理GB 44240电能<b class='flag-5'>存储系统</b>用锂蓄电池和电池组安全测试设备

    科达KCloudStor云存储系统与鲲鹏携手推进原生开发技术创新

    ,实现了从代码开发、流水线构建到兼容性测试、性能优化的全方位合作。 通过这一合作,科达KCloudStor云存储系统成功实现了“1套代码+1条流水线->多平台版本”的高效开发模式,极大提升了产品的跨平台兼容性和性能表现。目前,该
    的头像 发表于 01-23 16:22 1075次阅读

    电脑云存储系统,电脑云存储系统的教程,个人云电脑是什么以及怎么连接

    变成了亲情的纽带,跨越千里解决家人难题,让老人也能享受科技便利,不再为电脑故障烦恼。接下来和大家一起探索电脑云存储系统的教程。    电脑云存储系统的教程:    以搭建基于OwnCloud的云存储为例,先准备一台闲置电脑,安装
    的头像 发表于 12-31 13:57 728次阅读
    电脑云<b class='flag-5'>存储系统</b>,电脑云<b class='flag-5'>存储系统</b>的教程,个人云电脑是什么以及怎么连接

    24路电磁锁主板在智能存储系统中的作用

    在无人值守场景中,如自助服务机、智能生鲜柜、共享储物柜等,使用24路电磁锁主板可以集成身份识别技术,将用户的验证结果转化为相应的开锁动作,提升用户体验和运营效率,是实现智能存储系统高效、安全和自动化
    的头像 发表于 12-30 14:20 935次阅读
    24路电磁锁主板在智能<b class='flag-5'>存储系统</b>中的作用

    如何配置 RAID 5 存储系统

    配置 RAID 5 存储系统是一个涉及硬件和软件设置的过程。以下是配置 RAID 5 存储系统的一般步骤,以及一些注意事项。请注意,具体步骤可能会因不同的硬件和操作系统而有所不同。 1. 准备硬件
    的头像 发表于 12-27 17:02 3244次阅读