0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

奔向大模型时代,存算一体成为突破算力瓶颈的关键技术?

Carol Li 来源:电子发烧友网 作者:李弯弯 2023-04-03 00:28 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

电子发烧友网报道(文/李弯弯)大模型的训练和推理需要高性能的算力支持。以ChatGPT为例,据估算,在训练方面,1746亿参数的GPT-3模型大约需要375-625台8卡DGXA100服务器训练10天左右,对应A100GPU数量约3000-5000张。

在推理方面,如果以A100GPU单卡单字输出需要350ms为基准计算,假设每日访问客户数量高达5,000万人时,按单客户每日发问ChatGPT应用10次,单次需要50字回答,则每日消耗GPU的计算时间将会高达243万个小时,对应的GPU需求数量将超过10万个。

大模型的训练和推理依赖通用GPU

算力即计算能力,具体指硬件对数据收集、传输、计算和存储的能力,算力的大小表明了对数字化信息处理能力的强弱,常用计量单位是FLOPS(Floating-pointoperationspersecond),表示每秒浮点运算次数。

当前大模型的训练和推理多采用GPGPU。GPGPU是一种由GPU去除图形处理和输出,仅保留科学计算、AI训练和推理功能的GPU。GPU芯片最初用于计算机系统图像显示的运算,但因其相比于擅长横向计算的CPU更擅长于并行计算,在涉及到大量的矩阵或向量计算的AI计算中很有优势,GPGPU应运而生。

在这波ChatGPT浪潮中长期押注AI的英伟达可以说受益最多,ChatGPT、包括各种大模型的训练和推理,基本都采用英伟达的GPU。目前国内多个厂商都在布局GPGPU,包括天数智芯、燧原科技、壁仞科技、登临科技等,不过当前还较少能够应用于大模型。

事实上业界认为,随着模型参数越来越大,GPU在提供算力支持上也存在瓶颈。在GPT-2之前的模型时代,GPU内存还能满足AI大模型的需求,近年来,随着Transformer模型的大规模发展和应用,模型大小每两年平均增长240倍,实际上GPT-3等大模型的参数增长已经超过了GPU内存的增长。传统的设计趋势已经不能适应当前的需求,芯片内部、芯片之间或AI加速器之间的通信成为了AI计算的瓶颈。

存算一体技术如何突破算力瓶颈

而存算一体作为一种新型架构形式受到关注,存算一体将存储和计算有机结合,直接在存储单元中处理数据,避免了在存储单元和计算单元之间频繁转移数据,减少了不必要的数据搬移造成的开销,不仅大幅降低了功耗,还可以利用存储单元进行逻辑计算提高算力,显著提升计算效率。

大模型的训练和部署不仅对算力提出了高要求,对能耗的要求也很高,从这个角度来看,存算一体降低功耗,提升计算效率等特性在大模型方面确实更具优势。

因为独具优势,过去几年已经有众多企业进入到存算一体领域,包括知存科技、千芯科技、苹芯科技、后摩智能、亿铸科技等。各企业的技术方向也有所不同,从介质层面来看,有的采用NORFlash,有的采用SRAM,也有的采用RRAM。

从目前的情况来看,基于NORFlash的存算一体产品,在算力上难以做大,应用场景主要是对算力要求不高,对功耗要求高的可穿戴设备等领域;基于SRAM的存算一体算力可以更大些,能够用于自动驾驶领域;而真正能够在算力上实现突破,可以称之为大算力AI芯片的,目前只有亿铸科技主推的基于RRAM的存算一体技术。

在大模型对大算力的需求背景下,亿铸科技近期更是提出了存算一体超异构计算。超异构计算能够把更多的异构计算整合重构,从而各类型处理器间充分地、灵活地进行数据交互而形成的计算。

简单来说,就是结合DSA、GPU、CPU、CIM等多个类型引擎的优势,实现性能的飞跃:DSA负责相对确定的大计算量的工作;GPU负责应用层有一些性能敏感的并且有一定弹性的工作;CPU啥都能干,负责兜底;CIM就是存内计算,超异构和普通异构的主要区别就是加入了CIM,由此可以实现同等算力,更低能耗,同等能耗,更高算力。另外,CIM由于器件的优势,能负担比DSA更大的算力。

亿铸科技创始人、董事长兼CEO熊大鹏博士表示,存算一体超异构计算的好处在于:一是在系统层,能够把整体的效率做到最优;二是在软件层,能够实现跨平台架构统一。

基于存算一体超异构概念,亿铸科技提出了自己的技术畅想:若能把新型忆阻器技术(RRAM)、存算一体架构、芯粒技术(Chiplet)、3D封装等技术结合,将会实现更大的有效算力、放置更多的参数、实现更高的能效比、更好的软件兼容性、从而突破性能瓶颈,抬高AI大算力芯片的发展天花板。

图源:亿铸科技

目前国内已公开的能够实现存算一体AI大算力的芯片公司仅有亿铸科技,其基于RRAM的存算一体AI大算力芯片将在今年回片。

小结

无论是大模型的训练还是部署,对大算力芯片的需求都很大,从目前的情况来看,大模型的训练在很长时间都将要依赖于英伟达的GPU芯片。

而在大模型的推理部署方面,除了GPU,存算一体将是非常合适的选择。未来大模型的部署规模会很大,从前不久英伟达专门推出适合大型语言模型部署的芯片平台也能看出来。据亿铸科技透露,公司规划的产品,在同等功耗下,性能将超越英伟达H100系列的推理芯片。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • AI
    AI
    +关注

    关注

    91

    文章

    42075

    浏览量

    303106
  • 大数据
    +关注

    关注

    64

    文章

    9115

    浏览量

    144176
  • 存算一体
    +关注

    关注

    1

    文章

    122

    浏览量

    5260
  • 大模型
    +关注

    关注

    2

    文章

    3870

    浏览量

    5300
收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    企业如何突破AI困局?2026 年异构管理平台推荐

    随着 AI 大模型爆发式增长,异构管理已成为企业 AI 基础设施建设的核心挑战。本文从行业现状出发,分析异构
    的头像 发表于 05-20 12:53 98次阅读

    拆解一体技术瓶颈,亿铸科技如何逐个突破

    搬运,不仅造成带宽与时延瓶颈,还产生极高额外能耗。行业内个公认的观点是:当前 AI 计算中数据搬运成本已远超计算本身成本,存储墙、能耗墙成为制约
    的头像 发表于 05-14 09:51 239次阅读

    中国移动发布全国一体技术创新体系

    近日,在2026移动云大会期间,中国移动举办了"强基铸・智启新程——全国一体技术创新分论坛"。论坛聚焦AI
    的头像 发表于 05-09 10:44 1906次阅读

    安克创新发布Thus™芯片:一体架构重塑AI音频新生态

    2026年4月22日,安克创新在深圳举办技术沟通会,正式推出全球首款基于NOR Flash技术的神经网络一体(CIM)AI音频芯片Thu
    的头像 发表于 04-23 09:59 4433次阅读

    中科曙光scaleX40超节点革新AI协同

    在当前时代,以Token(词元)为代表的需求已成为行业核心刚需,而稳定、高效的
    的头像 发表于 03-28 15:46 1808次阅读

    天数智芯助力DeepLink异构训推一体化升级

    当前,通用人工智能发展驶入快车道,大模型的需求呈现爆发式增长,异构的高效协同成为释放
    的头像 发表于 03-26 09:30 492次阅读
    天数智芯助力DeepLink异构<b class='flag-5'>算</b><b class='flag-5'>力</b>训推<b class='flag-5'>一体</b>化升级

    忆联UH812a以极致破局大模型载入瓶颈

    随着大模型技术规模化落地,AI应用的实时性正成为企业竞争的核心。然而,在力持续升级的同时,模型
    的头像 发表于 03-04 16:22 1129次阅读
    忆联UH812a以极致<b class='flag-5'>存</b><b class='flag-5'>力</b>破局大<b class='flag-5'>模型</b>载入<b class='flag-5'>瓶颈</b>

    革命下的隐形基石:一体时代呼唤更精准的“时间心跳”

    正在浮现:决定系统最终效率与可靠性的,往往并非峰值本身,而是数据在存储与计算单元之间反复搬运所产生的巨大功耗与延迟瓶颈。为了突破“存
    的头像 发表于 01-21 08:44 1010次阅读
    <b class='flag-5'>算</b><b class='flag-5'>力</b>革命下的隐形基石:<b class='flag-5'>存</b><b class='flag-5'>算</b><b class='flag-5'>一体</b><b class='flag-5'>时代</b>呼唤更精准的“时间心跳”

    湘军,让变成生产

    脑极体
    发布于 :2025年11月25日 22:56:58

    后摩尔定律时代,3D-CIM+RISC-V打造国产一体新范式

    、能效与带宽瓶颈成为行业前行的关键阻碍,而美西方的技术禁运更让中国芯片产业面临严峻挑战。
    发表于 09-17 09:31 6367次阅读
    后摩尔定律<b class='flag-5'>时代</b>,3D-CIM+RISC-V打造国产<b class='flag-5'>存</b><b class='flag-5'>算</b><b class='flag-5'>一体</b>新范式

    在TR组件优化与一体架构中构建技术话语权

    电磁兼容性、热管理在内的12项专业能力评估。\"这种评估体系,正是行业对技术人才的分级认证标准。 1.2 异构计算架构下的能力矩阵 一体架构的普及正在重构工程师的知识体系: 近内
    发表于 08-26 10:40

    文看懂“一体

    今天这篇文章,我们来聊个最近几年很火的概念——一体。为什么会提出“
    的头像 发表于 08-18 12:15 1761次阅读
    <b class='flag-5'>一</b>文看懂“<b class='flag-5'>存</b><b class='flag-5'>算</b><b class='flag-5'>一体</b>”

    一体技术加持!后摩智能 160TOPS 端边大模型AI芯片正式发布

    ,同步推出力擎™系列M.2卡、谋®系列加速卡及计算盒子等硬件组合,形成覆盖移动终端与边缘场景的完整产品矩阵。这系列动作标志着后摩智能在一体
    的头像 发表于 07-30 07:57 9166次阅读
    <b class='flag-5'>存</b><b class='flag-5'>算</b><b class='flag-5'>一体</b><b class='flag-5'>技术</b>加持!后摩智能 160TOPS 端边大<b class='flag-5'>模型</b>AI芯片正式发布

    缓解高性能一体芯片IR-drop问题的软硬件协同设计

    在高性能计算与AI芯片领域,基于SRAM的一体(Processing-In-Memory, PIM)架构因兼具计算密度、能效和精度优势成为主流方案。随着
    的头像 发表于 07-11 15:11 1742次阅读
    缓解高性能<b class='flag-5'>存</b><b class='flag-5'>算</b><b class='flag-5'>一体</b>芯片IR-drop问题的软硬件协同设计

    国际首创新突破!中国团队以一体排序架构攻克智能硬件加速难题

    2025 年 6 月 25 日,北京大学团队在智能计算硬件方面取得领先突破,国际上首次实现了基于一体技术的高效排序硬件架构 (A fas
    的头像 发表于 07-02 16:50 1050次阅读
    国际首创新<b class='flag-5'>突破</b>!中国团队以<b class='flag-5'>存</b><b class='flag-5'>算</b><b class='flag-5'>一体</b>排序架构攻克智能硬件加速难题