0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

华为智能驾驶芯片深度分析

佐思汽车研究 来源:佐思汽车研究 2023-10-20 16:57 次阅读

华为智能汽车部门IntelligentAutomotive Solutions(IAS)下设包括提供应用算法的AutonomousDriving Solution (ADS)部门、提供域控制器的Mobile Data Center(MDC)和提供传感器系统的集成感知事业部。其中,ADS负责算法研究,下分很多小组,分得特别精细,比如有Obstacle Detection Team障碍物探测、Prediction and Decision预测与决策;MDC类似于Tier1,前身为中央计算部门,主要为华为ARM服务器业务提供硬件。华为智能驾驶使用的芯片海思提供,华为ARM服务器芯片也由海思提供,智能驾驶和ARM服务器芯片共用大部分研发成果。

华为海思AI产品线规划路线图

e78496b8-6f12-11ee-939d-92fbcf53809c.png

图片来源:https://ggim.un.org/meetings/2019/Deqing/documents/1-3%20Huawei%20slides.pdf

海思AI产品线规划有四条,分别为鲲鹏、昇腾、麒麟和鸿鹄。其中,鲲鹏系列主要是CPU,昇腾是AI加速器,麒麟主要是针对手机,鸿鹄针对电视。智能驾驶是昇腾产品线的延伸。此外基于麒麟990的麒麟990A则是华为汽车座舱芯片。

华为智能驾驶芯片主要有昇腾310、昇腾610和昇腾620,这三款芯片还可以级联增加性能。https://www-file.huawei.com/-/media/corp2020/pdf/publications/huawei-research/2022/huawei-research-issue1-en.pdf,这个文档里有华为昇腾系列芯片的详细解释,本文主要资料来源就是这个文档。

昇腾610的内部框架图

e790035e-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

昇腾910内部框架图

e79cd5f2-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

华为设计芯片是模块形式,尽量复用研发成果,昇腾系列芯片的CPU和AI核心基本是相同的,只是核心数量不同。

华为昇腾核心特性一览表

e7ae5f5c-6f12-11ee-939d-92fbcf53809c.jpg

图片来源:华为

昇腾核心即AI核,分原始、Max、Mini、Lite、Tiny几个版本,针对不同的应用使用不同的核心和数量配置,如针对手机领域的麒麟990,是两个Lite和一个Tiny核心,三个加起来是6.88TOPS@INT8算力。昇腾310则是两个Mini核心,昇腾610则是10个原始核心,昇腾910是32个Max核心。昇腾620可能是10个Max核心。每个核心基本是相同的,主要是缓存配置和频率配置不同。

不同的核心对应不同的算法网络

e7bb1e54-6f12-11ee-939d-92fbcf53809c.jpg

图片来源:华为

昇腾Max核心内部框架

e7c698ce-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

上图为Max核心内部框架,主要包括标量Scalar、矢量Vector和张量Tensor三个运算单元。标量单元负责任务调度,矢量单元负责深度学习最后的激活阶段,张量负责卷积矩阵乘法。

三种运算单元的计算模式

e7d87c38-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

标量基本近似CPU,灵活性最高,但针对AI运算力最低。1D矢量近似于GPU,灵活性居中,AI算力中等,CUBE针对2D矩阵,也就是一般意义上的张量。

e7edbff8-6f12-11ee-939d-92fbcf53809c.png

如果按照严格数学的定义,那么矢量是一阶张量,矩阵是二阶张量,CUBE核跟英伟达的所谓张量核Tensor基本一致。

e7f53fc6-6f12-11ee-939d-92fbcf53809c.png

英伟达自Turing架构开始用的张量核架构和华为的CUBE基本一致,都是三维架构。

三种运算核心的对比

e800ed80-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

一个CUBE核是8TOPS@FP16的算力,注意是FP16不是常见的INT8,车载领域一般是INT8。一个CUBE内部包含4096个FP16 MACs,8192个INT8 MACs,而一个MAC是包含两个Ops,因此如果运行频率是1GHz,那FP16算力就是1G*2*4096=8T。

同样,谷歌的TPU V1是65000个FP16 MAC,运行频率0.7GHz,那么算力就是65000*0.7G*2=91T。特斯拉第一代FSD两个NPU,每个NPU是9216个INT8 MAC,运行频率是2GHz,算力就是2*2*2G*9216=73TOPS。所谓算力基本就是MAC数量的堆砌,堆的越多,算力越高,面积也越大,成本就越高。

算力这个数字不用较真。

几个手机芯片的AI算力对比

e814b176-6f12-11ee-939d-92fbcf53809c.jpg

来源:华为

高通骁龙865标称最高,有8TOPS,但AI得分很低,远低于4.5TOPS的联发科天玑1000,更低于华为的麒麟990,显然高通的水分很大,联发科则太老实了,标称比实际低了至少1TOPS。

华为在2019年在IEEE上发表论文《Kunpeng 920: The First 7-nm Chiplet-Based 64-Core ARM SoC for CloudServices》,链接为https://ieeexplore.ieee.org/document/9444893,这可是要付费浏览的论文,不是ARXIV那种只要你投就发表的论文,IEEE的论文是要严格审核的。

华为的论文主要说了LLC,即最后一级缓存。鲲鹏920的设计中,将SoC的全局LLC切片到各个CPU Cluster中,使LLC与CPU Cluster形成NUMA关系。因此,需要仔细考虑如何选择每个集群的适当大小,以最大限度地发挥其效益。综合考虑多种因素,选择每个集群4个CPU核心,以获得当前进程节点的最佳PPA分数。

LLC采用私有模式或共享模式:私有模式通常用于每个CPU核心承载相对独立的任务数据时;当SoC内的任务共享大量数据时,通常使用共享模式。

在私有模式下,每个CPU集群和对应的LLC切片组成一个私有组,可以避免集群访问高延迟的缓存切片。

在共享模式下,所有 LLC切片组合在一起充当一个块,以提高 SoC 内部数据的重用率。

再来看CPU部分,昇腾610里是16核心的CPU,按照惯例这里的CPU核心很可能就是鲲鹏里的CPU核心,即《Kunpeng 920: The First 7-nm Chiplet-Based 64-Core ARM SoC for CloudServices》里所说的TAISHAN V110,众所周知,泰山也是华为服务器的产品线名称。TAISHAN V110是ARM系列的魔改,因为TAISHAN V120内核是基于ARM Cortex-A76的魔改,https://www.huaweicentral.com/kirin-990a-huaweis-first-auto-chipset-installed-in-arcfox-alpha-s-smart-car/,这里提到了麒麟990A的CPU是TAISHAN V120的lite版,而https://www.hisilicon.com/en/products/Kirin/Kirin-flagship-chips/Kirin-990-5G,则直接承认麒麟990的CPU就是ARM Cortex-A76,因此TAISHANV110很可能是ARM Cortex-A75或A73或者是ARM服务器系列的N1。和英伟达的Orin使用的ARM Cortex-A78AE差距很大,但华为用数量弥补了这一差距,基本与英伟达旗鼓相当。

NoC方面是2D的4*6 MESH网格,节点间工作频率2GHz,带宽1024位即256GB/s,这个在2019年是比较高端的配置,但现在是2023年了,只能是中等配置。

华为与其他智能驾驶芯片的对比

e81f39ac-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

华为最后也做了与其他智能驾驶芯片的对比,从中也可以看出昇腾610的die size尺寸很大,有401平方毫米。根据TechanaLye的分析,英伟达Orin的die size是455平方毫米,不过英伟达是三星的8纳米工艺,如果用和昇腾一样的台积电7纳米工艺,那么面积应该与昇腾610差不多,也就是说昇腾610的硬件成本和英伟达Orin是基本一致的。依照昇腾610的功率,水冷散热是少不了的。

算力实际上很难对比,英伟达的一般都是稀疏算力,而华为据说是稠密,通常两者会差一倍。英伟达Orin有多个版本,最顶级版本的275TOPS@稀疏INT8,算力实际上是两部分:一部分由2048个CUDA贡献,最高频率1.3GHz,贡献170TOPS@稀疏INT8算力;另一部分是64个张量核贡献,最高频率1.6GHz,贡献105TOPS@INT8稀疏算力,如果是FP32稠密格式那么算力仅为5.3TOPS(此时只有CUDA能处理FP32数据),并且CUDA核和张量核很难同时达到最大化性能。张量核主要做矩阵乘法,CUDA主要做矩阵与矢量乘法,矢量与矢量之间乘法,CPU会根据数据和任务的不同安排谁来工作。

此外稀疏和稠密有三种不同的定义,一种稀疏是计算稀疏,稀疏指计算密度低,谷歌第四代TPU就特设稀疏核,就是针对稀疏计算部分如transformer的嵌入部分。另一种是输入数据本身就是稀疏矩阵,还有一种是密集权重模型经过剪枝后的稀疏模型。天然稀疏矩阵指原始数据就包含很多0的矩阵,激光雷达的信息矩阵就是典型的稀疏矩阵,RGB摄像头一般是稠密矩阵。

在汽车这种嵌入式领域,算力和存储带宽限制需要尽可能地降低权重规模,对模型进行剪枝或者说蒸馏,这种属于主动将模型稀疏化,通常有四级,分别是Fine-grained、Vector、Kernel和Filter,分别对应单个权重、行或列、通道和卷积核。

英伟达对于最高级的fine grained做了特别优化,相对稠密模型,计算速度提高一倍,也就是算力数值高了一倍,英伟达公布的算力数值,一般默认是稀疏。如果没有针对fine grained优化,那么计算速度还是与稠密模型时一致。顺便说一句,对于激光雷达这种稀疏矩阵,人类目前没有找到好的优化加速的方法。

算力数值实际和算法高度捆绑。若算法不匹配,最糟糕的情况下,算力只能发挥1%不到,也就是如果是100TOPS的算力,那么实际只发挥了不到1TOPS,这种情况不算罕见。

昇腾的软件开发栈

e829f2e8-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

上图是昇腾的软件开发栈,CUDA还是必须使用,算子库还是常见的cuBLAS,英伟达的GPU此时会更占优势。

Transformer时代,存储带宽比算力数值更有价值。CNN时代,卷积之类的稠密算子占了90%以上的计算,而Transformer时代稠密算子所占的部分大幅下降,对存储带宽要求高的存储密集型算子大幅增加数倍,80-90%的计算延迟都是由这些算子造成的。

存储带宽方面,昇腾910不计成本使用了HBM,不过2019年只有HBM一代,昇腾910的存储带宽是1TB/s,和目前主流AI加速器比差距较大;昇腾610自然无法用昂贵的HBM,只能是LPDDR4/5,估计是100-200GB/s之间;昇腾310考虑成本,存储带宽只有47.8GB/s。特斯拉二代FSD用了GDDR6做存储,可轻易超过400GB/s。

考虑到华为的智能驾驶芯片是2019年确定设计框架的,这在2019年毫无疑问是全球最先进的,没有之一,即便到了2023年,这个设计仍然不算落伍,但与英伟达和高通的下一代相比,难免出现差距。特别是Transformer对AI运算有非常大的改变,必须做出对应的修改。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 华为
    +关注

    关注

    215

    文章

    33619

    浏览量

    247151
  • 智能驾驶
    +关注

    关注

    3

    文章

    2081

    浏览量

    48213
  • cnn
    cnn
    +关注

    关注

    3

    文章

    327

    浏览量

    21298

原文标题:华为智能驾驶芯片深度分析

文章出处:【微信号:zuosiqiche,微信公众号:佐思汽车研究】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    易控智驾获华为MDC 2023年智能驾驶杰出合作伙伴的称号

    4月24日下午,在“智在·必行”2024华为智能汽车解决方案MDC生态论坛上,易控智驾凭借在矿山无人驾驶领域规模化落地应用实践的突出成就,获得华为MDC 2023年
    的头像 发表于 04-25 18:27 449次阅读
    易控智驾获<b class='flag-5'>华为</b>MDC 2023年<b class='flag-5'>智能</b><b class='flag-5'>驾驶</b>杰出合作伙伴的称号

    华为发布以智能驾驶为核心的智能汽车解决方案新品牌—华为乾崑

    2024(第十八届)北京国际汽车展览会召开前夕,华为智能汽车解决方案发布会隆重召开,现场发布了以智能驾驶为核心的智能汽车解决方案新品牌——
    的头像 发表于 04-25 09:30 489次阅读

    平线与黑芝麻智驾芯片发展路径的深度复盘

    智能驾驶芯片市场正处于白热化的竞争之中,各大企业争相寻求突围和领先优势。 从现有数据和分析可以看出,智能
    发表于 04-01 11:47 413次阅读
    平线与黑芝麻智驾<b class='flag-5'>芯片</b>发展路径的<b class='flag-5'>深度</b>复盘

    华为自动驾驶技术怎么样?

    强大,主要体现在以下几个方面: 强大的研发团队:华为拥有一支专业的研发团队,专注于自动驾驶技术的研发和创新。这支团队汇聚了众多顶尖的技术专家和工程师,具备丰富的研发经验和技术积累。 领先的技术储备:华为在通信、
    的头像 发表于 02-02 16:58 932次阅读

    智能驾驶芯片TOP20排名

    智能驾驶芯片排名并不简单只看AI算力,CPU、存储带宽、功耗和AI算力数值一样重要,这个下文会详细分析
    的头像 发表于 12-28 10:29 888次阅读
    <b class='flag-5'>智能</b><b class='flag-5'>驾驶</b><b class='flag-5'>芯片</b>TOP20排名

    华为与哈工大联合推出新型芯片技术

    芯片华为
    深圳市浮思特科技有限公司
    发布于 :2023年12月07日 17:58:10

    一文详解华为智能驾驶MDC平台

    华为智能驾驶MDC平台已经在问界M5和M7、阿维达11、极狐阿尔法S Hi版落地量产了。最近问界M7可谓大火,并且智驾表现也是遥遥领先。
    的头像 发表于 10-23 10:28 1540次阅读
    一文详解<b class='flag-5'>华为</b><b class='flag-5'>智能</b><b class='flag-5'>驾驶</b>MDC平台

    华为芯片迎重大突破

    和巨额投入,已经在多个芯片领域取得了重大突破。例如,在人工智能领域,华为拥有自主研发的昇腾芯片,可以应用于智能
    的头像 发表于 09-06 11:14 3554次阅读

    西方分析公司看待华为破5G芯片

    西方如何看待华为5G芯片的突破?9月4日,加拿大分析公司TechInsights发布了拆解报告证实,华为5G芯片帮助西方证实了
    的头像 发表于 09-05 14:22 1522次阅读

    高通为什么不卖芯片华为华为用高通的芯片吗?

    高通为什么不卖芯片华为华为用高通的芯片吗? 作为全球领先的无线通信技术和芯片制造商,高通一直以来都是全球
    的头像 发表于 09-01 15:45 2734次阅读

    华为盘古大模型如何赋能自动驾驶

    华为盘古大模型如何赋能自动驾驶?  随着智能时代的到来,自动驾驶已成为许多汽车制造商和科技公司的追求,华为作为
    的头像 发表于 08-31 10:18 1434次阅读

    华大北斗高精度芯片助力上汽名爵MG7智能驾驶

    驶,让高阶智能驾驶不再只是电动车的专属,带来目前燃油轿车中最领先的智能辅助驾驶体验。华大北斗“芯片级”高性能、高精度导航定位解决方案成功应用
    发表于 08-30 14:44

    华为ai人工智能是什么

    华为人工智能是利用深度学习、自然语言处理、计算机视觉等技术开发的人工智能解决方案。华为正在开发各种人工智能工具和技术来帮助应用开发者解决复杂
    的头像 发表于 08-14 15:11 4222次阅读

    华为ai人工智能叫什么

    华为ai人工智能叫什么 华为AI人工智能叫做华为云和鲲鹏。这两个技术产品代表了华为在人工
    的头像 发表于 08-12 17:44 5728次阅读

    华为MDC自动驾驶

    智能驾驶汽车中,包含四个核心子系统:传感器、计算平台、执行器与应用算法,华为MDC( Mobile Data Center:移动数据中心)定位为智能
    发表于 06-06 09:45 3次下载
    <b class='flag-5'>华为</b>MDC自动<b class='flag-5'>驾驶</b>