0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

阿拉伯语自然语言处理模型NOOR的详细介绍

文传商讯 来源:文传商讯 作者:文传商讯 2022-04-12 11:53 次阅读

阿布扎比先进技术研究委员会旗下的全球研究中心和应用研究支柱部门技术创新研究所(TII)今天宣布推出NOOR语言处理模型,这是迄今为止全球规模居首的阿拉伯语自然语言处理(NLP)模型。

TII的高级研究人员和人工智能专家团队与LightOn联手,对这个阿拉伯语NLP模型进行了改进。LightOn是一家专为企业提供超大规模机器智能的技术公司。NOOR模型能够执行超出语言领域的任务,可提供覆盖整个端到端处理管道的高质量数据,包括大规模数据抓取、过滤和管理。该模型可促进超大规模数据的分布式训练和服务,基于该模型的应用具有高效推理能力,并可针对特定领域进行模型调整。

TII和ASPIRE首席执行官Ray O. Johnson博士表示:“这一进展将大幅提升我们的研究能力和资质,并提升阿布扎比和阿联酋作为重要研究生态系统的地位。我们的专家团队再次证明,阿布扎比和阿联酋地区可以取得具有世界影响力的、突破性的研发成果。”

TII人工智能跨学科中心部门主任Ebtesam Almazrouei博士表示:“在自然语言处理领域,大型语言模型不断涌现。能推出这个拥有100亿个参数的先进模型,我们感到很自豪。这是全球规模居首的阿拉伯语NLP模型。为训练该模型,我们采集了一套独一无二的大型阿拉伯语数据集。相关工作历经数月时间,包括对各种来源数据的整理、剔除和过滤。在此特别感谢参与该项目的整个团队,他们使NOOR成为世界各地学者和企业首选的阿拉伯语研究模型。”

TII数字科学研究中心和人工智能跨学科中心部门首席研究员Mérouane Debbah教授在发布会上表示:“通过NOOR,TII利用在大型语言模型方面的专有技术,扩大了现代标准阿拉伯语模型的范围,以在新一代人工智能研究中建立跨学科的先进专长。”

NOOR拥有超过300亿字的独特数据集,涵盖网络数据、书籍、诗歌、新闻文章和技术信息等来源,从而打造出全球规模居首的高质量跨领域阿拉伯语数据集,并大幅拓宽了该模型的适用范围。

Ebtesam Almazrouei博士表示,NOOR模型基于流行的Transformer架构,仅包含解码器,结构与GPT-3相似,其设计旨在处理生成类任务。经过升级的架构引入了机器学习领域的最新发展,包括更好的位置嵌入等改进。为确保NOOR大规模数据集的质量,TII团队设计了一个基于机器学习技术的自动过滤管道。相关工具可以识别优质参考文本,并保障模型不受垃圾内容污染。

NOOR利用先进的3D并行技术,在配备128个A100 GPU的高性能计算资源上进行了训练,该过程采用分布式计算模式,能够确保有效利用可用的硬件资源。

人工智能跨学科中心部门主任指出,NOOR只是该部门努力为更广泛的阿联酋人工智能战略做出贡献的第一步。

该模型以阿拉伯语中的“光”命名,以体现模型旨在启迪人类智慧的宗旨。

审核编辑:汤梓红

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 人工智能
    +关注

    关注

    1777

    文章

    43920

    浏览量

    230663
  • 模型
    +关注

    关注

    1

    文章

    2709

    浏览量

    47716
  • 自然语言处理

    关注

    1

    文章

    509

    浏览量

    13108
收藏 人收藏

    评论

    相关推荐

    【大语言模型:原理与工程实践】探索《大语言模型原理与工程实践》

    《大语言模型》是一本深入探讨人工智能领域中语言模型的著作。作者通过对语言模型的基本概念、基础技术
    发表于 04-30 15:35

    一种基于自然语言的轨迹修正方法

    本研究提出了ExTraCT框架,利用自然语言进行轨迹校正。该框架结合了大型语言模型(LLMs)用于自然语言理解和轨迹变形函数。ExTraCT能够根据场景在线生成轨迹修改特征及其
    的头像 发表于 01-19 10:45 187次阅读
    一种基于<b class='flag-5'>自然语言</b>的轨迹修正方法

    自然语言处理的研究内容

    自然语言处理(NLP)的最新发展改变了我们与AI系统的交互方式: 1. 预训练模型:像 GPT-3 这样的模型已经进步,使人工智能能够在聊天机器人和虚拟助手中生成更连贯的上下文感知响应
    的头像 发表于 01-18 16:39 206次阅读

    2023年科技圈热词“大语言模型”,与自然语言处理有何关系

    电子发烧友网报道(文/李弯弯)大语言模型(LLM)是基于海量文本数据训练的深度学习模型。它不仅能够生成自然语言文本,还能够深入理解文本含义,处理
    的头像 发表于 01-02 09:28 1406次阅读

    语言模型简介:基于大语言模型模型全家桶Amazon Bedrock

    本文基于亚马逊云科技推出的大语言模型与生成式AI的全家桶:Bedrock对大语言模型进行介绍。大语言
    的头像 发表于 12-04 15:51 414次阅读

    时间序列的基础模型自然语言处理那样存在吗

    适应各种各样的任务,而无需进一步的训练。 这就引出了一个问题: 时间序列的基础模型能像自然语言处理那样存在吗? 一个预先训练了大量时间序列数据的大型模型,是否有可能在未见过的数据上产生
    的头像 发表于 11-03 10:15 328次阅读
    时间序列的基础<b class='flag-5'>模型</b>像<b class='flag-5'>自然语言</b><b class='flag-5'>处理</b>那样存在吗

    自然语言处理和人工智能的区别

      自然语言处理(Natural Language Processing,NLP)是人工智能(AI)中的一个分支,它利用计算机技术对自然语言进行处理,使得电脑能够理解和操作人类
    发表于 08-28 17:32 942次阅读

    自然语言处理和人工智能的概念及发展史 自然语言处理和人工智能的区别

    自然语言处理(Natural Language Processing, NLP)的定义是通过电脑软件程序实现人们日常语言的机器自动处理。为了帮助计算机理解,掌握
    发表于 08-23 18:22 539次阅读

    自然语言处理的概念和应用 自然语言处理属于人工智能吗

      自然语言处理(Natural Language Processing)是一种人工智能技术,它是研究自然语言与计算机之间的交互和通信的一门学科。自然语言
    发表于 08-23 17:31 856次阅读

    自然语言处理的优缺点有哪些 自然语言处理包括哪些内容

    自然语言处理(Natural Language Processing)是一种人工智能的技术及领域,它致力于让计算机理解及处理人类语言。它可以帮助计算机对人类
    发表于 08-23 17:26 2620次阅读

    亚马逊云科技结合大语言模型自然语言问答,加速的数据决策

    亚马逊云科技近日宣布,正在将Amazon Bedrock提供的大语言模型能力与支持自然语言问答的Amazon QuickSight Q相结合,在Amazon QuickSight中提供生成式BI功能
    的头像 发表于 08-14 19:04 394次阅读
    亚马逊云科技结合大<b class='flag-5'>语言</b><b class='flag-5'>模型</b>和<b class='flag-5'>自然语言</b>问答,加速的数据决策

    自然语言处理包括哪些内容 自然语言处理技术包括哪些

    自然语言处理(Natural Language Processing, NLP)一般包括以下内容: 语音识别(Speech Recognition):将人类语言转换为计算机可以理解的形式。 语音合成
    的头像 发表于 08-03 16:22 3941次阅读

    PyTorch教程-16.5。自然语言推理:使用注意力

    实验室在 SageMaker Studio Lab 中打开笔记本 我们在16.4 节介绍自然语言推理任务和 SNLI 数据集。鉴于许多基于复杂和深层架构的模型, Parikh等人。( 2016
    的头像 发表于 06-05 15:44 347次阅读
    PyTorch教程-16.5。<b class='flag-5'>自然语言</b>推理:使用注意力

    PyTorch教程16.7之自然语言推理:微调BERT

    电子发烧友网站提供《PyTorch教程16.7之自然语言推理:微调BERT.pdf》资料免费下载
    发表于 06-05 10:52 0次下载
    PyTorch教程16.7之<b class='flag-5'>自然语言</b>推理:微调BERT

    可商用多语言聊天LLM开源,性能直逼GPT-4

    在针对英语、中文、法语、阿拉伯语、西班牙语、印度语这 6 种语言的评测中,GPT-4 的胜率为 54.75%,BLOOMChat 的胜率为 45.25%,稍弱于 GPT-4。但与其它 4 种主流的开源聊天 LLM 相比
    的头像 发表于 05-25 11:14 726次阅读
    可商用多<b class='flag-5'>语言</b>聊天LLM开源,性能直逼GPT-4