在近日举行的NeurIPS大会上,发布了两册英特尔提供支持的关于口语数据集的白皮书,其中,《人的语言》主要涉及到“自动语音识别”任务,另一册——《多语种口语语料库》则涵盖“关键词识别”。这两个项目的数据集都贡献了大量丰富的音频数据,且每个数据集在同类中都拥有最大的可用体量。
《多语种口语语料库》由英特尔软件与先进技术事业部(SATG)的机器学习工程师Keith Achorn参与撰写。Keith在英特尔社区网站的博客中讲述了自己参与该项目的经历。
在ML Commons的支持下,“人的语言”和“多语种口语语料库”于2018年开始启动,该项目旨在识别世界上最常用的50种语言并统一到单一的数据集中,从而使这些数据得到有效利用。该项目小组成员来自英特尔、哈佛大学、阿里巴巴、甲骨文、Landing AI、密歇根大学、谷歌、百度等。
在当今多元化、国际化、多语言的工作环境中,准确转录和翻译的能力愈发重要。通过使用以上数据集,计算机可以“听到”口语单词,并自动生成文本或译文。
这两个项目都运用了“多样化语音”,这意味着它们可以更好地展现自然环境音,如背景噪音、非正式语言模式、录音设备混音以及其他声学环境等。这与诸如有声读物之类的高度受控的内容不同,后者产生的声音更加“纯净”。然而,在实际应用中,多样化语音训练有助于提高识别的准确性。
“人的语言”项目内含数万小时的对话音频。如今,它是世界上最大的、可免费下载的、用于学术和商用的英语语音识别数据集之一。
“多语种口语语料库”是一个音频语音数据集,不仅拥有超过30万个关键字的数十种语言,能够通过智能设备访问,还涵盖了50多亿用户的日常对话,有助于推动全球范围内受众语音应用的研发。
这两个数据集都将提供给广泛的用户进行应用,它们包括商用在内的授权许可条款都相对较为宽松。
原文标题:英特尔助力人工智能语言识别
文章出处:【微信公众号:英特尔中国】欢迎添加关注!文章转载请注明出处。
审核编辑:汤梓红
-
英特尔
+关注
关注
61文章
10275浏览量
179357 -
人工智能
+关注
关注
1813文章
49757浏览量
261675 -
语言识别
+关注
关注
0文章
15浏览量
4976
原文标题:英特尔助力人工智能语言识别
文章出处:【微信号:英特尔中国,微信公众号:英特尔中国】欢迎添加关注!文章转载请注明出处。
发布评论请先 登录
Intewell×Intel 强强联合 | 光亚鸿道亮相2025英特尔生态大会
创芯赋能智能生态!汇顶科技亮相2025英特尔技术创新与产业生态大会
40个项目脱颖而出!2025英特尔人工智能大赛圆满收官,下一个AI应用浪潮开启
聚焦液冷痛点:英特尔UQD互换性认证助力数据中心高效发展
硬件与应用同频共振,英特尔Day 0适配腾讯开源混元大模型
挖到宝了!人工智能综合实验箱,高校新工科的宝藏神器
AI驱动零售变革!英特尔AI方案助力中国厂商海外破局
英特尔带来AI创新技能课程,为创新人才培养提供全栈支持
英特尔首秀上海车展:以“芯”赋能,携手合作伙伴推动全车智能化

英特尔助力人工智能语言识别
评论