0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

语音识别的技术原理是什么?

九芯电子语音芯片 2022-05-10 16:40 次阅读

自动语音辨认技术(ASR,Automatic Speech Recognition)是一种经过让机器经过辨认和了解的过程,把人类的语音信号转变为相应文本的技术。我们先来看看语音辨认的历史,其实早在计算机创造之前,有关ASR技术的理念就曾经降生了,而早期的声码器就能够被视为是语音辨认及合成的雏形。而1920年代消费的"Radio Rex"玩具狗,可能是早的语音辨认器,当这只狗的名字被召唤的时分,它可以从底座上弹出来。这么看来论辈分它是阿尔法狗的爷爷……但毫无疑问60年代计算机的开展推进了语音辨认技术技术,这其中重要的一个里程碑就是动态规划技术(DP)和线性预测剖析技术(LP),后者又开展出了更成熟的动态时间归正技术(DTW),包括矢量量化(VQ)和隐马尔可夫模型(HMM)理论。但这些还都只是单调又晦涩的算法,换句话说,工程师看到这些玩意也一头雾水,基本没方法疾速在应用到理论里。所以在80年代时,著名的AT&T Bell实验室经过努力,把本来深奥无比的HMM纯数学模型工程化,为应用开发打下了重要的基石。到90年代时,深度神经网络技术的打破性开展,终于把语音辨认技术本来的难关攻破了。所以在我们会发现,从21世纪后语音辨认技术的开展就疾速加快了。其实看起来高大上的语音辨认技术,原理并没有多么复杂。不管是微软家的Cortana、三星家的S-voice苹果家的Siri,还是国内一些独立做语音辨认的比方讯飞、Rokid,在原理在实质上没有几差别:就是语音输入后,停止特征提取,将提取的特征值放进模型库里,再不时地停止锻炼和匹配,终解码得到结果。

假如要细说的话就比拟复杂了,比方模型库中又分为声学模型和言语模型。其中言语模型是依据不同品种的言语,对词串停止统计建模,目前普遍采用的是基于(n-1)阶马尔可夫链统计的n元语法模型。这里细致说下声学建模吧。首先经过前端特征提取取得声学特征,再进一步对声学特征停止统计建模。建模运用到的贝叶斯统计建模框架,也就是大后验概率决策原则。这里算法这种深奥的东西就不说了,除非深度开发,否则直接套用就行了,我本人也是博古通今,还是念书的时分学的。说说提取声学特征该如何完成:当语音输入之后,首先停止模电转换,将模仿信号转变为数字信号,再停止静音切除去掉无关噪音,然后停止分帧。将此时的信号分红一帧一帧之后(每一帧并不是独立存在的而是相互关联的),还要停止一系列的信号处置,包括预加重、加窗之后,再停止FFT变换之后,再经过Mel参数的滤波和取对数、离散余弦变换等一系列算法处置后,能够停止用梅尔频率倒谱系数(MFCC)停止特征提取,得到声学特征。觉得越说越复杂了……后面简单点说吧。前面说了言语模型,而声学模型就是将声学特征统计建模后得到的。得到了模型库之后就能够停止模型锻炼和形式匹配了。所谓模型锻炼就是指依照一定的原则,从大量已知语音形式中获取一个具特征的模型参数。而形式匹配则相反,是依据一定原则,将未知语音形式与模型库中的某一个模型取得佳匹配后的解码过程又能够分红动态解码网络和静态解码网络两种:动态网络会编译一个状态网络并构成搜索空间,把单词转换成一个个的音素后将其依照语序拆分红状态序列,再依据音素上下文分歧性准绳将状态序列停止衔接。而静态网络普通是针对一些特殊词(孤立词)的辨认网络,它的构造就简单多了:先将每条特殊词扩展成HMM状态序列,然后再计算得分,选择得分大的作为辨认输出结果。由于静态网络是依据声学概率计算权重,不需求查询言语模型概率,因而解码速度很快。 这样的一个流程大致上就是语音辨认技术的主要原理。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 语音识别
    +关注

    关注

    37

    文章

    1635

    浏览量

    111838
收藏 人收藏

    评论

    相关推荐

    语音识别的技术历程及工作原理

    语音识别的本质是一种基于语音特征参数的模式识别,即通过学习,系统能够把输入的语音按一定模式进行分类,进而依据判定准则找出最佳匹配结果。
    的头像 发表于 03-22 16:58 836次阅读
    <b class='flag-5'>语音</b><b class='flag-5'>识别的</b><b class='flag-5'>技术</b>历程及工作原理

    情感语音识别的挑战与未来趋势

    一、引言 情感语音识别是一种通过分析和理解人类语音中的情感信息来实现智能交互的技术。尽管近年来取得了显著的进步,但情感语音
    的头像 发表于 11-30 11:24 254次阅读

    情感语音识别的应用与挑战

    一、引言 情感语音识别是一种通过分析人类语音中的情感信息实现智能化和个性化人机交互的技术。本文将探讨情感语音
    的头像 发表于 11-30 10:40 286次阅读

    情感语音识别技术前沿与未来趋势

    一、引言 情感语音识别是当前人工智能领域的前沿技术,它通过分析人类语音中的情感信息,实现更加智能化和个性化的人机交互。本文将探讨情感语音
    的头像 发表于 11-28 18:35 269次阅读

    情感语音识别的现状与未来趋势

    情感语音识别是一种涉及多个学科领域的前沿技术,包括心理学、语言学、计算机科学等。它通过分析人类语音中的情感信息,实现更加智能化和个性化的人机交互。本文将探讨情感
    的头像 发表于 11-28 17:22 389次阅读

    离线语音识别及控制是怎样的技术

    引言:  随着人工智能的飞速发展,离线语音识别技术成为了一项备受瞩目的创新。离线语音识别技术能够
    发表于 11-24 17:41

    情感语音识别的研究方法与实践

    一、引言 情感语音识别是指通过计算机技术和人工智能算法自动识别和理解人类语音中的情感信息。为了提高情感
    的头像 发表于 11-16 16:26 276次阅读

    情感语音识别技术的发展趋势与前景

    的发展趋势 深度学习技术的进一步应用:情感语音识别技术的发展得益于深度学习技术的不断进步。未来,随着深度学习算法的不断完善和改进,情感
    的头像 发表于 11-16 16:13 253次阅读

    情感语音识别的前世今生

    的支持。本文将探讨情感语音识别的前世今生,包括其发展历程、应用场景、面临的挑战以及未来发展趋势。 二、情感语音识别的发展历程 起步阶段:早期的情感
    的头像 发表于 11-12 17:33 342次阅读

    情感语音识别的技术挑战与解决方案

    将探讨这些挑战以及可能的解决方案。 二、情感语音识别的技术挑战 情感表达的复杂性:人的情感表达是复杂且多变的,受到文化、个人经历、语言习惯等多种因素的影响。这使得准确识别和理解人的情感
    的头像 发表于 11-12 17:31 241次阅读

    离线语音识别和控制的工作原理及应用

    的应用越来越广泛。本文将深入探讨离线语音识别的工作原理,以及其所使用的技术。   一、离线语音识别的工作原理   离线
    发表于 11-07 18:01

    语音识别技术:现状、挑战与未来发展

    1.深度学习驱动的语音识别:深度学习已经在语音识别领域取得了显著的成果。特别是循环神经网络(RNN)和长短期记忆网络(LSTM)的应用,使得语音
    的头像 发表于 10-12 16:57 1228次阅读

    语音识别技术的进步与挑战

    基于对声音的物理特性进行分析,如音调、音色等。但由于其局限性,这些技术并未取得实质性进展。 2.突破阶段:随着深度学习算法的兴起,研究者们开始利用神经网络进行语音特征的学习和识别。这些方法显著提高了
    的头像 发表于 09-22 18:29 456次阅读

    语音识别技术:原理、应用与未来

    语音识别的原理、当前的应用情况以及对未来的展望。 二、语音识别原理 语音识别
    的头像 发表于 09-19 18:30 1190次阅读

    语音识别技术的概念及应用前景

    解决的问题,就是使得设备可以用听觉感知周围的世界,用声音和人做最自然的交互,让操控和生活更为便捷。 智能语音的基础在于通过神经网络技术,提升语音识别的
    发表于 05-27 09:41