语音识别技术的应用及发展

机器人培训 2021-05-31 16:25www.robotxin.com机器人培训
是以语音为研究对象,通过语音信号处理和让机器自动识别和理解人类口述的语言。技术就是让机器通过识别和理解过程把语音信号转变为相应的文本或命令的高技术。是一门涉及面很广的交叉学科,它与声学、语音学、语言学、信息理论、理论以及神经生物学等学科都有非常密切的关系。技术正逐步成为计算机信息处理技术中的关键技术,语音技术的应用已经成为一个具有竞争性的新兴高技术产业。

1、的基本原理

系统本质上是一种系统,包括特征提娶模式匹配、参考模式库等三个基本单元,它的基本结构如下图所示

未知语音经过话筒变换成电信号后加在识别系统的输入端,经过预处理,再根据人的语音特点建立语音模型,对输入的语音信号进行分析,并抽取所需的特征,在此基础上建立所需的模板。而计算机在识别过程中要根据的模型,将计算机中存放的语音模板与输入的语音信号的特征进行比较,根据一定的搜索和匹配策略,找出一系列最优的与输入语音匹配的模板。然后根据此模板的定义,通过查表就可以给出计算机的识别结果。显然,这种最优的结果与特征的选择、语音模型的好坏、模板是否准确都有直接的关系。

2、技术的发展历史及现状

1952年,AT&TBell实验室的Davis等人研制了第一个可十个英文数字的特定人语音增强系统一Audry系统1956年,美国普林斯顿大学RCA实验室的Olson和Belar等人研制出能10个单音节词的系统,该系统采用带通滤波器组获得的频谱参数作为语音增强特征。1959年,Fry和Denes等人尝试构建音素器来4个元音和9个辅音,并采用频谱分析和模式匹配进行决策。这就大大提高了的效率和准确度。从此计算机的受到了各国科研人员的重视并开始进入的研究。60年代,苏联的Matin等提出了语音结束点的端点检测,使水平明显上升;Vintsyuk提出了动态编程,这一提法在以后的识别中不可或缺。60年代末、70年代初的重要成果是提出了信号线性预测编码(LPC)技术和动态时间规整(DTW)技术,有效地解决了语音信号的特征提取和不等长语音匹配问题;提出了矢量量化(VQ)和隐马尔可夫模型(HMM)理论。技术与语音合成技术结合使人们能够摆脱键盘的束缚,取而代之的是以语音输入这样便于使用的、自然的、人性化的输入方式,它正逐步成为信息技术中人机接口的关键技术。

3、的方法

目前具有代表性的方法主要有动态时间规整技术(DTW)、隐马尔可夫模型(HMM)、矢量量化(VQ)、人工(ANN)、支持向量机(SVM)等方法。

动态时间规整算法(Dynamic Time Warping,DTW)是在非特定人中一种简单有效的方法,该算法基于动态规划的思想,解决了发音长短不一的模板匹配问题,是技术中出现较早、较常用的一种算法。在应用DTW算法进行时,就是将已经预处理和分帧过的语音测试信号和参考语音模板进行比较以获取他们之间的相似度,按照某种距离测度得出两模板间的相似程度并选择最佳路径。

隐马尔可夫模型(HMM)是语音信号处理中的一种统计模型,是由Markov链演变来的,所以它是基于参数模型的统计识别方法。由于其模式库是通过反复训练形成的与训练输出信号吻合概率最大的最佳模型参数而不是预先储存好的模式样本,且其识别过程中运用待识别语音序列与HMM参数之间的似然概率达到最大值所对应的最佳状态序列作为识别输出,是较理想的模型。

矢量量化(Vector Quantization)是一种重要的信号压缩方法。与HMM相比,矢量量化主要适用于小词汇量、孤立词的中。其过程是将若干个语音信号波形或特征参数的标量数据组成一个矢量在多维空间进行整体量化。把矢量空间分成若干个小区域,每个小区域寻找一个代表矢量,量化时落入小区域的矢量就用这个代表矢量代替。矢量量化器的设计就是从大量信号样本中训练出好的码书,从实际效果出发寻找到好的失真测度定义公式,设计出最佳的矢量量化系统,用最少的搜索和计算失真的运算量实现最大可能的平均信噪比。

在实际的应用过程中,人们还研究了多种降低复杂度的方法,包括无记忆的矢量量化、有记忆的矢量量化和模糊矢量量化方法。

人工(ANN)是20世纪80年代末期提出的一种新的方法。其本质上是一个自适应非线性动力学系统,模拟了人类神经活动的原理,具有自适应性、并行性、鲁棒性、容错性和学习特性,其强大的分类能力和输入—输出映射能力在中都很有吸引力。其方法是模拟人脑思维机制的工程模型,它与HMM正好相反,其分类决策能力和对不确定信息的描述能力得到举世公认,但它对动态时间信号的描述能力尚不尽如人意,通常MLP分类器只能解决静态模式分类问题,并不涉及时间序列的处理。尽管学者们提出了许多含反馈的结构,但它们仍不足以刻画诸如语音信号这种时间序列的动态特性。由于ANN不能很好地描述语音信号的时间动态特性,所以常把ANN与传统识别方法结合,分别利用各自优点来进行而克服HMM和ANN各自的缺点。近年来结合和隐含马尔可夫模型的识别算法研究取得了显著进展,其识别率已经接近隐含马尔可夫模型的识别系统,进一步提高了的鲁棒性和准确率。

支持向量机(Support vector machine)是应用统计学理论的一种新的学习机模型,采用结构风险最小化原理(Structural Risk Minimization,SRM),有效克服了传统经验风险最小化方法的缺点。兼顾训练误差和泛化能力,在解决小样本、非线性及高维方面有许多优越的性能,已经被广泛地应用到领域。

4、系统的分类

系统可以根据对输入语音的限制加以分类。如果从说话者与识别系统的相关性考虑,可以将识别系统分为三类(1)特定人系统。仅考虑对于专人的话音进行识别。(2)非特定人语音系统。识别的语音与人无关,通常要用大量不同人的语音数据库对识别系统进行学习。(3)多人的识别系统。通常能识别一组人的语音,或者成为特定组系统,该系统仅要求对要识别的那组人的语音进行训练。

如果从说话的方式考虑,也可以将识别系统分为三类(1)孤立词系统。孤立词识别系统要求输入每个词后要停顿。(2)连接词系统。连接词输入系统要求对每个词都清楚发音,一些连音现象开始出现。(3)连续系统。连续语音输入是自然流利的连续语音输入,大量连音和变音会出现。

如果从识别系统的词汇量大小考虑,也可以将识别系统分为三类(1)小词汇量系统。通常包括几十个词的系统。(2)中等词汇量的系统。通常包括几百个词到上千个词的识别系统。(3)大词汇量系统。通常包括几千到几万个词的系统。随着计算机与器运算能力以及识别系统精度的提高,识别系统根据词汇量大小进行分类也不断进行变化。目前是中等词汇量的识别系统,将来可能就是小词汇量的系统。这些不同的限制也确定了系统的困难度。

5、的应用

可以应用的领域大致分为大五类

办公室或商务系统。典型的应用包括填写数据表格、数据库管理和控制、键盘功能增强等等。

制造业在质量控制中,系统可以为制造过程提供一种“不用手”、“不用眼”的检控(部件检查)。

电信相当广泛的一类应用在拨号电话系统上都是可行的,包括话务员协助服务的自动化、国际国内远程电子商务、语音呼叫分配、语音拨号、分类订货。

医疗这方面的主要应用是由声音来生成和编辑专业的医疗报告。

其他包括由语音控制和操作的游戏和玩具、帮助残疾人的系统、车辆行驶中一些非关键功能的语音控制,如车载交通路况控制系统、音响系统。

6、系统的最新发展

技术发展到今天,特别是中小词汇量非特定人系统识别精度已经大于98%,对特定人系统的识别精度就更高。这些技术已经能够满足通常应用的要求。由于大规模集成电路技术的发展,这些复杂的系统已经完全可以制成专用芯片,大量生产。在西方经济发达国家,大量的产品已经进入市场和服务领域。一些用户交换机、电话机、手机已经包含了拨号功能、语音记事本、语音智能玩具等产品,也包括与语音合成功能。人们可以通过电话网络用口语对话系统查询有关的机票、旅游、银行信息。调查统计表明,多达85%以上的人对的信息查询服务系统的性能表示满意。可以预测,在近5年内,系统的应用将更加广泛,各种各样的系统产品将不断出现在市场上。技术在人工邮件分拣中的作用也日益显现,发展前景诱人。一些发达国家的邮政部门已经使用了这一系统,技术逐渐成为邮件分拣的新技术。它可以克服手工分拣单纯依靠分拣员记忆力的不足,解决人员成本过高的问题,提高邮件处理的效率和效益。就教育领域来讲,技术的最直接的应用就是帮助用户更好地练习语言技巧。

技术的另一个发展分支就是电话技术的发展,贝尔实验室是这方面的先驱,电话技术将能够实现电话查询、自动接线以及一些专门业务如旅游信息等的操作。银行应用了语音理解技术的声讯查询系统后,可不分昼夜地为客户提供二十四小时的电话银行理财服务。而证券业方面,若是采用电话声讯系统的话,用户想查询行情便可以直接讲出股票名称或代码,而系统确认用户的要求后,会自动读出最新的股票价,这将大大方便用户。目前在114查号台还有大量的人工服务,如果采用语音技术,就可让计算机自动接听用户的需要,然后回放查询的电话号码,从而节约了人力资源。

Copyright © 2016-2025 www.robotxin.com 人工智能机器人网 版权所有 Power by