语音解析方法和装置的制造方法

文档序号:9766610 阅读:351 来源:国知局
语音解析方法和装置的制造方法
【技术领域】
[0001] 本发明设及语音识别技术领域,特别设及一种语音解析方法和装置。
【背景技术】
[0002] 随着人机信息交互技术的发展,语音识别技术显示出其重要性。在语音识别系统 中,语音端点检测是语音识别中的关键技术之一。语音端点检测是指在连续声音信号中找 出语音部分的起始点和终止点。端点检测准确与否,会直接影响到语音识别系统的性能。如 果端点切分出现错误,则会导致漏识别或者误识别等情况的发生,进而可导致语音识别结 果不准确。
[0003] 目前,传统的语音端点检测方法主要是获取时域或频域能量,并与给定的阔值进 行比较,从而判断出语音的起始点和终止点。端点检测的一般过程为:1、分帖提取语音特 征,计算时域或频域能量;2、将能量值与阔值比较,判断语音起始点;3、若找到语音起始点, 则继续向后取能量值与阔值比较,判断语音是否结束;4、若找到语音结束点,则终止查找, 返回结果。
[0004] 然而,在实现本发明的过程中发明人发现上述方法至少存在W下问题:当对一段 语音进行语音端点检测时,在非平稳噪声、较低信噪比环境下,所检测的语音端点的准确率 较低,影响语音识别系统的性能,可能会被误判为噪声,导致用户使用体验差。

【发明内容】

[0005] 本发明旨在至少在一定程度上解决相关技术中的技术问题之一。为此,本发明的 第一个目的在于提出一种语音解析方法,该方法能够准确地识别语音的有效性,W及通过 语义解析,确定语义是否与上下文相关,提高了语音识别系统的性能,使得多轮对话交互过 程更加流杨,提升用户使用体验。
[0006] 本发明的第二个目的在于提出一种语音解析装置。
[0007] 为实现上述目的,本发明第一方面实施例的语音解析方法,包括:S1、接收输入的 待检测语音信号;S2、分帖提取所述待检测语音信号的语音特征信息,根据所述语音特征信 息和声学模型生成所述待检测语音信号的识别结果;S3、根据所述识别结果和预设静音检 测算法初步检测出所述待检测语音信号的语音端点;S4、计算所述待检测语音信号的置信 度信息;S5、解析所述待检测语音信号的语义信息;W及S6、根据所述置信度信息和所述语 义信息获取所述待检测语音信号对应的语音解析结果。
[000引本发明实施例的语音解析方法,通过分帖提取待检测语音信号的语音特征信息, 根据语音特征信息和声学模型生成待检测语音信号的识别结果,再根据识别结果和预设静 音检测算法初步检测出待检测语音信号的语音端点,然后基于置信度信息和语义信息获取 待检测语音信号对应的语音解析结果,在复杂的环境噪声场景,能够准确地识别语音的有 效性,W及通过语义解析,确定语义是否与上下文相关,提高了语音识别系统的性能,使得 多轮对话交互过程更加流杨,提升用户使用体验。
[0009] 为实现上述目的,本发明第二方面实施例的语音解析装置,包括:接收模块,用于 接收输入的待检测语音信号;识别模块,用于分帖提取所述待检测语音信号的语音特征信 息,根据所述语音特征信息和声学模型生成所述待检测语音信号的识别结果;检测模块,用 于根据所述识别结果和预设静音检测算法初步检测出所述待检测语音信号的语音端点;计 算模块,用于计算所述待检测语音信号的置信度信息;解析模块,用于解析所述待检测语音 信号的语义信息;W及获取模块,用于根据所述置信度信息和所述语义信息获取所述待检 测语音信号对应的语音解析结果。
[0010] 本发明实施例的语音解析装置,通过分帖提取待检测语音信号的语音特征信息, 根据语音特征信息和声学模型生成待检测语音信号的识别结果,再根据识别结果和预设静 音检测算法初步检测出待检测语音信号的语音端点,然后基于置信度信息和语义信息获取 待检测语音信号对应的语音解析结果,在复杂的环境噪声场景,能够准确地识别语音的有 效性,W及通过语义解析,确定语义是否与上下文相关,提高了语音识别系统的性能,使得 多轮对话交互过程更加流杨,提升用户使用体验。
【附图说明】
[0011] 图1是根据本发明一个实施例的语音解析方法的流程图;
[0012] 图2是根据本发明一个实施例的检测语音起始点和语音结束点的流程图;
[0013] 图3是根据本发明一个实施例的语音解析装置的结构示意图。
【具体实施方式】
[0014] 下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终 相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附 图描述的实施例是示例性的,旨在用于解释本发明,而不能理解为对本发明的限制。
[0015] 下面参考附图描述本发明实施例的语音解析方法和装置。
[0016] 图1是根据本发明一个实施例的语音解析方法的流程图。
[0017] 如图1所示,该语音解析方法包括:
[0018] SI,接收输入的待检测语音信号。
[0019] 具体地,可接收用户通过麦克风等输入装置输入的待检测语音信号,如"帮忙查询 一下北京天气。"。
[0020] S2,分帖提取待检测语音信号的语音特征信息,根据语音特征信息和声学模型生 成待检测语音信号的识别结果。
[0021 ]具体地,在接收到待检测语音信号后,可对待检测语音信号进行分帖处理,并提取 每帖待检测语音信号的语音特征信息。其中,语音特征信息可包括梅尔频率倒谱系数(Mel Frequenc^y C邱Shum Coefficient,简称MFCC),W及MFCC的一阶差分和二阶差分等信息。 例如:可将用户输入的语音信号分成若干个W25毫秒为单位的语音帖。
[0022] 在生成语音特征信息之后,可基于声学模型计算每帖待检测语音信号在每个建模 单元上的似然值,然后通过动态规划算法,可W得到最优状态转移序列及其对应的词序列, 并将所得到的最优状态转移序列及其对应的词序列作为识别结果。
[0023] 其中,建模单元为经音素决策树聚类后的=音子状态。基于声学模型,可W获得待 检测语音信号在每个建模单元上的状态输出概率,状态输出概率和状态转移概率用于计算 路径扩展时每条路径的累积似然值。其中,状态转移概率是声学模型中预先训练好的,状态 转移概率是进行路径扩展时状态与状态之间进行跳转的概率值。
[0024] 为了提高声学识别的准确性和效率,可使用基于神经网络(D顺,Deep Neural Networks)的声学模型对语音特征信息进行识别。其中,DNN声学模型可通过对大量语音数 据进行训练获得。
[0025] S3,根据识别结果和预设静音检测算法初步检测出待检测语音信号的语音端点。
[0026] 其中,上述静音检测算法可W包括但不限于基于识别结果最优词序列的静音检测 算法。
[0027] S4,计算待检测语音信号的置信度信息。
[0028] 具体地,可根据识别结果、待检测语音信号的语音端点和待检测语音信号的信噪 比计算待检测语音信号的置信度信息。
[0029] 进一步而言,可基于识别结果,计算语音端点之间的每个词的声学后验概率。
[0030] 其中,计算语音端点之间的第k个词的声学后验概率的公式:
[0032] 其中Pk(X)为待检测语音信号中第k个词的声学后验概率,Pt(HikIx)为第t帖时该词 对应建模单元的似然值,;(町I X)为第t帖时所有建模单元的似然值和,Tk(X)为该词 二 0 的持续时长。
[0033] 在计算出声学后验概率后,可根据语音端点之间的每个词的声学后验概率和信噪 比计算每个词对应的置信度信息。
[0034] 具体地,针对语音端点之间的每个词,可基于当前词的短时能量值化(X
当前第1页 1 2 3 4
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1