音频信号的分类识别方法及装置的制作方法

文档序号:2823890 阅读:495 来源:国知局
专利名称:音频信号的分类识别方法及装置的制作方法
技术领域
本申请涉及通信技术领域,特别涉及语音音频处理中音频信号的分类识别方法及
直O
背景技术
USAC(Unified Coding of Speech and Audio,语音音频统一编码)是对语音信号和音乐信号的统一编码,在编码过程中需要正确识别出输入信号具有语音特征还是音乐特征,从而选择不同的编码方案对语音信号和音乐信号分别进行编码。参见图1,为现有识别语音和音乐信号的系统示意图。该系统包括MLER (改进型低能量帧率)特征获取模块110、贝叶斯后验分类模块120和后验决策模块130,该系统中基于分类特征进行判断,该分类特征具体为MLER。应用图1所示的系统,首先通过MLER特征获取模块110提取出第i个音频片段的MLER,然后利用贝叶斯后验分类模块120根据预先设置的阈值对该第i个音频片段的类型进行分类识别,最后利用后验决策模块130对前述分类识别的结果进行进一步验证,即后验决策模块130首先对识别结果进行缓存,并设定为初始状态,然后根据后续接收到的分类识别结果对前述保存的初始状态进行决策,利用后续音频片段的分类识别结果对已识别出的分类结果进行验证,以期减少分类误差。现有技术中使用了唯一的分类特征MLTR对音频片段的类型进行识别,每次判定以一个音频片段作为输出,一个音频片段的长度通常为1秒左右,因此相应会引入1秒左右的编码延迟,由此降低了音频处理的实时性能;由于现有技术中基于后验决策方法判断当前音频片段的类型,并且还需要通过后续音频片段的类型对当前音频片段的类型进行后验校验,因此将进一步加大语音音频的处理延时。

发明内容
本发明实施例提供音频信号的分类识别方法及装置,以解决现有音频信号的识别处理过程延时较大,音频处理实时性能不高的问题。本发明实施例提供一种音频信号的分类识别方法,包括获取一帧音频信号,对所述一帧音频信号进行预处理;通过预处理的结果对所述一帧音频信号之前的音频片段进行更新,生成包含所述一帧音频信号的当前音频片段;从所述当前音频片段中提取分类特征,所述分类特征包括低短时能量比LSTER和跳跃能量比JSTER ;根据所述分类特征识别所述一帧音频信号的类型,得到初始分类结果。本发明实施例提供一种音频信号的分类识别装置,包括获取单元,用于获取一帧音频信号;预处理单元,用于对所述一帧音频信号进行预处理;更新单元,用于通过预处理的结果对所述一帧音频信号之前的音频片段进行更新,生成包含所述一帧音频信号的当前音频片段;提取单元,用于从所述当前音频片段中提取分类特征,所述分类特征包括低短时能量比LSTER和跳跃能量比JSTER ;识别单元,用于根据所述分类特征识别所述一帧音频信号的类型,得到初始分类结果。由以上本申请实施例提供的技术方案可见,本申请实施例中获取一帧音频信号, 对一帧音频信号进行预处理,通过预处理的结果对一帧音频信号之前的音频片段进行更新,生成包含该一帧音频信号的当前音频片段,从当前音频片段中提取分类特征LSTER和 JSTER,根据分类特征识别一帧音频信号的类型,得到初始分类结果。与现有技术中每次需要识别一个音频片段的类别不同,本申请实施例中每次对一帧音频信号进行识别,由于音频信号的长度远远小于音频片段,因此延时性能极大提高,提高了音频处理的实时性能;本申请实施例中通过LSTER和JSTER两个分类特征对音频信号进行识别,增加了音频信号识别的准确性,并且由于无需进行复杂的后验决策等计算,因此降低了音频信号识别的复杂度。


为了更清楚地说明本申请实施例或现有技术中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本申请中记载的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动性的前提下,还可以根据这些附图获得其他的附图。图1为现有识别语音和音乐信号的系统示意图;图2为本申请音频信号的分类识别方法的第一实施例流程图;图3为本申请音频信号的分类识别方法的第二实施例流程图;图4为本申请实施例中对音频片段进行更新生成当前音频片段的示意图;图5为本申请音频信号的分类识别方法的第三实施例流程图;图6为本申请音频信号的分类识别装置的第一实施例框图;图7为本申请音频信号的分类识别装置的第二实施例框图。
具体实施例方式本申请实施例提供了音频信号的分类识别方法及装置。本申请实施例中对音频信号的分类识别主要指识别出音频信号属于语音信号或是音乐信号。为了使本技术领域的人员更好地理解本申请方案,并使本申请的上述目的、特征和优点能够更加明显易懂,下面结合附图和 具体实施方式
对本申请作进一步详细的说明。参见图2,为本申请音频信号的分类识别方法的第一实施例流程图步骤201 获取一帧音频信号,对该一帧音频信号进行预处理。具体的,将一帧音频信号划分为若干子帧,若干子帧中相邻两个子帧相互重叠,通过对每个子帧加汉明窗处理,计算每个子帧的短时能量。步骤202 通过预处理的结果对该一帧音频信号之前的音频片段进行更新,生成包含该一帧音频信号的当前音频片段。
具体的,将之前的音频片段的起始位置处的一帧音频信号的短时能量移除,将一帧音频信号的每个子帧的短时能量移入之前的音频片段的末端,生成当前音频片段。步骤203 从当前音频片段中提取分类特征低短时能量比LSTER和跳跃能量比 JSTER0LSTER(低短时能量比)指一个音频片段中能量低于阈值的子帧个数占该音频片段中子帧总数的比例JSTER(跳跃能量比)指一个音频片段中发生能量跳跃的子帧个数占该音频片段中子帧总数的比例。上述两个分类特征的提取主要在于计算每个子帧的短时能量,因此计算量较低。具体的,在提取LSTER时,计算当前音频片段中所有子帧的短时能量的平均值阈值,统计当前音频片段中子帧的短时能量低于平均值阈值的子帧个数,将低于平均值阈值的子帧个数除以当前音频片段中子帧的总数,得到LSTER。具体的,在提取JSTER时,获取当前音频片段中当前子帧的前一个子帧的短时能量和预测能量,根据前一个子帧的短时能量和预测能量计算当前子帧的预测能量,通过比较当前子帧的预测能量与当前子帧的短时能量判断当前子帧是否发生能量突变,统计当前音频片段中发生能量突变的子帧的个数,将发生能量突变的子帧个数除以当前音频片段中子帧的总数,得到JSTER。步骤204 根据分类特征识别该一帧音频信号的类型,得到初始分类结果。具体的,获取一帧音频信号的能量值,比较一帧音频信号的能量值与预设的静音帧的能量阈值,当能量值小于能量阈值时,判定一帧音频信号的类型与其上一帧音频信号的类型一致;当能量值大于阈值时,比较提取的LSTER与预先设置的LSTER阈值,当提取的 LSTER小于LSTER阈值时,判定一帧音频信号为音乐信号;当提取的LSTER大于LSTER阈值时,比较提取的JSTER与预先设置的JSTER阈值,当提取的JSTER小于JSTER阈值时,判定一帧音频信号为音乐信号,当提取的JSTER大于JSTER阈值时,判定一帧音频信号为语音信号。参见图3,为本申请音频信号的分类识别方法的第二实施例流程图,该实施例详细示出了对音频信号进行分类识别,并通过平滑处理得到最终的分类结果的过程步骤301 获取一帧音频信号。步骤302 将一帧音频信号划分为若干子帧,若干子帧中相邻两个子帧相互重叠。在进行预处理时,将读入的一帧音频信号划分为若干子帧,各个子帧之间相互重叠每个子帧点数的一半,对每个子帧加汉明窗进行处理,计算各个子帧的短时能量。其中,所读入的当前音频编码的一帧音频信号的长度可以根据具体编码环境的不同而不同,本申请实施例中,在划分子帧时,假设每个音频片段包含20帧音频信号,而每一帧音频信号中包含四个子帧,每个子帧的时长可以为23ms (毫秒),每两个相邻的子帧之间有11. 5ms的时长重叠。步骤303 通过对每个子帧加汉明窗处理,计算每个子帧的短时能量。本申请实施例中,假设每个子帧的数据长度为1024点,则在将当前输入的一帧音频信号划分为四个子帧后,依次为每个子帧加汉明窗进行处理,该汉明窗和子帧数据长度等长,即为1024点汉明窗。通过加汉明窗计算可以计算每个子帧的短时能量,得到当前一帧音频信号的四个子帧的短时能量。
步骤304 通过预处理的结果对一帧音频信号之前的音频片段进行更新,生成包含一帧音频信号的当前音频片段。在对音频片段进行更新时,将该当前一帧音频信号之前的一个音频片段的开始的四个子帧的短时能量移除,将当前一帧音频信号的四个子帧的短时能量移入该音频片段的末端,组成新的音频片段,作为当前音频片段。参见图4所示,为对音频片段进行更新生成当前音频片段的示意图。本申请实施例中使用包含当前一帧音频信号的一个音频片段的信息作为对该当前一帧音频信号进行分类的依据。步骤305 从当前音频片段中提取分类特征LSTER。在提取LSTER时,计算当前音频片段中子帧能量的平均值,并统计子帧能量低于平均值某个百分比的子帧的个数,其中平均值某个百分比的值可以记为平均值阈值,获得该音频片段的LSTER。具体来说,音频信号的分类结果主要包括语音信号和音乐信号两种,其中语音信号由于其中静音、清音和浊音的帧交替出现,因此导致各个子帧的短时能量不均等,而音乐信号由于比较平稳,因此音乐信号每个子帧的短时能量变化不大,和语音信号相比,音乐信号的短时能量变化的方差不大,且短时能量较低的子帧的比率也比较低,即音乐信号的 LSTER相对低于语音信号的LSTER。因此,根据语音信号和音乐信号的上述LSTER特征的不同,可以利用LSTER作为对音频信号进行分类的依据。仍然以包含20帧音频信号的音频片段为例,该音频片段中共包含80个子帧,则首先计算这80个子帧的短时能量的平均值,每个子帧的短时能量可以采用现有方法计算, 然后计算短时能量的平均值一定百分比的值作为平均值阈值,该百分比可以设定在5%至 10%之间,然后将80个子帧的短时能量分别与该计算出的平均值阈值进行比较,如果低于该平均值阈值则相应的子帧确定为短时能量较低的子帧,最后计算短时能量较低的子帧的个数占80个子帧的比例,即占当前音频片段的比例,得到LSTER,该LSTER具体可以按照如下公式进行计算其中,LSTER可以通过如下公式进行计算
权利要求
1.一种音频信号的分类识别方法,其特征在于,包括 获取一帧音频信号,对所述一帧音频信号进行预处理;通过预处理的结果对所述一帧音频信号之前的音频片段进行更新,生成包含所述一帧音频信号的当前音频片段;从所述当前音频片段中提取分类特征,所述分类特征包括低短时能量比LSTER和跳跃能量比JSTER ;根据所述分类特征识别所述一帧音频信号的类型,得到初始分类结果。
2.根据权利要求1所述的方法,其特征在于,所述对一帧音频信号进行预处理包括 将所述一帧音频信号划分为若干子帧,所述若干子帧中相邻两个子帧相互重叠; 通过对每个子帧加汉明窗处理,计算每个子帧的短时能量。
3.根据权利要求2所述的方法,其特征在于,所述通过预处理的结果对所述一帧音频信号之前的音频片段进行更新包括将所述之前的音频片段的起始位置处的一帧音频信号的短时能量移除; 将所述一帧音频信号的每个子帧的短时能量移入所述之前的音频片段的末端,生成所述当前音频片段。
4.根据权利要求2所述的方法,其特征在于,当分类特征为LSTER时,从所述当前音频片段中提取LSTER包括计算所述当前音频片段中所有子帧的短时能量的平均值阈值; 统计所述当前音频片段中子帧的短时能量低于所述平均值阈值的子帧个数; 将低于所述平均值阈值的子帧个数除以所述当前音频片段中子帧的总数,得到所述 LSTER0
5.根据权利要求2所述的方法,其特征在于,当分类特征为JSTER时,从所述当前音频片段中提取JSTER包括获取所述当前音频片段中当前子帧的前一个子帧的短时能量和预测能量; 根据所述前一个子帧的短时能量和预测能量计算所述当前子帧的预测能量; 通过比较所述当前子帧的预测能量与所述当前子帧的短时能量判断所述当前子帧是否发生能量突变;统计所述当前音频片段中发生能量突变的子帧的个数;将发生能量突变的子帧个数除以所述当前音频片段中子帧的总数,得到所述JSTER。
6.根据权利要求1所述的方法,其特征在于,所述根据所述分类特征识别一帧音频信号的类型包括获取所述一帧音频信号的能量值;比较所述一帧音频信号的能量值与预设的静音帧的能量阈值,当所述能量值小于所述能量阈值时,判定所述一帧音频信号的类型与其上一帧音频信号的类型一致;当所述能量值大于所述阈值时,比较提取的LSTER与预先设置的LSTER阈值,当所述提取的LSTER小于LSTER阈值时,判定所述一帧音频信号为音乐信号;当所述提取的LSTER大于LSTER阈值时,比较提取的JSTER与预先设置的JSTER阈值, 当所述提取的JSTER小于JSTER阈值时,判定所述一帧音频信号为音乐信号,当所述提取的 JSTER大于JSTER阈值时,判定所述一帧音频信号为语音信号。
7.根据权利要求6所述的方法,其特征在于,还包括通过所述一帧音频信号的初步分类结果对所述LSTER阈值和JSTER阈值进行调整,所述调整后的LSTER阈值和JSTER阈值用于所述一帧音频信号的下一帧音频信号的分类识别。
8.根据权利要求7所述的方法,其特征在于,所述通过一帧音频信号的初步分类结果对所述LSTER阈值和JSTER阈值进行调整包括将所述之前的音频片段的起始位置处的一帧音频信号的初步分类结果移除,并将所述一帧音频信号的初步分类结果移入所述之前的音频片段的末端,形成新的音频片段;当所述新的音频片段中初步分类结果为音乐信号的数量大于所述新的音频片段中所包含的音频信号数量的一半时,将所述LSTER阈值和JSTER阈值分别增加一个步长值,当所述新的音频片段中初步分类结果为音乐信号的数量小于所述新的音频片段中所包含的音频信号数量的一半时,将所述LSTER阈值和JSTER阈值分别减少一个步长值。
9.根据权利要求8所述的方法,其特征在于,还包括当判断增加一个步长值之后的LSTER阈值和JSTER阈值分别小于预设的LSTER最大值和JSTER最大值时,执行所述将LSTER阈值和JSTER阈值分别增加一个步长值;当判断见着一个步长值之后的LSTER阈值和JSTER阈值分别大于预设的LSTER最大值和JSTER最小值时,执行所述将LSTER阈值和JSTER阈值分别减少一个步长值。
10.根据权利要求1所述的方法,其特征在于,还包括对所述一帧音频信号的初始分类结果进行平滑,获得最终分类结果。
11.根据权利要求10所述的方法,其特征在于,所述对一帧音频信号的初始分类结果进行平滑包括获取已保存的所述一帧音频信号之前的若干帧音频信号的初步分类结果; 统计所述若干帧音频信号的初步分类结果中,语音信号和音乐信号的个数; 将语音信号和音乐信号中个数占多数的信号类型确定为所述一帧音频信号的最终分类结果。
12.—种音频信号的分类识别装置,其特征在于,包括 获取单元,用于获取一帧音频信号;预处理单元,用于对所述一帧音频信号进行预处理;更新单元,用于通过预处理的结果对所述一帧音频信号之前的音频片段进行更新,生成包含所述一帧音频信号的当前音频片段;提取单元,用于从所述当前音频片段中提取分类特征,所述分类特征包括低短时能量比LSTER和跳跃能量比JSTER ;识别单元,用于根据所述分类特征识别所述一帧音频信号的类型,得到初始分类结果。
13.根据权利要求12所述的装置,其特征在于,所述预处理单元包括子帧划分单元,用于将所述一帧音频信号划分为若干子帧,所述若干子帧中相邻两个子帧相互重叠;能量计算单元,用于通过对每个子帧加汉明窗处理,计算每个子帧的短时能量。
14.根据权利要求13所述的装置,其特征在于,所述更新单元包括能量移除单元,用于将所述之前的音频片段的起始位置处的一帧音频信号的短时能量移除;能量移入单元,用于将所述一帧音频信号的每个子帧的短时能量移入所述之前的音频片段的末端,生成所述当前音频片段。
15.根据权利要求13所述的装置,其特征在于,所述提取单元包括能量阈值计算单元,用于当提取的分类特征为LSTER时,计算所述当前音频片段中所有子帧的短时能量的平均值阈值;子帧个数统计单元,用于统计所述当前音频片段中子帧的短时能量低于所述平均值阈值的子帧个数;LSTER生成单元,用于将低于所述平均值阈值的子帧个数除以所述当前音频片段中子帧的总数,得到所述LSTER。
16.根据权利要求13所述的装置,其特征在于,所述提取单元包括能量获取单元,用于当提取的分类特征为JSTER时,获取所述当前音频片段中当前子帧的前一个子帧的短时能量和预测能量;能量计算单元,用于根据所述前一个子帧的短时能量和预测能量计算所述当前子帧的预测能量;能量突变判断单元,用于通过比较所述当前子帧的预测能量与所述当前子帧的短时能量判断所述当前子帧是否发生能量突变;突变个数统计单元,用于统计所述当前音频片段中发生能量突变的子帧的个数;JSTER生成单元,用于将发生能量突变的子帧个数除以所述当前音频片段中子帧的总数,得到所述JSTER。
17.根据权利要求12所述的装置其特征在于,所述识别单元包括能量值获取单元,用于获取所述一帧音频信号的能量值;比较识别单元,用于比较所述一帧音频信号的能量值与预设的静音帧的能量阈值,当所述能量值小于所述能量阈值时,判定所述一帧音频信号的类型与其上一帧音频信号的类型一致;当所述能量值大于所述阈值时,比较提取的LSTER与预先设置的LSTER阈值,当所述提取的LSTER小于LSTER阈值时,判定所述一帧音频信号为音乐信号;当所述提取的 LSTER大于LSTER阈值时,比较提取的JSTER与预先设置的JSTER阈值,当所述提取的JSTER 小于JSTER阈值时,判定所述一帧音频信号为音乐信号,当所述提取的JSTER大于JSTER阈值时,判定所述一帧音频信号为语音信号。
18.根据权利要求17所述的装置,其特征在于,还包括调整单元,用于通过所述一帧音频信号的初步分类结果对所述LSTER阈值和JSTER阈值进行调整,所述调整后的LSTER阈值和JSTER阈值用于所述一帧音频信号的下一帧音频信号的分类识别。
19.根据权利要求12所述的装置,其特征在于,还包括平滑单元,用于对所述一帧音频信号的初始分类结果进行平滑,获得最终分类结果。
20.根据权利要求19所述的装置,其特征在于,所述平滑单元包括初步分类结果获取单元,用于获取已保存的所述一帧音频信号之前的若干帧音频信号的初步分类结果;初步分类结果统计单元,用于统计所述若干帧音频信号的初步分类结果中,语音信号和音乐信号的个数;最终分类结果确定单元,用于将语音信号和音乐信号中个数占多数的信号类型确定为所述一帧音频信号的最终分类结果。
全文摘要
本申请实施例公开了一种音频信号的分类识别方法及装置,所述方法包括获取一帧音频信号,对所述一帧音频信号进行预处理;通过预处理的结果对所述一帧音频信号之前的音频片段进行更新,生成包含所述一帧音频信号的当前音频片段;从所述当前音频片段中提取分类特征低短时能量比LSTER和跳跃能量比JSTER;根据所述分类特征识别所述一帧音频信号的类型,得到初始分类结果。本申请实施例中每次对一帧音频信号进行识别,由于音频信号的长度远远小于音频片段,因此延时性能极大提高,提高了音频处理的实时性能;通过LSTER和JSTER两个分类特征对音频信号进行识别,增加了音频信号识别的准确性,降低了音频信号识别的复杂度。
文档编号G10L17/00GK102446506SQ20101051250
公开日2012年5月9日 申请日期2010年10月11日 优先权日2010年10月11日
发明者刘贵忠, 杜正中, 金剑, 顿玉洁 申请人:华为技术有限公司
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1