语音处理装置、语音处理方法和程序的制作方法

文档序号:2825028 阅读:262 来源:国知局
专利名称:语音处理装置、语音处理方法和程序的制作方法
技术领域
本发明涉及一种语音处理装置、语音处理方法和程序。
背景技术
在过去,已知一种抑制包括噪声的输入语音中的噪声的技术(例如,日本专利第 3484112号和第4M7037号)。根据日本专利第3484112号,检测从多个麦克风获得的信号的方向性,并根据检测结果通过执行谱减法来抑制噪声。此外,根据日本专利第4M7037 号,在处理多声道之后,通过使用声道之间的互相关(mutual correlation)来抑制噪声。

发明内容
然而,在日本专利第3484112号中,由于在频域中执行处理,因而存在这样的问题如果应付在非常短的时间段内集中的诸如操作声音的噪声,则由于噪声的不均勻性 (disparity)在整个频率中展开而不能充分地抑制噪声。此外,在日本专利第4M7037号中,通过使用扩展的互相关在频域中修改功率谱并执行处理以便于抑制偶发噪声,但是存在这样的问题类似于日本专利第3484112号,对于诸如操作声音的非常短的信号,不能充分地抑制噪声。从该意义上说,本发明考虑了这些问题,并且本发明期望提供一种新型和改进的语音处理装置、语音处理方法和程序,其使得能够检测噪声在非常短的时间段内集中且产生不均勻性的时间区间,从而充分地抑制噪声。为了解决该问题,根据本发明的实施例,提供了一种语音处理装置,包括区间检测单元,其从输入信号检测包括语音信号的语音区间或包括除了语音信号之外的非稳定的信号的非稳定声音区间;以及滤波器计算单元,其根据区间检测单元的检测结果来计算用于保持语音区间中的语音信号和用于抑制非稳定声音区间中的非稳定的信号的滤波器系数,其中,滤波器计算单元通过将在非稳定声音区间中计算出的滤波器系数用于语音区间并将在语音区间中计算出的滤波器系数用于非稳定声音区间来计算滤波器系数。此外,语音处理装置还包括记录单元,其将滤波器计算单元中计算出的滤波器系数的信息针对每个区间地记录在存储单元中,滤波器计算单元可以通过使用在语音区间中记录的非稳定声音区间的滤波器系数的信息和在非稳定声音区间中记录的语音区间的滤波器系数的信息来计算滤波器系数。滤波器计算单元可以计算用于输出使得输入信号被保持在语音区间中的信号的滤波器系数,并计算用于输出使得输入信号在非稳定声音区间中为零的信号的滤波器系数。此外,根据该实施例,语音处理装置包括特征量计算单元,其计算语音区间中的语音信号的特征量和非稳定声音区间中的非稳定声音信号的特征量,并且滤波器计算单元可以通过使用语音区间中的非稳定声音信号的特征量并使用非稳定声音区间中的语音信号的特征量来计算滤波器系数。
此外,区间检测单元可以检测包括语音信号或除了非稳定的信号之外的稳定的信号的稳定声音区间,并且滤波器计算单元计算用于抑制稳定声音区间中的稳定的信号的滤波器系数。此外,特征量计算单元可以计算稳定声音区间中的稳定声音信号的特征量。此外,滤波器计算单元可以通过在语音区间中使用非稳定声音信号的特征量和稳定声音信号的特征量、在非稳定声音区间中使用语音信号的特征量、以及在稳定声音区间中使用语音信号的特征量来计算滤波器系数。此外,根据该实施例,语音处理装置包括验证单元,其验证滤波器计算单元计算出的滤波器系数的约束条件,其中,验证单元可以基于特征量计算单元计算出的每个区间中的特征量来验证滤波器系数的约束条件。此外,验证单元可以基于非稳定声音区间中的非稳定声音信号的抑制量和稳定声音区间中的稳定声音信号的抑制量是否等于或小于预定阈值的确定来验证语音区间中的滤波器系数的约束条件。此外,验证单元可以基于语音区间中的语音信号的劣化量是否等于或大于预定阈值的确定来验证非稳定声音区间中的滤波器系数的约束条件。此外,验证单元可以基于语音区间中的语音信号的劣化量是否等于或大于预定阈值来验证稳定声音区间中的滤波器系数的约束条件。此外,为了解决上述问题,根据本发明的另一实施例,提供了一种语音处理方法, 包括以下步骤从输入信号检测包括语音信号的语音区间或包括除了语音信号之外的非稳定的信号的非稳定声音区间;以及根据检测结果,通过将在非稳定声音区间中计算出的滤波器系数用于语音区间来保持语音信号,并通过将在语音区间中计算出的滤波器系数用于非稳定声音区间来抑制非稳定的信号。此外,为了解决上述问题,提供了一种使计算机用作语音处理装置的程序,语音处理装置包括区间检测单元,其从输入信号检测包括语音信号的语音区间或包括除了语音信号之外的非稳定的信号的非稳定声音区间;以及滤波器计算单元,其根据区间检测单元的检测结果计算用于保持语音区间中的语音信号和用于抑制非稳定声音区间中的非稳定的信号的滤波器系数,并且滤波器计算单元通过将在非稳定声音区间中计算出的滤波器系数用于语音区间并将在语音区间中计算出的滤波器系数用于非稳定声音区间来计算滤波器系数。


图1是示出根据本发明的第一实施例的概况的说明图;图2是示出根据该实施例的语音处理装置的功能组成的框图;图3是示出根据该实施例的耳机的外观的说明图;图4是示出根据该实施例的语音检测单元的功能组成的框图;图5是示出根据该实施例的语音检测处理的流程图;图6是示出根据该实施例的操作声音检测单元的功能组成的框图;图7是示出根据该实施例的操作声音区间中的频率性质的说明图;图8是示出根据该实施例的操作声音检测处理的流程图9是示出根据该实施例的操作声音检测处理的流程图10是示出根据该实施例的滤波器计算单元的功能组成的框图11是示出根据该实施例的滤波器系数的计算处理的流程图12是示出根据该实施例的语音区间和操作声音区间的说明图13是示出根据该实施例的滤波器计算单元的功能组成的框图14是示出根据该实施例的滤波器系数的计算处理的流程图15是示出根据该实施例的特征量计算单元的功能组成的框图16是示出根据该实施例的特征量计算处理的流程图17是示出根据该实施例的特征量计算单元的详细操作的流程图18是示出根据本发明的第二实施例的语音处理装置的功能组成的框图19是示出根据该实施例的特征量计算处理的流程图20是示出根据该实施例的特征量计算处理的流程图21是示出根据该实施例的滤波器计算处理的流程图22是示出根据本发明的第三实施例的语音处理装置的功能组成的框图23是示出根据该实施例的约束条件验证单元的功能的框图24是示出根据该实施例的约束条件验证处理的流程图25是示出根据该实施例的约束条件验证处理的流程图26是示出根据本发明的第四实施例的语音处理装置的功能组成的框图27是示出根据本发明的第五实施例的语音处理装置的功能组成的框图;以及
图28是示出根据本发明的第六实施例的语音处理装置的功能组成的框图。
具体实施例方式下文中,将参照附图来详细描述本发明的示例性实施例。在本说明书和附图中,将向实际上具有相同功能组成的构成元件提供相同的附图标记,并且将不重复其重叠描述。此外,将根据以下顺序描述“优选实施例”。1.实施例的目的2.第一实施例3.第二实施例4.第三实施例5.第四实施例6.第五实施例7.第六实施例<1.实施例的目的〉首先,将描述实施例的目的。在过去,已经披露了用于抑制输入有噪声的输入语音中的噪声的技术(例如,日本专利第3484112号和第4247037号)。根据日本专利第3484112 号,检测从多个麦克风获得的信号的方向性,并根据检测结果通过执行谱减法来抑制噪声。 此外,根据日本专利第4247037号,在处理多声道之后,通过使用声道之间的互相关来抑制噪声。然而,在日本专利第3484112号中,由于在频域中执行处理,因而存在这样的问题如果应付在非常短的时间段内集中的诸如操作声音的噪声,则由于噪声的不均勻性在整个频率中展开,不能充分地抑制噪声。此外,在日本专利第4M7037号中,通过使用扩展的互相关在频域中修改功率谱并执行处理以便于抑制偶发噪声,但是存在这样的问题类似于日本专利第3484112号,对于诸如操作声音的非常短的信号,不能充分地抑制噪声。因此,考虑使用多个麦克风通过时域处理来抑制噪声。例如,用于仅拾取噪声的麦克风(噪声麦克风)被设置在与用于拾取语音的麦克风(主麦克风)的位置不同的位置处。 在该情况下,可以通过从主麦克风的信号中减去噪声麦克风的信号来去除噪声。然而,由于麦克风的位置不同,包含在主麦克风中的噪声信号和包含在噪声麦克风中的噪声信号不等同。因此,当不出现语音时执行学习,并使这两个语音信号彼此对应。在上述技术中,需要将两个麦克风彼此分离得足够远,使得语音不被输入到噪声麦克风,但是在该情况下,用于使噪声信号彼此对应的学习不是容易的,从而恶化了噪声抑制的性能。此外,如果两个麦克风变得彼此较近,则语音被包括在噪声麦克风中,从而语音分量因从主麦克风的信号中减去噪声麦克风的信号而劣化。以下例示了用于在从所有的麦克风获得语音和噪声的状态下抑制噪声的方法。(I)Adaptive Microphone-Array System for Noise Reduction (AMNOR)(用于噪声降低的自适应麦克风阵列系统),Yutaka Kaneda等人,IEEE Transactions on Acoustics, Speech, and Signal Processing, Vol. ASSP-34, No. 6,1986 年 12 月。(2) An Alternative Approach to Linear 1 y Constrained Adaptive Beamforming, Lloyd J.Griffiths 等人’ IEEE Transaction on Antennas and Propagation, Vol. AP-30,No. 1,1982 年 1 月。将通过例示上述的(1)号中提供的AMNOR方法来提供描述。在AMNOR方法中,在没有目标声音的区间中执行滤波器系数H的学习。此刻,执行该学习,使得语音分量的劣化减轻在特定水平内。当AMNOR方法被应用于操作声音的抑制时,发现如下两点。(1)当在长时间段中出现的噪声来自于固定方向时,AMNOR方法非常有效。然而, 滤波器的学习未被充分执行,这是因为操作声音是仅在短时间段中出现的非稳定声音,并且鼠标和键盘的声音依赖于它们各自的不同位置而来自于不同方向。(2)出于控制目标声音劣化的目的,在总是包括噪声的情况下,AMNOR方法在噪声抑制方面非常有效,但是操作声音和语音不稳定地重叠,因而该方法可能使目标语音的质量进一步劣化。因此,关注于以上环境,并创建了根据本发明的实施例的语音处理装置。在根据该实施例的语音处理装置中,检测噪声不均勻地在非常短的时间段内集中的时间区间,从而充分地抑制噪声。更具体地,在时间区间中执行处理以便于抑制在非常短的时间段内不稳定且不均勻地集中的噪声(下文中,其可以通过被称作操作声音来描述)。此外,多个麦克风被用于在多个位置出现的操作声音,并通过使用声音的方向来执行抑制。此外,为了响应于多样化的输入装置中的操作声音,根据输入信号来自适应地获取抑制滤波器。此外,执行滤波器的学习,用于还改善具有语音的区间中的声音质量。<2.第一实施例>接下来,将描述第一实施例。首先,将参照图1来描述第一实施例的概况。该实施例的目的在于抑制例如在语音聊天期间被并入到所传送的语音中的非稳定噪声。如图1中所示,假设用户IOA和IOB分别使用PC等进行语音聊天。此时,当用户IOB传送语音时,从
鼠标、键盘等的操作出现的“滴答滴答”的操作声音连同说出“火车的时间是......”的语
音一起被输入。如图1的附图标记50所示,操作声音不是总与语音重叠。此外,由于引起操作声音的键盘、鼠标等的位置改变,噪声的出现位置改变。此外,由于来自键盘、鼠标等的操作声音依赖于设备的种类而不同,因而存在各种操作声音。因此,在该实施例中,从输入信号中检测语音的区间和作为鼠标、键盘等的非稳定声音的操作声音的区间,并且通过采用每个区间中的最佳处理来高效地抑制噪声。此外,处理并非依赖于所检测的区间而不连续地转换,而是当语音开始时,连贯地转换处理以减少不适。而且,通过在每个区间中执行处理并且随后使用语音的劣化量和噪声抑制量,控制最终的声音质量是可能的。在上文中已描述了该实施例的概况。接下来,将参照图2描述语音处理装置100 的功能组成。图2是示出语音处理装置100的功能组成的框图。如图2中所示,语音处理装置100配备有语音检测单元102、操作声音检测单元104、滤波器计算单元106、滤波器单元108等。语音检测单元102和操作声音检测单元104是本发明的区间检测单元的示例。语音检测单元102具有从输入信号中检测包含语音信号的语音区间的功能。对于输入信号, 如图3中所示,在耳机20中使用两个麦克风,并且在耳机的嘴部分中提供麦克风21而在耳机的耳部分中提供麦克风22。此处,将参照图4来描述语音检测单元102的语音检测的功能。如图4中所示,语音检测单元102包括计算部112、比较/确定部114、保持部116等。计算部112计算从这两个麦克风输入的输入能量,并计算输入能量之间的差。比较/确定部114将计算的输入能量之间的差与预定阈值比较,并根据比较结果确定是否存在语音。然后,比较/确定部114 向特征量计算单元110和滤波器计算单元106提供关于语音的存在/不存在的控制信号。接下来,将参照图5来描述语音检测单元102进行的语音检测处理。图5是示出语音检测单元102进行的语音检测处理的流程图。如图5中所示,首先,针对在耳机中提供的两个麦克风计算每个麦克风的输入能量(E1和E2) (S102)。通过下面给出的数学表达式来计算输入能量。xdt)表示在时间t期间在麦克风i中观察到的信号。换句话说,表达式 1表示区间LpL2中的信号的能量。[表达式1]
权利要求
1.一种语音处理装置,包括区间检测单元,其从输入信号检测包括语音信号的语音区间或包括除了所述语音信号之外的非稳定信号的非稳定声音区间;以及滤波器计算单元,其根据所述区间检测单元的检测结果来计算用于保持所述语音区间中的所述语音信号和用于抑制所述非稳定声音区间中的所述非稳定信号的滤波器系数,其中,所述滤波器计算单元通过将在所述非稳定声音区间中计算出的滤波器系数用于所述语音区间并将在所述语音区间中计算出的滤波器系数用于所述非稳定声音区间来计算所述滤波器系数。
2.根据权利要求1所述的语音处理装置,还包括记录单元,其将所述滤波器计算单元中计算出的所述滤波器系数的信息针对每个区间地记录在存储单元中,其中,所述滤波器计算单元通过使用在所述语音区间中记录的非稳定声音区间的滤波器系数的信息和在所述非稳定声音区间中记录的语音区间的滤波器系数的信息来计算滤波器系数。
3.根据权利要求1所述的语音处理装置,其中,所述滤波器计算单元计算用于输出使得所述输入信号被保持在所述语音区间中的信号的滤波器系数,并计算用于输出使得所述输入信号在所述非稳定声音区间中为零的信号的滤波器系数。
4.根据权利要求1所述的声音处理装置,还包括特征量计算单元,其计算所述语音区间中的所述语音信号的所述特征量和所述非稳定声音区间中的所述非稳定声音信号的所述特征量,其中,所述滤波器计算单元通过使用所述语音区间中的所述非稳定信号的所述特征量并使用所述非稳定声音区间中的所述语音信号的所述特征量来计算所述滤波器系数。
5.根据权利要求1所述的语音处理装置,其中,所述区间检测单元检测包括所述语音信号或除了所述非稳定信号之外的稳定信号的稳定声音区间,以及其中,所述滤波器计算单元计算用于抑制所述稳定声音区间中的所述稳定声音信号的滤波器系数。
6.根据权利要求5所述的语音处理装置,其中,所述特征量计算单元计算所述稳定声音区间中的所述稳定声音信号的所述特征量。
7.根据权利要求6所述的语音处理装置,其中,所述滤波器计算单元通过在所述语音区间中使用所述非稳定声音信号的所述特征量和所述稳定声音信号的所述特征量、在所述非稳定声音区间中使用所述语音信号的所述特征量以及在所述稳定声音区间中使用所述语音信号的所述特征量来计算所述滤波器系数。
8.根据权利要求1所述的语音处理装置,包括验证单元,其验证所述滤波器计算单元计算出的所述滤波器系数的约束条件,其中,所述验证单元基于所述特征量计算单元计算出的每个区间中的特征量来验证所述滤波器系数的约束条件。
9.根据权利要求8所述的语音处理装置,其中,所述验证单元基于所述非稳定声音区间中的所述非稳定声音信号的抑制量和所述稳定声音区间中的所述稳定声音信号的抑制量是否等于或小于预定阈值的确定来验证所述语音区间中的所述滤波器系数的约束条件。
10.根据权利要求8所述的语音处理装置,其中,所述验证单元基于所述语音区间中的所述语音信号的劣化量是否等于或大于预定阈值的确定来验证所述非稳定声音区间中的所述滤波器系数的约束条件。
11.根据权利要求8所述的语音处理装置,其中,所述验证单元基于所述语音区间中的所述语音信号的劣化量是否等于或大于预定阈值来验证所述稳定声音区间中的所述滤波器系数的约束条件。
12.—种语音处理方法,包括以下步骤从输入信号检测包括语音信号的语音区间或包括除了所述语音信号之外的非稳定信号的非稳定声音区间;以及根据检测结果,通过将在所述非稳定声音区间中计算出的滤波器系数用于所述语音区间来保持所述语音信号,并通过将在所述语音区间中计算出的滤波器系数用于所述非稳定声音区间来抑制所述非稳定信号。
13.一种使计算机用作语音处理装置的程序,所述语音处理装置包括区间检测单元,其从输入信号检测包括语音信号的语音区间或包括除了所述语音信号之外的非稳定信号的非稳定声音区间;以及滤波器计算单元,其根据所述区间检测单元的检测结果计算用于保持所述语音区间中的所述语音信号和用于抑制所述非稳定声音区间中的所述非稳定信号的滤波器系数,其中,所述滤波器计算单元通过将在所述非稳定声音区间中计算出的滤波器系数用于所述语音区间并将在所述语音区间中计算出的滤波器系数用于所述非稳定声音区间来计算所述滤波器系数。
全文摘要
本发明涉及语音处理装置、语音处理方法和程序。语音处理装置包括区间检测单元,其从输入信号检测包括语音信号的语音区间或包括除了语音信号之外的非稳定信号的非稳定声音区间;以及滤波器计算单元,其根据区间检测单元的检测结果来计算用于保持语音区间中的语音信号和用于抑制非稳定声音区间中的非稳定信号的滤波器系数,其中,滤波器计算单元通过将在非稳定声音区间中计算出的滤波器系数用于语音区间并将在语音区间中计算出的滤波器系数用于非稳定声音区间来计算滤波器系数。
文档编号G10L21/02GK102194463SQ20111006085
公开日2011年9月21日 申请日期2011年3月9日 优先权日2010年3月16日
发明者关矢俊之, 安部素嗣 申请人:索尼公司
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1