音频处理系统的制作方法
【专利说明】
[0001] 相关申请的交叉引用
[0002] 本申请要求2013年4月5日提交的美国临时专利申请No. 61/809, 019和2013年 9月10日提交的美国临时专利申请No. 61/875, 959的优先权,每个专利申请特此通过其整 体引用而并入。
技术领域
[0003] 本公开一般涉及音频编码和解码。各种实施例提供特别适合于话音编码和解码的 音频编码和解码系统(被称为音频编解码器系统)。
【背景技术】
[0004] 复杂技术系统(包括音频编解码器系统)通常在长期的时间段累积式地发展,并 且常常是在独立的研究和开发团队中通过不协调的努力而发展。作为结果,这样的系统可 以包括表示不同的设计范式和/或不等水平的技术进步的组件的难处理的组合。频繁的保 持与旧有设备兼容的期望对设计者施加了附加的约束,并且可能导致系统架构的连贯性较 低。在参数化多声道音频编解码器系统中,向后兼容可能特别涉及提供编码格式,在该编码 格式中,下混信号在没有处理能力的单声道或立体声回放系统中被播放时将返回能感觉得 到地发声的输出。
[0005] 代表本领域的状态的可用音频编码格式包括MPEG环绕、USAC和高效AACv2。这 些已经在文献中被透彻地描述和分析。
[0006] 将期望的是,提出一种特别是对于话音信号具有合理的性能的、通用的、而架构上 统一的音频编解码器系统。
【发明内容】
【附图说明】
[0007] 现在将参照附图详细地描述本发明构思内的实施例,其中
[0008] 图1是示出根据示例实施例的音频处理系统的总体结构的一般化框图;
[0009] 图2示出用于音频处理系统的两种不同单声道解码模式的处理路径;
[0010] 图3示出用于两个不同的参数化立体声解码模式的处理路径,一个不具有而一个 包括通过波形编码低频内容的后上混增强;
[0011] 图4示出用于解码模式的处理路径,在该解码模式下,音频处理系统对具有分开 编码的声道的完全波形编码的立体声信号进行处理;
[0012] 图5示出用于解码模式的处理路径,在该解码模式下,音频处理系统通过在应用 谱带复制之后参数化地混合三声道下混信号来提供五声道信号;
[0013] 图6示出根据示例实施例的音频处理系统的结构以及该系统中的组件的内部工 作;
[0014] 图7是根据示例实施例的解码系统的一般化框图;
[0015] 图8示出图7中的解码系统的第一部分;
[0016] 图9示出图7中的解码系统的第二部分;
[0017] 图10示出图7中的解码系统的第三部分;
[0018] 图11是根据示例实施例的解码系统的一般化框图;
[0019] 图12示出图11的解码系统的第三部分;
[0020] 图13是根据示例实施例的解码系统的一般化框图;
[0021] 图14不出图13中的解码系统的第一部分;
[0022] 图15示出图13中的解码系统的第二部分;
[0023] 图16示出图13中的解码系统的第三部分;
[0024] 图17是根据第一不例实施例的编码系统的一般化框图;
[0025] 图18是根据第二不例实施例的编码系统的一般化框图;
[0026] 图19a示出以恒定比特速率提供比特流的示例音频编码器的框图;
[0027] 图19b示出以可变比特速率提供比特流的示例音频编码器的框图;
[0028] 图20示出基于变换系统的多个块产生示例包络;
[0029] 图21a示出变换系数的块的示例包络;
[0030] 图21b示出示例插值包络的确定;
[0031] 图22示出示例量化器集合;
[0032] 图23a示出示例音频解码器的框图;
[0033] 图23b示出图23a的音频解码器的示例包络解码器的框图;
[0034] 图23c示出图23a的音频解码器的示例子带预测器的框图;
[0035] 图23d示出图23a的音频解码器的示例谱解码器的框图;
[0036] 图24a示出示例的容许量化器集合的框图;
[0037] 图24b示出示例抖动量化器的框图;
[0038] 图24c示出示例的基于变换系数的块的谱对量化器的选择;
[0039] 图25示出用于在编码器处以及在对应的解码器处确定量化器集合的示例方案;
[0040] 图26示出用于对已经使用抖动量化器确定的、熵编码的量化索引进行解码的示 例方案的框图;以及
[0041] 图27示出示例比特分配处理。
[0042] 所有图都是示意性的,并且一般仅示出了为了阐明本发明而必须的部分,而其它 部分则可以被省略或者仅仅被建议。
【具体实施方式】
[0043] 音频处理系统接受被分割为携载音频数据的帧的音频比特流。音频数据可能已经 通过对声波进行采样并且将如此获得的电子时间采样变换为谱系数而被准备,这些谱系数 然后被量化并且被以适合于发送或存储的格式编码。音频处理系统适于以单声道、立体声 或多声道格式重构采样的声波。如本文中所使用的,音频信号可以与纯音频信号或者2020欧洲杯投注官网 、 视听或多媒体信号的音频部分有关。
[0044] 音频处理系统一般被划分为前端组件、处理级和采样速率转换器。前端组件包括: 解量化级,其适于接收量化的谱系数并且输出中间信号的第一频域表示;以及逆变换级, 其用于接收中间信号的第一频域表示,并且基于该第一频域表示来合成中间信号的时域表 示。在一些实施例中能够全部旁通的处理级包括:分析滤波器组,其用于接收中间信号的时 域表示,并且输出中间信号的第二频域表示;至少一个处理组件,其用于接收中间信号的所 述第二频域表示,并且输出处理的音频信号的频域表示;以及合成滤波器组,其用于接收处 理的音频信号的频域表示,并且输出处理的音频信号的时域表示。采样速率转换器最后被 配置为接收处理的音频信号的时域表示并且输出以目标采样频率采样的重构音频信号。
[0045] 根据示例实施例,音频处理系统是单一速率架构,其中,中间音频信号的时域表示 和处理的音频信号的时域表示的相应的内部采样速率是相等的。
[0046] 在前端级包括核心编码器并且处理级包括参数化上混级的特定示例实施例中,核 心编码器和参数化上混级以相等的采样速率进行操作。另外地或可替代地,核心编码器可 以被扩展为对变换长度的较广范围进行处理,并且采样速率转换器可以被配置为匹配标准 2020欧洲杯投注官网 帧速率以允许2020欧洲杯投注官网 同步音频帧的解码。以下将在音频模式编码章节下对这更详细地描 述。
[0047] 在更进一步的特定示例实施例中,前端组件可以在音频模式以及不同于音频模式 的话音模式下进行操作。因为话音模式专门适于话音内容,所以这样的信号可以被更忠实 地播放。在音频模式下,前端组件可以类似于图6以及该说明书的相关联的章节中所公开 的那样进行操作。在话音模式下,前端组件可以如以下在话音模式编码章节中特别讨论的 那样进行操作。
[0048] 在示例实施例中,一般来说,话音模式与前端组件的音频模式的不同之处在于,逆 变换级以较短的帧长度(或变换大小)进行操作。减小的帧长度已经被证明更高效地捕获 话音内容。在一些示例实施例中,帧长度在音频模式内以及在2020欧洲杯投注官网 模式内是可变的;它可以 例如被间歇地减小以捕获信号中的瞬变。在这样的情况下,从音频模式到话音模式的模式 改变将一所有其它的因素相等一暗示逆变换级的帧长度的减小。换句话说,这样的从音频 模式到话音模式的模式改变将暗示(音频模式和话音模式中的每一个内的可选择帧长度 之中的)最大帧长度的减小。特别地,话音模式下的帧长度可以是音频模式下的当前帧长 度的固定的一小部分(例如,1/8)。
[0049] 在示例实施例中,与处理级并行的旁通线路允许处理级在不希望频域处理的解码 模式下被旁通。当系统对分开编码的立体声或多声道信号(特别是整个谱范围被波形编码 (由此可能不需要谱带复制)的信号)进行解码时,这可能是合适的。为了避免在旁通线路 被切换进入处理路径或从其切换出来的时刻的时移,旁通线路可以优选地包括匹配处理级 在其当前模式下的延迟(或算法延迟)的延迟级。在处理级被布置为与其当前操作模式独 立地具有恒定的(算法)延迟的实施例中,旁通线路上的延迟级可能引发恒定的预定延迟; 否则,旁通线路中的延迟级优选地是自适应的,并且根据处理级的当前操作模式而变化。
[0050] 在示例实施例中,参数化上混级可以在它接收3声道下混信号并且返回5声道信 号的模式下进行操作。可选地,谱带复制组件可以被布置在参数化上混级的上游。在具有 三个前置声道(例如,L、R和C)以及两个环绕声道(例如,Ls、Rs)并且其中编码信号"前 端重"的回放声道配置中,该示例实施例可以实现更高效率的编码。实际上,音频比特流的 可用带宽主要花费在对三个前置声道尽可能多地进行波形编码的尝试上。准备将被音频处 理系统解码的编码设备可以在该模式下通过测量将被编码的音频信号的性质来自适应地 选择解码。以下在标题立体声编码下讨论将一个下混声道上混为两个声道的上混过程和对 应的下混过程的示例实施例。
[0051 ] 在前面的示例实施例的进一步开发中,下混信号中的三个声道中的两个对应于音 频比特流中的联合编码的声道。这样的联合编码可能需要,例如,一个声道的缩放被与其它 声道相比较地表达。类似的方法已经在AAC强度立体声编码中实现,其中,两个声道可以被 编码为声道对元素。已经通过收听实验证明,在给定比特速率处,当下混信号的一些声道被 联合编码时,重构音频信号的感知质量得到改进。
[0052] 在示例实施例中,音频处理系统还包括谱带复制模块。以下在标题立体声编码下 更详细地讨论谱带复制模块(或高频重构级)。谱带复制模块优选地在参数化上混级执行 上混操作时(即,当它返回具有被它接收的信号的声道的数量多的信号时)是活动的。然 而,当参数化上混级充当传递组件时,谱带复制模块可与参数化上混级的特定的当前模式 独立地进行操作;也就是说,在非参数化解码模式下,谱带复制功能是可选的。
[0053] 在示例实施例中,所述至少一个处理组件还包括波形编码级,以下在多声道编码 章节下更详细地描述波形编码级。
[0054] 在示例实施例中,音频处理系统可操作为提供适合于旧有回放设备的下混信号。 更确切地说,通过将同相的环绕声道内容加到下混信号中的第一声道并且将相移(例如, 相移90度)的环绕声道内容加到第二声道来获得立体声下混信号。这允许回放设备通过 组合的反向相移和减法运算来导出环绕声道内容。对于被配置为接受左-总/右-总下混 信号的回放设备,下混信号可能是可接受的。优选地,相移功能不是音频处理系统的默认设 置,而是可以在音频处理系统准备不意图用于这种类型的回放设备的下混信号时被停用。 实际上,存在已知的利用相移的环绕信号不良地再现的特殊内容类型;特别地,从具有有限 空间广度的源记录的、随后在左前和左环绕信号之间平移的声音将不会如预计的那样被感 知为位于对应的左前和左环绕扬声器之间,但是是将取决于与明确限定的空间位置无关联 的许多收听者。该伪象可以通过将环绕声道相移实现为可选的非默认功能来避免。
[0055] 在示例实施例中,前端组件包括预测器、谱解码器、相加单元以及逆平坦化单元。 以下将在标题话音模式编码下更详细地描述提高系统在它对话音类型的信号进行处理时 的性能的这些元件。
[0056] 在示例实施例中,音频处理系统还包括Lfe解码器,其用于基于音频比特流中的 信息来准备至少一个附加声道。优选地,Lfe解码器分别从音频比特流所携载的其它声道 提供被波形编码的低频效应声道。如果附加声道与重构音频信号的其它声道分开编码,则 对应的处理路径可以与音频处理系统的其余部分独立。理解的是,每个附加声道加到重构 音频信号中的声道的总数;例如,在参数化上混级一如果这样的级被提供一在N= 5模式下 进行操作并且存在一个附加声道的使用情况下,重构音频信号中的声道的总数将为N+1= 6〇
[0057] 进一步的示例实施例提供一种包括与以上音频处理系统在使用时执行的操作对 应的步骤的方法、以及一种用于使可编程计算机执行这样的方法的计算机程序产品。
[0058] 本发明构思进一步涉及一种编码器类型的音频处理系统,其用于将音频信号编码 为具有适合于在上文中描述的(解码器类型的)音频处理系统中进行解码的格式的音频比 特流。第一发明构思还包含用于准备音频比特流的编码方法和计算机程序产品。
[0059] 图1示出根据示例实施例的音频处理系统100。核心解码器101接收音频比特流, 并且至少输出量化的谱系数,该量化的谱系数被供给到包括解量化级102和逆变换级103 的前端组件。在一些示例实施例中,前端组件可以具有双模式类型。在这些实施例中,它可 以在通用音频模式和特定音频模式(例如,话音模式)下选择性地操作。在前端组件的下 游,处理级在其上游端由分析滤波器组104来定界,并且在其下游端由合成滤波器组108来 定界。布置在分析滤波器组104与合成滤波器组108之间的组件执行频域处理。在图1中 所示的第一构思的实施例中,这些组件包括:
[0060] ?压扩组件105 ;
[0061] ?组合组件106,其用于高频重构、参数化立体声和上混;以及
[0062] ?动态范围控制组件107。
[0063] 组件106可以例如执行如以下在本说明书的立体声编码章节中描述的上混。
[0064] 在处理级的下游,音频处理系统100还包括采样速率转换器109,其被配置为提供 以目标采样频率采样的重构音频信号。
[0065] 在下游端,系统100可以可选地包括负责实现无修剪(non-clip)条件的信号限制 组件(未示出)。
[0066] 此外,可选地,系统100可以包括并行处理路径,其用于提供一个或多个附加声道 (例如,低频效应声道)。该并行处理路径可以被实现为Lfe解码器(在图1和图3-11中 的任何一个中未示出),其接收音频比特流或者其一部分,并且被布置为将如此准备的附加 声道插入到重构音频信号中;插入点可以紧靠采样速率转换器109的上游。
[0067] 图2利用对应的标记示出图1中所示的音频处理系统的两个单声道解码模式。更 确切地说,图2示出在解码期间活动的并且形成用于基于音频比特流来准备重构(单声道) 音频信号的处理路径的那些系统组件。注意,图2中的处理路径还包括最终的信号限制组 件("Lim"),其被布置为缩减信号值以满足无修剪条件。图2中的上部的解码模式使用高 频重构,而图2中的下部的解码模式对完全经波形编码的声道进行解码。因此,在下部的解 码模式下,高频重构组件("HFR")已被延迟级("延迟")代替,该延迟级引发与HFR组件 的算法延迟相等的延迟。
[0068] 如图2的下部分所表明的,进一步可能的是完全旁通处理级("QMF"、"延迟"、 "DRCT'^QMF1");当对信号不执行动态范围控制(DRC)处理时,这可以是适用的。旁通处 理级消除了由于后跟QMF合成的QMF分析而导致的信号的任何潜在的劣化,该QMF合成可 以涉及非完美重构。旁通线路包括第二延迟线路级,其被配置为将信号延迟与处理级的总 (算法)延迟相等的量。
[0069] 图3示出两个参数化立体声解码模式。在两个模式下,通过以下获得立体声声道: 将高频重构应用于第一声道,使用解相关器("D")生成该第一声道的解相关版本,并然后 形成两者的线性组合以获得立体声信号。该线性组合由布置在DRC级的上游的上混级("上 混")计算。在模式中的一个一附图的下部分中所示的那个中一音频比特流附加地携载用 于两个声道的波形编码的低频内容(通过"\\\"填充的区域)。通过图7-10以及本说明书 的对应章节来描述后一模式的实现细节。
[0070] 图4示出其中音频处理系统对具有分开编码的声道的全部经波形编码的立体声 信号进行处理的解码模式。这是高比特速率立体声模式。如果DRC处理不被视为必须的, 则通过使用图4中所示的具有相应的延迟级的两个旁通线路,处理级可以被完全旁通。延 迟级优选地引发与处理级在其它解码模式下时的延迟相等的延迟,使得模式切换可以相对 于信号内容连续地发生。
[0071] 图5示出其中音频处理系统通过在应用谱带复制之后对三声道下混信号进行参 数化上混来提供五声道信号的解码模式。如已经提及的,有利的是,联合地对声道中的两 个(通过"///"填充的区域)编码(例如,作为声道对元素),并且音频处理系统优选地被 设计为利用该性质对比特流进行处理。为了该目的,音频处理系统包括两个接收部分,下部 的接收部分被配置为对声道对元素进行解码,而上部的接收部分用于对其余的声道(通过 "\\\"填充的区域)进行解码。在QMF域中进行高频重构之后,对声道对的每个声道单独进 行解相关,此后,第一上混级形成第一声道及其解相关的版本的第一线性组合,并且第二上 混级形成第二声道及其解相关的版本的第二线性组合。通过图7-10以及本说明书的对应 章节来描述该处理的实现细节。总共五个声道然后在QMF合成之前经受DRC处理。
[0072] 音频樽式编码
[0073] 图6是音频处理系统100的一般化框图,该音频处理系统100接收编码的音频比 特流P,并且以在图6中被示为一对立体声基带信号L、R的重构音频信号作为其最终输出。 在这个示例中,将假定比特流P包括量化的、变换编码的两声道音频数据。音频处理系统 100可以从通信网络、无线接收器或存储器(未示出)接收音频比特流P。系统100的输出 可以被供给到扬声器以用于回放,或者可以被以相同或不同的格式重编码以用于进一步通 过通信网络或无线链路发送或者以用于存储在存储器中。
[0074] 音频处理系统100包括解码器108,其用于将比特流P解码为量化的谱系数和控 制数据。其结构将在以下进行更详细地讨论的前端组件110对这些谱系数进行解量化,并 且供给要被处理级120处理的中间音频信号的时域表示。中间音频信号被分析滤波器组 122pl22R变换到第二频域中,该第二频域不同于与前面提及的编码变换相关联的频域;第 二频域表示可以是正交镜像滤波器(QMF)表示,在这种情况下,分析滤波器组12&、122R可 以被作为QMF滤波器组提供。在分析滤波器组12&、122R的下游,负责高频重构的谱带复制 (SBR)模块124和动态范围控制器(DRC)模块126对中间音频信号的第二频域表示进行处 理。在其下游,合成滤波器组12\、128在成如此处理的音频信号的时域表示。如本领域技 术人员在研究本公开之后将认识到的,谱带复制模块124和动态范围控制模块126都不是 本发明的必须元件;相反,根据不同示例实施例的音频处理系统可以将附加的或替代的模 块包括在处理级120内。在处理级120的下游,采样速率转换器130可操作为将处理的音 频信号的采样速率调整为预期回放设备(未示出)被设计成的期望的音频采样速率,诸如 44. 1kHz或48kHz。如何设计在输出中具有低量伪象的采样速率转换器130在本领域中本 身是已知的。采样速率转换器130可以在不需要采样速率转换时一即,在处理级120供给 已经具有目标采样频率的处理音频信号时一被停用。布置在采样速率转换器130的下游的 可选的信号限制模块140被配置为根据无修剪条件、按照需要来限制基带信号值,无修剪 条件可以鉴于特定的预期回放设备而被再次选择。
[0075] 如图6的下部分所示,前端组件110包括解量化级114和逆变换级11\、118R,该 解量化级114可以在具有不同块大小的几个模式中的一个下被操作,逆变换级11\、11心也 可以对不