本公开涉及自然语言处理领域,更具体地,涉及一种基于大型语言模型的数据处理方法、装置、设备和存储介质。
背景技术:
1、机器翻译是一项旨在实现自动将一种语言的文本转化为另一种语言的技术。随着全球化的不断发展和跨语言交流的增加,机器翻译在商业和社交领域中变得越来越重要。在机器翻译的背后,有许多关键技术和方法,其中之一是从双语语料库中提取翻译信息。双语语料库是一种同时包含两种语言的文本数据集合,其中通常包含大量的双语句子或文档,其中一种语言是源语言,另一种语言是目标语言。通过从这些语料库中提取翻译信息,机器翻译系统可以学习到不同语言之间的翻译规则和模式。
2、为了从双语语料库中提取翻译信息,研究人员使用了多种技术和方法。传统的基于统计的方法使用统计模型来学习语言之间的翻译概率,通过分析大量的双语语料库,机器翻译系统可以学习到不同语言之间的翻译模式和词汇选择,继而可以使用这些模式和概率来预测输入文本的翻译结果。基于统计的机器翻译方法在许多实际应用中取得了良好的效果,但对于低频词汇和复杂结构的处理仍然存在挑战。
3、因此,需要一种自动且高效地从双语语料库中提取翻译信息的方法。
技术实现思路
1、为了解决上述问题,本公开通过利用经微调的大型语言模型和经设计用于自动化地从双语语料库中提取翻译信息的指令,自动且高效地从双语语料库中提取出翻译信息。
2、本公开的实施例提供了一种基于大型语言模型的数据处理方法、装置、设备和计算机可读存储介质。
3、本公开的实施例提供了一种基于大型语言模型的数据处理方法,包括:从双语语料库中获取平行双语数据和非平行双语数据;基于所获取的平行双语数据对大型语言模型进行微调,其中,所述大型语言模型经过在大规模语料库上的预训练并且具有与所述双语语料库相关的语言知识和翻译能力;以及基于经微调的大型语言模型和翻译信息提取指令,从所获取的平行双语数据和非平行双语数据中提取双语翻译信息,所述双语翻译信息包括词对齐信息,用于指示所述双语语料库中的词对齐关系。
4、本公开的实施例提供了一种基于大型语言模型的数据处理装置,包括:数据获取模块,被配置为从双语语料库中获取平行双语数据和非平行双语数据;模型微调模块,被配置为基于所获取的平行双语数据对大型语言模型进行微调,其中,所述大型语言模型经过在大规模语料库上的预训练并且具有与所述双语语料库相关的语言知识和翻译能力;以及信息提取模块,被配置为基于经微调的大型语言模型和翻译信息提取指令,从所获取的平行双语数据和非平行双语数据中提取双语翻译信息,所述双语翻译信息包括词对齐信息,用于指示所述双语语料库中的词对齐关系。
5、本公开的实施例提供了一种基于大型语言模型的数据处理设备,包括:一个或多个处理器;以及一个或多个存储器,其中,所述一个或多个存储器中存储有计算机可执行程序,当由所述处理器执行所述计算机可执行程序时,执行如上所述的基于大型语言模型的数据处理方法。
6、本公开的实施例提供了一种计算机可读存储介质,其上存储有计算机可执行指令,所述指令在被处理器执行时用于实现如上所述的基于大型语言模型的数据处理方法。
7、本公开的实施例提供了一种计算机程序产品或计算机程序,该计算机程序产品或计算机程序包括计算机指令,该计算机指令存储在计算机可读存储介质中。计算机设备的处理器从计算机可读存储介质读取该计算机指令,处理器执行该计算机指令,使得该计算机设备执行根据本公开的实施例的基于大型语言模型的数据处理方法。
8、本公开的实施例所提供的方法相比于传统的翻译信息提取方法而言,能够利用具有强大翻译能力的大型语言模型,自动化地从双语语料库中挖掘翻译信息,并外置显式地保存大量翻译信息,并且通过将所提取的双语翻译信息融入大型语言模型的翻译过程,能够进一步优化机器翻译性能。
9、本公开的实施例所提供的方法通过利用从双语语料库中获取的平行双语数据对大型语言模型进行微调,以基于经微调的大型语言模型和所设计的翻译信息提取指令从双语语料库中的平行双语数据和非平行双语数据自动且高效地提取翻译信息。通过本公开的实施例的方法能够利用大型语言模型的强大翻译能力,实现从双语语料库的自动化高效翻译信息提取。此外,通过外置显式地保存所提取的双语翻译信息,能够将翻译信息融入大型语言模型的翻译过程,从而进一步优化机器翻译性能。
1.一种基于大型语言模型的数据处理方法,所述大型语言模型为用于双语语料库中的两种语言下的双语翻译任务的经预训练的大型语言模型,所述方法包括:
2.如权利要求1所述的方法,其中,从所述双语语料库中获取平行双语数据和非平行双语数据包括:
3.如权利要求1所述的方法,其中,基于所获取的平行双语数据对大型语言模型进行微调包括:
4.如权利要求3所述的方法,其中,基于所获取的平行双语数据中的句子对,对经预训练的大型语言模型进行微调包括:
5.如权利要求1所述的方法,其中,所述方法还包括:
6.如权利要求5所述的方法,其中,所述提示信息部分用于指示所述经微调的大型语言模型从所述输入内容部分中提取所述两种语言下的词语对,所述词语对包括所述两种语言中的一种语言下的词语和另一种语言下的与所述词语相对应的词语。
7.如权利要求1所述的方法,其中,基于经微调的大型语言模型和翻译信息提取指令,从所获取的平行双语数据和非平行双语数据中提取双语翻译信息包括:
8.如权利要求1所述的方法,其中,基于经微调的大型语言模型和翻译信息提取指令,从所获取的平行双语数据和非平行双语数据中提取双语翻译信息包括:
9.如权利要求1所述的方法,其中,所述方法还包括:
10.如权利要求9所述的方法,其中,所述方法还包括:
11.如权利要求10所述的方法,其中,所述翻译信息融合指令用于指示所述经微调的大型语言模型对所述输入内容部分进行翻译,并基于所提取的双语翻译信息对所述翻译的结果进行优化。
12.一种基于大型语言模型的数据处理装置,所述大型语言模型为用于双语语料库中的两种语言下的双语翻译任务的经预训练的大型语言模型,所述装置包括:
13.一种基于大型语言模型的数据处理设备,包括:
14.一种计算机程序产品,所述计算机程序产品存储在计算机可读存储介质上,并且包括计算机指令,所述计算机指令在由处理器运行时使得计算机设备执行权利要求1-11中任一项所述的方法。
15.一种计算机可读存储介质,其上存储有计算机可执行指令,所述指令在被处理器执行时用于实现权利要求1-11中任一项所述的方法。