一种基于深度学习模型的文本匹配方法、系统及介质与流程

文档序号:36175227 发布日期:2023-11-24 23:58 阅读:53 来源:国知局
一种基于深度学习模型的文本匹配方法与流程

本发明涉及文本识别,具体涉及一种基于深度学习模型的文本匹配方法、系统及介质。


背景技术:

1、对于保险公司而言,在保险理赔过程中会采集到客户的大量数据,在理赔中需要将用户数据与保险公司内部数据进行相互关联以保证采集数据的标准化。由于互联网的发展,线上保险办理的业务越来越多,但是对于采集信息标准化仍然需要大量的人工介入。目前有些保险公司会引入ocr技术,但是ocr识别不准确或者用户上传影像较差时,一般仍需要采用人工介入的方式对ocr识别的文字进行修正或者采用字符匹配的方式进行标准化。采用字符匹配会丢失文字之间的语义信息,文本匹配的正确率往往也较低,从而造成大量人工介入,工作效率难以提升。

2、基于上述技术问题,申请人提出了本申请的技术方案。


技术实现思路

1、本发明的目的是提供了一种基于深度学习模型的文本匹配方法、系统及介质,提取ocr技术识别出的影像数据中关键信息的特征向量,基于该特征向量进行数据检索,并对检索出的多条特征数据分别进行匹配,最终确定文本匹配结果,避免遗漏影像数据中的文本之间的语义信息,能够对ocr技术识别出的文本进行修正,提升ocr识别结果的正确率和准确性。

2、为实现上述目的,本发明提供了一种基于深度学习模型的文本匹配方法,包括:通过ocr技术识别出影像数据中的关键信息;

3、获取所述关键信息的特征向量;

4、基于所述关键信息的特征向量在预设数据库中进行数据检索,得到与所述关键信息相关的多条特征数据;

5、将所述关键信息与所述多条特征数据分别进行匹配,确定所述影像数据的文本匹配结果。

6、本发明还提供了一种基于深度学习模型的文本匹配系统,包括:

7、ocr识别模块用于通过ocr技术识别出影像数据中的关键信息;

8、向量获取模块用于基于所述关键信息,获取所述关键信息的特征向量;

9、数据检索模块用于基于所述关键信息的特征向量在预设的数据库中进行数据检索,得到与所述关键信息相关的多条特征数据;

10、文本匹配模块用于将所述关键信息与所述多条特征数据分别进行匹配,确定所述影像数据的文本匹配结果。

11、本发明实施例提供了一种存储介质,其上存储有计算机程序,当所述计算机程序被处理器调用时,使得所述处理器执行上述的文本匹配方法。

12、在一个实施例中,所述获取所述关键信息的特征向量,包括:

13、将所述关键信息输入到设定的特征向量生成模型中,得到所述关键信息的特征向量。

14、在一个实施例中,所述特征向量生成模型为cosent模型。

15、在一个实施例中,所述将所述关键信息与所述多条特征数据分别进行匹配,确定所述影像数据的文本匹配结果,包括:

16、计算所述关键信息与每条特征数据之间的三个分数,所述三个分数分别是向量匹配分数、拼音相似分数、文本相似分数;

17、针对每条特征数据,计算所述三个分数的加权平均分数,选取加权平均分数最高的特征数据作为所述影像数据的文本匹配结果。

18、在一个实施例中,所述三个分数的加权平均分数的权重分别为:向量匹配分数的权重为0.6,所述拼音相似分数的权重为0.1,所述文本相似分数的权重为0.3。

19、在一个实施例中,所述方法还包括:

20、对所述关键信息进行标准化处理,得到所述关键信息相对应的标准化命名;

21、将所述标准化命名展示在所述ocr技术识别的交互窗口中。

22、在一个实施例中,所述对所述关键信息进行标准化处理,通过以下步骤:

23、将所述关键信息输入设定的命名实体模型中,得到所述关键信息相对应的标准化命名。

24、在一个实施例中,所述设定的命名实体模型为bert+bilstm+crf识别模型。



技术特征:

1.一种基于深度学习模型的文本匹配方法,其特征在于,包括:

2.根据权利要求1所述的基于深度学习模型的文本匹配方法,其特征在于,所述获取所述关键信息的特征向量,包括:

3.根据权利要求2所述的基于深度学习模型的文本匹配方法,其特征在于,所述特征向量生成模型为cosent模型。

4.根据权利要求1所述的基于深度学习模型的文本匹配方法,其特征在于,所述将所述关键信息与所述多条特征数据分别进行匹配,确定所述影像数据的文本匹配结果,包括:

5.根据权利要求4所述的基于深度学习模型的文本匹配方法,其特征在于,所述三个分数的加权平均分数的权重分别为:向量匹配分数的权重为0.6,所述拼音相似分数的权重为0.1,所述文本相似分数的权重为0.3。

6.根据权利要求1所述的基于深度学习模型的文本匹配方法,其特征在于,所述方法还包括:

7.根据权利要求6所述的基于深度学习模型的文本匹配方法,其特征在于,所述对所述关键信息进行标准化处理,通过以下步骤:

8.根据权利要求7所述的基于深度学习模型的文本匹配方法,其特征在于,所述设定的命名实体模型为bert+bilstm+crf识别模型。

9.一种基于深度学习模型的文本匹配系统,其特征在于,包括:

10.一种存储介质,其上存储有计算机程序,其特征在于,当所述计算机程序被处理器调用时,使得所述处理器执行如权利要求1至8任一项所述的文本匹配方法。


技术总结
本发明实施例提供了一种基于深度学习模型的文本匹配方法、系统及介质,涉及文本识别技术领域。方法包括:通过OCR技术识别出影像数据中的关键信息;获取所述关键信息的特征向量;基于所述关键信息的特征向量在预设数据库中进行数据检索,得到与所述关键信息相关的多条特征数据;将所述关键信息与所述多条特征数据分别进行匹配,确定所述影像数据的文本匹配结果。本发明的文本匹配能够避免遗漏影像数据中的文本之间的语义信息,能够对OCR技术识别出的文本进行修正,提升OCR识别结果的正确率和准确性。

技术研发人员:陆培,李宁
受保护的技术使用者:金卫医保信息管理(中国)有限公司
技术研发日:
技术公布日:2024/1/16
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1