本技术涉及人工智能,具体而言,涉及一种基于大数据的知识图谱构建方法及系统。
背景技术:
1、当前的知识图谱构建主要依赖于人工输入或预设模板,以及基于统计的方法从大规模文本中抽取实体和关系。这些方法在处理结构化和半结构化数据时表现良好,但在面对非结构化的会话文本数据时,其性能往往难以满足要求。尤其是当涉及到复杂的对话场景和语义理解时,现有的方法往往力不从心。
2、例如,现有的知识图谱构建技术主要针对结构化和半结构化数据,对于非结构化的会话文本数据,其处理能力较弱,无法有效抽取其中的知识信息,并且通常只进行浅层次的匹配和提取,难以实现对复杂对话内容和用户意图的深度理解,并且缺乏自我学习和改进的过程,导致知识图谱构建过程通常耗时较长,且构建出的知识图谱准确性有待提高。
技术实现思路
1、为了至少克服现有技术中的上述不足,本技术的目的在于提供一种基于大数据的知识图谱构建方法及系统。
2、第一方面,本技术提供一种基于大数据的知识图谱构建方法,应用于大数据服务器系统,所述方法包括:
3、获取样例项目会话数据序列,所述样例项目会话数据序列包括多个样例项目会话数据、所述多个样例项目会话数据对应的样例学习价值和所述多个样例项目会话数据对应的目标会话关联矢量,所述样例项目会话数据包括自然会话文本段、扩展会话文本段和项目关注节点信息,所述目标会话关联矢量依据自然会话关联矢量和扩展会话关联矢量得到,所述自然会话关联矢量是依据所述自然会话文本段和所述项目关注节点信息进行联动会话关联矢量解析生成的,所述扩展会话关联矢量是依据所述扩展会话文本段和所述项目关注节点信息进行联动会话关联矢量解析生成的,所述样例项目会话数据序列来源于目标用户的会话文本大数据中的指定对话场景的会话文本数据;
4、依据所述样例学习价值从所述样例项目会话数据序列中确定当前样例项目会话数据;
5、将所述当前样例项目会话数据对应的当前目标会话关联矢量加载至初始化神经网络中进行初始化知识学习,当初始化知识学习结束时,生成第一知识关系估计网络;
6、依据所述第一知识关系估计网络优化所述多个样例项目会话数据对应的样例学习价值,并返回依据样例学习价值从所述样例项目会话数据序列中确定当前样例项目会话数据的操作,当检测到所述第一知识关系估计网络收敛时,生成第二知识关系估计网络,所述第二知识关系估计网络用于估计加载的会话文本段与加载的项目关注节点信息对应的知识关系属性特征,并基于各个会话文本段与加载的项目关注节点信息对应的知识关系属性特征进行知识图谱构建。
7、譬如,在第一方面的一种可能的实施方式中,所述方法还包括:
8、获取构建的各个知识图谱,并根据构建的各个知识图谱进行聚类形成各个类别的知识图谱组团,在接收到针对候选查询对话文本的知识查询指令时,获取所述候选查询对话文本的对话文本分词向量,并对所述候选查询对话文本的对话文本分词向量进行语义映射得到所述候选查询对话文本的语义映射向量;
9、依据语义映射向量,从各个类别的知识图谱组团中确定所述候选查询对话文本的语义映射向量对应的目标知识图谱组团;
10、获取所述目标知识图谱组团中的各知识图谱数据的对话文本分词向量,并依据各所述知识图谱数据的对话文本分词向量,确定各所述知识图谱数据所对应的知识标签信息、及各所述知识图谱数据与所述候选查询对话文本的查询关联度信息;
11、依据所述查询关联度信息,对各所述知识图谱数据进行整理,生成第一知识图谱数据集合;
12、依据所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的各知识图谱数据的次序进行更新,生成第二知识图谱数据集合;其中,所述知识图谱数据所对应的知识标签信息表征所述知识图谱数据归属各知识标签的可能性;
13、依据所述第二知识图谱数据集合,确定针对所述候选查询对话文本的知识图谱数据查询结果,并基于所述知识图谱数据查询结果对所述候选查询对话文本生成对应的推送知识内容。
14、譬如,在第一方面的一种可能的实施方式中,每个所述知识图谱组团对应一个对比语义映射向量,所述从各个类别的知识图谱组团中确定所述候选查询对话文本的语义映射向量对应的目标知识图谱组团,包括:
15、分别确定所述候选查询对话文本的语义映射向量与各所述知识图谱组团对应的对比语义映射向量之间的特征偏离度;
16、获取与所述语义映射向量的特征偏离度最小的对比语义映射向量所对应的聚类关注点,作为目标聚类关注点;
17、从各个类别的知识图谱组团中确定所述目标聚类关注点对应的知识图谱组团,作为所述候选查询对话文本的语义映射向量对应的目标知识图谱组团。
18、譬如,在第一方面的一种可能的实施方式中,在所述依据所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的各知识图谱数据的次序进行更新,生成第二知识图谱数据集合之后,所述方法还包括:
19、获取所述目标知识图谱组团中的各知识图谱数据的语义映射向量;
20、确定所述候选查询对话文本的语义映射向量与各所述知识图谱数据的语义映射向量之间的特征偏离度;
21、依据所述特征偏离度,从所述目标知识图谱组团包括的各知识图谱数据中选取目标数量的知识图谱数据,生成第三知识图谱数据集合;
22、所述依据所述第二知识图谱数据集合,确定针对所述候选查询对话文本的知识图谱数据查询结果,包括:
23、依据所述第三知识图谱数据集合,确定针对所述候选查询对话文本的知识图谱数据查询结果。
24、譬如,在第一方面的一种可能的实施方式中,所述依据各所述知识图谱数据的对话文本分词向量,确定各所述知识图谱数据与所述候选查询对话文本的查询关联度信息,包括:
25、基于所述候选查询对话文本的对话文本分词向量与各所述知识图谱数据的对话文本分词向量的特征偏离度,确定所述知识图谱数据和所述候选查询对话文本的查询关联度信息;
26、所述依据所述查询关联度信息,对各所述知识图谱数据进行整理,生成第一知识图谱数据集合,包括:
27、依据所述知识图谱数据和所述候选查询对话文本的查询关联度信息,对所述目标知识图谱组团中的知识图谱数据进行整理,生成第一知识图谱数据集合。
28、譬如,在第一方面的一种可能的实施方式中,所述依据所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的知识图谱数据进行调整,生成第二知识图谱数据集合,包括:
29、对所述候选查询对话文本进行文本内容标签预测,生成所述候选查询对话文本的目标知识标签;
30、依据所述目标知识标签及所述知识图谱数据所对应的知识标签信息,确定所述第一知识图谱数据集合中知识图谱数据的标签相关度;
31、依据所述知识图谱数据所对应的知识标签信息、以及所述第一知识图谱数据集合中知识图谱数据的标签相关度,对所述第一知识图谱数据集合中的知识图谱数据进行更新,生成第二知识图谱数据集合。
32、譬如,在第一方面的一种可能的实施方式中,所述方法依据知识查询网络实现,所述知识查询网络包括语义编码子网络、引用子网络、次序整理子网络及查询子网络;
33、所述获取所述候选查询对话文本的语义映射向量,包括:
34、依据所述语义编码子网络,获取所述候选查询对话文本的语义映射向量;
35、所述从各个类别的知识图谱组团中确定所述候选查询对话文本的语义映射向量对应的目标知识图谱组团,包括:
36、依据所述引用子网络,依据所述语义映射向量,从各个类别的知识图谱组团中确定所述候选查询对话文本的语义映射向量对应的目标知识图谱组团;
37、所述依据所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的各知识图谱数据的次序进行更新,生成第二知识图谱数据集合,包括:
38、依据所述次序整理子网络,获取所述目标知识图谱组团中的各知识图谱数据的对话文本分词向量,并依据所述次序整理子网络,依据各所述知识图谱数据的对话文本分词向量,确定各所述知识图谱数据所对应的知识标签信息、及各所述知识图谱数据与候选查询对话文本的查询关联度信息,依据所述查询关联度信息,对各所述知识图谱数据进行整理,生成第一知识图谱数据集合;
39、依据所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的各知识图谱数据的次序进行更新,生成第二知识图谱数据集合,所述知识图谱数据所对应的知识标签信息表征所述知识图谱数据归属各知识标签的可能性;
40、所述确定针对所述候选查询对话文本的知识图谱数据查询结果,包括:
41、依据所述查询子网络,依据所述第二知识图谱数据集合,确定针对所述候选查询对话文本的知识图谱数据查询结果。
42、譬如,在第一方面的一种可能的实施方式中,所述次序整理子网络包括第一标签预测单元、第二标签预测单元、标签比较单元及排列单元,所述依据所述次序整理子网络,依据所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的知识图谱数据进行更新,生成第二知识图谱数据集合,包括:
43、依据所述第一标签预测单元,获取所述目标知识图谱组团中各知识图谱数据所对应的知识标签信息;
44、依据所述第二标签预测单元,对所述候选查询对话文本的基础知识图谱数据特征进行标签预测,生成所述候选查询对话文本对应的目标知识标签;
45、依据所述标签比较单元,依据所述目标知识标签及所述知识图谱数据所对应的知识标签信息,确定所述第一知识图谱数据集合中的知识图谱数据的标签相关度;
46、依据所述排列单元,依据所述标签相关度以及所述知识图谱数据所对应的知识标签信息,对所述第一知识图谱数据集合中的各知识图谱数据进行整理,生成第二知识图谱数据集合。
47、譬如,在第一方面的一种可能的实施方式中,所述依据所述语义编码子网络,获取所述候选查询对话文本的语义映射向量之前,所述方法还包括:
48、获取待训练文本数据序列以及初始化权重参数的所述知识查询网络,所述待训练文本数据包括靶向训练文本数据、积极训练文本数据及消极训练文本数据,所述靶向训练文本数据与所述积极训练文本数据为相同文本数据,所述靶向训练文本数据与所述消极训练文本数据为不相同文本数据;
49、依据所述知识查询网络的语义编码子网络,分别对所述待训练文本数据序列进行语义编码,生成所述待训练文本数据序列的语义映射向量;
50、依据所述知识查询网络的引用子网络,依据所述待训练文本数据序列的语义映射向量,从各个类别的知识图谱组团中确定所述待训练文本数据序列的语义映射向量对应的目标知识图谱组团;
51、依据所述知识查询网络的次序整理子网络,获取所述目标知识图谱组团中各知识图谱数据的次序整理信息,并依据所述次序整理信息对所述目标知识图谱组团中的知识图谱数据进行整理,生成预测第二知识图谱数据集合,所述次序整理信息包括以下至少之一:所述知识图谱数据和所述待训练文本数据序列的语义相关性参数、所述知识图谱数据所对应的知识标签信息;
52、依据所述知识查询网络的查询子网络,依据所述预测第二知识图谱数据集合,确定针对所述待训练文本数据序列的知识图谱数据查询结果;
53、获取与所述待训练文本数据序列的语义映射向量对应的训练误差值,并依据所述待训练文本数据序列与所述预测第二知识图谱数据集合中各知识图谱数据之间的偏离度,确定所述待训练文本数据序列的查询误差值;
54、依据所述训练误差值以及所述查询误差值,更新所述知识查询网络的网络权重信息。
55、譬如,在第一方面的一种可能的实施方式中,所述依据所述第二知识图谱数据集合,确定针对所述候选查询对话文本的知识图谱数据查询结果,包括:
56、从所述第二知识图谱数据集合中的首个知识图谱数据开始,依次进行知识图谱数据选取,直至选取目标数量的所述知识图谱数据,确定为针对所述候选查询对话文本的知识图谱数据查询结果。
57、第二方面,本技术实施例还提供一种大数据服务器系统,所述大数据服务器系统包括处理器和机器可读存储介质,所述机器可读存储介质中存储有计算机程序,所述计算机程序结合该处理器加载并执行以实现以上第一方面的基于大数据的知识图谱构建方法。
58、采用以上任意方面的技术方案,首先获取样例项目会话数据序列,其中包括多个样例项目会话数据、对应的学习价值以及目标会话关联矢量,然后根据这些样例学习价值,确定出当前样例项目会话数据,并将其对应的目标会话关联矢量加载至初始化神经网络进行知识学习,生成了第一知识关系估计网络,接着,利用第一知识关系估计网络对各样例项目会话数据的学习价值进行优化,形成了一个自我学习和改进的循环过程,提高了网络估计准确性。当第一知识关系估计网络收敛时,生成第二知识关系估计网络。这个网络可以估计加载的会话文本段与加载的项目关注节点信息对应的知识关系属性特征,并基于各个会话文本段与加载的项目关注节点信息对应的知识关系属性特征进行知识图谱构建。通过构建知识图谱,可以更好地理解和处理项目会话数据的内容,从而提升了知识图谱构建的效率。