本技术涉及数据处理,特别是涉及提案的自动分类方法、装置、计算机设备和存储介质。
背景技术:
1、提案是与会单位、团体或参会人员,向会议提出的书面意见和建议,供会议讨论,并作为决策参考。
2、随着技术的发展,提案的数量越来越多,涉及到的分类也越来越广泛。
3、现有技术中,提案在提交时,需要人工进行分类,以便提交至正确的办理单位。
4、但是,当提案较多时,人工分类需要花费很多时间搜索对应的类别,费时费力,效率很低,而且,可能会由于主观原因,将提案分到错误的类别,并提交至错误的办理单位,准确率也不高。
技术实现思路
1、基于此,有必要针对上述技术问题,提供一种提案的自动分类方法、装置、计算机设备和存储介质,能够对提案进行自动分类,提高提案分类的效率和准确率。
2、提案的自动分类方法,包括:
3、获取提案集,提案集包括多个提案,对每个提案进行分词,得到每个提案的词条库;提案包括一个待分类提案以及多个参考提案;
4、根据每个提案的词条库,计算提案中每个词条与该提案的匹配度,得到每个提案的匹配概率;并根据所述匹配概率,输出每个提案的推荐词条组;
5、根据每个提案的推荐词条组,计算待分类提案与每个参考提案之间的相似度,并以相似度为权值,结合每个提案的匹配概率,计算待分类提案的词条向量;
6、根据待分类提案的词条向量,得到待分类提案的自动分类。
7、在一个实施例中,提案分为历史提案和目标提案;根据待分类提案的词条向量,得到待分类提案的自动分类包括:根据待分类历史提案的词条向量得到待分类历史提案的自动分类以及根据待分类目标提案的词条向量得到待分类目标提案的自动分类;
8、在得到待分类目标提案的自动分类之后,还包括:
9、根据待分类历史提案的词条向量以及待分类历史提案的自动分类,计算分类梯度;
10、根据分类梯度,得到待分类目标提案的最终分类。
11、在一个实施例中,根据每个提案的推荐词条组,计算待分类提案与参考提案之间的相似度,包括:
12、;
13、式中,表示待分类提案和参考提案之间的相似度,为由待分类提案和参考提案的推荐词条组构成的推荐词条库,为待分类提案的推荐词条组中词条的多维向量,为参考提案的推荐词条组中词条的多维向量,是待分类提案的推荐词条组,是参考提案的推荐词条组。
14、在一个实施例中,以相似度为权值,结合每个提案的匹配概率,计算待分类提案的词条向量,包括:
15、;
16、式中,为待分类提案的词条向量,为待分类提案和参考提案之间的相似度,为参考提案的匹配概率,是参考提案的词条,是所有提案的所有词条,所有提案包括所有目标提案以及所有历史提案,是参考提案,是所有提案所在的提案集。
17、在一个实施例中,以相似度为权值,结合每个提案的匹配概率,计算待分类提案的词条向量,包括:
18、;
19、式中,为待分类提案的词条向量,为待分类提案和参考提案之间的相似度,为参考提案的匹配概率,是参考提案的词条,是所有提案的所有词条,所有提案包括所有目标提案以及所有历史提案,是参考提案,是所有提案所在的提案集,为权重,取值在0~1之间,为所有提案的平均匹配概率。
20、在一个实施例中,获取多个历史提案以及每个历史提案的历史分类;
21、根据待分类历史提案的词条向量以及待分类历史提案的自动分类,计算分类梯度;根据分类梯度,得到待分类目标提案的最终分类,包括:
22、;
23、式中,为分类梯度,为待分类历史提案的自动分类,为历史提案的历史分类,为待分类历史提案的词条向量;
24、根据分类梯度,调整权重:
25、;
26、式中,为第次迭代的权重,为第次迭代的权重,为学习率,为第次迭代的分类梯度;
27、当迭代的权重满足预设条件时,得到最优权重;根据最优权重,计算待分类目标提案的最优词条向量,并得到待分类目标提案的最终分类。
28、在一个实施例中,根据每个提案的词条库,计算提案中每个词条与该提案的匹配度,得到每个提案的匹配概率,并根据所述匹配概率,输出每个提案的推荐词条组,包括:
29、根据每个提案的词条库,采用协同过滤算法,输出提案中每个词条的出现次数;根据提案中每个词条的出现次数,采用词向量模型,计算提案中每个词条与该提案的匹配度,得到每个提案的匹配概率;
30、输出匹配概率最大的多个词条作为每个提案的推荐词条组。
31、提案的自动分类装置,包括:
32、获取模块,用于获取提案集,提案集包括多个提案,对每个提案进行分词,得到每个提案的词条库;提案包括一个待分类提案以及多个参考提案;
33、匹配模块,用于根据每个提案的词条库,计算提案中每个词条与该提案的匹配度,得到每个提案的匹配概率;并根据所述匹配概率,输出每个提案的推荐词条组;
34、计算模块,用于根据每个提案的推荐词条组,计算待分类提案与每个参考提案之间的相似度,并以相似度为权值,结合每个提案的匹配概率,计算待分类提案的词条向量;
35、分类模块,用于根据待分类提案的词条向量,得到待分类提案的自动分类。
36、一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现以下步骤:
37、获取提案集,提案集包括多个提案,对每个提案进行分词,得到每个提案的词条库;提案包括一个待分类提案以及多个参考提案;
38、根据每个提案的词条库,计算提案中每个词条与该提案的匹配度,得到每个提案的匹配概率;并根据所述匹配概率,输出每个提案的推荐词条组;
39、根据每个提案的推荐词条组,计算待分类提案与每个参考提案之间的相似度,并以相似度为权值,结合每个提案的匹配概率,计算待分类提案的词条向量;
40、根据待分类提案的词条向量,得到待分类提案的自动分类。
41、一种计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现以下步骤:
42、获取提案集,提案集包括多个提案,对每个提案进行分词,得到每个提案的词条库;提案包括一个待分类提案以及多个参考提案;
43、根据每个提案的词条库,计算提案中每个词条与该提案的匹配度,得到每个提案的匹配概率;并根据所述匹配概率,输出每个提案的推荐词条组;
44、根据每个提案的推荐词条组,计算待分类提案与每个参考提案之间的相似度,并以相似度为权值,结合每个提案的匹配概率,计算待分类提案的词条向量;
45、根据待分类提案的词条向量,得到待分类提案的自动分类。
46、上述提案的自动分类方法、装置、计算机设备和存储介质,求词条向量时,根据相似度结合参考提案的匹配概率而不是结合待分类提案的匹配概率,可以避免分类类别过多的情况以及待分类提案过于冷门导致某个分类中仅有少量提案的情况,从而建立出分类模型以对提案进行自动分类,提高提案分类的效率与准确率。优选地,考虑平均匹配概率并设置权重,以对分类模型进行优化,从而减少干扰词(与分类无关的词,比如:我)的比重,进一步提高提案分类的效率与准确率。进一步优选地,考虑历史提案数据(历史提案、历史提案的历史分类以及历史提案的自动分类),对分类模型进行进一步优化调整,融合历史分类特征,从而更进一步提案分类的效率与准确率。