本发明涉及网站结构分类解析领域,具体涉及一种基于决策树分类算法的融合模型网站结构解析方法。
背景技术:
1、针对数据采集需求,通过数据爬虫方式,可以通过自动化的方式从互联网上收集和提取数据。帮助技术人员获取大量的数据,并且可以在短时间内完成这个过程。传统的数据采集工作,依靠技术人员前期针对每个数据采集网站,分析页面结构,然后编写爬虫代码的方式,但随着大数据技术、人工智能技术的发展对数据支撑需求不断扩大,已无法低成本、高效率支撑。因此,通过一种智能化手段,实现对网站结构的智能分析方法来代替人工分析,同时依靠逐渐提高算力的高速计算设备,可将先前单独训练的模型合并训练,进而将不同训练集、不同模型输出融合到单一模型中获取,从而将分析结果及要素直接反馈给技术人员后,技术人员直接编写数据采集程序将大大提升人工采集升本,从而降低数据采集成本,提升技术人员开发效率,进而支撑大数据、人工智能技术的发展意义重大。
技术实现思路
1、针对现有技术的不足,本发明提供了一种基于决策树分类算法的融合模型网站结构解析方法,通过快速建立二分类模型,并在实施各阶段进行模型提升与结果验证,能够快速准确地提取目标数据。
2、为实现上述目的,本发明提供了一种基于决策树分类算法的融合模型网站结构解析方法,包括:
3、s1、基于dom提取技术获取待解析网站的html代码;
4、s2、根据所述待解析网站的html代码获取对应解析元素特征;
5、s3、利用所述解析元素特征基于决策树分类算法得到待解析网站的结构解析结果。
6、优选的,所述基于dom提取技术获取待解析网站的html代码包括:
7、基于dom提取技术获取待解析网站的初始html代码;
8、判断所述初始html代码是否存在对应历史html代码,若是,则利用所述待解析网站的初始html代码与初始html代码对应历史html代码作为待解析网站的html代码,否则,直接输出待解析网站的初始html代码作为待解析网站的html代码。
9、进一步的,根据所述待解析网站的html代码获取对应解析元素特征包括:
10、根据所述待解析网站的html代码获取待解析网站的文本数据;
11、根据所述待解析网站的文本数据进行页面解析得到待解析网站的标签属性数据;
12、利用所述待解析网站的文本数据与标签属性数据作为解析元素特征。
13、进一步的,根据所述待解析网站的文本数据进行页面解析得到待解析网站的标签属性数据包括:
14、获取待解析网站的网站标签;
15、根据所述待解析网站的文本数据获取对应文本数据属性;
16、利用所述待解析网站的网站标签与文本数据属性作为待解析网站的标签属性数据;
17、其中,所述网站标签包括页面标题、页面描述与关键词。
18、进一步的,利用所述解析元素特征基于决策树分类算法得到待解析网站的结构解析结果包括:
19、s3-1、利用所述解析元素特征基于决策树分类算法建立决策分类模型;
20、s3-2、利用所述解析元素特征根据决策分类模型得到待解析网站的特征决策分类结果;
21、s3-3、利用所述待解析网站的特征决策分类结果得到待解析网站的结构解析结果。
22、进一步的,利用所述解析元素特征基于决策树分类算法建立决策分类模型包括:
23、s3-1-1、利用所述解析元素特征中待解析网站的文本数据与对应文本数据属性划分为一级数据集;
24、s3-1-2、利用所述解析元素特征中标签属性数据的待解析网站的网站标签划分为二级数据集;
25、s3-1-3、利用所述一级数据集与二级数据集基于决策树分类算法建立决策分类模型。
26、进一步的,利用所述一级数据集与二级数据集基于决策树分类算法建立决策分类模型包括:
27、s3-1-3-1、利用所述一级数据集作为第一训练集,基于决策树分类算法进行根节点训练得到第一初始决策分类模型;
28、s3-1-3-2、利用所述二级数据集作为第二训练集,基于决策树分类算法进行决策树剪枝处理得到第二初始决策分类模型;
29、s3-1-3-3、判断当前一级数据集与二级数据集对应待解析网站的html代码是否存在历史html代码,若是,则根据所述历史html代码获取历史决策分类模型,对第二初始决策分类模型进行校对处理得到决策分类模型,否则,直接输出第二初始决策分类模型作为决策分类模型。
30、进一步的,根据所述历史html代码获取历史决策分类模型,对第二初始决策分类模型进行校对处理得到决策分类模型包括:
31、s3-1-3-3-1、根据所述历史html代码获取历史决策分类模型;
32、s3-1-3-3-2、获取所述历史决策分类模型对应历史第一数据集与历史第二数据集;
33、s3-1-3-3-3、获取所述历史第一数据集与当前第一数据集的相似度作为第一校对相似度;
34、s3-1-3-3-4、获取所述历史第二数据集与当前第二数据集的相似度作为第二校对相似度;
35、s3-1-3-3-5、判断所述第一校对相似度与第二校对相似度是否相同,若是,则执行s3-1-3-3-6,否则,输出所述第二初始决策分类模型作为决策分类模型;
36、s3-1-3-3-6、判断所述第二初始决策分类模型与历史决策分类模型的模型结构是否相同,若是,则利用第二初始决策分类模型作为决策分类模型,否则,获取所述第二初始决策分类模型与历史决策分类模型的模型结构相似度,并执行s3-1-3-3-7;
37、s3-1-3-3-7、判断所述模型结构相似度与第一校对相似度是否相同,若是,则利用第二初始决策分类模型作为决策分类模型,否则,利用所述历史第一数据集与历史第二数据集作为当前第一训练集与第二训练集,并返回s3-1-3-1;
38、其中,所述模型结构相似度为决策树分类模型中各节点与路径的相似度。
39、进一步的,利用所述待解析网站的特征决策分类结果得到待解析网站的结构解析结果包括:
40、s3-3-1、获取所述待解析网站的特征决策分类结果对应待解析网站的html代码;
41、s3-3-2、利用所述待解析网站的特征决策分类结果作为映射基准;
42、s3-3-3、利用所述映射基准与待解析网站的html代码建立当前待解析网站的特征决策分类结果对应校对映射;
43、s3-3-4、利用所述校对映射建立前置验证库;
44、s3-3-5、利用所述前置验证库输出待解析网站的结构解析结果。
45、进一步的,利用所述前置验证库输出待解析网站的结构解析结果包括:
46、s3-3-5-1、判断当前校对映射在前置验证库中是否存在对应历史校对映射,若是,则执行s3-3-5-2,否则,直接输出当前校对映射对应特征决策分类结果作为待解析网站的结构解析结果;
47、s3-3-5-2、判断当前校对映射对应html代码与历史校对映射对应html代码是否相同,若是,则输出当前校对映射对应特征决策分类结果作为待解析网站的结构解析结果,否则,执行s3-3-5-3;
48、s3-3-5-3、判断当前校对映射对应html代码与历史校对映射对应html代码相互是否存在父子关系,若是,则输出当前校对映射对应特征决策分类结果作为待解析网站的结构解析结果,否则,返回s3-3-5-1。
49、与最接近的现有技术相比,本发明具有的有益效果:
50、通过常见分类算法,实现对网站结构的自动解析,减少人工干预,减少数据采集程序编写中技术人员对于页面结构解析的人工精力,做到降本增效,同时能够快速准确地提取目标数据,支持非专业人员进一步的数据分析和应用,提高数据利用效率。