本发明涉及数据处理,具体涉及一种用于空气质量数据缺失的数据插补方法及系统。
背景技术:
1、随着工业化和城市化的不断发展,空气质量成为了一个重要的环境问题。监测和评估空气质量数据成为了保护公众健康和环境的重要工作。空气质量指数是一种用于度量空气质量的标准化指标,常用于向公众传递空气质量信息。通过监测与空气质量相关的数据,如pm2.5、pm10、臭氧、二氧化氮、二氧化硫、一氧化碳等,并将其与国家或地区的空气质量标准相比较,从而得到空气质量指数。
2、用于空气质量数据缺失的数据插补方法及系统,是指通过对已有的监测数据结合空间等因素分析并推断出由于监测位置发生故障导致数据缺失或者未知区域的空气质量数据,以便在分析、建模和决策中获得更全面的空气质量信息。
3、现有的问题:在对空气质量数据进行插值计算的过程中,传统的插值算法往往会在插值过程中对数据进行平滑处理,导致插值结果过于平缓,无法准确地反映真实的数据变化情况,这可能掩盖了真实的空气质量波动或污染源的局部影响,导致插值结果和实际情况有所偏差。
技术实现思路
1、本发明提供一种用于空气质量数据缺失的数据插补方法及系统,以解决现有的问题。
2、本发明的一种用于空气质量数据缺失的数据插补方法及系统采用如下技术方案:
3、本发明一个实施例提供了一种用于空气质量数据缺失的数据插补方法,该方法包括以下步骤:
4、将城市内任意一片区域,记为目标区域;在当前时刻上,使用传感器采集目标区域内每个监测位置的经纬度、风速值、湿度值、污染物浓度值;将目标区域内任意一个监测位置,记为目标监测位置;根据目标监测位置的风速值、湿度值、污染物浓度值,得到目标监测位置的属性值;
5、根据所有监测位置的属性值之间的差异、监测位置的经纬度,得到初始距离序列与每个监测位置的更新污染物浓度值;
6、根据初始距离序列、所有监测位置的更新污染物浓度值,得到距离序列与距离序列中每个数据值对应的半方差,并得到平面坐标系上的距离与半方差散点图;
7、根据距离与半方差散点图中所有相邻数据点的连线的斜率之间的差异,得到变程;
8、将目标区域内不是监测位置的任意一个位置,记为参考位置;根据当前时刻上目标区域内所有监测位置的更新污染物浓度值、距离序列中所有数据值与其对应的半方差、变程,使用克里金插值算法,得到当前时刻上目标区域内参考位置对应的污染物浓度值。
9、进一步地,所述根据目标监测位置的风速值、湿度值、污染物浓度值,得到目标监测位置的属性值对应的具体计算公式为:
10、
11、其中z为目标监测位置的属性值,c为目标监测位置的污染物浓度值,s为目标监测位置的湿度值,v为目标监测位置的风速值,为线性归一化函数。
12、进一步地,所述根据所有监测位置的属性值之间的差异、监测位置的经纬度,得到初始距离序列与每个监测位置的更新污染物浓度值,包括的具体步骤如下:
13、根据监测位置的经纬度,计算目标区域内任意两个监测位置之间的距离,将所有监测位置之间的距离由小到大排序,得到初始距离序列;
14、在目标区域内,将距离目标监测位置最近的监测位置,记为目标监测位置对应的参考监测位置;将目标监测位置对应的参考监测位置的属性值,记为目标监测位置的参考属性值;
15、根据目标区域内目标监测位置与其之外的所有监测位置的属性值、目标监测位置的参考属性值,得到目标监测位置存在数据异常的可能性;
16、当目标监测位置存在数据异常的可能性大于预设的异常阈值时,将目标监测位置的更新污染物浓度值设置为目标监测位置对应的参考监测位置的污染物浓度值;
17、当目标监测位置存在数据异常的可能性小于等于预设的异常阈值时,将目标监测位置的更新污染物浓度值设置为目标监测位置的污染物浓度值。
18、进一步地,所述根据目标区域内目标监测位置与其之外的所有监测位置的属性值、目标监测位置的参考属性值,得到目标监测位置存在数据异常的可能性对应的具体计算公式为:
19、
20、其中p为目标监测位置存在数据异常的可能性,z为目标监测位置的属性值,为目标区域内目标监测位置之外的所有监测位置的属性值的均值,为目标监测位置的参考属性值,为线性归一化函数,| |绝对值函数。
21、进一步地,所述根据初始距离序列、所有监测位置的更新污染物浓度值,得到距离序列与距离序列中每个数据值对应的半方差,包括的具体步骤如下:
22、将初始距离序列等分为n个初始距离序列段,依次计算每个初始距离序列段内的数据均值,得到距离序列;所述n为预设的等分数量;
23、根据目标区域内所有监测位置的更新污染物浓度值,使用半方差函数,依次将距离序列中每个数据值作为距离阈值,得到距离序列中每个数据值对应的半方差。
24、进一步地,所述得到平面坐标系上的距离与半方差散点图,包括的具体步骤如下:
25、以距离序列中的数据值为横轴,以距离序列中数据值对应的半方差为纵轴,构建平面坐标系;
26、在平面坐标系上,根据距离序列中所有数据值与其对应的半方差构成的数据点,得到距离与半方差散点图。
27、进一步地,所述根据距离与半方差散点图中所有相邻数据点的连线的斜率之间的差异,得到变程,包括的具体步骤如下:
28、根据距离与半方差散点图中数据点的横坐标值,由小到大将所有数据点排序,依次计算相邻两个数据点的连线的斜率,得到斜率序列;
29、依次计算斜率序列中相邻两个数据的差值的绝对值,得到绝对值序列;
30、将斜率序列中每个数据对应在绝对值序列中的数据的均值,记为斜率序列中每个数据对应的邻域差异;
31、根据斜率序列中每个数据对应的邻域差异、所有数据之间的差异,得到斜率序列中每个数据为分割界限的可能性;
32、根据斜率序列中每个数据为分割界限的可能性的大小,得到变程。
33、进一步地,所述根据斜率序列中每个数据对应的邻域差异、所有数据之间的差异,得到斜率序列中每个数据为分割界限的可能性对应的具体计算公式为:
34、
35、其中为斜率序列中第i个数据为分割界限的可能性,为斜率序列中第i个数据对应的邻域差异,为斜率序列中第i个数据与其之前的所有数据的均值,为斜率序列中第i个数据之后的所有数据的均值,| |为绝对值函数。
36、进一步地,所述根据斜率序列中每个数据为分割界限的可能性的大小,得到变程,包括的具体步骤如下:
37、在斜率序列中,选取所有数据为分割界限的可能性中的最大值对应的数据,将所述最大值对应的数据对应在距离与半方差散点图中的两个数据点的横坐标值中的最大值,记为变程。
38、本发明还提出了一种用于空气质量数据缺失的数据插补系统,包括存储器和处理器,所述处理器执行所述存储器存储的计算机程序,以实现前述所述的方法。
39、本发明的技术方案的有益效果是:
40、本发明实施例中,使用传感器采集目标区域内每个监测位置的经纬度、风速值、湿度值、污染物浓度值,将任意一个监测位置,记为目标监测位置,根据目标监测位置的风速值、湿度值、污染物浓度值,得到目标监测位置的属性值,结合监测位置的经纬度,得到初始距离序列与每个监测位置的更新污染物浓度值,由此对目标监测位置中的异常数据进行修正,从而提高后续数据插补的准确性。再获取距离序列与距离序列中每个数据值对应的半方差,并得到距离与半方差散点图,根据距离与半方差散点图中数据点的分布,得到变程,由此自适应克里金插值算法中的重要参数,使得算法构建的模型更加合理与符合实际数据。最后使用克里金插值算法,得到目标区域内监测不到空气质量的位置对应的污染物浓度值。至此本发明通过对克里金插值算法中的半方差函数模型进行分析计算得到更加符合实际的数据,使得插值结果在空间上更加平滑和连续,有助于准确地估计观测不到的位置的空气质量。