一种红外目标识别方法、装置、设备及介质

文档序号:36175525 发布日期:2023-11-25 00:40 阅读:47 来源:国知局
一种红外目标识别方法

本发明涉及人工智能,具体涉及一种红外目标识别方法、装置、设备及介质。


背景技术:

1、随着大数据、互联网、物联网等计算机技术的发展,图形处理器更新迭代带来的计算资源的极大丰富,以大型卷积神经网络为代表的人工智能技术飞速发展,并且极大地推动了人类社会生产力的提升。其对于各行各业,都产生了积极的推动作用,例如在图像识别、2020欧洲杯投注官网 理解、自动驾驶、无人监控等领域,都活跃着人工智能技术的身影,使得这些领域变得更加的高效。人工智能作为推动技术变革的引领者,发挥着巨大的作用。其中,目标识别是人工智能领域的一个重要组成部分,其意义同样重大。

2、目标识别技术在诸多领域和行业都发挥着积极作用。随着交通和汽车行业的发展,自动驾驶也开始蓬勃发展,在自动驾驶领域,目标识别是其核心技术之一,汽车在自动驾驶的过程中需要自动识别周围的行人和车辆,以及交通灯和道路标志,并根据周围的环境信息实时判断是否存在安全威胁。这一过程,对于目标识别模型,提出了很高的要求。第一,这需要目标识别模型具有较高的识别速度以胜任实时识别场景,第二,这需要目标识别模型能够在复杂的未见场景中精确识别不同类别的目标,这就需要模型具备较强的泛化性能。此外,自动驾驶中的目标识别还面临着其它考验,例如,城市的天气多变,目标识别模型能够识别晴天时的道路目标,却未必能精准识别雨天时的目标;在夜晚条件下,可见光微弱,此时模型需要识别红外图像,相比于可见光图像,红外图像的目标轮廓不够清晰,且信息量较少,此外,虽然已经有了足够多的可见光图像数据集,但是模型实际应用场景的红外图像数据相对较少且不容易进行数据收集,因此在模型实际开发的过程中,可供模型训练学习的数据仅包括带有标签的可见光图像集和无标签的红外图像集。这些问题,制约了模型识别红外目标的能力。而基于领域自适应的目标识别技术可以解决上述问题,基于领域自适应,可以使模型在不同场景以及不同风格的图像中学习到共性知识,从而使模型在面对复杂的现实场景时做到游刃有余。基于领域自适应的红外目标识别的关键技术在于如何在带标签的可见光和无标签的红外图像中提取到语义不变的高级特征,从而使模型能够在不同模态的图像中寻找到共性信息,提升模型对红外目标的识别能力。目前已经提出了许多方法,这些方法根据基础框架的分类,可以分为一阶段和二阶段域自适应红外目标识别方法。其主要差别为,前者识别速度较快但精度不高,后者识别速度较慢但精度相对较高。

3、基于领域自适应的红外目标识别方法基本上基于两个框架,一个是二阶段目标识别框架faster r-cnn,一个是一阶段目标识别框架yolo。faster r-cnn模型的目标识别过程可以分为两个阶段,在第一个阶段,骨干网络从图像中提取出高级特征,它们代表了图像的目标以及背景信息,在第二个阶段,结合区域候选网络rpn,模型对这些特征进行进一步的筛选,得到目标的位置信息,然后将这些候选区域的特征输入分类器,从而得到目标的类别信息,这样就实现了目标识别。yolo模型则同时完成目标的定位和分类任务,将输入模型的图像划分为网格,每一个网格负责识别属于该网格的目标,并在一个阶段内同时输出目标的坐标、类别以及置信度等数据预测,从而完成一阶段的目标识别任务。以上两种目标识别框架,其主要差别在于识别速度和精度。在实际应用中,一阶段的目标识别框架更具实用性。

4、据了解,现有的基于领域自适应的红外目标识别技术大多采用生成对抗网络gan,将带标签的可见光源域图像转化为红外模态的图像。这一转换过程中,图像的内容保持不变,因此原有的可见光图像标签可以直接用于转化后的红外图像,最后通过训练,使得模型在仅有可见光图像训练集的条件下也可以具备红外目标识别能力。然而,基于gan生成红外图像技术存在一些不足,其生成的图像质量不够稳定。

5、有鉴于此,提出本技术。


技术实现思路

1、有鉴于此,本发明的目的在于提供一种红外目标识别方法、装置、设备及介质,能够有效解决现有技术中的基于领域自适应的红外目标识别技术大多采用生成对抗网络gan,而基于gan生成红外图像技术存在生成的图像质量不够稳定的问题。

2、本发明公开了一种红外目标识别方法, 包括:

3、获取红外摄像机采集到的红外图片数据集,其中,所述红外图片数据集中的红外图片的图像张量为,为同批次输入图像数量,为通道数,为高度,为宽度;

4、调用训练好的yolov5目标识别模型对所述红外图片数据集的红外图片进行识别处理,生成输出特征张量和模型识别精度,其中,所述yolov5目标识别模型包括骨干网络backbone、颈网络neck和目标识别头组件head,所述目标识别头组件head包括小目标识别头、中目标识别头和大目标识别头;

5、调用注意力模块对所述输出特征张量和所述模型识别精度进行过滤处理,生成三个不同尺寸的过滤特征图,其中,所述三个不同尺寸的过滤特征图分别与所述小目标识别头、所述中目标识别头和所述大目标识别头相对应;

6、所述小目标识别头、所述中目标识别头和所述大目标识别头分别依照对应的不同尺寸的过滤特征图,对待识别物体进行识别。

7、优选地,调用训练好的yolov5目标识别模型对所述红外图片数据集的红外图片进行识别处理,生成输出特征张量和模型识别精度,具体为:

8、调用所述骨干网络backbone中的focus模块对所述红外图片的初始张量进行切片处理,生成切片张量;

9、调用所述骨干网络backbone中的csp网络模块对所述切片张量进行特征合并处理,生成合并张量,其中,所述特征合并处理为将所述切片张量的基础层的特征映射划分为两部分,再通过跨阶段层次结构将该两部分合并;

10、使用多个不同卷积层的多个卷积核对所述合并张量进行卷积运算,生成输出特征张量,其中,所述输出特征张量的大小为;

11、调用所述颈网络neck中的csp网络连接结构对所述输出特征张量进行特征融合处理,生成模型识别精度,其中,所述特征融合处理包括计算交并比iou、类别交叉熵和预测置信度,计算所述模型识别精度的训练损失函数为:

12、

13、其中,为损失值,损失值越小,精度越高,为输入图像,为模型输出的边框位置预测,为目标框对应的类别预测,为第一个和第二个损失项的超参数,为网格的总数,为第四个损失项的超参数,为类别总数,为c属于总数,为预测值,为标签,表示为对象是否出现在单元网格中,表示为单元网格中第个边框预测器负责该预测,为目标中心的真实坐标,为模型预测的目标中心坐标,为真实目标的宽,为真实目标的高,为模型预测的目标宽,为模型预测的目标高,为真实置信度,当该网格区域存在真实目标时,,反之,,为模型预测的置信度,为类别信息。

14、优选地,在调用训练好的yolov5目标识别模型对所述红外图片数据集的红外图片进行识别处理之前,还包括:

15、获取红外摄像机采集到的红外图片训练数据集和拍摄摄像头采集到的可见光数据集,并采用mosaic数据增强技术对所述红外图片训练数据集和所述可见光数据集进行处理;

16、建立一个基础yolov5模型,调用所述基础yolov5模型的骨干网络backbone中的focus模块对所述红外图片训练数据集和所述可见光数据集进行切片处理;

17、调用所述基础yolov5模型的骨干网络backbone中的csp网络模块对切片处理后的所述红外图片训练数据集和所述可见光数据集进行特征合并处理,并使用多个不同卷积层的多个卷积核对合并后的所述红外图片训练数据集和所述可见光数据集的张量进行卷积运算,生成训练张量;

18、调用注意力模块对所述训练张量进行过滤处理,生成过滤特征图;

19、分别调用域自适应组件和所述目标识别头组件head对所述过滤特征图进行预处理,以训练所述基础yolov5模型区分功能,提升模型对不同尺度目标的跨域识别能力,其中,所述基础yolov5模型区分功能是用于区分输入模型的特征张量是属于源域还是属于目标域的;

20、根据训练好的所述基础yolov5模型,生成yolov5目标识别模型。

21、优选地,分别调用域自适应组件和所述目标识别头组件head对所述过滤特征图进行预处理,具体为:

22、调用域自适应组件的梯度反转层grl对所述过滤特征图进行反转处理,并将反转处理后的所述过滤特征图依次经过两个1×1的卷积层和全连接层,生成第一特征张量;

23、当判断到所述第一特征张量为源域时,输出第一预测类别;

24、当判断到所述第一特征张量不为源域时,输出第二预测类别;

25、结合所述目标识别头组件head根据所述第一预测类别或所述第二预测类别,生成域分类的损失函数和多任务损失函数,其中,所述域分类的损失函数的公式为,是所述域自适应组件的域分类器对于第i个训练图像的(x,y)处的特征图的域类别预测,是第i个图像的域标签,当=0时,其为源域图像,当=1时,其为目标域图像;

26、其中,所述多任务损失函数的公式为,为多任务损失函数,为模型的目标识别训练损失函数,为模型的域分类损失函数,为一个常数。

27、优选地,调用注意力模块对所述输出特征张量和所述模型识别精度进行过滤处理,生成三个不同尺寸的过滤特征图,具体为:

28、根据公式对所述输出特征张量和所述模型识别精度进行过滤处理,生成所述过滤特征图,其中,表示待被过滤的特征图,表示被过滤后的特征图,表示特征矩阵之间的逐元素点乘融合,为5个空间二维1×1卷积;

29、其中,softmax操作的计算公式为,代表第个输出值结果,代表所有输出结果的数量,所述softmax操作可以将所有的输出值转化为概率在之间的值,且所有概率值的总和等于1。

30、本发明还公开了一种红外目标识别装置,包括:

31、图片获取单元,用于获取红外摄像机采集到的红外图片数据集,其中,所述红外图片数据集中的红外图片的图像张量为,为同批次输入图像数量,为通道数,为高度,为宽度;

32、目标识别模型单元,用于调用训练好的yolov5目标识别模型对所述红外图片数据集的红外图片进行识别处理,生成输出特征张量和模型识别精度,其中,所述yolov5目标识别模型包括骨干网络backbone、颈网络neck和目标识别头组件head,所述目标识别头组件head包括小目标识别头、中目标识别头和大目标识别头;

33、过滤特征图生成单元,用于调用注意力模块对所述输出特征张量和所述模型识别精度进行过滤处理,生成三个不同尺寸的过滤特征图,其中,所述三个不同尺寸的过滤特征图分别与所述小目标识别头、所述中目标识别头和所述大目标识别头相对应;

34、物体识别单元,用于所述小目标识别头、所述中目标识别头和所述大目标识别头分别依照对应的不同尺寸的过滤特征图,对待识别物体进行识别。

35、优选地,所述目标识别模型单元具体用于:

36、调用所述骨干网络backbone中的focus模块对所述红外图片的初始张量进行切片处理,生成切片张量;

37、调用所述骨干网络backbone中的csp网络模块对所述切片张量进行特征合并处理,生成合并张量,其中,所述特征合并处理为将所述切片张量的基础层的特征映射划分为两部分,再通过跨阶段层次结构将该两部分合并;

38、使用多个不同卷积层的多个卷积核对所述合并张量进行卷积运算,生成输出特征张量,其中,所述输出特征张量的大小为;

39、调用所述颈网络neck中的csp网络连接结构对所述输出特征张量进行特征融合处理,生成模型识别精度,其中,所述特征融合处理包括计算交并比iou、类别交叉熵和预测置信度,计算所述模型识别精度的训练损失函数为:

40、

41、其中,为损失值,损失值越小,精度越高,为输入图像,为模型输出的边框位置预测,为目标框对应的类别预测,为第一个和第二个损失项的超参数,为网格的总数,为第四个损失项的超参数,为类别总数,为c属于总数,为预测值,为标签,表示为对象是否出现在单元网格中,表示为单元网格中第个边框预测器负责该预测,为目标中心的真实坐标,为模型预测的目标中心坐标,为真实目标的宽,为真实目标的高,为模型预测的目标宽,为模型预测的目标高,为真实置信度,当该网格区域存在真实目标时,,反之,,为模型预测的置信度,为类别信息。

42、优选地,所述过滤特征图生成单元具体用于:

43、根据公式对所述输出特征张量和所述模型识别精度进行过滤处理,生成所述过滤特征图,其中,表示待被过滤的特征图,表示被过滤后的特征图,表示特征矩阵之间的逐元素点乘融合,为5个空间二维1×1卷积;

44、其中,softmax操作的计算公式为,代表第个输出值结果,代表所有输出结果的数量,所述softmax操作可以将所有的输出值转化为概率在之间的值,且所有概率值的总和等于1。

45、本发明还公开了一种红外目标识别设备,包括处理器、存储器以及存储在存储器中且被配置由处理器执行的计算机程序,处理器执行计算机程序时实现如上任意一项的基于一种红外目标识别方法。

46、本发明还公开了一种可读存储介质,存储有计算机程序,计算机程序能够被该存储介质所在设备的处理器执行,以实现如上任意一项的一种红外目标识别方法。

47、综上所述,本实施例提供的一种红外目标识别方法、装置、设备及介质,该方法另辟蹊径,设计了一种域自适应组件,并结合一种注意力机制,对yolov5模型进行了改进;关键部分在域自适应组件,在训练过程中,通过域自适应组件使模型在带标签的可见光图像和无标签的红外图像中提取域不变特征,在测试阶段,域自适应组件不参与模型的识别过程,因此不会影响模型的检测速度。从而解决现有技术中的基于领域自适应的红外目标识别技术大多采用生成对抗网络gan,而基于gan生成红外图像技术存在生成的图像质量不够稳定的问题。

当前第1页 1 2
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1