一种基于深度学习的多模态细粒度场景识别方法

文档序号:36175153 发布日期:2023-11-24 23:47 阅读:47 来源:国知局
一种基于深度学习的多模态细粒度场景识别方法

本发明涉及场景识别方法,具体为一种基于深度学习的多模态细粒度场景识别方法。


背景技术:

1、深度学习是学习样本数据的内在规律和表示层次,这些学习过程中获得的信息对诸如文字,图像和声音等数据的解释有很大的帮助,它的最终目标是让机器能够像人一样具有分析学习能力,能够识别文字、图像和声音等数据,并且是一个复杂的机器学习算法;

2、细粒度场景识别对属于同一基础类别的图像(汽车、狗、花、鸟等)进行更加细致的子类划分;

3、多模态即多种异构模态数据协同推理。多模态数据分析外需与高级认知智能内需相互促进。

4、现有的场景识别方法通常使用算法函数对图像数据进行数据处理,从而对处理后的数据进行分析,往往图像数据中包含有多种复杂的杂波影响识别的过程,从而导致结果的准确性下降。


技术实现思路

1、(一)解决的技术问题

2、针对现有技术的不足,本发明提供了一种基于深度学习的多模态细粒度场景识别方法,解决了杂波影响识别的过程,从而导致结果的准确性下降问题。

3、(二)技术方案

4、为实现以上目的,本发明通过以下技术方案予以实现:一种基于深度学习的多模态细粒度场景识别方法,具体包括以下步骤:

5、s1.图像接收处理

6、首先通过u盘,移动硬盘以及光盘将需要进行识别的图像进行压缩处理,接着将压缩后的图像数据输入到图像识别的专用设备中,设备将图像进行解码并准备开始识别处理;

7、s2.图像多模态学习

8、处理设备汲取数值、文本、符号、时间序列,以及集合、树、图不同数据结构所组成的复合数据形式,乃至来自不同数据库、不同知识库的各种信息资源的组合,进行对多源异构数据的挖掘分析;

9、s3.细粒度图像分类

10、使用双线性卷积神经网络模型对细粒度图像进行高层语义特征获取,通过迭代训练网络模型中的卷积参数,过滤图像中不相关的背景信息,接着对图像进行分类处理,其中将同一位置的两个特征进行矩阵外积后进行sunm polling,接着将其张成向量,最后进行矩归一化操作和l2归一化操作得到融合后的特征;

11、s4.分类图像识别

12、建立固定场景库,安装用户预设的场景分类与分类好的图像进行匹配,最终将图像对应到各个场景;

13、s5.场景结果输出

14、对处理好的图像进行判断,并且将场景判断结果反馈在显示器中,同时最后处理后的图像也通过显示器显现出来。

15、优选的,所述s1.图像接收处理中,在进行压缩处理时,首先将输入的图像数据进行映射变换,接着对其进行量化编码,并且量化编码的过程中,首先利用比较短的代码取代图像数据中出现比较频繁的数据,并且利用比较长的代码取代图像数据中使用频率比较低的数据,最后压缩完成。

16、优选的,所述s2.图像多模态学习中,具体包括多源数据分类、多模态情感分析、多模态语义计算、跨模态样本匹配、跨模态检索、跨模态样本生成以及多模态信息融合。

17、优选的,所述s3.细粒度图像分类中,双线性卷积神经网络模型中双线性模型m由一个四元组组成:m=(fa;fb;p;c),其中fa;fb代表特征提取函数。

18、优选的,所述特征提取函数卷积网络a和卷积网络b,p是一个池化函数,c是分类函数,在进行分类的过程中通过网络a和网络b互补处理,其中网络a对图像中的物体进行定位,网络b完成对网络a定位到的物体位置进行特征提取,最后完成细粒度图像识别任务。

19、(三)有益效果

20、本发明提供了一种基于深度学习的多模态细粒度场景识别方法。具备以下有益效果:

21、1、本发明提供了一种基于深度学习的多模态细粒度场景识别方法,本识别方法在进行场景的识别时,首先汲取数值、文本、符号、时间序列,以及集合、树、图不同数据结构所组成的复合数据形式,乃至来自不同数据库、不同知识库的各种信息资源的组合,进行对多源异构数据的挖掘分析,并且使用双线性卷积神经网络模型对细粒度图像进行高层语义特征获取,通过迭代训练网络模型中的卷积参数,过滤图像中不相关的背景信息,接着对图像进行分类处理,最终使得图像处理的精度更高。

22、2、本发明提供了一种基于深度学习的多模态细粒度场景识别方法,图像进行处理前的图像数据传输中,通过对图像数据进行算数编码,使用比较短的代码取代图像数据中出现比较频繁的数据,而使用比较长的代码取代图像数据中使用频率比较低的数据,最终可实现对数据的压缩,并且算数编码属于可逆的无损无失真压缩,大大提高了图像数据传输的稳定性以及速度,并且在进行图像处理的过程中对处理好的图像进行识别判断,判断完成后将判断结果显示在显示器上,更加显现了图像处理后的特征,并且显示器可设置为多个,方便对处理后的图像进行多模块的分析,并且方便了图像处理器判断结果的显示。



技术特征:

1.一种基于深度学习的多模态细粒度场景识别方法,其特征在于,具体包括以下步骤:

2.根据权利要求1所述的一种基于深度学习的多模态细粒度场景识别方法,其特征在于:所述s1.图像接收处理中,在进行压缩处理时,首先将输入的图像数据进行映射变换,接着对其进行量化编码,并且量化编码的过程中,首先利用比较短的代码取代图像数据中出现比较频繁的数据,并且利用比较长的代码取代图像数据中使用频率比较低的数据,最后压缩完成。

3.根据权利要求1所述的一种基于深度学习的多模态细粒度场景识别方法,其特征在于:所述s2.图像多模态学习中,具体包括多源数据分类、多模态情感分析、多模态语义计算、跨模态样本匹配、跨模态检索、跨模态样本生成以及多模态信息融合。

4.根据权利要求1所述的一种基于深度学习的多模态细粒度场景识别方法,其特征在于:所述s3.细粒度图像分类中,双线性卷积神经网络模型中双线性模型m由一个四元组组成:m=(fa;fb;p;c),其中fa;fb代表特征提取函数。

5.根据权利要求4所述的一种基于深度学习的多模态细粒度场景识别方法,其特征在于:所述特征提取函数卷积网络a和卷积网络b,p是一个池化函数,c是分类函数,在进行分类的过程中通过网络a和网络b互补处理,其中网络a对图像中的物体进行定位,网络b完成对网络a定位到的物体位置进行特征提取,最后完成细粒度图像识别任务。


技术总结
本发明提供一种基于深度学习的多模态细粒度场景识别方法,涉及场景识别方法技术领域。该基于深度学习的多模态细粒度场景识别方法,包括S1.图像接收处理,S2.图像多模态学习,S3.细粒度图像分类,S4.分类图像识别,S5.场景结果输出。通过在进行场景的识别时,首先汲取数值、文本、符号、时间序列,以及集合、树、图不同数据结构所组成的复合数据形式,进行对多源异构数据的挖掘分析,并且使用双线性卷积神经网络模型对细粒度图像进行高层语义特征获取,通过迭代训练网络模型中的卷积参数,过滤图像中不相关的背景信息,接着对图像进行分类处理,最终使得图像处理的精度更高。

技术研发人员:杨杰
受保护的技术使用者:重庆工贸职业技术学院
技术研发日:
技术公布日:2024/1/16
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1