您所在的位置: 成果库 一种基于改进YOLO模型的多模态行人检测方法

一种基于改进YOLO模型的多模态行人检测方法

成果类型:: 实用新型专利

发布时间: 2022-06-30 15:09:05

科技成果产业化落地方案
方案提交机构:江苏无锡市| 朱建萍 | 2022-10-31 10:37:54

本发明涉及一种基于改进YOLO模型的多模态行人检测方法,属于深度学习目标检测领域。该基于改进YOLO模型的多模态行人检测算法,使用KAIST数据集中一一对应的可见光图片和红外光图片样本进行训练,得到训练好的模型,通过训练好的模型检测可见光 红外光图片对中是否包含行人目标,该基于YOLO网络的多模态行人检测算法使用并行Darknet53作为特征提取网络,分别提取可见光模态和红外光模态的多尺度特征图,而且使用了加权特征融合层和CBAM注意力机制,使可见光特征和红外光特征图片更好的融合,再将多尺度注意力加权融合特征图依次级联并送入YOLO层中进行行人检测。

1)获得模型检测和训练所需的多模态数据;

进一步的,所述的步骤1)中,对包含一一对应的可见光-红外光图片的视频数据每隔相同帧数采样一次,并按照1:1划分为训练集和测试集。为防止模型过拟合,训练时对图像对进行随机水平翻转。

2)使用两个并行的Darknet53作为特征提取网络,分别提取可见光和红外光图片的多尺度特征;

3)对步骤2)中提取到的可见光特征和红外光特征进行模态加权融合,获得加权后的多模态融合特征图;

进一步的,所述的步骤3)中,先使用1×1的卷积核对可见光特征Vi和红外光特征Ii进行维度压缩,再将其分别送入一个两层的神经网络中,第一层的参数为Vi和Ii的通道数除以16,第二层的参数为Vi和Ii的通道数,以ReLU作为激活函数。分别获得特征描述符,将特征描述符作为各模态的权重,各模态特征图乘以权重后级联,作为加权融合特征图;每个尺度的加权融合特征图为。

Mi=fcat(fnin(Vi)×Av/(Am),fnin(Ii)×(Ai/(Am))) (2)

4)对步骤3)中获得的多模态融合特征图引入包含通道注意力模块和空间注意力模块的CBAM注意力机制;

进一步的,所述的步骤4)中CBAM注意力机制是对加权融合特征图进行通道注意力加强和空间注意力加强,通道注意力机制获得了特征图的通道注意力权重,与加权融合特征图Mi相乘得到新特征。空间注意力机制利用不同空间位置之间的关系学习空间权重图,并将其与对应空间位置相乘得到新特征;CBAM层的输入为多尺度加权融合特征图{M1,M2,M3}。

近年来,行人检测在无人驾驶、视频监控等领域得到了广泛关注。行人检测技术也得到了快速发展。传统方法使用人工设计的梯度直方图、小波变换、聚合通道特征等特征提取器提取行人特征,并使用支持向量机、自适应提升等分类器判断区域内是否有目标。深度学习快速发展之后,深度网络模型在行人检测领域得到广泛应用,检测的精度也随之提高,但单模态图片在进行行人检测时在夜晚光照不足条件下检测效果不好,为应对此问题,可见光与红外光融合的行人检测算法受到人们的重视,但是现有的融合方法过于简单,导致模型识别精度不够高。

江南大学是教育部直属、国家“211工程”重点建设高校和“双一流”建设高校。学校具有悠久的办学历史、厚重的文化积淀,源起1902年创建的三江师范学堂,历经国立中央大学、南京大学等发展时期;1958年南京工学院食品工业系整建制东迁无锡独立建校,成立无锡轻工业学院;1962年无锡纺织工学院并入无锡轻工业学院;1995年更名为无锡轻工大学;2001年无锡轻工大学、江南学院、无锡教育学院合并组建江南大学;2003年东华大学无锡校区并入江南大学。

本发明基于YOLO神经网络,针对可见光单模态行人检测效果不好的问题,在对可见光与红外光图片进行融合后进行目标检测,可以有效提高夜间光照不足环境下行人目标的检测效果。针对目前常用的级联融合方式,本发明提出的结合注意力机制的模态加权特征融合能对可见光图片和红外光图片进行更好的特征融合,提高多模态行人检测的准确率。

科技成果只有通过实施开发应用,使其转化为生产力,才能取得经济效益和社会效益。成果方目标是将科技成果转化为现实生产力,期待有意愿的企业或合作单位进行合作推广或者进行产品生产。考虑合作转化、许可+合作等转化方式与企业、科学技术研究开发机构和其他组织建立合作关系。