您所在的位置: 成果库 基于注意力机制的多模态信息融合识别方法及系统

基于注意力机制的多模态信息融合识别方法及系统

成果类型:: 发明专利

发布时间: 2023-11-01 15:30:36

科技成果产业化落地方案
方案提交机构:天津市滨海新区| 宋学姮 | 2023-11-10 09:33:47
本发明涉及一种基于注意力机制的多模态信息融合识别方法及系统。该方法及系统首先对人体动作的RGB和depth视频帧序列进行压缩表示,生成整个视频的时空信息表示图;然后分别将RGB和depth的时空表示图输入双流深度卷积网络提取其高层语义特征;之后将这两种模态的特征输入注意力信息融合模块得到两个不同的多模态融合特征表示;最后将这两个多模态特征向量相加或拼接操作整合成一个特征向量,通过全连接层和softmax函数分类,得到待测视频中的所属动作类,能够有效地利用RGB和depth数据的互补信息,产生语义丰富的多模态特征表示,极大地提高人体动作识别的准确率和抗干扰能力。
一种基于注意力机制的多模态信息融合识别方法,其特征在于,包括以下步骤: 对人体动作的RGB和depth视频帧序列进行压缩表示,生成整个视频的时空信息表示图; 分别将RGB和depth的时空信息表示图输入双流深度卷积网络提取其高层语义特征; 将RGB和depth两种模态的高层语义特征进行注意力信息融合得到两个不同的多模态融合特征表示; 将两个多模态融合特征向量相加或拼接操作整合成一个特征向量,然后通过全连接层和softmax函数分类,得到待测视频中的所属动作类别。
  1. 情感分析: 在情感分析中,可以将图像、文本和音频等多模态信息融合,通过注意力机制选择最相关的特征,从而更准确地识别情感。

  2. 智能交互: 在智能交互中,可以通过融合视觉、语音和手势等多模态信息,实现更自然和智能的人机交互。

  3. 医学诊断: 在医学诊断中,可以将多模态的医学图像和临床数据进行融合,通过注意力机制提取最相关的特征,从而辅助医生进行准确的诊断。

  4. 智能驾驶: 在智能驾驶中,可以将来自摄像头、雷达和激光雷达等多模态传感器的信息进行融合,通过注意力机制选择最重要的信息,从而实现更安全和高效的自动驾驶系统。

中国科学院深圳先进技术研究院提升了粤港地区及我国先进制造业和现代服务业的自主创新能力,推动我国自主知识产权新工业的建立,成为国际一流的工业研究院。 深圳先进院目前已初步构建了以科研为主的集科研、教育、产业、资本为一体的微型协同创新生AC态系统,由九个研究平台,国科大深圳先进技术学院,多个特色产业育成基地、多支产业发展基金、多个具有独立法人资质的新型专业科研机构等组成。开展先进技术研究,促进科技发展。信息、电子、通讯技术研究新材料、新能源技术研究高性能计算、自动化、精密机械研究生物医学与医疗仪器研究相关学历教育、博士后培养与学术交流。
  1. 注意力机制: 注意力机制是一种模仿人类视觉系统的机制,它可以根据输入的信息重点关注其中最相关的部分。在多模态信息融合中,注意力机制可以用来自动学习和选择最相关的特征或模态。

  2. 多模态特征提取: 针对不同的模态,可以使用不同的特征提取方法,如卷积神经网络(CNN)用于图像、循环神经网络(RNN)用于文本等。通过提取每个模态的特征,可以得到多模态的表示。

  3. 注意力融合: 在多模态信息融合中,注意力机制可以用来动态地融合不同模态的信息。通过计算每个模态的权重或注意力分布,可以将不同模态的特征进行加权融合,从而得到更准确的表示。

  4. 分类器: 在融合后的多模态表示上,可以使用各种分类器进行识别任务,如支持向量机(SVM)、深度神经网络(DNN)等。

技术转让

基于注意力机制的多模态信息融合识别方法在各个领域都有重要的应用价值。通过融合多模态信息并重点关注最相关的信息,可以提高识别任务的准确性和效果,并且有助于实现更智能和自然的人机交互。