成果介绍
本发明公开了一种基于卷积神经网络‑转换器混合架构的图像分类方法。该方法包括:利用预训练卷积神经网络提取图像的特征并生成指示目标位置轮廓的注意力掩码,该注意力掩码表征对应元素属于目标类别的概率;将所述注意力掩码作为先验信息指导转换器网络,以关注辨识性区域来确定图像类别,其中所述转换器网络是以设定的损失函数为优化目标经训练获得。本发明能自动发现目标辨识性的区域,并学习该区域的特征以供区分类别,从而提升了细粒度图像分类的准确性。
成果亮点
1.一种基于卷积神经网络-转换器混合架构的图像分类方法,包括以下步骤:
利用预训练卷积神经网络提取图像的特征并生成指示目标位置轮廓的注意力掩码,该注意力掩码表征对应元素属于目标类别的概率;
将所述注意力掩码作为先验信息指导转换器网络,以关注辨识性区域来确定图像类别,其中所述转换器网络是以设定的损失函数为优化目标经训练获得。
2.根据权利要求1所述的方法,其特征在于,所述注意力掩码采用以下公式获得:
其中,Mi表示第i个通道的特征图,Norm表示规范化操作。
3.根据权利要求1所述的方法,其特征在于,对于所述转换器网络,其包含多层编码器,首先输入的图像张量将被分块并投影为固定大小的一维特征向量,并额外添加一个用于分类的可学习向量和一个用于位置编码的可学习向量,最后输入编码器的张量表示为:
z0=[x0;x1,x2,...,xN]+xpos
其中,x0、xpos分别表示添加的分类向量和位置编码,均被初始化为高斯分布的向量并设置为可学习的;x1至xN表示各个小块对应的一维特征向量。
团队介绍
中国科学院深圳先进技术研究院提升了粤港地区及我国先进制造业和现代服务业的自主创新能力,推动我国自主知识产权新工业的建立,成为国际一流的工业研究院。 深圳先进院目前已初步构建了以科研为主的集科研、教育、产业、资本为一体的微型协同创新生AC态系统,由九个研究平台,国科大深圳先进技术学院,多个特色产业育成基地、多支产业发展基金、多个具有独立法人资质的新型专业科研机构等组成。开展先进技术研究,促进科技发展。信息、电子、通讯技术研究新材料、新能源技术研究高性能计算、自动化、精密机械研究生物医学与医疗仪器研究相关学历教育、博士后培养与学术交流。
成果资料