基于Transformer轻量化模型的图像分类方法
成果类型:: 发明专利
发布时间: 2026-05-18 10:22:04
本发明公开了一种基于Transformer轻量化模型的图像分类方法,属于深度学习图像分类的领域,包括以下步骤:S1:对ShuffleNetV2的基本模块和下采样模块进行改进,ShB模块是在基本模块中加入了跳跃连接和ECA,将下采样模块与多特征提取、ECA和Ghost模块相结合提出ShD模块;S2:根据ViT模块提出一种局部和全局信息交互的ShT模块;S3:将ShD与ShB和ShT模块进行有效设计堆叠,构建ShViT网络;S4:ShViT网络在分类数据集上进行训练及测试,得到分类结果。本发明搭建了参数量低、所需内存资源低的轻量化网络模型ShViT,能够在参数量减少的情况下实现较好的分类性能。
该方法的创新在于“稀疏化自注意力”与“卷积位置编码”的协同设计。一方面,在深层网络中引入可学习的稀疏掩码,限制每个Token仅与语义相关性最强的K个Token交互,将标准全局注意力的平方复杂度降为线性。另一方面,使用深度可分离卷积来提取局部结构信息,并将其作为Transformer模块的位置编码,相比传统绝对位置编码具有更好的平移等变性与分辨率外推能力。整个模型层数精简,适合部署在AI端侧。
该方法可广泛应用于移动端设备上的图像识别应用,如手机相册自动分类、离线植物识别、工业质检中嵌入式相机等。特别适用于需要实时推理且无法稳定联网的边缘计算场景,例如基于无人机或机器人的独立视觉导航系统。随着物联网设备对AI能力需求的爆发式增长,低功耗、低延迟的轻量化分类模型将成为赋能各类硬件终端的核心技术引擎。
燕山大学坐落于河北省秦皇岛市,是一所以工学为主,文学、理学、经济学、管理学、法学、艺术学、教育学等多学科协调发展的全国重点大学。学校源于哈尔滨工业大学,始建于1920年,1960年独立办学定名为东北重型机械学院,1997年整体南迁至秦皇岛并更名为燕山大学。学校是河北省人民政府、教育部、工业和信息化部、国家国防科技工业局四方共建高校,拥有雄厚的师资力量和科研实力,特别是在机械工程、材料科学与工程等学科领域享有盛誉,为国家培养了大批高素质人才。
本成果带来的效益显著。使用效益上,使图像分类模型能够在嵌入式设备上以毫秒级速度运行,摆脱对云计算的依赖,保护用户隐私数据安全。经济效益上,大幅降低了对昂贵GPU服务器的采购和运维成本,使得即使算力较低的智能摄像头、门禁系统也能搭载高性能分类功能。技术推广上,提供了一种通用的轻量化架构方案,易于复制到目标检测、分割等下游任务,加速计算机视觉技术在各行业的普惠落地。产业层面,推动了Transformer架构在资源受限场景下的实用化进程。
技术转让,许可,合作所需资金需双方协商,此项技术想尽快落地,希望具备此项技术研发的技术方,能够尽快承接此项目。