成果介绍
本发明公开了一种基于词嵌入与自编码器融合的生物序列特征提取方法。该方法包括:构建表示模型和压缩模型,表示模型包含词嵌入网络,压缩模型是自编码器模型,包括编码器和解码器;以设定的总损失函数最小化为优化目标,联合训练表示模型和压缩模型,其中词嵌入网络以短序列Kmer集合作为输入,并通过遮挡部分短序列Kmer,对序列中的Kmer进行上下文关联,学习序列中每个Kmer的嵌入向量,获得组成序列的Kmer对应的嵌入信息;压缩模型的编码器将该嵌入信息转化为低维特征向量,并通过解码器解码重构序列的Kmer嵌入,输出重构向量;利用该重构向量对序列中被遮挡的Kmer进行分类。本发明实现生物序列的高效表征,保证了后续分类的准确性。
成果亮点
1.一种基于词嵌入与自编码器融合的生物序列特征提取方法,包括以下步骤:
构建表示模型和压缩模型,其中表示模型包含词嵌入网络,压缩模型是自编码器模型,包括编码器和解码器;
以设定的总损失函数最小化为优化目标,联合训练所述表示模型和所述压缩模型,其中词嵌入网络以短序列Kmer集合作为输入,并通过遮挡部分短序列Kmer,对序列中的Kmer进行上下文关联,学习序列中每个Kmer的嵌入向量,获得组成序列的Kmer对应的嵌入信息;所述压缩模型的编码器将该嵌入信息转化为低维特征向量,并通过解码器解码重构序列的Kmer嵌入,输出重构向量;利用该重构向量对序列中被遮挡的Kmer进行分类。
2.根据权利要求1所述的方法,其特征在于,所述总损失函数表示为:
L=αLc+βLr
其中,Lc为分类损失项,Lr为重构损失项,α和β是对应项的权重系数。
3.根据权利要求2所述的方法,其特征在于,所述分类损失项表示为:
其中,将短序列Kmer视作单词,N表示被遮挡的单词总数,V表示词典集合,|V|表示词典的数量,pi(m=mj|θ)表示预测的单词m为词典中的第j个单词mj的概率,θ是需训练的参数。
团队介绍
中国科学院深圳先进技术研究院提升了粤港地区及我国先进制造业和现代服务业的自主创新能力,推动我国自主知识产权新工业的建立,成为国际一流的工业研究院。 深圳先进院目前已初步构建了以科研为主的集科研、教育、产业、资本为一体的微型协同创新生AC态系统,由九个研究平台,国科大深圳先进技术学院,多个特色产业育成基地、多支产业发展基金、多个具有独立法人资质的新型专业科研机构等组成。开展先进技术研究,促进科技发展。信息、电子、通讯技术研究新材料、新能源技术研究高性能计算、自动化、精密机械研究生物医学与医疗仪器研究相关学历教育、博士后培养与学术交流。
成果资料