您所在的位置: 成果库 一种基于协方差矩阵的主动学习方法

一种基于协方差矩阵的主动学习方法

成果类型:: 实用新型专利

发布时间: 2022-07-01 10:44:38

科技成果产业化落地方案
方案提交机构:江苏无锡市| 朱建萍 | 2022-10-25 17:06:46

本发明公开了一种基于协方差矩阵的主动学习方法,其特征在于:包括,采集脱丁烷塔生产过程的丁烷浓度值,并将丁烷浓度值作软测量建模样本;将软测量建模样分为训练集和测试集,其训练集划分为有标签样本集和无标签样本集;利用有标签样本集建立高斯过程回归模型,并确定模型初参数;根据无标签样本集,选出构成协方差矩阵行列式值最大的样本;重新建立高斯过程回归模型,确定模型参数;利用测试集对丁烷浓度进行预测本发明通过数值仿真分析和脱丁烷塔过程的应用仿真,验证了基于协方差矩阵选择策略的有效性。

作为本发明所述基于协方差矩阵的主动学习方法的一种优选方案,其中:挑选m个无标签样本的步骤如下:

从N个无标签样本选取前m个样本,根据公式(1),通过有标签样本集建立的GPR模型确定的模型参数,并计算这m个无标签样本的协方差矩阵行列式值;

剩余的无标签样本依次替代m个无标签样本中的第1个样本,替换次数为剩余无标签样本个数,计算替换后的协方差矩阵行列式值;

设第a个样本替换第1个样本后,协方差矩阵行列式值最大,则以第a个样本替换第1个无标签样本,其无标签样本集则除去第a个样本;

按上述流程依次替换直至使行列式值最大的样本z替换第m个样本,完成m个样本的全部替换;

对m个无标签样本集进行人工标记,标记后加入有标签样本集更新高斯过程回归模型。

传统机器学习方法必须依赖大量信息完整的样本来构建模型,而在实际情况中,由于人工或环境条件限制,很难获得完整的样本信息,大部分的样本信息是缺失的;在这种情况下,如何利用少部分有标签样本和大量无标签样本来提升模型性能,成为机器学习研究的关键问题;若仅采用少量的标记样本训练模型,模型的预测精度和泛化能力很难达到理想效果;此外,忽略大量的无标签样本是对数据资源的浪费;因此,需对无标签样本进行标记,常用的算法有半监督学习和主动学习;半监督学习旨在利用有标签样本输入输出建模的基础上提取无标签样本中的有用信息,来达到提升回归精度的目的;然而传统的半监督学习方法虽然提升了模型性能,但可能会带来计算量的增加而且模型精度的提升效果很大程度上取决于半监督模型的结构。

区别于传统半监督学习方法仅利用未标记样本来提升模型性能,主动学习借助专家知识,引入“人机协同”概念;将标记后的样本加入有标记样本集中进行监督学习;主动学习方法以最小的标记代价获得模型提升效果最大化,同时挑选出质量较高的无标签样本。

江南大学是教育部直属、国家“211工程”重点建设高校和“双一流”建设高校。学校具有悠久的办学历史、厚重的文化积淀,源起1902年创建的三江师范学堂,历经国立中央大学、南京大学等发展时期;1958年南京工学院食品工业系整建制东迁无锡独立建校,成立无锡轻工业学院;1962年无锡纺织工学院并入无锡轻工业学院;1995年更名为无锡轻工大学;2001年无锡轻工大学、江南学院、无锡教育学院合并组建江南大学;2003年东华大学无锡校区并入江南大学。

本发明通过数值仿真分析和脱丁烷塔过程的应用仿真,验证了基于协方差矩阵选择策略的有效性;并与现有的基于方差的选择策略和随机选择策略进行对比,实验证明本发明选择策略更具备优越性,即在相同的人工标记消耗下获得更高质量的无标签样本。

科技成果只有通过实施开发应用,使其转化为生产力,才能取得经济效益和社会效益。成果方目标是将科技成果转化为现实生产力,期待有意愿的企业或合作单位进行合作推广或者进行产品生产。考虑合作转化、许可+合作等转化方式与企业、科学技术研究开发机构和其他组织建立合作关系。