一种基于改进自训练算法的半监督高斯过程回归软测量建模对脱丁烷塔底丁烷浓度进行预测的方法
成果类型:: 发明专利
发布时间: 2022-02-17 20:23:35
本发明公开了一种基于改进自训练算法的半监督高斯过程回归软测量建模对脱丁烷塔底丁烷浓度进行预测的方法。用于带有缺失主导变量的训练数据集的化工过程软测量建模。该方法采用自训练算法估计缺失的主导变量样本,并根据得到的估计样本对原有训练数据的影响,筛选出泛化能力强的样本加入到原始样本集中,从而构成新的训练样本集进行建模。该方法一方面实现估计样本的有效筛选,提高半监督模型精度;另一方面筛选准则简单,不需要划分完整数据集,且不受模型结构的限制。该方法可以提高产品质量,降低生产成本。
针对实际工业过程中主导变量的获取频率远远低于辅助变量,导致训练样本集中仅有一部分样本是有标签的,直接采用这样的数据集进行建模会导致模型预测性能不高。
采用自训练算法估计缺失的主导变量样本,并根据得到的估计样本对原有训练数据的影响,筛选出泛化能力强的样本加入到原始样本集中,从而构成新的训练样本集进行建模。
本发明的目的是通过以下技术方案实现的:
基于改进自训练算法的半监督GPR软测量建模,所述方法包括以下过程:针对半监督数据集,用自训练算法估计缺失主导变量值,并采用一种变量筛选方法,挑选出泛化能力强的样本重构训练样本集。
最终根据重构后的训练样本集,新到来的查询样本进行预测。
目前,化工过程的复杂性正在日益增加,对产品质量的要求也在不断提高,现代工业往往需要装备一些先进的监控系统。然而由于某些关键质量变量的传感器价格昂贵、可靠性差或者具有很大的测量滞后性等缺点,导致一些重要的过程变量不能实时有效地测量。
为了解决这些问题,软测量技术在工业过程领域受到了越来越广泛的关注。在过去的十几年,基于数据驱动的软测量建模技术得到了广泛研究,用于提高产品的质量,降低对环境的影响。一些常用的线性回归的方法如主元回归(principal componentregression,PCR)、偏最小二乘(partial least squares,PLS)、等能够很好地处理输入变量和输出变量之间的线性关系。然而,输入和输出之间常常呈现非线性的关系,线性建模方法不再适用,非线性建模方法如人工神经网络(artificial neural networks,ANN)、支持向量机(support vector machine,SVM)、最小二乘支持向量机(least squares supportvector machine,LS-SVM)可以得到良好的预测精度。
虽然这些方法能够获得很好的全局泛化性能,但是工业过程常常呈现多阶段、时变的动态特性,预测效果往往不能得到保证。高斯过程回归(Gaussian processregression,GPR)能够作为一种非参数概率模型,不仅可以给出预测值,还可以得到预测值对模型的信任值。因此,选择GPR建立软测量模型。
当前权利人:江南大学 发明(设计)人:熊伟丽 ;史旭东;江南大学是教育部直属、国家“211工程”重点建设高校和“双一流”建设高校。学校具有悠久的办学历史、厚重的文化积淀,源起1902年创建的三江师范学堂,历经国立中央大学、南京大学等发展时期;1958年南京工学院食品工业系整建制东迁无锡独立建校,成立无锡轻工业学院;1962年无锡纺织工学院并入无锡轻工业学院;1995年更名为无锡轻工大学;2001年无锡轻工大学、江南学院、无锡教育学院合并组建江南大学;2003年东华大学无锡校区并入江南大学。
针对实际工业过程中主导变量的获取频率远远低于辅助变量,导致训练样本集中仅有一部分样本是有标签的,更多的是只有输入变量而缺失输出变量的无标签样本。自训练方法运算简单,可操作性强,且易于同软测量模型结合,本发明采用自训练估计缺失的主导变量值。
传统的自训练算法仅实现缺失主导变量样本的估计,却无法辨别估计值的好坏。由于自训练模型根据相似度估计缺失主导变量,以及GPR方法的非线性和非参数特征,二者简单结合容易发生模型过拟合的现象,因此本发明建立一种筛选估计样本的准则,剔除信息冗余的样本,将泛化能力强的样本加入到完整数据集中,实现训练样本的重构以提高模型预测精度。
科技成果只有通过实施开发应用,使其转化为生产力,才能取得经济效益和社会效益。成果方目标是将科技成果转化为现实生产力,期待有意愿的企业或合作单位进行合作推广或者进行产品生产。考虑合作转化、许可+合作等转化方式与企业、科学技术研究开发机构和其他组织建立合作关系。