您所在的位置: 成果库 标记分布学习范式

标记分布学习范式

发布时间: 2025-05-14

基本信息

合作方式: 技术许可
成果类型: 发明专利
行业领域:
电子信息技术
成果介绍
传统机器学习主要面向“单标记”样本,一个标记(label)通常对应一个概念类别。然而,现实任务中常会遇到“多标记”样本,即一个样本同时与多个类别相关。对于这类多义性数据,既有机器学习技术表现出标记强度不精确、示例表示不丰富、监督信息不充分等瓶颈问题。近年来,耿新教授团队针对上述 问题开展了系统深入的研究,在理论、方法和应用层面均取得了相应成果,并逐渐凝练形成了一种称为“标记分布学习(Label Distribution Learning,简 记为LDL)”的新型学习范式(learning paradigm),为多义性机器学习闯出 了一条新路。作为第二完成人、以LDL为核心科学发现点之一的项目“面向多义性对象的新型机器学习理论与方法”2020年获国家自然科学奖二等奖。
成果亮点
针对标记强度不精确问题,提出了“多义性标记分布”机制,用一种称为“标记分布”的数据结构取代原始类别标记来对示例的类别信息进行描述,从理论上证明了由此产生的新问题的可学习性,并提出了多种有效的学习算法;针对示例表示不丰富问题,提出了“多义性示例表示”机制,打破既有研究中用简单特征向量来表示示例的通常做法,提出了既能够有效提取示例空间特征、又能够适配多义性数据复杂类别信息的结构化示例表示方法。
团队介绍
研究团队针对监督信息不充分问题,提出了“多义性标记增强”机制,对大量应用中现存的、用简单逻辑标记标注的多义性数据,通过数据分析为每个示例自动生成标记分布,从而使得在逻辑标记数据上应用基于标记分布的学习算法成为可能。上述三个机制分别对应多义性机器学习问题的三大要素,即标记(类别)、示例(样本)以及两者之间的监督关系,它们共同构成了一种新型机器学习范式,被命名为“标记分布学习(LDL)”。相比既有机器学习范式,LDL范式形成了独具特色的学习理论与方法。
成果资料