您所在的位置: 成果库 一种多特征双向门控领域专家实体抽取方法及系统

一种多特征双向门控领域专家实体抽取方法及系统

成果类型:: 发明专利

发布时间: 2023-10-19 11:05:34

科技成果产业化落地方案
方案提交机构:成果发布人| 涂媛 | 2023-10-19 11:05:34

本发明公开了一种多特征双向门控领域专家实体抽取方法及系统。该方法首先通过构建领域专家语料库以训练实体抽取模型;接着,使用BERT方法进行字嵌入表示,对语料库专业领域词汇构造要素进行特征分析并提取边界特征;然后,利用双向门控神经网络和注意力机制有效获取特定词语长距离依赖关系;最后,结合条件随机场模型实现命名实体识别,将抽取后的信息建立高质量的实体信息索引项返还WEB应用系统。本发明方法可有效抽取领域专家信息实体,充分利用文本字嵌入特征、边界特征以及上下文特征以获得更好的NER性能,从而解决人工特征提取成本高和专业新词无法识别等问题。

发明目的:为解决领域专家信息抽取过程中人工特征提取成本高和专业新词无法识别等问题,本发明提供一种多特征双向门控领域专家实体抽取方法及系统,充分利用领域专业术语在文档中的特征,结合门控神经网络可以从上下文中自动找到更有用的单词以提取指定类型的关键性信息。

传统专家命名实体识别方法存在过度依赖人工特征标注和分词效果,以及专家简介中大量专业新词无法识别等问题。段大高、赵宁、韩忠明等人提出了一种基于规则模型的实体抽取与关系挖掘构建知识图谱的方法(中国专利ZL201710006826.2),通过将文本信息转换成词向量数学信息,然后进行向量相似度比较,并根据数字间的关系,来标注实体间的关系,但这种方法过度依赖人工标注的结果;张力文、程国艮等人提出了一种面向中文专利文本的实体抽取方法和系统(中国专利公开号CN 109101538A),该方法和系统依据词性规则模板,无需人工标注便可对专利文本中的实体自动进行提取,克服了现有技术严重依赖大规模标注语料的缺陷,节省了标注的人力成本,却依赖于现有规则的制订,对新词提取无法识别;牛志超、马语菡、南海涛等人提出了一种基于BERT算法模型的知识图谱构建系统(中国专利公开号CN 110866125A),通过使用BERT-bilstm-crf中文命名识别深度学习算法对归零文档段落中的数据进行实体提取,虽然模型使用神经网络之后保证了实体提取的快速性和精准性,但是对专业领域的关键词实体的识别率上还存在挑战。

此技术是淮阴工学院李翔研发,淮阴工学院,位于江苏省淮安市,宗旨和业务范围是“培养高等学历人才,促进社会发展。工学类、理学类、经济学类、管理学类、文学类、法学类、艺术学类和农学类学科本科学历教育工程硕士研究生学历教育相关科学研究技术开发继续教育专业培训学术交流与咨询服务会议展览服务”。

有益效果:本发明与现有技术相比,具有以下优点:

1、本发明基于网络爬虫挖掘数据集,利用第三方工具标记语料,通过统计方法提取边界特征和使用BERT语言模型抽取字特征,使用门控神经网络可以从上下文中自动找到更有用的单词以获得更好的NER性能,从而解决人工特征提取成本高和专业新词无法识别等问题;

2、本发明将自然语言处理与行业知识深度融合,深度挖掘包含领域特征文本,从而更好的对复杂文本进行处理。

技术转让,许可,合作所需资金需双方协商,此项技术想尽快落地保定,希望具备此项技术研发的技术方,能够尽快承接此项目。