本申请提供一种基于音素信息的声纹识别方法及电子设备,该方法包括:对待识别音频进行端点检测,得到有效语音片段;有效语音片段通过预训练的自动语音识别模型,实现音素标定及确定有效语音片段中的音素级别语音片段;根据音素标定结果,判断有效语音片段中标出的所有音素是否满足音素覆盖率条件,若满足音素覆盖率条件,则采用音素级别声纹识别;若不满足音素覆盖率条件,则采用句子级别声纹识别。该方案采用融合句子级别和音素级别的说话人嵌入的声纹识别,可以提高声纹识别系统在复杂实际环境中准确率和可靠性。
1.一种基于音素信息的声纹识别方法,其特征在于,所述方法包括:
对待识别音频进行端点检测,得到有效语音片段;
所述有效语音片段通过预训练的自动语音识别模型,实现音素标定及确定所述有效语音片段中的音素级别语音片段;
根据音素标定结果,判断有效语音片段中标出的所有音素是否满足音素覆盖率条件,若满足所述音素覆盖率条件,则采用音素级别声纹识别;若不满足所述音素覆盖率条件,则采用句子级别声纹识别。
2.根据权利要求1所述的方法,其特征在于,所述有效语音片段通过预训练的自动语音识别模型,实现音素标定及确定所述有效语音片段中的音素级别语音片段,包括:
采用预训练的自动语音识别模型确定所述有效语音片段中每个语音帧关于不同音素标签的后验概率;
根据每个语音帧的最大后验概率,切分得到单个音素的有效语音段;
滤除所述有效语音段中静音标记的语音段及片段总帧数小于长度阈值的音素段,得到音素级别语音片段。
3.根据权利要求2所述的方法,其特征在于,所述根据每个语音帧的最大后验概率,切分得到单个音素的有效语音段,
声纹识别包括了声纹辨认和声纹确认等任务,按是否依赖固定语音语义信息,可分为文本相关与文本无关。声纹辨认指,识别未知身份信息的说话人的语音,通过提取声纹特征,与声纹数据库中注册录入的声纹信息比对得到身份信息,是“一对多”的任务。声纹确认指,已知身份信息的说话人的检测语音,与数据库中对应说话人保存的信息比对,判断声明的身份是否为真,是“一对一”的任务。
中国科学院深圳先进技术研究院提升了粤港地区及我国先进制造业和现代服务业的自主创新能力,推动我国自主知识产权新工业的建立,成为国际一流的工业研究院。 深圳先进院目前已初步构建了以科研为主的集科研、教育、产业、资本为一体的微型协同创新生态系统,由九个研究平台,国科大深圳先进技术学院,多个特色产业育成基地、多支产业发展基金、多个具有独立法人资质的新型专业科研机构等组成。开展先进技术研究,促进科技发展。信息、电子、通讯技术研究新材料、新能源技术研究高性能计算、自动化、精密机械研究生物医学与医疗仪器研究相关学历教育、博士后培养与学术交流。
本申请提供一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,处理器执行程序时实现如第一方面的基于音素信息的声纹识别方法。
由以上本说明书实施例提供的技术方案可见,该方案:采用融合句子级别和音素级别的说话人嵌入的声纹识别,可以提高声纹识别系统在复杂实际环境中准确率和可靠性。
技术合作
需要说明的是,术语“包括”、“包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、方法、商品或者设备不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、方法、商品或者设备所固有的要素。在没有更多限制的情况下,由语句“包括一个……”限定的要素,并不排除在包括要素的过程、方法、商品或者设备中还存在另外的相同要素。
本说明书中的各个实施例均采用递进的方式描述,各个实施例之间相同相似的部分互相参见即可,每个实施例重点说明的都是与其他实施例的不同之处。尤其,对于系统实施例而言,由于其基本相似于方法实施例,所以描述的比较简单,相关之处参见方法实施例的部分说明即可。