适应度空间的粗糙度评估方法、装置、电子设备及存储介质
成果类型:: 发明专利
发布时间: 2023-09-14 17:13:24
在生物学研究中,越来越多的数据被应用于研究生物的复杂性和多样性。生物序列是其中的一个重要部分,包括DNA序列、蛋白质序列、RNA序列等。这些生物序列描述了生物体内的基因、蛋白质等分子在空间和时间上的变化,对于了解生命的本质和生物系统的功能和演化具有重要意义。
生物序列适应度空间是用于描述生物序列在不同环境下适应性。适应度空间的粗糙度评估是对适应性进行量化,以便更好地理解生物序列在适应环境中的行为。然而,由于生物序列适应度空间的复杂性和数据的不确定性,粗糙度评估评估往往会出现误差。
其中,数据集不完整或者存在误差会导致适应度空间的表示不准确,导致粗糙度评估结果出现误差。举例来说,数据集中缺失关键的生物序列会导致适应度空间的粗糙度评估结果产生误差,在生物序列较长时,其数量是一个天文数字,因此,得到的适应度空间相比完整空间将会存在大量生物序列缺失,由于适应度空间存在缺失,相比无缺失的原始适应度空间,本身已经损失了大量生物序列涵盖的信息,也就是说,粗糙度评估结果的系统误差无法被消灭,只能适当减小。
由上可知,适应度空间的粗糙度评估结果的误差大成为了亟需解决的问题。
通过确定数据集中的邻接序列对,基于各邻接序列对得到粗糙度评估结果,避免出现数据集中非邻接序列在生物序列缺失时,对编辑距离产生的异常光滑效应;邻接序列在生物序列缺失前后,都能保持一个近似的粗糙度,通过邻接序列得到的粗糙度评估结果,能够尽可能避免粗糙度评估结果不受生物序列缺失的影响,保证粗糙度评估结果的精确性,从而能够有效地解决相关技术中存在的生物序列适应度空间的粗糙度评估结果误差大的问题。
技术合作
与相关技术相比,第一,对于不同数量大小的数据集,利用不同的方式计算邻接序列对,可以减少计算量,加快计算速度,从而保证粗糙度评估的效率;第二,本方法的扩展性好,可以适用于各种生物序列适应度空间的粗糙度评估,例如,DNA序列、RNA序列、蛋白质序列;第三,通过邻接序列得到的粗糙度评估结果,能够尽可能避免粗糙度评估结果不受生物序列缺失的影响,保证粗糙度评估结果的精确性,从而能够有效地解决相关技术中存在的生物序列适应度空间的粗糙度评估结果误差大的问题。
应该理解的是,虽然附图的流程图中的各个步骤按照箭头的指示依次显示,但是这些步骤并不是必然按照箭头指示的顺序依次执行。除非本文中有明确的说明,这些步骤的执行并没有严格的顺序限制,其可以以其他的顺序执行。而且,附图的流程图中的至少一部分步骤可以包括多个子步骤或者多个阶段,这些子步骤或者阶段并不必然是在同一时刻执行完成,而是可以在不同的时刻执行,其执行顺序也不必然是依次进行,而是可以与其他步骤或者其他步骤的子步骤或者阶段的至少一部分轮流或者交替地执行。
以上所述仅是本申请的部分实施方式,应当指出,对于本技术领域的普通技术人员来说,在不脱离本申请原理的前提下,还可以做出若干改进和润饰,这些改进和润饰也应视为本申请的保护范围。