语义分割方法、装置、电子设备及存储介质
成果类型:: 发明专利
发布时间: 2023-09-05 16:01:02
到2050年,世界盲人数量预计会达到7.03亿。“为盲人导盲”一直是一个热点研究问题,尤其是针对盲人生活场景中占用较多的室内场景。可以理解,室内场景往往包含较多物体,例如,物体可以是家电、家具等,该些物体在室内场景中不仅容易相互遮挡,而且容易出现纹理相近的现象,这都会影响语义分割的精度,从而增加为盲人导盲的难度。
目前,为了提高语义分割的精度,语义分割的对象主要有RGB图像和RGBD图像,但是采集RGB图像和RGBD图像对图像采集设备所造成的芯片功耗是十分巨大的,并利于降低语义分割的成本;若是基于深度图进行语义分割,在芯片功耗方面具有比较明显的优势,但是深度图的图像质量要低于RGB图像、RGBD图像,这会影响语义分割的精度。
由上可知,如何平衡语义分割的精度和功耗仍有待解决。
在上述技术方案中,基于目标场景下的深度图像,调用预训练模型进行模态转换得到自然图像,将该自然图像和深度图像进行模态融合,并针对模态融合后的图像进行语义分割得到语义分割结果,由此可见,语义分割的对象不再是RGB图像或RGBD图像等自然图像而是深度图像,以此来降低图像采集对图像采集设备所造成的巨大的芯片功耗,同时,利用经过训练、且具有在深度图像和自然图像之间进行模态转换的预训练模型来对深度图像进行模态转换,以利用模态转换得到的自然图像对深度图像进行额外图像信息的补充,使得语义分割能够获取足够丰富且有效的信息量,进而有利于提高语义分割的精度,从而能够有效地解决相关技术中存在的语义分割难以平衡精度和功耗的问题。
技术合作
本申请实施例中提供了一种计算机程序产品,计算机程序产品包括计算机可读指令,计算机可读指令存储在存储介质中,电子设备的一个或多个处理器从存储介质读取计算机可读指令,加载并执行该计算机可读指令,使得电子设备实现如上所述的基于深度图的语义分割方法。
与相关技术相比,一方面,引入预训练模型对深度图像预处理,以生成自然图像,便于为模态融合提供额外图像信息;另一方面,基于深度图像实现的语义分割,不仅解决了现阶段因RGB/RGBD图像采集芯片功耗高而阻碍导盲设备续航设计的难题,而且能够有效地提升语义分割的精准度,从而为盲人导盲提供丰富资料,有效地改善盲人生活质量。
应该理解的是,虽然附图的流程图中的各个步骤按照箭头的指示依次显示,但是这些步骤并不是必然按照箭头指示的顺序依次执行。除非本文中有明确的说明,这些步骤的执行并没有严格的顺序限制,其可以以其他的顺序执行。而且,附图的流程图中的至少一部分步骤可以包括多个子步骤或者多个阶段,这些子步骤或者阶段并不必然是在同一时刻执行完成,而是可以在不同的时刻执行,其执行顺序也不必然是依次进行,而是可以与其他步骤或者其他步骤的子步骤或者阶段的至少一部分轮流或者交替地执行。
以上所述仅是本申请的部分实施方式,应当指出,对于本技术领域的普通技术人员来说,在不脱离本申请原理的前提下,还可以做出若干改进和润饰,这些改进和润饰也应视为本申请的保护范围。