用于实现导航的可迁移的元学习的无监督DQN强化学习
发布时间: 2022-05-12
基本信息
本发明公开了一种用于实现导航的可迁移的元学习的无监督DQN强化学习方法,所述方法的ULTRA框架包括三个部分,无监督的对抗性任务生成、共享层次结构策略和元强化学习;所述的无监督的对抗性任务生成的基于任务的对抗性训练过程包含任务生成器和元学习器;任务生成器自动生成多组任务,而没有来自环境的任何监督信号,元学习者将尝试完成这些任务;所述的共享层次结构策略,元学习器的体系结构是共享层次结构策略,其中包含一个主策略和一组子策略;在每个主时间脉络中,主策略首先根据算法随机进行选择要激活的子策略,然后所选的子策略执行主操作。所述的元强化学习,是使用强化学习的算法对整个任务中所有主策略下分配的子策略的参数进行优化。
Copyright © 2022 中国科学技术协会 版权所有 | 京ICP备16016202号-20