作为人工智能领域的热门研究问题,深度强化学习自提出以来,就受到人们越来越多的关注.目前,深度强化学习能够解决很多以前难以解决的问题,比如直接从原始像素中学习如何玩视频游戏和针对机器人问题学习控制策略,深度强化学习通过不断优化控制策略,建立一个对视觉世界有更高层次理解的自治系统.其中,基于值函数和策略梯度的深度强化学习是核心的基础方法和研究重点.该文对这两类深度强化学习方法进行了系统的阐述和总结,包括用到的求解算法和网络结构.首先,本文概述了基于值函数的深度强化学习方法,包括开山鼻祖深度Q网络和基于深度Q网络的各种改进方法.然后介绍了策略梯度的概念和常见算法,并概述了深度确定性策略梯度、信赖域策略优化和异步优势行动者-评论家这三种基于策略梯度的深度强化学习方法及相应的一些改进方法.接着概述了深度强化学习前沿成果阿尔法狗和阿尔法元,并分析了后者和该文概述的两种深度强化学习方法的联系.最后对深度强化学习的未来研究方向进行了展望.
类型: 期刊论文
作者: 刘建伟,高峰,罗雄麟
关键词: 深度学习,强化学习,深度强化学习,值函数,策略梯度,机器学习
来源: 计算机学报 2019年06期
年度: 2019
分类: 信息科技
专业: 自动化技术
单位: 中国石油大学(北京)自动化系
基金: 国家自然科学基金(21676295),中国石油大学(北京)2018年度前瞻导向及培育项目(2462018QZDX02)资助~~
分类号: TP18
页码: 1406-1438
总页数: 33
文件大小: 1571K
下载量: 3909
本文来源: https://www.lunwen66.cn/article/7c2b7e03850c8b5ffcb05db6.html