收藏 分销(赏)

深度强化学习.pptx

上传人:人****来 文档编号:14221794 上传时间:2026-07-20 格式:PPTX 页数:23 大小:3.36MB 下载积分:8 金币
下载 相关
深度强化学习.pptx_第1页
第1页 / 共23页
深度强化学习.pptx_第2页
第2页 / 共23页


点击查看更多>>
资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,DQN,简述,1/23,Background,Q-learning,学习过程可写成下面公式,:,2/23,Background,上面公式是,将旧,Q-learning,函数,Q,old,(s,t,a,t,),向着学习目标,(,当前取得,Reward,加上下一步可取得最大期望价值,),按一个较小学习速率学习,得到新,Q-learning,函数,Q,new,(s,t,a,t,),。,其中学习速率决定了我们使用新获取样本信息覆盖之前掌握信息比率,通常设为一个较小值,能够确保学习过程稳定,同时确保最终收敛性。,3/23,Background,Lorem ipsum dolor sit amet,consectetur adipisicing elit,sed do eiusmod tempor incididunt ut labore et dolore magna aliqua.,4/23,从,RL,看结合,Deep Learning,困难之处,深度学习成功依赖于大量有标签样本,从而进行有监督学习。而增强学习只有一个,reward,返回值,而且这个值还经常带有噪声,延迟,而且是稀少。尤其是延迟,经常是几千毫秒之后再返回。,深度学习样本都是独立,而,RL,中,state,状态却是相关,前后状态是有影响,这显而易见。,深度学习目标分布是固定。但增强学习,分布却是一直改变。,5/23,增强学习要结合深度学习存在三个问题:,没有标签怎么办?,样本相关性太高怎么办?,目标分布不固定怎么办?,6/23,处理之道,CNN+Q-Learning=Deep Q,Network:,经过,Q-Learning,使用,Q,value,来结构标签,经过,experience replay,方法来处理相关性及非静态分布问题,7/23,DQN算法,8/23,DQN,算法,记忆库,(,用于重复学习,),神经网络计算,Q,值,暂时冻结,q_target,参数,(,切断相关性,),9/23,为了使用,Tensorflow,来实现,DQN,比较推荐方式是搭建两个神经网络,target_net,用于预测,q_target,值,他不会及时更新参数,.,eval_net,用于预测,q_eval,这个神经网络拥有最新神经网络参数,.,不过这两个神经网络结构是完全一样,只是里面参数不一样,.,10/23,DQN,网络结构,11/23,DQN,网络结构,12/23,DQN,结构设置,在,DQN,中引入卷积层,13/23,DQN,结构设置,加入,Experience Replay.,因为深度学习需要大量样本,所以传统,Q-learning,online update,方法可能不太适合,DQN,。,Experience Replay,主要思想是存放,Agent,Experience(,即样本,),,而且每次训练时随机抽取一部分样本供给网络学习。,14/23,DQN,结构设置,使用两个,DQN,网络。,第二个,DQN,网络用来辅助训练,普通称其为,target DQN,它作用是辅助计算目标,Q,值,即提供学习目标公式里,max,a,Q(s,t+1,a),。这么做目标是防止让网络训练陷入目标,Q,值与预测,Q,值反馈循环中。,15/23,DQN,结构设置,Double DQN,网络中在主,DQN,上经过其最大,Q,值选择,Action,,再去获取这个,Action,在,target DQN,上,Q,值。这么主网络负责选择,Action,而这个被选定,Action,Q,值则由,target DQN,生成。,16/23,Dueling DQN,Dueling DQN,将,Q,值函数,Q(s,t,a,t,),拆成两部分,一部分是静态环境状态本身含有价值,V(s,t,),称为,Value;,另一部分是动态经过选择某个,Action,额外带来价值,A(a,t,),称为,Advantage,。而,Q,值由这两部分组合而成:,DQN,结构设置,17/23,DQN-environment,18/23,Dueling DQN,19/23,DQN,20/23,DQN,21/23,DQN,22/23,thanks,23/23,
展开阅读全文

开通  VIP会员、SVIP会员  优惠大
下载10份以上建议开通VIP会员
下载20份以上建议开通SVIP会员


开通VIP      成为共赢上传

当前位置:首页 > 包罗万象 > 大杂烩

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        抽奖活动

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服