拓冰建站拓冰建站
首页 / 资讯中心 / 正文

RL-10-TD算法-ActorCritic02-离线算法03-赵:Off-Policy Policy Gradient

3、off-policy Policy Gradient有了刚刚的重要性采样,我们就把这个技术应用到policy gradient当中,去实现off-policy的学习。下面其实我们有两个步骤,第一个步骤就是要得到gradient它的表达式是什么,在得到这个gradient表达式之后,我们就可以把它应用到梯度上升的方法当中去进行优化。就像上面的on-policy的情况,我们需要将policy gradient推导到off-policy的情
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门