拓冰建站拓冰建站
首页 / 资讯中心 / 正文

RL-10-赵-Actor-Critic01-在线算法01:QAC【Actor:Policy函数拟合算法】【Critic:Sarsa算法】【π>0,具有探索性】【Q表示action value】

我们知道基于Monte-Carlo的Policy Gradient算法如下图所示:我们将估计action values的方法换成“Temporal-difference learning”,现在给出第一个Actor-Critic算法:QAC
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门