RL-10-赵-Actor-Critic03:DPG(Deterministic actor-critic)【Deterministic Policy Gradient】 2026/9/29 5:37:41 0 次阅读 直到现在,用在policy gradient methods中的policies全部都是stochastic,因为对于所有的( s , a ) , π ( a ∣ s , θ ) 0 (s, a) , \pi(a \mid s, \theta)0(s,a 分享: