ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法02-5:目标函数/metrics的选取05【目标函数的梯度】

RL-赵-(九)-Policy函数拟合算法-Policy Gradient算法02-5:目标函数/metrics的选取05【目标函数的梯度】 二、目标函数的梯度(Gradients of the metrics)给定一个metric,然后推导它的梯度然后,应用gradient-based methods去优化这个metric。gradient的计算是policy gradient methods中最复杂的计算部分!首先,我们需要区分不同的目标函数/metrics:v ˉ π = ∑ s ∈ S d ( s ) v π ( s ) ≐ E [ ∑ t = 0 ∞ γ t R t + 1 ] \begin{aligned}\bar{v}_{\pi}\:=\sum_{s\in\mathcal{S}}d(s)v_{\pi}(s)\doteq\mathbb{E}\left[\sum_{t=0}^\infty\gamma^tR_{t+1}\right] \end{aligned}vˉπ​​=s∈S∑​d(s)vπ​(s)≐E[t=0∑∞​γtRt+1​]​v ˉ π 0 \bar{v}_\pi^0vˉπ0​;r ˉ π ≐ ∑ s ∈ S d π ( s ) r π ( s ) ≐ lim ⁡ n → ∞ 1 n E [ ∑ k = 1 n R t + k ] \begin{aligned}\bar{r}_{\pi}\doteq\sum_{s\in\mathcal{S}}d_{\pi}\left(s\right)r_{\pi}\left(s\right) \doteq\lim_{n\to\infty}\frac{1}{n}\mathbb{E}\left[\sum_{k=1}^{n}R_{t+k}\right] \\[4ex]\end{aligned}rˉπ​≐s∈S∑​dπ​(s)rπ​(s)≐n→∞lim​n1​E[k=1∑n​Rt+k​]​第二,我们需要区分 the discounted 和 undiscounted casesGradients/梯度的统一表示形式:∇ θ J ( θ ) = ∑ s ∈ S η ( s ) ∑ a ∈ A ∇ θ π ( a ∣ s , θ ) q π ( s , a ) \color{red}{ \nabla_\theta J(\theta)=\sum_{s\in\mathcal{S}}\eta(s)\sum_{a\in\mathcal{A}}\nabla_\theta\pi(a|s,\theta)q_\pi(s,a)}∇θ​J(θ)=s∈S∑​η(s)a∈A∑​∇θ​π(a∣s,θ)qπ​(s,a)其中目标函数J ( θ ) J(\theta)J(θ)可以是:v ˉ π = ∑ s ∈ S d ( s ) v π ( s ) ≐ E [ ∑ t = 0 ∞ γ t R t + 1 ] \begin{aligned}\bar{v}_{\pi}\:=\sum_{s\in\mathcal{S}}d(s)v_{\pi}(s)\doteq\mathbb{E}\left[\sum_{t=0}^\infty\gamma^tR_{t+1}\right] \end{aligned}vˉπ​​=s∈S∑​d(s)vπ​(s)≐E[t=0∑∞​γtRt+1​]​v ˉ π 0 \bar{v}_\pi^0vˉπ0​;r ˉ π ≐ ∑ s ∈ S d π ( s ) r π ( s ) ≐ lim ⁡ n → ∞ 1 n E [ ∑ k = 1 n R t + k ] \begin{aligned}\bar{r}_{\pi}\doteq\sum_{s\in\mathcal{S}}d_{\pi}\left(s\right)r_{\pi}\left(s\right) \doteq\lim_{n\to\infty}\frac{1}{n}\mathbb{E}\left[\sum_{k=1}^{n}R_{t+k}\right] \\[4ex]\end{aligned}rˉπ​≐s∈S∑​dπ​(s)rπ​(s)≐n→∞lim​n1​E[k=1∑n​Rt+k​]​= ==可以表示严格相等(=),近似(≈)或者成比例等于(∝);∑ s ∈ S \begin{aligned}\sum_{s\in\mathcal{S}}\end{aligned}s∈S∑​​:表示对s ss求和;η \etaη是一个在states下的分布或者权重,每一个state有一个权重η ( s ) \eta(s)η(s);η \etaη对于不同的目标函数在不同的情况下它会呈现出来不同的distribution;∑ a ∈ A ∇ θ π ( a ∣ s , θ ) q π ( s , a ) \begin{aligned}\sum_{a\in\mathcal{A}}\nabla_\theta\pi(a|s,\theta)q_\pi(s,a)\end{aligned}a∈A∑​∇θ​
返回列表