十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RL-赵-(七)-不基于模型2-时序差分/TD算法02:计算出给定π下的State Value【求解出State Value➜PE➜PI➜找最优π】

RL-赵-(七)-不基于模型2-时序差分/TD算法02:计算出给定π下的State Value【求解出State Value➜PE➜PI➜找最优π】 二、TD learning of state valuesTD learning既可以指一大类的强化学习算法,也可以指一个具体的estimating state values的算法。TD算法是基于数据,也就是不基于模型来实现强化学习。1、TD算法描述TD算法要求的data/experience如下:给定π ππ产生的( s 0 , r 1 , s 1 , … , s t , r t + 1 , s t + 1 , … ) o r { ( s t , r t + 1 , s t + 1 ) } t (s_0,r_1,s_1,\ldots,s_t,r_{t+1},s_{t+1},\ldots)\mathrm{~or~}\{(s_t,r_{t+1},s_{t+1})\}_t(s0​,r1​,s1​,…,st​,rt+1​,st+1​,…)or{(st​,rt+1​,st+1​)}t​TD算法如下:{ v t + 1 ( s t ) = v t ( s t ) − α t ( s t ) [ v t ( s t ) − [ r t + 1 + γ v t ( s t + 1 ) ] ] v t + 1 ( s ) = v t ( s ) , ∀ s ≠ s t \color{red}{ \left \{\begin{array} {l}v_{t+1}(s_t)=v_t(s_t)-\alpha_t(s_t)\Big[v_t(s_t)-[r_{t+1}+\gamma v_t(s_{t+1})]\Big]\\[1ex] \\v_{t+1}(s)=v_t(s),\quad\forall s\neq s_t \end{array} \right.}⎩⎨⎧​vt+1​(st​)=vt​(st​)−αt​(st​)[vt​(st​)−[rt+1​+γvt​(st+1​)]]vt+1​(s)=vt​(s),∀s=st​​其中:t = 0 , 1 , 2 , . . . t=0,1,2,...t=0,1,2,...,这里的v t ( s t ) v_t(s_t)vt​(st​)是v π ( s t ) v_\pi(s_t)vπ​(st​)的estimated state value,s ss是state space,α t ( s t ) \alpha_t(s_t)αt​(st​)是在t tt时刻s t s_tst​的学习率。在t tt时刻,只有visited states t s_tst​的值被更新,而unvisited statess ≠ s t s\neq s_ts=st​的 values 保持不变。在等式 (2) 中的更新过程在后面的内容中将被省略2、TD算法详细解析对TD算法进行一些标注:v t + 1 ( s t ) ⏟ newestimate = v t ( s t ) ⏟ currentestimate − α t ( s t ) [ v t ( s t ) − [ r t + 1 + γ v t ( s t + 1 ) ⏟ υ ˉ t TDtarget v ˉ t ] ] ⏞ TDerror δ t \color{red}{ \underbrace{v_{t+1}(s_t)}_{\text{new estimate}} =\underbrace{v_t(s_t)}_{\text{current estimate}} - \alpha_t(s_t)[\overbrace{v_t(s_t)-[\underbrace{r_{t+1}+\gamma v_t(s_{t+1})}_{\bar{\upsilon}_t}^{\text{TD target }\bar{v}_t}]]}^{\text{TD error}\ \delta_t}}newestimatevt+1​(st​)​​=currentestimatevt​(st​)​​−αt​(st​)[vt​(st​)−[TDtargetvˉt​rt+1​+γvt​(st+1​)​​]]​TDerrorδt​​其中:v ˉ t ≐ r t + 1 + γ v ( s t + 1 ) \bar{v}_t\doteq r_{t+1}+\gamma v(s_{t+1})vˉt​≐rt+1​+γv(st+1​)被称为TD target。δ t ≐ v ( s t ) − [ r t + 1 + γ v ( s t + 1 ) ] = v ( s t ) − v ˉ t \begin{aligned}\delta_t\doteq v(s_t)-[r_{t+1}+\gamma v(s_{t+1})]=v(s_t)-\bar{v}_t\end{aligned}δt​≐v(s
返回列表