제목 없음
3.5 Policies and Value Functions a $policy$ is a mapping from states to probabilities of selecting each possible action.If the agent is following policy $\pi$ at time $t$, then $\pi(a|s)$ is the probability that $A_{t} = a$ if $S_{t} = s$. $v_{\pi}$ : state-value function for policy $\pi$. $v_{\pi}(s) \doteq \mathbb{E}_{\pi} [G_{t} | S_{t} = s] = \mathbb{E}_{\pi} \Big[ \sum\limits_{k=0}^\infty \..
$$ax^2 + bx + c = 0$$ 인라인? $\mathbf{x} = [x_{1}, x_{2}, \cdots, x_{D}] \in \mathbb{R}^{D}$
원글(https://jay.tech.blog/2017/01/04/policy-gradient-methods-part-2/) 먼저 소개한(?) REINFORCE-with-baseline method는 policy 및 state value function을 모두 학습하지만,이것을 actor-critic method라고 하지 않는 이유는,state-value function이 baseline에만 사용되고 critic으로서 사용되지는 않기 때문이다.즉. 이것은 bootstrapping에 사용되지 않고 baseline으로만 사용된다.Boot... [출처:https://jay.tech.blog/2017/01/04/policy-gradient-methods-part-2/] Actor-critic methods는 위 ..