Visit In statistic/Monte Carlo Method
- 한 episode 에서 state 를 발견한 경우, 이를 a visit to 라고 한다.
- 물론 는 한 episode 에서 여러번 visited 될 수 있다.
- 한 episode 에서 를 처음 발견한 것은 first-visit 라고 한다.
1 min read
first-visit MC 방법은 처음 visit 하는 s 에 대해서 returns 의 평균값을 취해 v_π(s) 를 계산한다.
first-visit MC 방법은 처음 visit 하는 s 에 대해서 returns 의 평균값을 취해 v \pi(s) 를 계산한다.
every-visit MC 방법은 first-visit MC 와 달리, 어떤 s 든 visit 할때마다 returns 의 평균값을 취해 v \pi(s) 를 계산한다. Every-visit MC 방법도 first-visit MC 방법과 큰 차이는 없다.
Exploring starts 는 GPI 방식을 진행할 때, (s) 에서 시작하는 것이 아니라, (s,a) 쌍에서 시작하는 것을 의미한다. MC 에서 최적의 policy 를 찾기 위해서는 모든 (s,a) 를 무한히 visit 해야 한다.
Monte Carlo Method Monte Carlo Method 방법은 경험 (experience) 이 필요하다. 경험이란 환경과의 상호 작용을 통해 얻어지는 일련의 states, actions 그리고 rewards 의 sample 을 의미한다.
SARSA 는 state-value function 값 말고, action-value function 값을 이용하여 policy 를 improve 하는 temporal difference 방법이다.
policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
REINFORCE 방식은 몬테카를로 방식의 Policy Gradient 이다. 즉, 큰 분산 (high variance) 을 가질 수 있고, 따라서 학습 속도가 느려질 수도 있다.
machine learning 기법 중 하나.
MDP 에서 정의하는 dynamics 는 다음과 같다.
n+1 회의 상태 (state) 는 오직 n 회에서의 상태, 혹은 그 이전 일정 기간의 상태에만 영향을 받는 것 P\left(q {i}\mid q {1},\ldots,q {i-1}\right)=P\left(q {i}\mid q {i-1}\right).