Every-visit MC
- every-visit MC 방법은 first-visit MC 와 달리, 어떤 든 visit 할때마다 returns 의 평균값을 취해 를 계산한다.
- Every-visit MC 방법도 first-visit MC 방법과 큰 차이는 없다.
- 다만, 가 해당 에피소드에서 방문했는지 하지 않았는지 검사하지 않는다.
1 min read
first-visit MC every-visit MC
First-visit MC first-visit MC 방법은 처음 visit 하는 s 에 대해서 returns 의 평균값을 취해 v \pi(s) 를 계산한다.
Monte Carlo Method Monte Carlo Method 방법은 경험 (experience) 이 필요하다. 경험이란 환경과의 상호 작용을 통해 얻어지는 일련의 states, actions 그리고 rewards 의 sample 을 의미한다.
Visit In 한 episode 에서 state s 를 발견한 경우, 이를 a visit to s 라고 한다. 물론 s 는 한 episode 에서 여러번 visited 될 수 있다. 한 episode 에서 s 를 처음 발견한 것은 first-visit 라고 한다.
Exploring Starts Exploring starts 는 GPI 방식을 진행할 때, (s) 에서 시작하는 것이 아니라, (s,a) 쌍에서 시작하는 것을 의미한다. MC 에서 최적의 policy 를 찾기 위해서는 모든 (s,a) 를 무한히 visit 해야 한다.
Incremental Implementation Q n 는 action a 를 n-1 번 선택한 이후의 action-value function 의 추정값을 의미한다.
REINFORCE REINFORCE 방식은 몬테카를로 방식의 Policy Gradient 이다. 즉, 큰 분산 (high variance) 을 가질 수 있고, 따라서 학습 속도가 느려질 수도 있다.
Reinforcement Learning machine learning 기법 중 하나.
Policy Evaluation 강화학습에서 주어진 policy 를 평가하는 것은 다양한 방법이 존재한다. 그중에서 policy \pi 의 state-value function v \pi 을 계산하여 비교하는 방법이 있다.
Temporal Difference Temporal Difference(TD)는 Monte Carlo 처럼 실제 경험에서 배우면서도, episode 가 끝날 때까지 기다리지 않고 다음 상태의 추정값을 이용해 바로 업데이트하는 강화학습 방법이다.
Value-based Method RL 커뮤니티에서는 Q-learning 으로 정의되며, bandit literature 에서는 Direct Method(DM) 라고 불린다.