Hard-exploration 문제
hard-exploration 문제란, 보상이 매우 드문 특정 환경에서의 exploration 을 의미한다. 임의의 exploration 의 경우, 성공적인 state 나 의미있는 feedback 을 발견하기가 매우 어렵다.
1 min read
Exploring starts 는 GPI 방식을 진행할 때, (s) 에서 시작하는 것이 아니라, (s,a) 쌍에서 시작하는 것을 의미한다. MC 에서 최적의 policy 를 찾기 위해서는 모든 (s,a) 를 무한히 visit 해야 한다.
agent 가 조합적 선택 (combinatorial selections) 을 연속적으로 수행해야 하는 문제.
policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
임의로 아무 콘텐츠나 시도해보며 콘텐츠의 반응률을 유추하는 과정을 탐색 (explore) 라고 부르며, 지금까지 반응률이 가장 높았던 콘텐츠를 노출시키는 것을 활용 (exploit) 이라 부른다.
machine learning 기법 중 하나.
MDP 에서 정의하는 dynamics 는 다음과 같다.
advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.
SARSA 는 state-value function 값 말고, action-value function 값을 이용하여 policy 를 improve 하는 temporal difference 방법이다.
every-visit MC 방법은 first-visit MC 와 달리, 어떤 s 든 visit 할때마다 returns 의 평균값을 취해 v \pi(s) 를 계산한다. Every-visit MC 방법도 first-visit MC 방법과 큰 차이는 없다.
Q n 는 action a 를 n-1 번 선택한 이후의 action-value function 의 추정값을 의미한다.