Hard-exploration 문제
hard-exploration 문제란, 보상이 매우 드문 특정 환경에서의 exploration 을 의미한다. 임의의 exploration 의 경우, 성공적인 state 나 의미있는 feedback 을 발견하기가 매우 어렵다.
1 min read
Exploring Starts Exploring starts 는 GPI 방식을 진행할 때, (s) 에서 시작하는 것이 아니라, (s,a) 쌍에서 시작하는 것을 의미한다. MC 에서 최적의 policy 를 찾기 위해서는 모든 (s,a) 를 무한히 visit 해야 한다.
S-MDP agent 가 조합적 선택 (combinatorial selections) 을 연속적으로 수행해야 하는 문제 B) Related C) References.
임의로 아무 콘텐츠나 시도해보며 콘텐츠의 반응률을 유추하는 과정을 탐색 (explore) 라고 부르며, 지금까지 반응률이 가장 높았던 콘텐츠를 노출시키는 것을 활용 (exploit) 이라 부른다.
Policy policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
Reinforcement Learning machine learning 기법 중 하나.
Dynamics MDP 에서 정의하는 dynamics 는 다음과 같다.
Advantage Function advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.
SARSA SARSA 는 state-value function 값 말고, action-value function 값을 이용하여 policy 를 improve 하는 temporal difference 방법이다.
Q-learning Q-Learning 은 model-free 강화 학습 알고리즘이다. 환경에 대한 모델이 필요없다는 점에서 model-free 라는 prefix 가 붙었다.
Expected SARSA SARSA 에서 기대값 을 사용한 SARSA 버전 즉, Q \left(S {t+1},A {t+1}\right) 대신 \mathbb{E} {\pi}[Q(S {t+1},A {t+1})\mid S {t+1}] 를 사용한다.