Advantage Function
advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.
이 함수는 를 만족하는 특징이 있다.
advantage 함수는 각 action 의 상대적 중요성을 판단하기 위해 사용하는 값이다.
1 min read
advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.
Aπ(s,a)=Qπ(s,a)−Vπ(s)이 함수는 Ea∼π(s)[Aπ(s,a)]=0 를 만족하는 특징이 있다.
advantage 함수는 각 action 의 상대적 중요성을 판단하기 위해 사용하는 값이다.
Action-value Function Action-value function q {\pi}(s, a) 는 다음과 같은 질문에 대한 답을 지닌 함수다.
State-value Function state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.
Value Function state s 에서 policy \pi 를 따를 경우 state-value function 은 v {\pi}(s) 다.
Value-based Method RL 커뮤니티에서는 Q-learning 으로 정의되며, bandit literature 에서는 Direct Method(DM) 라고 불린다.
Policy Evaluation 강화학습에서 주어진 policy 를 평가하는 것은 다양한 방법이 존재한다. 그중에서 policy \pi 의 state-value function v \pi 을 계산하여 비교하는 방법이 있다.
Incremental Implementation Q n 는 action a 를 n-1 번 선택한 이후의 action-value function 의 추정값을 의미한다.
Q-learning Q-Learning 은 model-free 강화 학습 알고리즘이다. 환경에 대한 모델이 필요없다는 점에서 model-free 라는 prefix 가 붙었다.
Policy policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
Policy Improvement (theorem) 현재 policy \pi 보다 더 좋은 policy 는 어떻게 찾을까? 만약 state s 에서 a 를 선택하고 \pi 를 따르는 것이 s 에서 바로 \pi 를 따르는 것보다 좋은 선택이라면, s 를 만날때마다 a 를 선택하는 것이 \pi 보다 좋은 policy...
SARSA SARSA 는 state-value function 값 말고, action-value function 값을 이용하여 policy 를 improve 하는 temporal difference 방법이다.