Policy
policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 로 표현한다.
MDP 에서 RL 의 목표는 expected cumulative reward(expected return) 값을 최대화 하는 policy 를 찾는 것이다.
1 min read
policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 π 로 표현한다.
π(a∣s)=P[At=a∣St=s]MDP 에서 RL 의 목표는 expected cumulative reward(expected return) 값을 최대화 하는 policy 를 찾는 것이다.
...e function v π(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다. 그리고 MDP 에서 이 함수는 policy 를 위해 정의된 것이다. policy 에 의해 전이 확률 행렬이 결정되는 것을 고려해볼 때, policy 를 변경한다는 것은 결국 다른 state-value function 을 가진다는 것을...
State-value Function state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.
Expected Return 누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다.
Markov Decision Process MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다.
Policy Evaluation 강화학습에서 주어진 policy 를 평가하는 것은 다양한 방법이 존재한다. 그중에서 policy \pi 의 state-value function v \pi 을 계산하여 비교하는 방법이 있다.
Policy Improvement (theorem) 현재 policy \pi 보다 더 좋은 policy 는 어떻게 찾을까? 만약 state s 에서 a 를 선택하고 \pi 를 따르는 것이 s 에서 바로 \pi 를 따르는 것보다 좋은 선택이라면, s 를 만날때마다 a 를 선택하는 것이 \pi 보다 좋은 policy...
Dynamics MDP 에서 정의하는 dynamics 는 다음과 같다.
Advantage Function advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.
Reinforcement Learning machine learning 기법 중 하나.
S-MDP agent 가 조합적 선택 (combinatorial selections) 을 연속적으로 수행해야 하는 문제 B) Related C) References.
Value Function state s 에서 policy \pi 를 따를 경우 state-value function 은 v {\pi}(s) 다.