Markov Chain 에 reward 를 추가한 시스템
어떤 state 에 도달할 때마다 reward 를 개별적으로 부여한다고 생각하면 편하다.
MRP 는 tuple 로 충분히 표현이 가능하다. 여기서 는 states 집합, 는 전이 확률 행렬, 은 보상 함수 그리고 은 discount factor 이다.
1 min read
Markov Chain 에 reward 를 추가한 시스템
어떤 state 에 도달할 때마다 reward 를 개별적으로 부여한다고 생각하면 편하다.
MRP 는 tuple (S,P,R,γ) 로 충분히 표현이 가능하다. 여기서 S 는 states 집합, P 는 전이 확률 행렬, R 은 보상 함수 그리고 γ∈[0,1] 은 discount factor 이다.
Bellman Equation for MRP Markov Reward Process 에서 특정 state s 와 다른 state s& 039; 간 value 관계를 표현한 수식
Discounted Return 만약 끝이 없는 학습 (continuing tasks) 에서는 보상값이 무한대로 치솟을 수 있다 (e.g. Markov Reward Process). 이를 막기 위해 discounting return Gt 를 사용한다.
MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다. MDP 구성 요소 MDP 는 Markov Reward Process 와 다르게 Action 이 추가된 구성을 가진다. S, A, P, R, γ
MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다. MDP 구성 요소 MDP 는 Markov Reward Process 와 다르게 Action 이 추가된 구성을 가진다.
Markov chain 은 일련의 이벤트를 통해 state 간의 전이 확률을 나타낸 확률적 모델 (stochastic model) 이다. Markov Chain 은 transition Matrix 을 이용해 표현된다.
v {\pi}(s)=\mathbb{E} {\pi}\left[R {t+1}+\gamma v {\pi}\left(S {t+1}\right)\mid S {t}=s\right],\ \ \text{for all }s\in\mathcal{S} 식 유도 \begin{aligned} v...
누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다. 끝이 있는 학습 (episode 가 존재하는 학습, episodic tasks) 에서는 return G t 다음과 같이 표현될 수 있다.
discounting return 에 사용되는 값으로 , expected return > Discounting Return 참조.
n+1 회의 상태 (state) 는 오직 n 회에서의 상태, 혹은 그 이전 일정 기간의 상태에만 영향을 받는 것 P\left(q {i}\mid q {1},\ldots,q {i-1}\right)=P\left(q {i}\mid q {i-1}\right).
MDP 에서 정의하는 dynamics 는 다음과 같다.
POMDP 는 tuple \langle S, A, O, P, R, Z, \gamma\rangle 에 의해 표현될 수 있다.
policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.