Markov Property
회의 상태 (state) 는 오직 회에서의 상태, 혹은 그 이전 일정 기간의 상태에만 영향을 받는 것
1 min read
A.1.3) Markov property
MDP 의 time t 는 굳이 시간에 대한 개념이 아니라 stages 로 생각하면 좋다. A.2) Markov Property Markov property: MDP 의 St 와 At 는 무조건 St-1 와 At-1 에 의해서만 영향을 받음 B) Dynamics of the MDP time step t 에서 ...
Stationary Distribution Markov property 를 만족한 상태에서 Markov 연쇄를 반복하다 보면 현재 상태의 확률이 직전 상태의 확률과 같아지면서 수렴하게 되는데, 이렇게 평형 상태에 도달한 확률 분포를 정적분포 (Stati...
Markov Decision Process MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다.
Markov Reward Process Markov Chain 에 reward 를 추가한 시스템 어떤 state 에 도달할 때마다 reward 를 개별적으로 부여한다고 생각하면 편하다. MRP 는 tuple (S, P, R, \gamma) 로 충분히 표현이 가능하다.
Markov Chain Markov chain 은 일련의 이벤트를 통해 state 간의 전이 확률을 나타낸 확률적 모델 (stochastic model) 이다. Markov Chain 은 transition Matrix 을 이용해 표현된다.
Dynamics MDP 에서 정의하는 dynamics 는 다음과 같다.
Policy policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
Partially Observable Markov Decision Process POMDP 는 tuple \langle S, A, O, P, R, Z, \gamma\rangle 에 의해 표현될 수 있다.
S-MDP agent 가 조합적 선택 (combinatorial selections) 을 연속적으로 수행해야 하는 문제 B) Related C) References.
Reinforcement Learning machine learning 기법 중 하나.
State-value Function state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.
Advantage Function advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.