S-MDP
agent 가 조합적 선택 (combinatorial selections) 을 연속적으로 수행해야 하는 문제
1 min read
Dynamics MDP 에서 정의하는 dynamics 는 다음과 같다.
Policy policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
Hard-exploration 문제 hard-exploration 문제란, 보상이 매우 드문 특정 환경에서의 exploration 을 의미한다. 임의의 exploration 의 경우, 성공적인 state 나 의미있는 feedback 을 발견하기가 매우 어렵다.
Markov Decision Process MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다.
Reinforcement Learning machine learning 기법 중 하나.
DP DP 방식은 MDP 에 대한 optimal solution 을 제공하는 방법이다. 일반적으로 MDP 와 같은 환경에 대한 완벽한 모델이 주어졌을 때 사용하는 알고리즘의 총칭을 의미한다.
Partially Observable Markov Decision Process POMDP 는 tuple \langle S, A, O, P, R, Z, \gamma\rangle 에 의해 표현될 수 있다.
Markov Property n+1 회의 상태 (state) 는 오직 n 회에서의 상태, 혹은 그 이전 일정 기간의 상태에만 영향을 받는 것 P\left(q {i}\mid q {1},\ldots,q {i-1}\right)=P\left(q {i}\mid q {i-1}\right) Related References.
State-value Function state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.
Markov Reward Process Markov Chain 에 reward 를 추가한 시스템 어떤 state 에 도달할 때마다 reward 를 개별적으로 부여한다고 생각하면 편하다. MRP 는 tuple (S, P, R, \gamma) 로 충분히 표현이 가능하다.