Dynamics
MDP 에서 정의하는 dynamics 는 다음과 같다.
“ timestamp 에서 action 를 통해 state 에서 state 으로 옮겨서 reward 을 받을 확률”
위 수식에서 는 definition 이라는 뜻이다.
A.1) 특징
가능한 모든 를 더하면 1 이 된다.
1 min read
MDP 에서 정의하는 dynamics 는 다음과 같다.
“t timestamp 에서 action a 를 통해 state s 에서 state s′ 으로 옮겨서 reward r 을 받을 확률”
p(s′,r∣s,a)≐Pr{St=s′,Rt=r∣St−1=s,At−1=a}위 수식에서 ≐ 는 definition 이라는 뜻이다.
가능한 모든 p 를 더하면 1 이 된다.
s′∈S∑r∈R∑p(s′,r∣s,a)=1, for all s∈S,a∈A(s)환경에 대한 dynamics 를 정확히 알아야 한다. 계산을 위한 충분한 자원이 있어야 할 것 state 가 Markov property 를 따를 것
...s 값을 이용하여 강화 학습 문제를 해결한다. 여기서는 terminal state 가 있는 episodic task 만 고려한다. C) DP Vs MC C.1) 차이점 MC 는 환경에 대한 dynamics 을 알 필요가 없다. 반대로 DP 는 다음 events 에 대한 모든 확률 분포를 알아야된다. MC 도 transition 확률을 알 필요는 있다. 그렇지만 이것도 DP 처럼 가능한 모든 ...
Markov Decision Process MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다.
Bellman Optimality Equation state-value function v \pi(s) 에 대한 Bellman Equation 은 다음과 같다.
Monte Carlo Method Monte Carlo Method 방법은 경험 (experience) 이 필요하다. 경험이란 환경과의 상호 작용을 통해 얻어지는 일련의 states, actions 그리고 rewards 의 sample 을 의미한다.
Policy policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.
Markov Reward Process Markov Chain 에 reward 를 추가한 시스템 어떤 state 에 도달할 때마다 reward 를 개별적으로 부여한다고 생각하면 편하다. MRP 는 tuple (S, P, R, \gamma) 로 충분히 표현이 가능하다.
S-MDP agent 가 조합적 선택 (combinatorial selections) 을 연속적으로 수행해야 하는 문제 B) Related C) References.
State-value Function state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.
Markov Chain Markov chain 은 일련의 이벤트를 통해 state 간의 전이 확률을 나타낸 확률적 모델 (stochastic model) 이다. Markov Chain 은 transition Matrix 을 이용해 표현된다.
DP DP 방식은 MDP 에 대한 optimal solution 을 제공하는 방법이다. 일반적으로 MDP 와 같은 환경에 대한 완벽한 모델이 주어졌을 때 사용하는 알고리즘의 총칭을 의미한다.
Markov Property n+1 회의 상태 (state) 는 오직 n 회에서의 상태, 혹은 그 이전 일정 기간의 상태에만 영향을 받는 것 P\left(q {i}\mid q {1},\ldots,q {i-1}\right)=P\left(q {i}\mid q {i-1}\right) Related References.