Zzong's Notes

Home

❯

RL

❯

discount factor

discount factor

2026년 6월 14일1 min read

Discount Factor

discounting return 에 사용되는 값으로 ,

expected return > Discounting Return 참조


링크된 언급

3
DRN - A Deep Reinforcement Learning Framework for News Recommendation

Abstract 뉴스 추천을 위한 딥러닝 기반의 강화 학습 프레임워크를 제안한다. news feature 들과 user 의 preferences 의 변동성 (dynamic) 을 설명하는 것은 상당히 어렵다. 기존에도 이를 다루는 방식들이 있었지만 다음과 같은 세 가지 중요 이슈가 있다. 현재 reward(CTR) 에 대해서만 모델링이 가능 대부분 click 또는 no click labels ...

expected return

여기서 γ 는 감가율 discount factor 라 부름 (0≤γ≤1) 좀 더 general 하게 다음과 같이 쓴다.

Markov Reward Process

...다. MRP 는 tuple (S, P, R, γ) 로 충분히 표현이 가능하다. 여기서 S 는 states 집합, P 는 전이 확률 행렬, R 은 보상 함수 그리고 γ [0, 1] 은 discount factor 이다. Related References

함께 보면 좋은 글

expected return

Expected Return 누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다.

Markov Reward Process

Markov Reward Process Markov Chain 에 reward 를 추가한 시스템 어떤 state 에 도달할 때마다 reward 를 개별적으로 부여한다고 생각하면 편하다. MRP 는 tuple (S, P, R, \gamma) 로 충분히 표현이 가능하다.

DRN - A Deep Reinforcement Learning Framework for News Recommendation

Abstract 뉴스 추천을 위한 딥러닝 기반의 강화 학습 프레임워크를 제안한다. news feature 들과 user 의 preferences 의 변동성 (dynamic) 을 설명하는 것은 상당히 어렵다.

state-value function

State-value Function state 의 value 를 state-value function v {\pi}(s) 이라 부른다. 이는 state s 에서 시작할 때 얻을 수 있는 expected discounted return 값을 의미한다.

advantage function

Advantage Function advantage function 은 q-value 값과 state-value function 값의 차이를 의미한다.

Reinforcement Learning

Reinforcement Learning machine learning 기법 중 하나.

policy

Policy policy 란 주어진 states 에서 actions 에 대한 확률 분포를 의미하며 \pi 로 표현한다.

action-value function

Action-value Function Action-value function q {\pi}(s, a) 는 다음과 같은 질문에 대한 답을 지닌 함수다.

value function

Value Function state s 에서 policy \pi 를 따를 경우 state-value function 은 v {\pi}(s) 다.

value-based method

Value-based Method RL 커뮤니티에서는 Q-learning 으로 정의되며, bandit literature 에서는 Direct Method(DM) 라고 불린다.