Zzong's Notes

Home

❯

RL

❯

Reinforcement Learning

Reinforcement Learning

2026년 8월 28일1 min read

machine learning 기법 중 하나.

For RS

A Survey on Reinforcement Learning for Recommender Systems

Related

  • Markov Decision Process, dynamic programming, statistic/Monte Carlo Method, temporal difference
    • N-step Bootstrapping
  • Policy Gradient
  • Multi-Armed Bandit

링크된 언급

8
asynchronous dynamic programming

일반적으로 Reinforcement Learning 에서 DP 를 얘기하면, synchronous DP (동기 DP) 를 의미하는 것이다. 동기 DP 는 state set 전체에 대한 sweeps 이 필요하다는 것이 단점이다: ...

bootstrapping

...정 값을 반복적으로 계산할 수 있다. 이러한 과정을 bootstrapping 이라 한다. 다만, 이렇게 수행하는 방식은 states 가 너무 많은 경우 실행이 불가능하다. 많은 Reinforcement Learning 방법은 DP 에서 요구되는 완전하고 정확한 환경 모델 (MDP) 없이도 bootstrapping 을 수행한다. Related bagging

expected return

누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다. 끝이 있는 학습 (episode 가 존재하는 학습, episodic tasks) 에서는 return Gt 다음과...

Exploration by Random Network Distillation

RL methods work by maximizing the expected return of a policy. In reality it is often impractical to engineer d...

Multi-Armed Bandit

...dit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다. 수학적 정의

RLHF

Illustrating Reinforcement Learning from Human Feedback (RLHF)

SAGE - Steerable Agentic Data Generation for Deep Search with Execution Feedback

Deep Search Reinforcement Learning

Trinity, 여러 LLM을 조율하는 진화된 코디네이터

학습 방법성능특징sep-CMA-ES (Trinity)61.5%—지도학습(SFT)59.2%라벨 생성 비용이 매우 큼무작위 탐색(RS)37.4%수렴이 느림REINFORCE (RL)25.3%그래디언트 노이즈가 극심

함께 보면 좋은 글

Multi-Armed Bandit

정의 Multi-armed Bandit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다.

DP (Reinforcement Learning)

DP DP 방식은 MDP 에 대한 optimal solution 을 제공하는 방법이다. 일반적으로 MDP 와 같은 환경에 대한 완벽한 모델이 주어졌을 때 사용하는 알고리즘의 총칭을 의미한다.

A Survey on Reinforcement Learning for Recommender Systems

References paper link: arxiv.org/pdf/2109.10665.pdf Reinforcement Learning based Recommender Systems: A Survey .

temporal difference

Temporal Difference(TD)는 Monte Carlo 처럼 실제 경험에서 배우면서도, episode 가 끝날 때까지 기다리지 않고 다음 상태의 추정값을 이용해 바로 업데이트하는 강화학습 방법이다.

Markov Decision Process

MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다. MDP 구성 요소 MDP 는 Markov Reward Process 와 다르게 Action 이 추가된 구성을 가진다.

expected return

누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다. 끝이 있는 학습 (episode 가 존재하는 학습, episodic tasks) 에서는 return G t 다음과 같이 표현될 수 있다.

asynchronous dynamic programming

일반적으로 Reinforcement Learning 에서 DP 를 얘기하면, synchronous DP (동기 DP) 를 의미하는 것이다.

Exploration and Exploitation trade-off

임의로 아무 콘텐츠나 시도해보며 콘텐츠의 반응률을 유추하는 과정을 탐색 (explore) 라고 부르며, 지금까지 반응률이 가장 높았던 콘텐츠를 노출시키는 것을 활용 (exploit) 이라 부른다.

epsilon-greedy algorithm

\varepsilon-Greedy 알고리즘은 \varepsilon 확률로 가능한 모든 action 들 중 하나를 동일한 확률로 임의 선택하는 것이다. 그 외에는 greedy 알고리즘과 동일하다.

Policy Gradient

action-value function 은 action 선택에 더 이상 활용되지 않지만만 policy parameter vector \boldsymbol{\theta}\in\mathbb{R}^{d^{\prime}} 를 학습하는데 사용될수는 있음 \pi(a\mid...

  • For RS
  • Related