Zzong's Notes

Home

❯

RL

❯

Reinforcement Learning

Reinforcement Learning

2026년 6월 14일1 min read

Reinforcement Learning

machine learning 기법 중 하나.

B) For RS

A Survey on Reinforcement Learning for Recommender Systems

C) Related

  • Markov Decision Process, dynamic programming, Monte Carlo Method, temporal difference
    • N-step Bootstrapping
  • Policy Gradient
  • Multi-Armed Bandit

링크된 언급

8
asynchronous dynamic programming

Asynchronous Dynamic Programming 일반적으로 Reinforcement Learning 에서 DP 를 얘기하면, synchronous DP (동기 DP) 를 의미하는 것이다. 동기 DP 는 state set 전체에 대한 sweeps 이 필요하다는 것이 단점이다: ...

bootstrapping

...정 값을 반복적으로 계산할 수 있다. 이러한 과정을 bootstrapping 이라 한다. 다만, 이렇게 수행하는 방식은 states 가 너무 많은 경우 실행이 불가능하다. 많은 Reinforcement Learning 방법은 DP 에서 요구되는 완전하고 정확한 환경 모델 (MDP) 없이도 bootstrapping 을 수행한다. D) Related bagging

expected return

Expected Return 누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다. 끝이 있는 학습 (episode 가 존재하는 학습, episodic tasks) 에서는 return Gt 다음과...

Exploration by Random Network Distillation

Exploration by Random Network Distillation RL methods work by maximizing the expected return of a policy. In reality it is often impractical to engineer d...

Multi-Armed Bandit

...dit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다. A.1) 수학적 정의

RLHF

RLHF

SAGE - Steerable Agentic Data Generation for Deep Search with Execution Feedback

Deep Search Reinforcement Learning

Trinity, 여러 LLM을 조율하는 진화된 코디네이터

학습 방법성능특징sep-CMA-ES (Trinity)61.5%—지도학습(SFT)59.2%라벨 생성 비용이 매우 큼무작위 탐색(RS)37.4%수렴이 느림REINFORCE (RL)25.3%그래디언트 노이즈가 극심

함께 보면 좋은 글

Multi-Armed Bandit

정의 Multi-armed Bandit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다.

temporal difference

Temporal Difference Temporal Difference(TD)는 Monte Carlo 처럼 실제 경험에서 배우면서도, episode 가 끝날 때까지 기다리지 않고 다음 상태의 추정값을 이용해 바로 업데이트하는 강화학습 방법이다.

Markov Decision Process

Markov Decision Process MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다.

expected return

Expected Return 누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다.

Exploration and Exploitation trade-off

임의로 아무 콘텐츠나 시도해보며 콘텐츠의 반응률을 유추하는 과정을 탐색 (explore) 라고 부르며, 지금까지 반응률이 가장 높았던 콘텐츠를 노출시키는 것을 활용 (exploit) 이라 부른다.

epsilon-greedy algorithm

\varepsilon-Greedy 알고리즘은 \varepsilon 확률로 가능한 모든 action 들 중 하나를 동일한 확률로 임의 선택하는 것이다. 그 외에는 greedy 알고리즘과 동일하다.

Policy Gradient

Policy Gradient action-value function 은 action 선택에 더 이상 활용되지 않지만만 policy parameter vector \boldsymbol{\theta}\in\mathbb{R}^{d^{\prime}} 를 학습하는데 사용될수는 있음 \pi(a\mid...

Exploration by Random Network Distillation

Exploration by Random Network Distillation RL methods work by maximizing the expected return of a policy.

UCB

UCB란 UCB(Upper Confidence Bound) 알고리즘은 각 팔(arm)의 현재까지의 평균 보상(mean reward)을 추적하면서, 동시에 각 arm 에 대한 상위 신뢰 구간(upper confidence bound, UCB)을 계산합니다.

RLHF

RLHF 단순한 next token prediction loss 와 같은 loss function 은 좋은 언어 모델을 학습하는데 제한적이다. 이를 보완하기 위해서 사용자의 선호도를 직접 모델에 알려줄 수 있는 강화 학습 방식을 적용할 수 있다.

  • Reinforcement Learning
  • B) For RS
  • C) Related