Reinforcement Learning
machine learning 기법 중 하나.
B) For RS
A Survey on Reinforcement Learning for Recommender Systems
1 min read
machine learning 기법 중 하나.
A Survey on Reinforcement Learning for Recommender Systems
Asynchronous Dynamic Programming 일반적으로 Reinforcement Learning 에서 DP 를 얘기하면, synchronous DP (동기 DP) 를 의미하는 것이다. 동기 DP 는 state set 전체에 대한 sweeps 이 필요하다는 것이 단점이다: ...
...정 값을 반복적으로 계산할 수 있다. 이러한 과정을 bootstrapping 이라 한다. 다만, 이렇게 수행하는 방식은 states 가 너무 많은 경우 실행이 불가능하다. 많은 Reinforcement Learning 방법은 DP 에서 요구되는 완전하고 정확한 환경 모델 (MDP) 없이도 bootstrapping 을 수행한다. D) Related bagging
Expected Return 누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다. 끝이 있는 학습 (episode 가 존재하는 학습, episodic tasks) 에서는 return Gt 다음과...
Exploration by Random Network Distillation RL methods work by maximizing the expected return of a policy. In reality it is often impractical to engineer d...
...dit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다. A.1) 수학적 정의
RLHF
Deep Search Reinforcement Learning
학습 방법성능특징sep-CMA-ES (Trinity)61.5%—지도학습(SFT)59.2%라벨 생성 비용이 매우 큼무작위 탐색(RS)37.4%수렴이 느림REINFORCE (RL)25.3%그래디언트 노이즈가 극심
정의 Multi-armed Bandit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다.
Temporal Difference Temporal Difference(TD)는 Monte Carlo 처럼 실제 경험에서 배우면서도, episode 가 끝날 때까지 기다리지 않고 다음 상태의 추정값을 이용해 바로 업데이트하는 강화학습 방법이다.
Markov Decision Process MDP 는 sequential decision-making 문제를 풀기위한 모델을 설정할 때 사용할 수 있는 프레임워크를 의미한다.
Expected Return 누적 보상을 의미하며, Reinforcement Learning 에서 agent 의 목표는 이 값을 최대화 하는 것을 의미한다.
임의로 아무 콘텐츠나 시도해보며 콘텐츠의 반응률을 유추하는 과정을 탐색 (explore) 라고 부르며, 지금까지 반응률이 가장 높았던 콘텐츠를 노출시키는 것을 활용 (exploit) 이라 부른다.
\varepsilon-Greedy 알고리즘은 \varepsilon 확률로 가능한 모든 action 들 중 하나를 동일한 확률로 임의 선택하는 것이다. 그 외에는 greedy 알고리즘과 동일하다.
Policy Gradient action-value function 은 action 선택에 더 이상 활용되지 않지만만 policy parameter vector \boldsymbol{\theta}\in\mathbb{R}^{d^{\prime}} 를 학습하는데 사용될수는 있음 \pi(a\mid...
Exploration by Random Network Distillation RL methods work by maximizing the expected return of a policy.
UCB란 UCB(Upper Confidence Bound) 알고리즘은 각 팔(arm)의 현재까지의 평균 보상(mean reward)을 추적하면서, 동시에 각 arm 에 대한 상위 신뢰 구간(upper confidence bound, UCB)을 계산합니다.
RLHF 단순한 next token prediction loss 와 같은 loss function 은 좋은 언어 모델을 학습하는데 제한적이다. 이를 보완하기 위해서 사용자의 선호도를 직접 모델에 알려줄 수 있는 강화 학습 방식을 적용할 수 있다.