Zzong's Notes
Search
검색
다크 모드
라이트 모드
탐색기
reinforcement_learning
66건의 항목
2026년 9월 04일
Group Sequence Policy Optimization
LLM
reinforcement_learning
post_training
RLVR
policy_optimization
Qwen
2026년 9월 04일
Pessimistic Reward Models for Off-Policy Learning in Recommendation
reinforcement_learning
recommendation_system
2026년 9월 04일
RLHF
LLM
reinforcement_learning
2026년 9월 04일
Decoupled Clip and Dynamic sAmpling Policy Optimization
LLM
reinforcement_learning
post_training
RLVR
policy_optimization
ByteDance
2026년 9월 04일
Group Relative Policy Optimization
reinforcement_learning
LLM
2026년 8월 29일
Actor–Critic Method
reinforcement_learning
2026년 8월 29일
Bellman optimality equation
reinforcement_learning
2026년 8월 29일
DP (Reinforcement Learning)
reinforcement_learning
2026년 8월 29일
Deep Q-Network
reinforcement_learning
deep_learning
2026년 8월 29일
Deep Reinforcement Learning with Double Q-Learning
reinforcement_learning
Google
y2016
AAAI
2026년 8월 29일
EXP3
reinforcement_learning
MAB
2026년 8월 29일
Expected SARSA
reinforcement_learning
2026년 8월 29일
Exploration and Exploitation trade-off
MAB
reinforcement_learning
2026년 8월 29일
Exploring Starts
reinforcement_learning
2026년 8월 29일
Human-level control through deep reinforcement learning
reinforcement_learning
deep_learning
2026년 8월 29일
Incremental Implementation
reinforcement_learning
algorithm
2026년 8월 29일
Markov Chain
reinforcement_learning
probability_distribution
2026년 8월 29일
Markov Decision Process
reinforcement_learning
2026년 8월 29일
Markov Reward Process
reinforcement_learning
2026년 8월 29일
Markov property
reinforcement_learning
2026년 8월 29일
Monte Carlo Method(RL)
reinforcement_learning
2026년 8월 29일
Policy Gradient
reinforcement_learning
2026년 8월 29일
Q-learning
reinforcement_learning
2026년 8월 29일
REINFORCE
reinforcement_learning
2026년 8월 29일
S-MDP
reinforcement_learning
2026년 8월 29일
SARSA
reinforcement_learning
2026년 8월 29일
advantage function
reinforcement_learning
2026년 8월 29일
asynchronous dynamic programming
reinforcement_learning
DP
2026년 8월 29일
discount factor
reinforcement_learning
2026년 8월 29일
dynamics
reinforcement_learning
2026년 8월 29일
epsilon-greedy algorithm
reinforcement_learning
algorithm
MAB
2026년 8월 29일
every-visit MC
reinforcement_learning
2026년 8월 29일
expected return
reinforcement_learning
2026년 8월 29일
exploration
reinforcement_learning
2026년 8월 29일
first-visit MC
reinforcement_learning
2026년 8월 29일
partially observable Markov decision process
reinforcement_learning
2026년 8월 29일
policy evaluation
reinforcement_learning
2026년 8월 29일
policy improvement
reinforcement_learning
2026년 8월 29일
policy iteration
reinforcement_learning
DP
2026년 8월 29일
policy
reinforcement_learning
2026년 8월 29일
temporal difference
reinforcement_learning
2026년 8월 29일
value function
reinforcement_learning
2026년 8월 29일
value iteration
reinforcement_learning
DP
2026년 8월 29일
value-based method
reinforcement_learning
2026년 8월 29일
visit
reinforcement_learning
word
2026년 8월 29일
UCB
MAB
reinforcement_learning
2026년 8월 29일
Proximal Policy Optimization
reinforcement_learning
LLM
2026년 8월 29일
Making contextual decisions with low technical debt
contextual_bandit
machine_learning
paper_review
reinforcement_learning
2026년 8월 29일
Qwen-AgentWorld - Language World Models for General Agents
language_model
llm
agent
world_model
reinforcement_learning
paper_review
Qwen
y2026
2026년 8월 29일
A Survey on Reinforcement Learning for Recommender Systems
paper_review
survey
reinforcement_learning
recommendation_system
2026년 8월 29일
DRN - A Deep Reinforcement Learning Framework for News Recommendation
paper_review
reinforcement_learning
WWW
2026년 8월 29일
Deep Exploration via Bootstrapped DQN
Google
ensemble
paper_review
reinforcement_learning
2026년 8월 29일
Deep reinforcement learning for search, recommendation, and online advertising - a survey
paper_review
recommendation_system
reinforcement_learning
survey
2026년 8월 29일
Exploration by Random Network Distillation
paper_review
reinforcement_learning
2026년 8월 29일
Exploring compact reinforcement-learning representations with linear regression
MAB
linear_regression
paper_review
reinforcement_learning
2026년 8월 29일
Recommendations with Negative Feedback via Pairwise Deep Reinforcement Learning
KDD
deep_learning
paper_review
recommendation_system
reinforcement_learning
y2018
2026년 8월 29일
Reinforcement Learning for Slate-based Recommender Systems - A Tractable Decomposition and Practical Methodology
paper_review
reinforcement_learning
2026년 8월 29일
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
LLM
RLVR
paper_review
reinforcement_learning
2026년 8월 29일
Solving Continual Combinatorial Selection via Deep Reinforcement Learning
IJCAI
deep_learning
paper_review
reinforcement_learning
y2019
2026년 8월 29일
RLlib
reinforcement_learning
python
2026년 8월 29일
Multi-Armed Bandit
MAB
reinforcement_learning
2026년 8월 28일
Reinforcement Learning
reinforcement_learning
MAB
2026년 8월 28일
bootstrapping
ensemble
statistic
sampling
reinforcement_learning
2026년 8월 28일
Bellman Equation
reinforcement_learning
linear_algebra
2026년 8월 28일
action-value function
reinforcement_learning
2026년 8월 28일
state-value function
reinforcement_learning