Zzong's Notes
Search
검색
다크 모드
라이트 모드
탐색기
post_training
4건의 항목
2026년 9월 04일
Group Sequence Policy Optimization
LLM
reinforcement_learning
post_training
RLVR
policy_optimization
Qwen
2026년 9월 04일
Decoupled Clip and Dynamic sAmpling Policy Optimization
LLM
reinforcement_learning
post_training
RLVR
policy_optimization
ByteDance
2026년 9월 04일
자연스러운 한국어를 위한 LLM Post-Training
LLM
post_training
alignment
instruction_tuning
korean
2026년 8월 29일
TLPO - Token-Level Policy Optimization
language_model
llm
post_training
rl
paper_review
y2026