Zzong's Notes
Search
검색
다크 모드
라이트 모드
탐색기
post_training
3건의 항목
2026년 6월 28일
Group Sequence Policy Optimization
LLM
reinforcement_learning
post_training
RLVR
policy_optimization
Qwen
2026년 6월 28일
자연스러운 한국어를 위한 LLM Post-Training
LLM
post_training
alignment
instruction_tuning
korean
2026년 6월 26일
TLPO - Token-Level Policy Optimization
language_model
llm
post_training
rl
paper_review
y2026