Zzong's Notes

post_training

3건의 항목

  • 2026년 6월 28일

    Group Sequence Policy Optimization

    • LLM
    • reinforcement_learning
    • post_training
    • RLVR
    • policy_optimization
    • Qwen
  • 2026년 6월 28일

    자연스러운 한국어를 위한 LLM Post-Training

    • LLM
    • post_training
    • alignment
    • instruction_tuning
    • korean
  • 2026년 6월 26일

    TLPO - Token-Level Policy Optimization

    • language_model
    • llm
    • post_training
    • rl
    • paper_review
    • y2026