Zzong's Notes

post_training

4건의 항목

  • 2026년 9월 04일

    Group Sequence Policy Optimization

    • LLM
    • reinforcement_learning
    • post_training
    • RLVR
    • policy_optimization
    • Qwen
  • 2026년 9월 04일

    Decoupled Clip and Dynamic sAmpling Policy Optimization

    • LLM
    • reinforcement_learning
    • post_training
    • RLVR
    • policy_optimization
    • ByteDance
  • 2026년 9월 04일

    자연스러운 한국어를 위한 LLM Post-Training

    • LLM
    • post_training
    • alignment
    • instruction_tuning
    • korean
  • 2026년 8월 29일

    TLPO - Token-Level Policy Optimization

    • language_model
    • llm
    • post_training
    • rl
    • paper_review
    • y2026