Zzong's Notes

rl

2건의 항목

  • 2026년 6월 26일

    TLPO - Token-Level Policy Optimization

    • language_model
    • llm
    • post_training
    • rl
    • paper_review
    • y2026
  • 2026년 6월 14일

    SAGE - Steerable Agentic Data Generation for Deep Search with Execution Feedback

    • language_model
    • llm
    • deep_search
    • data_generation
    • rl
    • paper_review