Paper List
M-REWARDBENCH: Evaluating Reward Models in Multilingual Settings
- RewardBench 데이터셋을 번역하여 기존 모델들을 다시 테스트함.
- 언어에 따라 모델 성능 차이가 존재함.
- 모든 모델이 영어 벤치마크에서의 성능에 비해, 다국어 벤치마크에서는 낮은 성과를 보임.
1 min read
M-REWARDBENCH: Evaluating Reward Models in Multilingual Settings
reward model이 결국 “두 답변 중 어느 쪽이 더 좋은가”를 구분하려는 것이라면, 굳이 reward model을 따로 만들지 말고 그 비교 목표를 language model loss 안에 직접 넣으면...
...tool calling, 한국어만 쓰기, 금칙어 회피처럼 reward를 비교적 안정적으로 만들 수 있는 부분은 RL로 따로 분리해볼 수 있다. Reward를 쓴다면 이렇게 쪼갠다 하나의 reward model에게 “자연스러운가?”를 한 번에 판단하게 하면 불안정하다. 차라리 reward를 여러 축으로 나누는 편이 낫다.
DPO를 한 문장으로 잡기 DPO(Direct Preference Optimization)는 chosen/rejected 답변 쌍을 이용해 LLM을 선호도에 맞게 미세조정하는 방법이다.
2026년 기준 LLM post-training의 핵심은 DPO 같은 알고리즘 하나를 고르는 데 있지 않다. 먼저 좋은 cold-start SFT로 행동과 말투의 기준선을 잡고, verifiable reward가 있는 영역은 GRPO 계열 RL로 다룬다.
현재 연구되고 있는 LLM 고도화 방향 특정 부분을 개선하면 우리만의 세일즈 포인트를 찾아볼 수 있을지…? 개선 포인트에서 현실성이 떨어지는 부분은 제외함 할루시네이션 감소 창의적인 task 에서는 환각은 일종의 feature 역할을 한다.
한계점 제한된 범위: 인코더 - 디코더 모델이나 seq2seq task 한정으로 연구가 진행되었고, GPT-3 와 같은 NLG 모델은 덜 연구되었음 메모리 한계: 많은 파라매터 개수가 필요하다.
배경 Qwen2.5 의 72b 급 대용량 모델을 학습하는 방법에 대해 조사해보자.
단순한 next token prediction loss 와 같은 loss function 은 좋은 언어 모델을 학습하는데 제한적이다. 이를 보완하기 위해서 사용자의 선호도를 직접 모델에 알려줄 수 있는 강화 학습 방식을 적용할 수 있다.
Let’s reproduce GPT-2 (124M) - YouTube Questions dropout 은 왜 softmax 이후에 적용하는 걸까? GPT 모델에서 cheating 방지를 위해 masking 하는 방식은 아직도 이해를 잘 못하겠음.
한줄 요약 DAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization)는 GRPO를 그대로 돌렸을 때 실제로 터지는 문제 네 가지를 각각 고친 RL 레시피다.
왜 전통적인 분류 모델을 사용하지 않고, LLM 을 통해 분류 문제를 해결하려 할까? LLM 만의 장점 학습 데이터셋이 많지 않은 경우, 빅 모델이 성능 면에서 더 효율적일 수 있다. 클래스가 자주 바뀌는 경우, LLM 은 자주 재학습시킬 필요가 없다.
Prompt 종류 Instruction Prompt Extract the name of the author from the quotation below.