Paper List
M-REWARDBENCH: Evaluating Reward Models in Multilingual Settings
- RewardBench 데이터셋을 번역하여 기존 모델들을 다시 테스트함.
- 언어에 따라 모델 성능 차이가 존재함.
- 모든 모델이 영어 벤치마크에서의 성능에 비해, 다국어 벤치마크에서는 낮은 성과를 보임.
1 min read
M-REWARDBENCH: Evaluating Reward Models in Multilingual Settings
reward model이 결국 “두 답변 중 어느 쪽이 더 좋은가”를 구분하려는 것이라면, 굳이 reward model을 따로 만들지 말고 그 비교 목표를 language model loss 안에 직접 넣으면...
...calling, 한국어만 쓰기, 금칙어 회피처럼 reward를 비교적 안정적으로 만들 수 있는 부분은 RL로 따로 분리해볼 수 있다. F.4) Reward를 쓴다면 이렇게 쪼갠다 하나의 reward model에게 “자연스러운가?”를 한 번에 판단하게 하면 불안정하다. 차라리 reward를 여러 축으로 나누는 편이 낫다.
DPO를 한 문장으로 잡기 DPO(Direct Preference Optimization)는 chosen/rejected 답변 쌍을 이용해 LLM을 선호도에 맞게 미세조정하는 방법이다.
자연스러운 한국어를 위한 LLM Post-Training 2026년 기준 LLM post-training의 핵심은 DPO 같은 알고리즘 하나를 고르는 데 있지 않다.
Open Challenges in LLM Research 현재 연구되고 있는 LLM 고도화 방향 특정 부분을 개선하면 우리만의 세일즈 포인트를 찾아볼 수 있을지…? 개선 포인트에서 현실성이 떨어지는 부분은 제외함 A.1) 할루시네이션 감소 창의적인 task 에서는 환각은 일종의 feature 역할을 한다.
MoE B) 한계점 제한된 범위: 인코더 - 디코더 모델이나 seq2seq task 한정으로 연구가 진행되었고, GPT-3 와 같은 NLG 모델은 덜 연구되었음 메모리 한계: 많은 파라매터 개수가 필요하다.
배경 Qwen2.5 의 72b 급 대용량 모델을 학습하는 방법에 대해 조사해보자.
GPT-2 Let’s reproduce GPT-2 (124M) - YouTube B) Questions dropout 은 왜 softmax 이후에 적용하는 걸까? GPT 모델에서 cheating 방지를 위해 masking 하는 방식은 아직도 이해를 잘 못하겠음.
llm as classifier 왜 전통적인 분류 모델을 사용하지 않고, LLM 을 통해 분류 문제를 해결하려 할까? B) LLM 만의 장점 학습 데이터셋이 많지 않은 경우, 빅 모델이 성능 면에서 더 효율적일 수 있다.
MT-bench MT-bench LLM 모델을 평가하기 위한 multi-turn open-ended 질문 모음 To automate the evaluation process, we prompt strong LLMs like GPT-4 to act as judges and assess the quality of...
Prompt 종류 A.1) Instruction Prompt Extract the name of the author from the quotation below.
Vicuna ShareGPT 에서 모은 약 125K 개의 사용자 대화 데이터를 기반으로 파인튜닝한 Llama 기반 모델 B) Training B.1) 데이터셋 ShareGPT 데이터셋은 공개하지 않음 B.1.1) Preprocessing To ensure data quality, we convert the...