

MT-bench MT-bench LLM 모델을 평가하기 위한 multi-turn open-ended 질문 모음 To automate the evaluation process, we prompt strong LLMs like GPT-4 to act as judges and assess the quality of...
Paper List M-REWARDBENCH: Evaluating Reward Models in Multilingual Settings RewardBench 데이터셋을 번역하여 기존 모델들을 다시 테스트함. 언어에 따라 모델 성능 차이가 존재함.
Hallucination B) Related C) References.
Multi-task Learning Related References.
GPT B) Related C) References.
Prompt Engineering Related References.
Masked Language Modeling.
llm as classifier 왜 전통적인 분류 모델을 사용하지 않고, LLM 을 통해 분류 문제를 해결하려 할까? B) LLM 만의 장점 학습 데이터셋이 많지 않은 경우, 빅 모델이 성능 면에서 더 효율적일 수 있다.
General Language Understanding Evaluation NLP 모델에 대한 일반적인 언어의 “이해”를 측정하기 위한 평가 방식으로, 9 개의 Tasks 들에 대한 점수의 평균을 구하는 것으로 모델을 평가한다.