Zzong's Notes

Home

❯

machine_learning

❯

generative_ai

❯

evaluation

❯

MMLU

MMLU


함께 보면 좋은 글

MT-bench

MT-bench MT-bench LLM 모델을 평가하기 위한 multi-turn open-ended 질문 모음 To automate the evaluation process, we prompt strong LLMs like GPT-4 to act as judges and assess the quality of...

ARC

reward model

Paper List M-REWARDBENCH: Evaluating Reward Models in Multilingual Settings RewardBench 데이터셋을 번역하여 기존 모델들을 다시 테스트함. 언어에 따라 모델 성능 차이가 존재함.

Hallucination

Hallucination B) Related C) References.

multi-task learning

Multi-task Learning Related References.

GPT

GPT B) Related C) References.

Prompt Engineering

Prompt Engineering Related References.

masked language modeling

Masked Language Modeling.

llm_as_classifier

llm as classifier 왜 전통적인 분류 모델을 사용하지 않고, LLM 을 통해 분류 문제를 해결하려 할까? B) LLM 만의 장점 학습 데이터셋이 많지 않은 경우, 빅 모델이 성능 면에서 더 효율적일 수 있다.

General Language Understanding Evaluation

General Language Understanding Evaluation NLP 모델에 대한 일반적인 언어의 “이해”를 측정하기 위한 평가 방식으로, 9 개의 Tasks 들에 대한 점수의 평균을 구하는 것으로 모델을 평가한다.