Zzong's Notes

Home

❯

machine_learning

❯

NLP

❯

Bilingual Evaluation Understudy Score

Bilingual Evaluation Understudy Score

2026년 8월 29일1 min read

BLEU 는 번역에 대한 성능을 측정하는 방법이다. 기계 번역 결과와 사람이 직접 번역한 결과가 얼마나 유사한지 비교하여 그 성능을 측정한다.

특징

  • 언어에 구애받지 않고 사용할 수 있으며, 계산 속도가 빠릅니다.
  • BLEU 는 PPL 과는 달리 높을 수록 성능이 더 좋음을 의미합니다.

References

  • 14-03 BLEU Score(Bilingual Evaluation Understudy Score) - 딥 러닝을 이용한 자연어 처리 입문

함께 보면 좋은 글

General Language Understanding Evaluation

NLP 모델에 대한 일반적인 언어의 “이해”를 측정하기 위한 평가 방식으로, 9 개의 Tasks 들에 대한 점수의 평균을 구하는 것으로 모델을 평가한다. 아래는 GLUE 점수를 구하는 것을 시각화한 것이다.

perplexity

높은 확률은 모델이 새로운 예시에 “ 놀라거나 (surprised)” “ 당황하지 (perplexed)” 않았음을 나타내며 언어의 기본 문법 패턴을 학습했음을 나타냅니다.

Neural machine translation

하나의 신경망이 원문을 받아 번역문을 통째로 내놓도록 학습시키는 기계번역 방식이다. 2014년 무렵부터 이전의 통계 기반 방식을 빠르게 대체했다. 통계 기반 방식(SMT)은 번역을 여러 부품으로 나눠 각각 학습시켰다.

seq2seq

Application of seq2seq Model Translation Image captioning: Example of the Alexnet 일반적인 Language 모델과의 비교 일반적인 language 모델과 달리, 주어진 입력이 zero vector 가 아니라, encoder 의 output...

Beam search

배경 seq2seq 의 decoder 에서 output 을 결정하는 방식은 Recurrent Neural Network 처럼 확률 분포에 기반한 random sampling 을 따를 경우, 결과가 좋지 않을 수 있다.

Pororo

카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 References...

polyglot

한국어 모델 Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그.

GloVe

global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...

Natural Language Process

Natural Language Processing 사람이 쓰는 말과 글을 컴퓨터가 다루게 만드는 분야다. 번역, 요약, 질의응답, 감성 분석, 개체명 인식처럼 겉보기에 다른 작업들이 모두 여기 들어간다.

Doc2Vec

문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.

  • 특징
  • References