Zzong's Notes

Home

❯

machine_learning

❯

NLP

❯

GloVe

GloVe

2026년 6월 14일1 min read

GloVe

global vectors for word representation

minimizei=1∑V​j=1∑V​f(Xij​)(θiT​ej​+bi​+bj′​−logXij​)2
  • Xij​: the number of times j (target) appears in the context of i (context).
  • f(Xij​): weight function

B) Related

C) References

  • 09-05) 글로브(GloVe) - 딥 러닝을 이용한 자연어 처리 입문
    • 설명이 썩 맘에드는 편은 아니다. 식 유도가 친절한 편이다.
  • GloVe: Global Vectors for Word Representation

링크된 언급

1
Word Embedding

skip-gram CBOW GloVe negative sampling

함께 보면 좋은 글

Word Embedding

Word Embedding 각 단어에 대한 n 차원 feature 를 만들고 적절한 값을 부여하는 방식을 의미한다. A.1) 예시 One Hot Encoding 을 통해서도 Word Embedding 이 가능하긴 하다.

Doc2Vec

Doc2Vec 문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.

Word2Vec

Word2Vec Word2Vec 은 shallow neural network 를 통해 단어를 저차원 vector space 로 임베딩 하는 모델이다. 모델의 학습 결과로 얻어지는 vector 간 거리가 가깝다는 것은 단어 간 의미가 서로 비슷함을 의미한다.

skip-gram

Skip Gram Skip Gram 은 중심 단어를 통해 주변단어를 예측하는 Word Embedding 모델이다.

bag of words

Bag of Words 단어들의 순서는 전혀 고려하지 않고, 단어들의 출현 빈도 (frequency) 에만 집중하는 텍스트 데이터의 수치화 표현 방법 A.1) 장점 간단하다. A.2) 단점 단어 간 순서의 정보를 잃게 된다.

FastText

FastText Word2Vec 과 비슷한 임베딩 모델이다. 주요 차이점은 FastText 의 경우 문자 레벨에서 동작하고, Word2Vec 은 단어 레벨에서 동작한다는 점이다.

polyglot

Polyglot 한국어 모델 2. Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그 3. Related 4. References.

n-gram

N-gram B) Related C) References.

Transformer(huggingface)

Transformer(huggingface) B) Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..?...

Pororo

Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...

  • GloVe
  • B) Related
  • C) References