Zzong's Notes

Home

❯

machine_learning

❯

NLP

❯

polyglot

polyglot

2026년 6월 14일1 min read

Polyglot

한국어 모델

2. Eos Token 이슈

한글 LLM 맛보기 : 네이버 블로그

3. Related

4. References


함께 보면 좋은 글

Pororo

Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...

GPT

GPT B) Related C) References.

Prompt 종류

Prompt 종류 A.1) Instruction Prompt Extract the name of the author from the quotation below.

n-gram

N-gram B) Related C) References.

KorQuAD

KorQuAD The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading...

GloVe

GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...

FastChat

FastChat LLM 파인 튜닝 용 라이브러리 B) Arguments Description tf32 C) Related D) References.

Transformer(huggingface)

Transformer(huggingface) B) Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..?...

tokenization

Tokenization 요약 huggingface: 토크나이저 요약 사전 학습된 모델은 훈련 데이터와 동일한 규칙으로 토큰화된 입력을 제공해야만 제대로 작동합니다.

SentencePiece

SentencePiece BPE 와 unigram language model 을 지원한다. B) 특징 유니크 토큰 개수가 정해져 있다: 8k, 16k, 32k.

  • Polyglot
  • 2. Eos Token 이슈
  • 3. Related
  • 4. References