Zzong's Notes

Home

❯

machine_learning

❯

NLP

❯

Tokenizers(huggingface)

Tokenizers(huggingface)

2026년 9월 04일1 min read

References

  • Tokenizers

링크된 언급

1
tokenization

... refactoring 같은 단어는 re, factor, ing 와 같은 subword 로 나눌 수 있습니다. BPE, SentencePiece 등 Special Tokens Tokenizers(huggingface) 에서는 token 들을 종류별로 나눈다.

함께 보면 좋은 글

tokenization

Tokenization 요약 huggingface: 토크나이저 요약 사전 학습된 모델은 훈련 데이터와 동일한 규칙으로 토큰화된 입력을 제공해야만 제대로 작동합니다.

Transformer(huggingface)

Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..? Tranining Model from Scratch This is a good approach to take if you have a lot of data and it is very different from...

SentencePiece

BPE 와 unigram language model 을 지원한다. 특징 유니크 토큰 개수가 정해져 있다: 8k, 16k, 32k. 기존 sub-word 구현체는 입력 문장들이 이미 토크나이징 되어 있다고 가정하는데, 이거는 Raw sentence 로 부터 학습한다.

polyglot

한국어 모델 Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그.

WordPiece

BERT, Electra 에서 사용되어 인기가 많아진 토크나이징 방식. Vs. BPE BPE 와 비슷하지만, 다른점은 symbol pair 를 선택하여 단어집에 넣는 방식에 있다.

korean nlp model

한국어 자연어 처리에 대한 모델을 정리한다. KcELECTRA 공개된 한국어 Transformer 계열 모델들은 대부분 한국어 위키, 뉴스 기사, 책 등 잘 정제된 데이터를 기반으로 학습한 모델입니다.

Pororo

카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 References...

Natural Language Process

Natural Language Processing 사람이 쓰는 말과 글을 컴퓨터가 다루게 만드는 분야다. 번역, 요약, 질의응답, 감성 분석, 개체명 인식처럼 겉보기에 다른 작업들이 모두 여기 들어간다.

GloVe

global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...

Doc2Vec

문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.