1 min read
.... 예를 들어, c, a, r 에서 ca 가 가장 많이 나온다고하면, c, a, r, ca 로 총 4 개 크기의 단어집이 구성된다. 이 작업을 특정 크기가 될때까지 반복한다. 이후 out-of-vocabulary 단어가 등장하는 경우에도, 가장 작은 단위로 나눠서 빈도수가 높은 단어는 매칭을 시키고 나머지는 unknown [UNK] 토큰을 붙여준다. 예를 들어, card 를 토크나이징하면,...
OOV 단어에 대한 임베딩을 생성할 수 있다. 발생 빈도수가 낮은 단어에 대해서도 보다 좋은 단어 임베딩을 생성할 수 있다.
bostoₖeₙ: 문장의 시작을 알리는 토큰 eostoₖeₙ: 문장의 끝을 알리는 토큰 unktoₖeₙ: out-of-vocabulary 토큰을 나타내는 특수 토큰 septoₖeₙ: 같은 입력 내 서로 다른 두 문장의 분리를 나타내는 토큰 padtoₖeₙ: batch 목적으로 array 들의 구분을 나타내는 토큰 c...
Tokenization 요약 huggingface: 토크나이저 요약 사전 학습된 모델은 훈련 데이터와 동일한 규칙으로 토큰화된 입력을 제공해야만 제대로 작동합니다.
Byte-Pair Encoding Tokenization 단어집에 가장 작은 단위의 문자를 넣고, 사용자가 설정한 크기가 될때까지 가장 빈도수가 높은 문자를 조합하여 단어집에 계속 넣는다. 즉, vocabulary size 를 hyperparameter 로 입력받는다.
N-gram B) Related C) References.
FastText Word2Vec 과 비슷한 임베딩 모델이다. 주요 차이점은 FastText 의 경우 문자 레벨에서 동작하고, Word2Vec 은 단어 레벨에서 동작한다는 점이다.
NLP B) Related C) References.
Megatron-LM B) Related C) References.
GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
Daumkakao Hangul Analyzer B) Related C) References.
Hallucination B) Related C) References.
Polyglot 한국어 모델 2. Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그 3. Related 4. References.