1 min read
...factoring 같은 단어는 re, factor, ing 와 같은 subword 로 나눌 수 있습니다. BPE, SentencePiece 등 B) Special Tokens Tokenizers(huggingface) 에서는 token 들을 종류별로 나눈다.
Tokenization 요약 huggingface: 토크나이저 요약 사전 학습된 모델은 훈련 데이터와 동일한 규칙으로 토큰화된 입력을 제공해야만 제대로 작동합니다.
Masked Language Modeling.
Transformer(huggingface) B) Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..?...
Korean Nlp Model 한국어 자연어 처리에 대한 모델을 정리한다. KcELECTRA 공개된 한국어 Transformer 계열 모델들은 대부분 한국어 위키, 뉴스 기사, 책 등 잘 정제된 데이터를 기반으로 학습한 모델입니다.
Neural Machine Translation 신경망을 이용한 기계 해석 분야를 의미한다. Related References.
Positional Encoding 포지션 정보를 토큰 벡터에 추가하는 방식을 의미한다. 기존의 attention 방식은 모든 토클에 대해서 병렬적으로 수행될 수 있지만, 각 토큰의 시퀀스 내 순서를 고려하지 않는다.
Self-attention 이란 셀프 어텐션은 transformer 에서 나오는 attention 기법으로, attention 의 입력으로 들어가는 세개의 값 Q, K, V 이 모두 동일하다.
N-gram B) Related C) References.
Named Entity Recognition NER (Named Entity Recognition, 개체명 인식) 은 텍스트에서 의미 있는 개체(entity)를 식별하고 분류하는 NLP 태스크이다.
GPT B) Related C) References.