Neural Machine Translation
신경망을 이용한 기계 해석 분야를 의미한다.
1 min read
...이징 되어 있다고 가정하는데, 이거는 Raw sentence 로 부터 학습한다. 띄어쓰기가 없는 중국어나 일본어한테 유리한 특징이라고 한다. 입력 텍스트를 유니코드 문자들의 시퀀스로 인식한다. NMT 모델의 정확도 향상에 도움이 되도록 subword regularization 을 적용
SentencePiece BPE 와 unigram language model 을 지원한다. B) 특징 유니크 토큰 개수가 정해져 있다: 8k, 16k, 32k.
Masked Language Modeling.
Named Entity Recognition NER (Named Entity Recognition, 개체명 인식) 은 텍스트에서 의미 있는 개체(entity)를 식별하고 분류하는 NLP 태스크이다.
Tokenizers(huggingface) Related References Tokenizers .
Self-attention 이란 셀프 어텐션은 transformer 에서 나오는 attention 기법으로, attention 의 입력으로 들어가는 세개의 값 Q, K, V 이 모두 동일하다.
Korean Nlp Model 한국어 자연어 처리에 대한 모델을 정리한다. KcELECTRA 공개된 한국어 Transformer 계열 모델들은 대부분 한국어 위키, 뉴스 기사, 책 등 잘 정제된 데이터를 기반으로 학습한 모델입니다.
N-gram B) Related C) References.
General Language Understanding Evaluation NLP 모델에 대한 일반적인 언어의 “이해”를 측정하기 위한 평가 방식으로, 9 개의 Tasks 들에 대한 점수의 평균을 구하는 것으로 모델을 평가한다.
Positional Encoding 포지션 정보를 토큰 벡터에 추가하는 방식을 의미한다. 기존의 attention 방식은 모든 토클에 대해서 병렬적으로 수행될 수 있지만, 각 토큰의 시퀀스 내 순서를 고려하지 않는다.
GPT B) Related C) References.