BERT 모델의 크기는 줄이고 성능은 높임.

학습 방식
Next Sentence Prediction (NSP) 보다 SOP 방식으로 학습을 진행
Sentence Order Prediction(SOP)
실제로 연속하는 두 문장 (positive example) 과 두 문장의 순서를 앞뒤로 바꾼 것 (negative example) 으로 구성되어 문장의 순서가 옳은지 predict
1 min read
BERT 모델의 크기는 줄이고 성능은 높임.

Next Sentence Prediction (NSP) 보다 SOP 방식으로 학습을 진행
실제로 연속하는 두 문장 (positive example) 과 두 문장의 순서를 앞뒤로 바꾼 것 (negative example) 으로 구성되어 문장의 순서가 옳은지 predict
BERT Google 에서 만든 language representation model. BERT 는 미리 학습된 (pre-trained) 언어 모델이다.
카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 References...
Pretrained model on English language using a masked language modeling (MLM) objective. Vs.
BART란 BERT와 GPT의 구조를 결합한 모델로, 특히 summarization(요약) 작업에서 우수한 성능을 보인 것으로 알려져 있습니다. MASS와 달리, BART는 Encoder에 다양한 Noise를 추가하는 방식으로 더욱 뛰어난 성능을 기록하였습니다.
문장의 일부 토큰을 가린 뒤, 가려진 자리에 원래 무엇이 있었는지 맞히도록 학습시키는 사전학습 방식이다. 정답이 원문 자체에 들어 있으므로 사람이 라벨을 붙일 필요가 없다. self-supervised 학습의 대표적인 형태다.
Tokenizer BERT 에서 사용하는 일반적인 WordPiece 방식을 사용하거나 양방향 WordPiece 방식을 사용하여 실험 그리고 문자 단위인지 sub- 문자 단위인지에 따라서 실험 여기서 문자 단위는 춥다 를 춥 다 로 바꾸고, sub- 문자 단위는 춥 ㅂ다 로 바꾼다.
ICLR 2020 에서 구글 리서치 팀은 새로운 pre-training 기법을 적용한 language model, ELECTRA (Efficiently Learning an Encoder that Classifies Token Replacements Accurately) 를 발표 기존 BERT 에서 masked...
Code Reivew Encoding 문장이 배치로 주어지면, 문장 길이가 가장 짧은 순서대로 문장을 정렬해서 배치로 가져온다.
토큰의 예측 순서를 무작위로 섞은 뒤, 그 순서대로 앞에 놓인 토큰들만 보고 다음 토큰을 맞히게 하는 사전학습 방식이다. XLNet 이 제안했다. 문장 자체를 뒤섞는 것이 아니라 예측 순서 만 뒤섞는다. 각 토큰의 원래 위치 정보는 그대로 유지된다.
BERT, Electra 에서 사용되어 인기가 많아진 토크나이징 방식. Vs. BPE BPE 와 비슷하지만, 다른점은 symbol pair 를 선택하여 단어집에 넣는 방식에 있다.