Zzong's Notes

Home

❯

machine_learning

❯

NLP

❯

Pororo

Pororo

2026년 9월 04일1 min read

카카오 브레인에서 만든 자연어 처리 모델

SentenceFactory

  • sentence transformers 라이브러리 사용
  • 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임
  • brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음

References

  • GitHub - kakaobrain/pororo: PORORO: Platform Of neuRal mOdels for natuRal language prOcessing

함께 보면 좋은 글

RoBERTa

Pretrained model on English language using a masked language modeling (MLM) objective. Vs.

sentence transformers

Code Reivew Encoding 문장이 배치로 주어지면, 문장 길이가 가장 짧은 순서대로 문장을 정렬해서 배치로 가져온다.

ALBERT

BERT 모델의 크기는 줄이고 성능은 높임.

korean nlp model

한국어 자연어 처리에 대한 모델을 정리한다. KcELECTRA 공개된 한국어 Transformer 계열 모델들은 대부분 한국어 위키, 뉴스 기사, 책 등 잘 정제된 데이터를 기반으로 학습한 모델입니다.

KorQuAD

The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading Comprehension...

polyglot

한국어 모델 Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그.

Tokenizers(huggingface)

References Tokenizers .

Transformer(huggingface)

Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..? Tranining Model from Scratch This is a good approach to take if you have a lot of data and it is very different from...

Electra

ICLR 2020 에서 구글 리서치 팀은 새로운 pre-training 기법을 적용한 language model, ELECTRA (Efficiently Learning an Encoder that Classifies Token Replacements Accurately) 를 발표 기존 BERT 에서 masked...

BART

BART란 BERT와 GPT의 구조를 결합한 모델로, 특히 summarization(요약) 작업에서 우수한 성능을 보인 것으로 알려져 있습니다. MASS와 달리, BART는 Encoder에 다양한 Noise를 추가하는 방식으로 더욱 뛰어난 성능을 기록하였습니다.

  • SentenceFactory
  • References