Zzong's Notes

Home

❯

machine_learning

❯

NLP

❯

Pororo

Pororo

2026년 6월 14일1 min read

Pororo

카카오 브레인에서 만든 자연어 처리 모델

SentenceFactory

  • sentence transformers 라이브러리 사용
  • 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임
  • brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음

Related

References

  • GitHub - kakaobrain/pororo: PORORO: Platform Of neuRal mOdels for natuRal language prOcessing

함께 보면 좋은 글

RoBERTa

Roberta Pretrained model on English language using a masked language modeling (MLM) objective. B) Vs.

sentence transformers

Sentence Transformers Code Reivew Encoding 문장이 배치로 주어지면, 문장 길이가 가장 짧은 순서대로 문장을 정렬해서 배치로 가져온다.

polyglot

Polyglot 한국어 모델 2. Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그 3. Related 4. References.

KorQuAD

KorQuAD The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading...

Transformer(huggingface)

Transformer(huggingface) B) Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..?...

Electra

Electra ICLR 2020 에서 구글 리서치 팀은 새로운 pre-training 기법을 적용한 language model, ELECTRA (Efficiently Learning an Encoder that Classifies Token Replacements Accurately) 를 발표 기존 BERT 에서...

BART

BART란 BERT와 GPT의 구조를 결합한 모델로, 특히 summarization(요약) 작업에서 우수한 성능을 보인 것으로 알려져 있습니다. MASS와 달리, BART는 Encoder에 다양한 Noise를 추가하는 방식으로 더욱 뛰어난 성능을 기록하였습니다.

GloVe

GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...

SentencePiece

SentencePiece BPE 와 unigram language model 을 지원한다. B) 특징 유니크 토큰 개수가 정해져 있다: 8k, 16k, 32k.

Doc2Vec

Doc2Vec 문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.

  • Pororo
  • SentenceFactory
  • Related
  • References