1 min read
N-gram B) Related C) References.
Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...
Polyglot 한국어 모델 2. Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그 3. Related 4. References.
KorQuAD The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading...
Transformer(huggingface) B) Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..?...
LDA LDA(Latent Dirichlet Allocation)는 문서를 여러 latent topic 의 mixture 로 보고, 각 topic 은 word distribution 을 가진다고 가정하는 topic model 이다.
GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
Morphemes 의미를 가지는 언어의 가장 작은 단위를 의미한다. 형태소는 음소 (phonemes) 의 조합을 통해서 만들어진다. 형태소는 단어 (Words) 처럼 보이기는 하지만, 그렇다고 행태소가 곧 단어는 아닙니다.
Doc2Vec 문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
SentencePiece BPE 와 unigram language model 을 지원한다. B) 특징 유니크 토큰 개수가 정해져 있다: 8k, 16k, 32k.