1 min read
...다. 주요 차이점은 FastText 의 경우 문자 레벨에서 동작하고, Word2Vec 은 단어 레벨에서 동작한다는 점이다. 즉, skip-gram 구조를 가져가면서 학습할때 사용하는 데이터가 n-gram 단위로 나눠진 문자가 되는 것이다. B) 문자 N-gram 문자 n-gram 이란, 주어진 문자를 크기가 n 인 윈도우만큼 잘라내었을 때 확인할 수 있는 문자들의 집합을 의미한다. B.1) ...
FastText Word2Vec 과 비슷한 임베딩 모델이다. 주요 차이점은 FastText 의 경우 문자 레벨에서 동작하고, Word2Vec 은 단어 레벨에서 동작한다는 점이다.
Polyglot 한국어 모델 2. Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그 3. Related 4. References.
GPT B) Related C) References.
NLP B) Related C) References.
GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
Daumkakao Hangul Analyzer B) Related C) References.
Transformer(huggingface) B) Pipeline AutoModelForSequenceClassification 은 뭐하는 거지..?...
Doc2Vec 문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
Skip Gram Skip Gram 은 중심 단어를 통해 주변단어를 예측하는 Word Embedding 모델이다.
Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...