Corpus
documents 의 모음을 나타낸다. 여기서 document 는 문장을 의미한다. 즉, 문장들의 모음을 corpus 라 부른다.
B) Usage in Gensim
Gensim 에서 corpus 는 모델의 학습 데이터로 사용된다.
1 min read
documents 의 모음을 나타낸다. 여기서 document 는 문장을 의미한다. 즉, 문장들의 모음을 corpus 라 부른다.
Gensim 에서 corpus 는 모델의 학습 데이터로 사용된다.
이 확률 벡터는 corpus 내 고유 단어 개수인 n 차원의 벡터이며, 각 단어가 context 에 기반해 선택될 확률을 나타냅니다.
Example: large corpus of English text
여기서 f (wᵢ) 는 각 단어 wᵢ 가 corpus 에서 출현하는 횟수입니다. 즉, 자주 등장하는 단어일수록 확률값이 줄어들게 됩니다. 그리고 t 는 parameter 값으로 10^−5 을 추천합니다.
Stopword 분석을 하는 것에 있어서 큰 도움이 되지 않는 단어들 예) I, my, me, over, 조사, 접미사 NLTK 에서 영어의 불용어 확인하기 from nltk.corpus import stopwords stopwords.words(& 039;english& 039;)[:10] [& 039;i&...
Gensim Gensim 은 문서를 semantic vector 로 효율적으로 표현하기 위한 파이썬 라이브러리이다. Gensim 은 구조화 되어있지 않은 plain text 를 unsupervised learning 알고리즘을 통해 처리한다.
Semantic Textual Similarity STS 는 텍스트가 서로 유사한지를 구하는 task 이다. 저는 어거스트 러쉬라는 영화를 가장 좋아합니다. 제가 제일 재미있게 본 영화는 어거스트 러쉬입니다. 위의 두가지 문장은 다르지만, 유사하다.
Recurrent Neural Networks (RNN) A.1) 왜 RNN 을 사용하는가? 일반 neural network(DNN) 보다 RNN 을 사용하는 이유는 무엇일까? 그 이유는 DNN 은 RNN 과 달리 parameter sharing 이 가능하지 않기 때문이다.
Doc2Vec 문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...
Tokenizers(huggingface) Related References Tokenizers .
GPT B) Related C) References.
KorQuAD The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading...