documents 의 모음을 나타낸다. 여기서 document 는 문장을 의미한다. 즉, 문장들의 모음을 corpus 라 부른다.
Usage in Gensim
Gensim 에서 corpus 는 모델의 학습 데이터로 사용된다.
1 min read
documents 의 모음을 나타낸다. 여기서 document 는 문장을 의미한다. 즉, 문장들의 모음을 corpus 라 부른다.
Gensim 에서 corpus 는 모델의 학습 데이터로 사용된다.
이 확률 벡터는 corpus 내 고유 단어 개수인 n 차원의 벡터이며, 각 단어가 context 에 기반해 선택될 확률을 나타냅니다.
Example: large corpus of English text
여기서 f (wᵢ) 는 각 단어 wᵢ 가 corpus 에서 출현하는 횟수입니다. 즉, 자주 등장하는 단어일수록 확률값이 줄어들게 됩니다. 그리고 t 는 parameter 값으로 10^−5 을 추천합니다.
Gensim 은 문서를 semantic vector 로 효율적으로 표현하기 위한 파이썬 라이브러리이다. Gensim 은 구조화 되어있지 않은 plain text 를 unsupervised learning 알고리즘을 통해 처리한다.
분석을 하는 것에 있어서 큰 도움이 되지 않는 단어들 예) I, my, me, over, 조사, 접미사 NLTK 에서 영어의 불용어 확인하기 from nltk.corpus import stopwords stopwords.words(& 039;english& 039;)[:10] [& 039;i& 039;, &...
STS 는 텍스트가 서로 유사한지를 구하는 task 이다. 저는 어거스트 러쉬라는 영화를 가장 좋아합니다. 제가 제일 재미있게 본 영화는 어거스트 러쉬입니다. 위의 두가지 문장은 다르지만, 유사하다. 이러한 유사도를 판별해 내는 것이 바로 STS 의 목적이다.
Recurrent Neural Networks (RNN) 왜 RNN 을 사용하는가 일반 neural network(DNN) 보다 RNN 을 사용하는 이유는 무엇일까? 그 이유는 DNN 은 RNN 과 달리 parameter sharing 이 가능하지 않기 때문이다.
문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
Natural Language Processing 사람이 쓰는 말과 글을 컴퓨터가 다루게 만드는 분야다. 번역, 요약, 질의응답, 감성 분석, 개체명 인식처럼 겉보기에 다른 작업들이 모두 여기 들어간다.
global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading Comprehension...
카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 References...
연속한 n 개의 단위를 하나로 묶은 것이다. 단위는 문맥에 따라 단어일 수도 문자일 수도 있다.