- clustering
- anomaly detection
- One-class support vector machine
- Isolation Forest
- dimensionality reduction
- Association rule learning
1 min read
...ned) 언어 모델이다. BERT is designed to pre-train deep bidirectional representations from unlabeled text(unsupervised learning) by jointly conditioning on both left and right context in all layers. 기존 방식들은 fine-tuning 을 잘 하지 ...
Gensim 은 문서를 semantic vector 로 효율적으로 표현하기 위한 파이썬 라이브러리이다. Gensim 은 구조화 되어있지 않은 plain text 를 unsupervised learning 알고리즘을 통해 처리한다. Gensim 에서 지원하는 비지도 학습 알고리즘은 Word2Vec, FastText, LDA, LSA 등 이 있다.
...도학습처럼 훈련하는 방식이다. 입력의 일부를 감추거나 변형해 놓고 원래 모습을 맞히게 하면, 정답은 원본에 이미 들어 있으므로 라벨링 비용이 들지 않는다. 라벨이 없다는 점에서 unsupervised learning 에 속하지만, 실제 학습 루프는 손실 함수와 정답이 있는 지도학습과 똑같다. 그래서 따로 이름을 붙여 부른다. 정답을 만드는 방법 가리고 복원하기 — masked languag...
unsupervised learning
학습 방식 Span corruption task 를 통해 unsupervised learning (MLM) 만 적용했다고 한다.
Tags unsupervised learning k-Nearest Neighbors linear regression logistic regression support vector machine Decision Tree and random forest .
t-SNE t-Stochastic Nearest Embedding 는 vector visualization 을 위하여 자주 이용되는 차원 축소 알고리즘이다.
PCA N 개의 i.i.d. 를 만족하는 데이터 포인트들 \mathbf{X}=\left[\mathbf{x} {1},\ldots,\mathbf{x} {N}\right]^{T} 이 존재하고, 각 \mathbf{x} 는 D 차원 벡터라고 하자.
Problem Statement of the Anomaly Detection \begin{aligned} &\text { Dataset: }\left\{x^{(1)}, x^{(2)}, \ldots, x^{(m)}\right\}\\ &\text { Is } x {\text {test}} \ \text...
Self-supervised Learning 사람이 붙인 라벨 없이, 데이터 자체에서 정답을 만들어 지도학습처럼 훈련하는 방식이다. 입력의 일부를 감추거나 변형해 놓고 원래 모습을 맞히게 하면, 정답은 원본에 이미 들어 있으므로 라벨링 비용이 들지 않는다.
DBSCAN은 density 기반 clustering 알고리즘이다. 가까운 이웃이 충분히 많은 point를 core point로 보고, core point들이 이어진 dense region을 cluster로 만든다.
Classification with SVM binary classification 의 핵심은 D 차원 공간에 존재하는 example 들을 레이블에 따라 두 파티션으로 나눈다는 것이다. 이때, 공간을 나누는 역할을 hyperplane 이 맡게된다.
Gensim 은 문서를 semantic vector 로 효율적으로 표현하기 위한 파이썬 라이브러리이다. Gensim 은 구조화 되어있지 않은 plain text 를 unsupervised learning 알고리즘을 통해 처리한다.
데이터의 차원수를 줄이는 방법 Lesson Learned 가장 보편적인 방식은 PCA, UMAP, t-SNE 가 있다. 선형 변환 방식인 PCA 은 비선형 변환 방식인 UMAP 또는 t-SNE 와 비교하진 않고, 서로 조합하면서 사용하는 것 같다.
시간 복잡도 O(kNrD) k : 클러스터 개수 (사용자에 의해 정의됨) N : 객체 개수 r: 수렴할때 까지 반복한 iteration 횟수 D : 객체의 차원 수 (window 를 이용한 clustering 의 경우, window 길이) Optimization Object k-means clustering 도...