Elbow Method

1 min read
K-means silhouette score Elbow Method
Choosing the Number of Clusters: Elbow Method B.2) K-means++ center 초기값 선택 알고리즘이다.
K-means A.1) 시간 복잡도 O(kNrD) k : 클러스터 개수 (사용자에 의해 정의됨) N : 객체 개수 r: 수렴할때 까지 반복한 iteration 횟수 D : 객체의 차원 수 (window 를 이용한 clustering 의 경우, window 길이) A.2) Optimization Object...
Distortion Distortion 은 clustering 에서 data point 와 자신이 속한 cluster center 사이의 거리 기반 cost 를 말한다.
Clustering B) 다차원에서의 클러스터링 다차원 (high dimensional) 데이터를 이용한 클러스터링은 의미없을 수 있다 (may be meaningless).
K-prototype K-prototype 은 k-means 와 k-mode 를 결합하여 수치적 데이터와 범주적 데이터가 모두 있는 데이터 세트를 처리하는 클러스터링 알고리즘 (clustering) B) References Detailed EDA | k-prototypes clustering | Kaggle...
Hierarchical Clustering 객체 간 pairwise distance matrix 를 이용해서, 비슷한 객체 간 중첩된 계층 그룹을 생성하는 방법 B) Methods 두 가지 방법이 존재한다.
Silhouette Score clustering 적용 후, 데이터가 얼마나 잘 분류되었는지 수치적으로 확인할 수 있는 값 {\displaystyle s(i)={\frac{b(i)-a(i)}{\max\{a(i),b(i)\}}}} -1 부터 1 의 값을 가지며, 높을수록 데이터 (object) 가 클러스터에 잘...
KNN 어떤 문제를 푸냐에 따라 방식이 달라진다: 분류 또는 회귀. For classification: 비교 대상이 되는 데이터 주변에 가장 가까이 존재하는 k 개의 데이터와 비교해 가장 가까운 데이터 종류로 판별한다.
t-SNE t-Stochastic Nearest Embedding 는 vector visualization 을 위하여 자주 이용되는 차원 축소 알고리즘이다.
Deep Learning Related References.
Probability Calibration B) Related C) References.