Zzong's Notes

Home

❯

machine_learning

❯

K-prototype

K-prototype

2026년 6월 14일1 min read

K-prototype

K-prototype 은 k-means 와 k-mode 를 결합하여 수치적 데이터와 범주적 데이터가 모두 있는 데이터 세트를 처리하는 클러스터링 알고리즘 (clustering)

B) References

  • Detailed EDA | k-prototypes clustering | Kaggle
  • K-Means vs K-Prototype | Kaggle

함께 보면 좋은 글

clustering

Clustering B) 다차원에서의 클러스터링 다차원 (high dimensional) 데이터를 이용한 클러스터링은 의미없을 수 있다 (may be meaningless).

K-means

K-means A.1) 시간 복잡도 O(kNrD) k : 클러스터 개수 (사용자에 의해 정의됨) N : 객체 개수 r: 수렴할때 까지 반복한 iteration 횟수 D : 객체의 차원 수 (window 를 이용한 clustering 의 경우, window 길이) A.2) Optimization Object...

distortion

Distortion Distortion 은 clustering 에서 data point 와 자신이 속한 cluster center 사이의 거리 기반 cost 를 말한다.

k-Nearest Neighbors

KNN 어떤 문제를 푸냐에 따라 방식이 달라진다: 분류 또는 회귀. For classification: 비교 대상이 되는 데이터 주변에 가장 가까이 존재하는 k 개의 데이터와 비교해 가장 가까운 데이터 종류로 판별한다.

Hierarchical Clustering

Hierarchical Clustering 객체 간 pairwise distance matrix 를 이용해서, 비슷한 객체 간 중첩된 계층 그룹을 생성하는 방법 B) Methods 두 가지 방법이 존재한다.

Elbow Method

Elbow Method B) References.

downsampling

Downsampling 데이터를 줄여서 샘플링하는 방법이다.

sampling

Sampling 데이터가 불균형한 분포를 가지는 경우, 모델의 학습이 제대로 이루어지지 않을 확률이 높습니다. 이 문제를 해결하기 위해 나온 개념이 언더 섬플링 (Undersampling) 과 오버 샘플링 (Oversampling) 입니다.

machine learning

Machine Learning deep Learning 과 달리 structured data 가 필요한 학습 모델 2.

Transductive

Transductive 학습의 목적이 parameters 가 아닌 학습을 의미한다.즉, 모델을 구축하지 않아서 새로운 데이터가 입력으로 들어왔을 때, 알고리즘을 처음부터 재학습할 필요성이 존재한다.

  • K-prototype
  • B) References