class 분류 문제에서 class 당 instance 수의 균형이 맞지 않는 문제를 말하며, 이를 imbalanced data 라고 한다.
Solutions
가장 먼저 해볼것은 그냥 전체 데이터를 이용해 학습해 보는 것이다. 만약 모델이 잘 동작한다면 문제 없다.
Solutions
- Negative down sampling
1 min read
...하게 치우친 경우에도 해석이 어려워진다. positive 가 100 개 중 2 개뿐이면 예측 하나가 바뀌는 것만으로 TPR 이 50% 움직여서 곡선 자체가 불안정해진다. 이런 class imbalance problem 상황에서는 AUPRC 를 함께 본다. Multi-class 와 Multi-label 원래 AUC 는 이진 분류용 지표라서, class 가 셋 이상이면 이진 문제로 쪼개서 계산...
일반적인 classification 문제: y\in{0,1} (0 은 Negative Class, 1 은 Positive Class) E-mail: 스팸 yes or no? 온라인 거래: 사기 yes or no? Tumor: 양성 or 음성?...
AUC AUC 는 ROC 곡선 아래의 면적이다. ROC 곡선이 임계값을 0 에서 1 까지 훑으면서 그려지는 곡선이므로, 그 아래 면적은 “임계값을 어디에 두든 평균적으로 얼마나 잘 구분하는가” 를 한 숫자로 요약한 값이 된다.
KNN 어떤 문제를 푸냐에 따라 방식이 달라진다: 분류 또는 회귀. For classification: 비교 대상이 되는 데이터 주변에 가장 가까이 존재하는 k 개의 데이터와 비교해 가장 가까운 데이터 종류로 판별한다.
Decision boundary 는 label 값 y 가 0 인지 1 인지 결정하는 영역을 나누는 선이다.
데이터를 줄여서 샘플링하는 방법이다. Apply with cross-validation K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.
데이터가 불균형한 분포를 가지는 경우, 모델의 학습이 제대로 이루어지지 않을 확률이 높습니다. 이 문제를 해결하기 위해 나온 개념이 언더 섬플링 (Undersampling) 과 오버 샘플링 (Oversampling) 입니다.
값이 순서 없는 몇 개의 범주 중 하나인 feature 다. 색상(red/blue), 지역 코드, 사용자 등급 같은 것이 여기 들어간다. 값 사이에 크기 비교가 성립하지 않으므로 숫자로 그냥 바꿔 넣으면 모델이 없는 순서를 학습한다.
Classification with SVM binary classification 의 핵심은 D 차원 공간에 존재하는 example 들을 레이블에 따라 두 파티션으로 나눈다는 것이다. 이때, 공간을 나누는 역할을 hyperplane 이 맡게된다.
Naive Bayes 는 feature 들이 class 조건부로 서로 독립이라고 가정하고 Bayes theorem 으로 class 를 고르는 probabilistic classifier 다.
Negative Sampling 은 skip-gram 모델의 softmax 함수 계산 비용을 절약하기 위해 고안된 Word Embedding 방식이다.