Synthetic Minority Over-sampling Technique
SMOTE 는 낮은 비율 클래스 데이터들의 최근접 이웃을 이용하여 새로운 데이터를 생성합니다.
완전히 똑같은 특성을 가진 데이터를 복사하는 것은 의미가 없기 때문에, 아래 그림과 같이 근접해 있는 데이터들과 일정한 거리를 떨어진 위치에 데이터를 생성하는 것입니다.

1 min read
...균형을 해소하는 아이디어 입니다. 이 방법이 가능하다면 언더 샘플링보다 훨씬 좋은 해결책이 될 수 있을것 같은데, 문제는 ” 어떻게 “ 없던 데이터를 생성하느냐 입니다. 오버 샘플링 방식으로 SMOTE 가 있다. A.2.1) 주의점 오버 샘플링을 고려할때 주의해야 할 것이 있습니다. 바로 Recall 과 precision 이다. positive 데이터가 negative 데이터보다 훨씬 부족...
Sampling 데이터가 불균형한 분포를 가지는 경우, 모델의 학습이 제대로 이루어지지 않을 확률이 높습니다. 이 문제를 해결하기 위해 나온 개념이 언더 섬플링 (Undersampling) 과 오버 샘플링 (Oversampling) 입니다.
Stratified Sampling 모집단을 계층 구조로 나눠서 각 계층마다 샘플링을 진행하는 방법 1.1. 예 미국 인구 투표율을 조사할 때 흑인, 백인, 그리고 아시아인으로 나눈 뒤 투표 여부를 샘플링한다. 2. Related Stratified k-fold 3.
Rejection Sampling Rejection sampling 은 어떤 확률 밀도 함수 p(x) 에 대해, 다음과 같은 조건에서 효율적으로 sampling 을 수행할 수 있는 방법이다.
Inverse Transform Sampling Inverse transform sampling 는 어떤 확률 분포에서 해당 분포의 inverse cumulative distribution (또는 quantile function) F^{-1}(x) 를 활용해서 임의의 값을 생성하는 방법을 의미한다.
Importance Sampling Importance sampling 은 효율적으로 기댓값을 추정하기 위해 고안된 방법이다. Why We Need IS? Rejection sampling 는 rejection 이 많을 경우 계산 비용이 많이드는 단점이 있다.
Monte Carlo Method 몬테카를로 방법이란 랜덤 표본을 뽑아 함수의 값을 확률적으로 계산하는 알고리즘 계산하려는 값이 닫힌 형식 (closed form) 으로 표현되지 않거나 복잡한 경우에 그 값을 근사적으로 계산하려고 할 때 쓰임 A.1) 예시 특정 확률 분포를 따르는 f(x) 함수의...
Sampling Distribution 표본 분포란, 임의의 샘플링 결과들에 의해 구해진 확률 분포를 의미한다.
Gibbs Sampling Gibbs sampling 은 특정 multivariate 확률 분포에서 approximated 된 일련의 관찰값 (observations) 들을 획득하기 위한 MCMC 알고리즘으로, 직접적인 샘플링이 어려울 때 사용한다.
Stratified K-fold cross-validation 방식 중 하나 각 fold 를 가져올때마다 타겟 class 의 구성 비율이 동일하도록 가져온다. 2. Related 3. References 3.1.
Mode The mode (statistics) is the value that appears most often in a set of data values.