SMOTE 는 낮은 비율 클래스 데이터들의 최근접 이웃을 이용하여 새로운 데이터를 생성합니다.
완전히 똑같은 특성을 가진 데이터를 복사하는 것은 의미가 없기 때문에, 아래 그림과 같이 근접해 있는 데이터들과 일정한 거리를 떨어진 위치에 데이터를 생성하는 것입니다.

1 min read
SMOTE 는 낮은 비율 클래스 데이터들의 최근접 이웃을 이용하여 새로운 데이터를 생성합니다.
완전히 똑같은 특성을 가진 데이터를 복사하는 것은 의미가 없기 때문에, 아래 그림과 같이 근접해 있는 데이터들과 일정한 거리를 떨어진 위치에 데이터를 생성하는 것입니다.

...균형을 해소하는 아이디어 입니다. 이 방법이 가능하다면 언더 샘플링보다 훨씬 좋은 해결책이 될 수 있을것 같은데, 문제는 ” 어떻게 “ 없던 데이터를 생성하느냐 입니다. 오버 샘플링 방식으로 SMOTE 가 있다. 주의점 오버 샘플링을 고려할때 주의해야 할 것이 있습니다. 바로 Recall 과 precision 이다. positive 데이터가 negative 데이터보다 훨씬 부족한 데이터로 ...
데이터가 불균형한 분포를 가지는 경우, 모델의 학습이 제대로 이루어지지 않을 확률이 높습니다. 이 문제를 해결하기 위해 나온 개념이 언더 섬플링 (Undersampling) 과 오버 샘플링 (Oversampling) 입니다.
Rejection sampling 은 어떤 확률 밀도 함수 p(x) 에 대해, 다음과 같은 조건에서 효율적으로 sampling 을 수행할 수 있는 방법이다. 주어진 확률 분포 p(x) 의 확률 밀도 함수 (pdf) 를 알고 있어야 한다.
몬테카를로 방법이란 랜덤 표본을 뽑아 함수의 값을 확률적으로 계산하는 알고리즘 계산하려는 값이 닫힌 형식 (closed form) 으로 표현되지 않거나 복잡한 경우에 그 값을 근사적으로 계산하려고 할 때 쓰임 예시 특정 확률 분포를 따르는 f(x) 함수의 expectation 은 monte carlo...
한줄 요약 Importance sampling 은 뽑기 어려운 분포의 기댓값을, 뽑기 쉬운 분포에서 뽑아서 계산하는 방법이다. 어떤 확률 분포 p 에서 f(x) 의 평균이 궁금한데 p 에서 sample 을 만들기 어려운 경우가 있다.
관측 불가능한 variables 의 집합 (반대: data) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.
MCMC(Markov Chains Monte Carlo) algorithms 은 주어진 분포에 대한 sampling 또는 분포의 parameter estimation 에 사용되는 알고리즘이다.
linear model 을 학습하는 방법 중 하나로, 계수 추정에 제약을 줘서 계수가 0 으로 shrink 하도록 유도하는 학습 방법이다. II. Related ridge regression lasso regression .
데이터의 차원이 증가할수록, 해당 공간의 크기 (부피) 가 기하급수적으로 증가하기 때문에, 동일한 개수의 데이터의 밀도는 차원이 증가할수록, 급속도로 희박해진다.
outlier is a point for which y i is far from the value predicted by the model.
데이터를 줄여서 샘플링하는 방법이다. Apply with cross-validation K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.