Zzong's Notes

Home

❯

machine_learning

❯

covariate shift

covariate shift

2026년 8월 29일1 min read

covariate shift 는 ML 에서 종종 마주치는 특수한 형태의 데이터 변화를 의미한다.

References

  • https://www.seldon.io/what-is-covariate-shift

함께 보면 좋은 글

machine learning

deep Learning 과 달리 structured data 가 필요한 학습 모델 Machine Learning Model Representation 위 그림의 h 는 가설 (hypothesis) 을 뜻함 h:X\rightarrow Y X 는 입력 데이터 공간 (space), Y 는 출력 데이터 공간.

Data Bias

Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다. 아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.

underfitting

모델이 학습 데이터의 패턴조차 제대로 잡아내지 못하는 상태다. 학습 데이터에서의 오차도 크고, 새로운 데이터에서의 오차도 크다. 반대는 overfitting 으로, 학습 데이터는 거의 완벽하게 맞히지만 새로운 데이터에서 오차가 커지는 상태다.

overfitting

Overfitting 이란 모델이 특정 데이터 셋에 과도하게 적합된 것을 의미 Overfitting 문제를 완화하기 위한 접근들 더 많은 training data Data Augmentation regularization dropout Early Stopping .

Data Augmentation

overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.

downsampling

데이터를 줄여서 샘플링하는 방법이다. Apply with cross-validation K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.

Transductive

학습의 목적이 parameters 가 아닌 학습을 의미한다.즉, 모델을 구축하지 않아서 새로운 데이터가 입력으로 들어왔을 때, 알고리즘을 처음부터 재학습할 필요성이 존재한다. 예) t-SNE 는 고차원 데이터에 대한 최적의 저차원 데이터를 추정한다.

non-stationary

데이터를 만들어내는 확률분포가 시간에 따라 변하는 상황을 말한다. 반대로 분포가 시간이 지나도 그대로면 stationary 다. 머신러닝 모델은 대개 “학습 데이터와 앞으로 들어올 데이터가 같은 분포에서 나온다” 는 가정 위에 서 있다.

manifold

manifold 의 정의 고차원의 데이터를 저차원으로 옮길 때 데이터를 잘 설명하는 집합의 모형 매니폴드 가정 (manifold Hypothesis (assumption) 고차원의 데이터의 밀도는 낮지만, 이들의 집합을 포함하는 저차원의 manifold(subspace) 가 있다는 가정 Natural data...

semi-supervised learning

Semi-supervised learning은 label이 있는 데이터와 label이 없는 데이터를 함께 써서 모델을 학습하는 설정이다. label은 비싸고 unlabeled data는 많은 상황에서 자주 등장한다.