Overfitting 이란
모델이 특정 데이터 셋에 과도하게 적합된 것을 의미
Overfitting 문제를 완화하기 위한 접근들
- 더 많은 training data
- Data Augmentation
- regularization
- dropout
- Early Stopping
1 min read
모델이 특정 데이터 셋에 과도하게 적합된 것을 의미
평가 AdaBoost 는 잘 동작하지만 왜 잘 동작하는지 설명하기는 어렵다. 일부는 silver bullet 으로 이해하지만, 단순히 overfitting 되었다는 평가도 많다. 특히 데이터의 outlier 가 많은 경우에 overfitting 문제에 더 취약하다. 이런 약점에 대응하기 위해 AdaBoost 대신 GBM 을 사용할 수 있다...
...비슷한 형질을 지닌 데이터만 올바르게 복원할 수 있다. 어떻게 생각하면 autoencoder 의 디코더의 기능이 인코더가 특정 데이터를 인코딩 해 놓은 좌표에만 잘 작동하게끔 오버피팅 (overfitting) 되어 있는 상태라고도 말할 수 있을 것이다.
bagging 은 boosting 에 비해 구조의 단순성 때문에 정확도가 상대적으로 낮은 편이다. variance 를 낮추는 전략으로 인해 overfitting 에 robust 한 편이다.
boosting 방식이 bagging 모델에 비해 overfitting 에 취약하다.
...rap sampling (of training triples) 을 이용한 stochastic gradient descent 기반의 방법 Related Works SVD 를 통한 MF 는 overfitting 에 취약하다는 문제점이 있다. 이를 해결하기 위해 a regularized least-square optimization with case weights (WR-MF) 를 제안한다. 해...
...etwork 왜 단순한 DNN 이 아니라 CNN 이 필요한 것일까? 이미지를 일반적인 fully neural network 로 학습하게 된다면 많은 parameters 를 가져야 하므로 overfitting 위험과 연산량 증가 이슈가 있다. 예시를 들어보면 아래와 같다.
...-validation 방법은 validation data 가 고정되어 있다는 문제가 존재한다. 즉, validation 에 의에 검증된 모델은 해당 validation dataset 에 overfitting 될 가능성이 높다.
overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다. ...
Decision tree 학습자는 데이터를 과도하게 복잡하게 분할(over-complex tree)하여 일반화 성능이 떨어질 수 있습니다. 이러한 현상을 overfitting이라고 합니다.
... centroid update 를 반복하면서 distortion 을 줄인다. cluster 수 K 를 늘리면 distortion 은 보통 감소하지만, 너무 큰 K 는 해석력을 떨어뜨리고 overfitting 에 가까운 clustering 을 만들 수 있다. Related
overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.
Regularization 은 overfitting 문제를 완화하기 위한 방법이다.
Early Stopping 전략이란 무엇인가 Early Stopping 은 overfitting 현상을 완화하는 방법으로, 학습을 하다가 일정 기준에 의해 학습을 중간에 멈추는 방법을 의미한다.
모델이 학습 데이터의 패턴조차 제대로 잡아내지 못하는 상태다. 학습 데이터에서의 오차도 크고, 새로운 데이터에서의 오차도 크다. 반대는 overfitting 으로, 학습 데이터는 거의 완벽하게 맞히지만 새로운 데이터에서 오차가 커지는 상태다.
분류 및 회귀 문제를 위해서, 여러 bootstrapping 샘플을 가지고 독립적인 모델 (e.g. Decision Tree) 들을 여러개 만든 다음 각 모델에서 나온 예측값을 평균 (분류 문제에서는 과반수 투표) 내는 것을 방식을 의미한다.
cross-validation 은 데이터를 나눠서 모델을 검증하는 방식을 의미한다. 교차 검증을 사용해야 하는 이유 고정된 training set 에 대한 overfitting 현상을 막기 위해서 사용한다. 즉, 더 일반화된 모델을 학습하기 위해서 사용한다.
데이터를 줄여서 샘플링하는 방법이다. Apply with cross-validation K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.
데이터가 불균형한 분포를 가지는 경우, 모델의 학습이 제대로 이루어지지 않을 확률이 높습니다. 이 문제를 해결하기 위해 나온 개념이 언더 섬플링 (Undersampling) 과 오버 샘플링 (Oversampling) 입니다.
Distortion 은 clustering 에서 data point 와 자신이 속한 cluster center 사이의 거리 기반 cost 를 말한다. K-means 에서는 각 point 가 배정된 centroid 와 얼마나 떨어져 있는지를 평균적으로 측정한다.
covariate shift 는 ML 에서 종종 마주치는 특수한 형태의 데이터 변화를 의미한다. References www.seldon.io/what-is-covariate-shift .