Zzong's Notes

Home

❯

machine_learning

❯

overfitting

overfitting

2026년 6월 14일1 min read

Overfitting 이란

모델이 특정 데이터 셋에 과도하게 적합된 것을 의미

B) Overfitting 문제를 완화하기 위한 접근들

  1. 더 많은 training data
  2. Data Augmentation
  3. regularization
  4. dropout
  5. Early Stopping

C) Related

D) References


링크된 언급

10
AdaBoost

C) 평가 AdaBoost 는 잘 동작하지만 왜 잘 동작하는지 설명하기는 어렵다. 일부는 silver bullet 으로 이해하지만, 단순히 overfitting 되었다는 평가도 많다. 특히 데이터의 outlier 가 많은 경우에 overfitting 문제에 더 취약하다. 이런 약점에 대응하기 위해 AdaBoost 대신 GBM 을 사용할 수 있다...

autoencoder

...비슷한 형질을 지닌 데이터만 올바르게 복원할 수 있다. 어떻게 생각하면 autoencoder 의 디코더의 기능이 인코더가 특정 데이터를 인코딩 해 놓은 좌표에만 잘 작동하게끔 오버피팅 (overfitting) 되어 있는 상태라고도 말할 수 있을 것이다.

bagging

bagging 은 boosting 에 비해 구조의 단순성 때문에 정확도가 상대적으로 낮은 편이다. variance 를 낮추는 전략으로 인해 overfitting 에 robust 한 편이다.

boosting

boosting 방식이 bagging 모델에 비해 overfitting 에 취약하다.

BPR - Bayesian Personalized Ranking from Implicit Feedback

... sampling (of training triples) 을 이용한 stochastic gradient descent 기반의 방법 C) Related Works SVD 를 통한 MF 는 overfitting 에 취약하다는 문제점이 있다. 이를 해결하기 위해 a regularized least-square optimization with case weights (WR-MF) 를 제안한다. 해...

Convolution Neural Network

...etwork 왜 단순한 DNN 이 아니라 CNN 이 필요한 것일까? 이미지를 일반적인 fully neural network 로 학습하게 된다면 많은 parameters 를 가져야 하므로 overfitting 위험과 연산량 증가 이슈가 있다. 예시를 들어보면 아래와 같다.

cross-validation

...-validation 방법은 validation data 가 고정되어 있다는 문제가 존재한다. 즉, validation 에 의에 검증된 모델은 해당 validation dataset 에 overfitting 될 가능성이 높다.

Data Augmentation

Data Augmentation overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다. ...

Decision Tree

Decision tree 학습자는 데이터를 과도하게 복잡하게 분할(over-complex tree)하여 일반화 성능이 떨어질 수 있습니다. 이러한 현상을 overfitting이라고 합니다.

distortion

... centroid update 를 반복하면서 distortion 을 줄인다. cluster 수 K 를 늘리면 distortion 은 보통 감소하지만, 너무 큰 K 는 해석력을 떨어뜨리고 overfitting 에 가까운 clustering 을 만들 수 있다. C) Related

함께 보면 좋은 글

Early Stopping

Early Stopping 2. Early Stopping 전략이란 무엇인가? Early Stopping 은 overfitting 현상을 완화하는 방법으로, 학습을 하다가 일정 기준에 의해 학습을 중간에 멈추는 방법을 의미한다.

Data Augmentation

Data Augmentation overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.

regularization

Regularization Regularization 은 overfitting 문제를 완화하기 위한 방법이다.

bagging

Bagging 분류 및 회귀 문제를 위해서, 여러 bootstrapping 샘플을 가지고 독립적인 모델 (e.g. Decision Tree) 들을 여러개 만든 다음 각 모델에서 나온 예측값을 평균 (분류 문제에서는 과반수 투표) 내는 것을 방식을 의미한다.

distortion

Distortion Distortion 은 clustering 에서 data point 와 자신이 속한 cluster center 사이의 거리 기반 cost 를 말한다.

Gradient Boosting Machine

Gradient Boosting Machine Gradient Boosting Algorithm (GBM) 은 regression 또는 classification 을 수행할 수 있는 예측모형이며 예측모형의 ensemble 방법론 중 boosting 계열에 속하는 알고리즘 여러개의 weak models 을 조합해서...

Decision Tree

Decision Tree란 Decision Trees(DT, 의사결정나무)는 비모수(non-parametric)적인 supervised learning 방법으로, 주로 classification과 regression 문제에 사용됩니다.

cross-validation

Cross-validation cross-validation 은 데이터를 나눠서 모델을 검증하는 방식을 의미한다. B) 교차 검증을 사용해야 하는 이유? 고정된 training set 에 대한 overfitting 현상을 막기 위해서 사용한다.

dropout

Dropout Dropout 방식은 neural network 의 overfitting 문제를 완화하기 위해, 사용자 정의된 확률에 기반하여 각 레이어의 일부 노드들을 계산에 포함시키지 않는 방법을 의미한다.

downsampling

Downsampling 데이터를 줄여서 샘플링하는 방법이다.

  • Overfitting 이란
  • B) Overfitting 문제를 완화하기 위한 접근들
  • C) Related
  • D) References