- 보통 모델이나 알고리즘의 “feature”들을 제거해 나가면서 그 행위가 성능에 얼마나 영향을 미치는지를 확인해보는 것
- 다른 말로 하면, 제안한 요소가 모델에 어떠한 영향을 미치는지 확인하고 싶을 때, 이 요소를 포함한 모델과 포함하지 않은 모델을 비교하는 것
1 min read
현실에 직접 적용하는 대신 정해진 데이터셋에서 성능 평가를 하는 것 일반적으로 사용자들이 관측하지 않은 콘텐츠에 대한 반응을 유추하여 평가하나, 실제 데이터를 사용하지 않았기 때문에 정확한 성능 비교가 어렵다.
cross-validation 방법 중 하나로, NN(샘플 수 만큼) 번의 model 을 만들고, 각 모델을 만들 때에 하나의 샘플만 제외하면서 그 제외한 샘플로 test set performance 를 계산하여 N 개의 performance 에 대해서 평균을 내는 방법입니다.
학습에 사용되지 않은 데이터를 이용해서 예측을 수행하는 방식을 의미한다. fold 는 k-fold cross-validation 의 fold 로, 데이터를 셔플링한 뒤에 균일하게 나눠진 데이터 구간을 fold 로 정해서 사용한다.
cross-validation 은 데이터를 나눠서 모델을 검증하는 방식을 의미한다. 교차 검증을 사용해야 하는 이유 고정된 training set 에 대한 overfitting 현상을 막기 위해서 사용한다. 즉, 더 일반화된 모델을 학습하기 위해서 사용한다.
Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.
Overfitting 이란 모델이 특정 데이터 셋에 과도하게 적합된 것을 의미 Overfitting 문제를 완화하기 위한 접근들 더 많은 training data Data Augmentation regularization dropout Early Stopping .
Filtering Method 통계적 기법이나 알고리즘을 이용하여 feature 간 상관 관계를 계산함 t-test \chi^2-test information gain information value Wrapper Method Forward Greedy Backward Greedy Genetic Search...
데이터를 줄여서 샘플링하는 방법이다. Apply with cross-validation K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.
deep Learning 과 달리 structured data 가 필요한 학습 모델 Machine Learning Model Representation 위 그림의 h 는 가설 (hypothesis) 을 뜻함 h:X\rightarrow Y X 는 입력 데이터 공간 (space), Y 는 출력 데이터 공간.
라벨 스무딩은 Hard label(One-hot encoded vector 로 정답 인덱스는 1, 나머지는 0 으로 구성) 을 Soft label(라벨이 0 과 1 사이의 값으로 구성) 로 스무딩하는 것을 뜻한다.