Downsampling
데이터를 줄여서 샘플링하는 방법이다.
B) Apply with cross-validation
K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.
1 min read
데이터를 줄여서 샘플링하는 방법이다.
K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.
Sampling 데이터가 불균형한 분포를 가지는 경우, 모델의 학습이 제대로 이루어지지 않을 확률이 높습니다. 이 문제를 해결하기 위해 나온 개념이 언더 섬플링 (Undersampling) 과 오버 샘플링 (Oversampling) 입니다.
Cross-validation cross-validation 은 데이터를 나눠서 모델을 검증하는 방식을 의미한다. B) 교차 검증을 사용해야 하는 이유? 고정된 training set 에 대한 overfitting 현상을 막기 위해서 사용한다.
Overfitting 이란 모델이 특정 데이터 셋에 과도하게 적합된 것을 의미 B) Overfitting 문제를 완화하기 위한 접근들 더 많은 training data Data Augmentation regularization dropout Early Stopping C) Related D) References.
Clustering B) 다차원에서의 클러스터링 다차원 (high dimensional) 데이터를 이용한 클러스터링은 의미없을 수 있다 (may be meaningless).
Lazy Learning Training data 전체를 메모리상에 보관하면서 test 데이터가 새로 들어왔을 때 바로 학습하는 방법 A.1) 장점 추가적인 학습 시간 없이, 곧바로 학습 결과를 얻을 수 있다.
Machine Learning deep Learning 과 달리 structured data 가 필요한 학습 모델 2.
Transductive 학습의 목적이 parameters 가 아닌 학습을 의미한다.즉, 모델을 구축하지 않아서 새로운 데이터가 입력으로 들어왔을 때, 알고리즘을 처음부터 재학습할 필요성이 존재한다.
Data Augmentation overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.
Knowledge Distillation 모델 경량화를 위해 쓰이는 방식 2. Related 3. References Hinton et al.,2015 .
Ensemble 기계 학습 모델의 예측 결과를 서로 합치는 방식을 의미 추천시스템의 경우 MAB 를 통해서도 추천 결과를 앙상블 할 수 있다.