Knowledge Distillation
모델 경량화를 위해 쓰이는 방식

2. Related
3. References
- Hinton et al.,2015
1 min read
D) Pruning 및 Knowledge Distillation 을 통한 압축 기법 Compact Language Models via Pruning and Knowledge Distillation 에서 수행된 광범위한 ablation 연구를...
한줄 요약 GKD(Generalized Knowledge Distillation, Google DeepMind 2023)는 autoregressive LM을 위한 지식 증류 기법으로, 고정된 데이터셋이 아니라 학생이 직접 생성한 문장 위에서 교사의 토큰별 ...
Ablation Study 보통 모델이나 알고리즘의 “feature”들을 제거해 나가면서 그 행위가 성능에 얼마나 영향을 미치는지를 확인해보는 것 다른 말로 하면, 제안한 요소가 모델에 어떠한 영향을 미치는지 확인하고 싶을 때, 이 요소를 포함한 모델과 포함하지 않은 모델을 비교하는 것 2.
Machine Learning deep Learning 과 달리 structured data 가 필요한 학습 모델 2.
Downsampling 데이터를 줄여서 샘플링하는 방법이다.
Overfitting 이란 모델이 특정 데이터 셋에 과도하게 적합된 것을 의미 B) Overfitting 문제를 완화하기 위한 접근들 더 많은 training data Data Augmentation regularization dropout Early Stopping C) Related D) References.
Clustering B) 다차원에서의 클러스터링 다차원 (high dimensional) 데이터를 이용한 클러스터링은 의미없을 수 있다 (may be meaningless).
Label Smoothing 라벨 스무딩은 Hard label(One-hot encoded vector 로 정답 인덱스는 1, 나머지는 0 으로 구성) 을 Soft label(라벨이 0 과 1 사이의 값으로 구성) 로 스무딩하는 것을 뜻한다.
Covariate Shift covariate shift 는 ML 에서 종종 마주치는 특수한 형태의 데이터 변화를 의미한다. Related References www.seldon.io/what-is-covariate-shift .
Lazy Learning Training data 전체를 메모리상에 보관하면서 test 데이터가 새로 들어왔을 때 바로 학습하는 방법 A.1) 장점 추가적인 학습 시간 없이, 곧바로 학습 결과를 얻을 수 있다.
Eager Learning 일반적인 학습 과정으로, training 데이터로 일정 기간 학습시킨 후, 학습시킨 모델을 기반으로 테스트 데이터를 적용하는 방법 training 데이터는 학습 시에만 메모리에 보관되며 학습 이후에는 training 데이터를 메모리에서 제거한다.
Multi-task Learning Related References.