1 min read
차원 축소에 관련된 알고리즘은 autoencoder, machine_learning/Principal Component Analysis 등 다양하게 존재한다. 하지만, t-SNE 는 Transductive 학습 모델이고, 나머지 autoencoder 와 machine_learning/Principal Component Analysis 는 Inductive 학습 모델이라는 특징을 지니고있다...
Inductive Learning 학습의 목적이 최적의 parameters 를 추정하는 학습을 의미한다. 즉, 모델을 구축하기 때문에 새로운 데이터가 입력으로 들어왔을 때, 알고리즘을 처음부터 재시작할 필요성이 없다.
t-SNE t-Stochastic Nearest Embedding 는 vector visualization 을 위하여 자주 이용되는 차원 축소 알고리즘이다.
관측 불가능한 variables 의 집합 (반대: data) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.
Training data 전체를 메모리상에 보관하면서 test 데이터가 새로 들어왔을 때 바로 학습하는 방법 장점 추가적인 학습 시간 없이, 곧바로 학습 결과를 얻을 수 있다.
deep Learning 과 달리 structured data 가 필요한 학습 모델 Machine Learning Model Representation 위 그림의 h 는 가설 (hypothesis) 을 뜻함 h:X\rightarrow Y X 는 입력 데이터 공간 (space), Y 는 출력 데이터 공간.
Semi-supervised learning은 label이 있는 데이터와 label이 없는 데이터를 함께 써서 모델을 학습하는 설정이다. label은 비싸고 unlabeled data는 많은 상황에서 자주 등장한다.
데이터를 줄여서 샘플링하는 방법이다. Apply with cross-validation K-fold validation 을 적용할때 downsampling 을 적용하는 기법은 학습 데이터 (in-fold data) 만 일부 샘플링하여 적용하는 것이다.
정의 metric learning 은 데이터 포인트 간의 거리를 측정하는 방법을 학습하는 기법입니다.
일반적인 학습 과정으로, training 데이터로 일정 기간 학습시킨 후, 학습시킨 모델을 기반으로 테스트 데이터를 적용하는 방법 training 데이터는 학습 시에만 메모리에 보관되며 학습 이후에는 training 데이터를 메모리에서 제거한다.
covariate shift 는 ML 에서 종종 마주치는 특수한 형태의 데이터 변화를 의미한다. References www.seldon.io/what-is-covariate-shift .