- Deployment 전에 가능한 데이터로 오직 한번만 학습하는 방식
1 min read
POI 추천 모델들의 대부분이 Offline Learning 기반이다. 매일 사용자가 수많은 데이터를 생성하기 때문에, 이러한 전략은 optimal 하지 않다.
Offline Evaluation 현실에 직접 적용하는 대신 정해진 데이터셋에서 성능 평가를 하는 것 일반적으로 사용자들이 관측하지 않은 콘텐츠에 대한 반응을 유추하여 평가하나, 실제 데이터를 사용하지 않았기 때문에 정확한 성능 비교가 어렵다.
Eager Learning 일반적인 학습 과정으로, training 데이터로 일정 기간 학습시킨 후, 학습시킨 모델을 기반으로 테스트 데이터를 적용하는 방법 training 데이터는 학습 시에만 메모리에 보관되며 학습 이후에는 training 데이터를 메모리에서 제거한다.
Lazy Learning Training data 전체를 메모리상에 보관하면서 test 데이터가 새로 들어왔을 때 바로 학습하는 방법 A.1) 장점 추가적인 학습 시간 없이, 곧바로 학습 결과를 얻을 수 있다.
Downsampling 데이터를 줄여서 샘플링하는 방법이다.
Machine Learning deep Learning 과 달리 structured data 가 필요한 학습 모델 2.
Transductive 학습의 목적이 parameters 가 아닌 학습을 의미한다.즉, 모델을 구축하지 않아서 새로운 데이터가 입력으로 들어왔을 때, 알고리즘을 처음부터 재학습할 필요성이 존재한다.
Regression 회귀는 예측하는 함수를 만드는 것이다. 예측하려는 데이터의 종류가 numerical 또는 categorical data 에 따라서 사용하는 알고리즘이 달라진다.
Data Bias Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다. 아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.
Leave-one-out cross-validation 방법 중 하나로, NN(샘플 수 만큼) 번의 model 을 만들고, 각 모델을 만들 때에 하나의 샘플만 제외하면서 그 제외한 샘플로 test set performance 를 계산하여 N 개의 performance 에 대해서 평균을 내는 방법입니다.
Covariate Shift covariate shift 는 ML 에서 종종 마주치는 특수한 형태의 데이터 변화를 의미한다. Related References www.seldon.io/what-is-covariate-shift .