References
- A Sub-linear, Massive-scale Look-alike Audience Extension System (yahoo, 2016)
1 min read
information gain information value
Filtering Method 통계적 기법이나 알고리즘을 이용하여 feature 간 상관 관계를 계산함 t-test \chi^2-test information gain information value Wrapper Method Forward Greedy Backward Greedy Genetic Search...
Decision Tree 에서 tree 의 node 를 나눌 때, feature 를 선택하는 기준으로 information gain 을 사용한다.
피셔 정보는 어떤 정보의 양을 측정하는 방법이다. 그 정보란, 랜덤 변수가 가지는 분포의 매개변수에 대해 유추할 수 있는 정보를 말한다.
Permutation Importance 는 feature importance 를 측정하기 위한 방법으로,모델을 학습시킨 뒤 특정 feature 의 데이터를 shuffle 했을 때, 검증 데이터 셋에 대한 예측성능을 확인하고 feature importance 를 계산한다.
새로운 user 에 대해서 rating 을 측정할 필요가 있다.
시간 t 에 대한 RIG 값은 다음과 같다.
서로 다른 성격 (도메인) 을 지닌 feature 를 섞어서 하나의 context 로 표현하는 것 (예시) 어느 사람이 바나나를 샀고, 요리책을 샀다면 믹서기를 살 확률이 높다.
데이터를 정규 분포 에 가깝게 만들어 주는 변환 방법 x>0 에 대하여 box-cox 변환은 다음을 만족하도록 한다.
값이 순서 없는 몇 개의 범주 중 하나인 feature 다. 색상(red/blue), 지역 코드, 사용자 등급 같은 것이 여기 들어간다. 값 사이에 크기 비교가 성립하지 않으므로 숫자로 그냥 바꿔 넣으면 모델이 없는 순서를 학습한다.
데이터의 차원수를 줄이는 방법 Lesson Learned 가장 보편적인 방식은 PCA, UMAP, t-SNE 가 있다. 선형 변환 방식인 PCA 은 비선형 변환 방식인 UMAP 또는 t-SNE 와 비교하진 않고, 서로 조합하면서 사용하는 것 같다.