데이터를 정규 분포 에 가깝게 만들어 주는 변환 방법
에 대하여 box-cox 변환은 다음을 만족하도록 한다.
여기서 는 변환이 필요한지의 여부를 나타내며, 주로 를 고려한다.
를 만족하므로, 는 변환이 필요하다고 생각할 수 있다.
1 min read
데이터를 정규 분포 에 가깝게 만들어 주는 변환 방법
x>0 에 대하여 box-cox 변환은 다음을 만족하도록 한다.
g(x):=⎩⎨⎧λxλ−1logx,λ=0,λ=0여기서 λ 는 변환이 필요한지의 여부를 나타내며, 주로 λ=0,1,2 를 고려한다.
λ→0limλxλ−1=logx 를 만족하므로, g0(x)=log(x) 는 변환이 필요하다고 생각할 수 있다.
Permutation Importance 는 feature importance 를 측정하기 위한 방법으로,모델을 학습시킨 뒤 특정 feature 의 데이터를 shuffle 했을 때, 검증 데이터 셋에 대한 예측성능을 확인하고 feature importance 를 계산한다.
데이터의 차원수를 줄이는 방법 Lesson Learned 가장 보편적인 방식은 PCA, UMAP, t-SNE 가 있다. 선형 변환 방식인 PCA 은 비선형 변환 방식인 UMAP 또는 t-SNE 와 비교하진 않고, 서로 조합하면서 사용하는 것 같다.
Filtering Method 통계적 기법이나 알고리즘을 이용하여 feature 간 상관 관계를 계산함 t-test \chi^2-test information gain information value Wrapper Method Forward Greedy Backward Greedy Genetic Search...
서로 다른 성격 (도메인) 을 지닌 feature 를 섞어서 하나의 context 로 표현하는 것 (예시) 어느 사람이 바나나를 샀고, 요리책을 샀다면 믹서기를 살 확률이 높다.
값이 순서 없는 몇 개의 범주 중 하나인 feature 다. 색상(red/blue), 지역 코드, 사용자 등급 같은 것이 여기 들어간다. 값 사이에 크기 비교가 성립하지 않으므로 숫자로 그냥 바꿔 넣으면 모델이 없는 순서를 학습한다.
1. 누락 데이터(결측값) 처리 결측값 처리는 데이터 전처리 단계에서 매우 중요합니다. 대표적인 접근 방식은 다음과 같습니다.
manifold 의 정의 고차원의 데이터를 저차원으로 옮길 때 데이터를 잘 설명하는 집합의 모형 매니폴드 가정 (manifold Hypothesis (assumption) 고차원의 데이터의 밀도는 낮지만, 이들의 집합을 포함하는 저차원의 manifold(subspace) 가 있다는 가정 Natural data...
Hashing trick은 범주형 값을 해시 함수에 통과시켜 나온 나머지를 그대로 feature 인덱스로 쓰는 방법이다. 값과 인덱스를 짝지어 놓은 사전(vocabulary)을 유지하지 않아도 되고, 처음 보는 값도 계산만으로 자리를 얻는다.
t-SNE 랑 비슷한 non-linear dimension reduction 방식 일반적으로 t-SNE 보다 훨씬 빠르다고 한다. Parameters UMAP 적용할 때 parameter 설정 중 눈에 띄는 것들 init: 초기화 방법에 PCA 적용이 있다.
새로운 user 에 대해서 rating 을 측정할 필요가 있다.