Shannon Entropy
Gini index 와 비슷하게, 비균등 분포를 측정할 때 사용할 수 있는 지표
The entropy is when a single item is always chosen or recommended, and when items are chosen or recommended equally often.
1 min read
...추천이 가능하기 때문에 추천의 다양성 자체는 상승하지만, 균등한 추천이 불가능하므로 지니계수가 높아지게 되는 이슈가 있다 (적은 풀을 사용하는 추천이 유리함).업 D) Related Shannon Entropy E) Reference
Entropy entropy 란 불확실성 (uncertainty) 에 대한 척도이며, 다음과 같이 계산된다.
Joint Entropy Joint entropy 는 두 random variable 을 함께 관찰했을 때의 불확실성을 측정한다. X, Y 의 joint distribution 이 p(x, y) 라면 joint entropy 는 다음과 같다.
Mutual Information mutual information 은 X 와 Y 간 정보를 얼마나 공유하는지를 측정한다: 즉, 한쪽 변수를 앎으로써 다른 변수에 대한 불확실성을 얼만큼 줄일 수 있는지의 척도가 된다.
In Recommender System 얼마나 비균등하게 각기 다른 아이템들이 사용자들에게 선택받고 있는가를 추정 \displaystyle G=\frac{1}{n-1}\sum {j=1}^{n}(2j-n-1)p\left(i {j}\right) i 는 아이템, p(i) 는 사용자에게 선택된 비율 (해당 item...
Correlation 두 변수 간 선형 관계를 측정하기 위해서 사용하는 값 covariance 역시 선형 관계를 측정하지만, normalized 된 것이냐 아니냐의 차이가 있다. 아래는 Pearson correlation 계산 식을 나타낸다.
한줄 요약 KL-Divergence(Kullback-Leibler Divergence)는 두 확률분포가 얼마나 다른지를 재는 값이다. 직관으로는 “진짜 분포가 P인데 내가 Q라고 믿고 행동하면, 평균적으로 얼마나 손해를 보나” 를 잰다.
Jensen–Shannon Divergence KL-Divergence 의 symmetric 및 normalized 버전 \operatorname{JSD}(P\|Q)=\frac{1}{2}D(P\|M)+\frac{1}{2}D(Q\|M) M=\frac{1}{2}(P+Q) D(P\|Q) 는 두 분포 P,Q 의...
Residual Sum of Squares estimation 과 실제 값의 차이의 제곱에 대한 합을 나타낸다.
Standard Error 표준 오차란, 표본 집단에서 계산할 수 있는 통계 (e.g. 평균) 를 여러번 계산했을 때, 모집단에서 계산할 수 있는 통계와의 편차의 정도를 의미한다. 정의에서 보아도 알 수 있듯이 당연하게도 모평균의 표준오차라는 말은 존재하지 않는다.
Cross-entropy 우리가 예측 모형을 build 하는 이유는 불확실성을 제어하고자 하는 것이다. 이때, 예측 모형은 실제 분포인 q 를 모르고, 모델링을 하여 q 분포를 예측하고자 하는 것이다. 예측 모델링을 통해 구한 분포를 p 라고 해보자.