Gini index 와 비슷하게, 비균등 분포를 측정할 때 사용할 수 있는 지표
The entropy is when a single item is always chosen or recommended, and when items are chosen or recommended equally often.
1 min read
Gini index 와 비슷하게, 비균등 분포를 측정할 때 사용할 수 있는 지표
H=−i=1∑np(i)logp(i)The entropy is 0 when a single item is always chosen or recommended, and logn when n items are chosen or recommended equally often.
...양한 추천이 가능하기 때문에 추천의 다양성 자체는 상승하지만, 균등한 추천이 불가능하므로 지니계수가 높아지게 되는 이슈가 있다 (적은 풀을 사용하는 추천이 유리함).업 Related Shannon Entropy Reference
entropy 란 불확실성 (uncertainty) 에 대한 척도이며, 다음과 같이 계산된다.
Joint entropy 는 두 random variable 을 함께 관찰했을 때의 불확실성을 측정한다. X, Y 의 joint distribution 이 p(x, y) 라면 joint entropy 는 다음과 같다.
X 가 주어졌을 때 Y 의 conditional entropy 는 다음과 같이 계산된다 \displaystyle\mathrm{H}(Y\mid X)=-\sum {x\in\mathcal{X},y\in\mathcal{Y}}p(x,y)\log\frac{p(x,y)}{p(x)}...
In Recommender System 얼마나 비균등하게 각기 다른 아이템들이 사용자들에게 선택받고 있는가를 추정 \displaystyle G=\frac{1}{n-1}\sum {j=1}^{n}(2j-n-1)p\left(i {j}\right) i 는 아이템, p(i) 는 사용자에게 선택된 비율 (해당 item...
Mutual Information(MI)은 두 random variable이 얼마나 많은 정보를 공유하는지 를 측정한다. 조금 더 직관적으로 말하면, X를 알게 되었을 때 Y에 대한 불확실성이 얼마나 줄어드는지를 보는 값이다.
두 변수 간 선형 관계를 측정하기 위해서 사용하는 값 covariance 역시 선형 관계를 측정하지만, normalized 된 것이냐 아니냐의 차이가 있다. 아래는 Pearson correlation 계산 식을 나타낸다.
한줄 요약 KL-Divergence(Kullback-Leibler Divergence)는 두 확률분포가 얼마나 다른지를 재는 값이다. 직관으로는 “진짜 분포가 P인데 내가 Q라고 믿고 행동하면, 평균적으로 얼마나 손해를 보나” 를 잰다.
KL-Divergence 의 symmetric 및 normalized 버전 \operatorname{JSD}(P\|Q)=\frac{1}{2}D(P\|M)+\frac{1}{2}D(Q\|M) M=\frac{1}{2}(P+Q) D(P\|Q) 는 두 분포 P,Q 의 KL-Divergence...
estimation 과 실제 값의 차이의 제곱에 대한 합을 나타낸다.
표준 오차란, 표본 집단에서 계산할 수 있는 통계 (e.g. 평균) 를 여러번 계산했을 때, 모집단에서 계산할 수 있는 통계와의 편차의 정도를 의미한다. 정의에서 보아도 알 수 있듯이 당연하게도 모평균의 표준오차라는 말은 존재하지 않는다.