실제 음성 (negative) 인 데이터를 (통계) 모델이 양성 (positive) 으로 판정해서 발생하는 오류
- 실제: negative (False)
- 예측: positive
귀무가설 이 실제로 참이지만, 귀무가설을 기각하는 오류이다.
Error 라고도 불린다. Type 1 error 의 0.05 및 5% 의 유의수준은 귀무 가설이 5% 확률로 잘못 기각될 수 있다는 의미를 가진다.
1 min read
실제 음성 (negative) 인 데이터를 (통계) 모델이 양성 (positive) 으로 판정해서 발생하는 오류
귀무가설 이 실제로 참이지만, 귀무가설을 기각하는 오류이다.
α Error 라고도 불린다. Type 1 error 의 0.05 및 5% 의 유의수준은 귀무 가설이 5% 확률로 잘못 기각될 수 있다는 의미를 가진다.
임계값을 올리면 (예: 0.7) positive 판정이 엄격해져 False Positive 가 줄어들지만 True Positive 도 같이 줄어든다. 임계값을 내리면 (예: 0.3) positive 판정이 관대해져 True Positive 가 늘어나지만 False Posit...
블룸 필터는 공간을 효율적으로 사용할 수 있는 확률적 데이터 구조로, 어떤 원소가 주어진 집합의 원소로 존재하는지 여부를 테스트하는데 사용된다. 블룸필터에서 False Positive 는 발생할 수 있지만, False Negative 는 발생할 수 없다. 다른말로 하자면, 주어진 쿼리는 “ 아마 집합에 존재할 것 ” 이거나 “ 반드시 집합에 존재하지 않는다 ” 라는...
FPR FPR(False Positive Rate)은 실제 negative 중에서 모델이 positive 로 잘못 예측한 비율이다.
hard negative 는 False Positive 의 일종으로, 실제로는 negative 인데 positive 라고 잘못 예측하기 쉬운 데이터다. 반대로, easy negative 는 실제로 negative 이고 예측도 negativ...
FPR FPR(False Positive Rate)은 실제 negative 중에서 모델이 positive 로 잘못 예측한 비율이다.
AUC AUC 는 ROC 곡선 아래의 면적이다. ROC 곡선이 임계값을 0 에서 1 까지 훑으면서 그려지는 곡선이므로, 그 아래 면적은 “임계값을 어디에 두든 평균적으로 얼마나 잘 구분하는가” 를 한 숫자로 요약한 값이 된다.
hard negative 는 False Positive 의 일종으로, 실제로는 negative 인데 positive 라고 잘못 예측하기 쉬운 데이터다.
귀무가설 이 실제로 거짓이지만, 귀무가설을 채택하는 오류. 실제 양성인 것을 음성으로 판별. \beta 오류라고 부른다.
Recall은 실제 positive example 중에서 모델이 positive로 찾아낸 비율이다. binary classification에서는 True Positive Rate(TPR), medical diagnosis에서는 sensitivity라고도 부른다.
ROC(Receiver Operating Characteristic) curve 는 classification 의 모델의 성능을 표현하기 위한 curve 이다. 어떻게 활용하냐에 따라서 multi-class 또는 multi-label 분류기의 성능 측정까지 가능하다.
f1 score 는 Recall 과 precision 에 대한 조화 평균 (harmonic mean) 점수다.
MSE of the estimates \begin{aligned}\operatorname{MSE}&=\mathbb{E}\left[\left(\hat{\theta} {m}-\theta\right)^{2}\right]=\operatorname{Bias}\left(\hat{\theta}...
귀무 가설이란 귀무가설 (null hypothesis) H 0 은 모집단의 특성에 대해 옳다고 제안하는 잠정적인 주장을 의미한다. In other words, 우리가 관찰한 어떤 효과가 특별한 것이 아니고 우연에 의해 발생한 것이라는 주장을 의미한다.
bias 는 데이터 내에 있는 모든 정보를 고려하지 않음으로 인해, 지속적으로 잘못된 것들을 학습하는 경향을 말한다. 어떤 모델을 학습시켰을 경우, 그 모델이 예측한 값과 실제 정답이 얼마나 멀리있는지를 나타내는가 생각해보면 된다.