- Parametric method 와 달리, 자료가 정규분포가 아니거나 표본의 크기가 작아서 분포에 대한 기본가정을 필요로 하지 않는 통계적 방법
- 다음과 같은 경우에 Nonparametric method 를 사용한다.
- (정규성 검정)Normality test 에서 정규분포를 따르지 않는다고 증명되었을 경우
- 표본의 수가 적어 정규분포를 가정할 수 없는 경우
- 모집단에 대한 아무런 정보가 없는 경우
1 min read
그 반대: 비모수적 방법 (Nonparametric method)
모수적 방법 (Parametric method) 은 관측 값이 어느 특정한 확률분포 (e.g. 정규분포, 이항분 포 등) 를 따른다고 전제한 후, 그 분포의 모수 (parameter) 에 대한 검정을 실시하는 방법이다.
Noarmlity Test 란 데이터셋의 분포가 정규 분포 Gaussian distribution 을 따르는지 검사하는 것 Normality Test 말고도 Q-Q plot 이나 Frequency Distribution 을 통해 시각화에 기반하여 Gaussian distribution 을 따르는 지 확인할 수 있다.
비모수 통계 기법 중 순열 검정 (permutation test) 을 이용하면 데이터의 모집단 분포가 정규분포를 따르지 않거나 특이한 통계량을 사용하더라도 표본 집단간 비교를 수행할 수 있다 두 표본 집단이 하나의 모집단에서 나왔다는 귀무가설 이 참이라면, 두 그룹 안에 있는 샘플들을 교환한 뒤 통계적으로...
t- 분포는 Student’s t- 분포라고 불리며, 모집단의 평균에서 표본 평균 간 거리의 표준화된 (standardized) 거리를 표현하기 위해 사용하는 분포다.
Z-test (Z- 검정) 는 test statistic 의 분포가 null hypothesis 의 가정 아래 Gaussian distribution 으로 근사화될 수 있는지 확인하는 hypothesis test 를 의미한다.
F-statistic 만약 모델이 포함하고 있는 parameter 가 많다면, t-statistic 대신 F-statistic 을 사용한다. t-statistic 값을 이용하면 p-value 를 계산할 수 있다.
Frequency distribution 은 관측값이 각 category 또는 구간에 얼마나 자주 나타나는지 정리한 분포다. 범주형 데이터라면 category 별 count 를 세고, 연속형 데이터라면 bin 을 나누어 count 를 센다.
단측 검정 특정 그룹이 더 성능이 좋것나 나쁠것으로 가정하는 검정. 즉, 결과가 한쪽으로 분명할 것으로 가정하는 검정 방법이다. 실험 전부터 이미 한쪽 방안의 승리 또는 패배를 가정한다.
밀도 추정(Density Estimation) 밀도 추정이란, 유한한 개수의 관측값 \mathbf{x 1}, \cdots, \mathbf{x N} 이 주어졌을 때, 확률변수 \mathbf{x}의 확률분포 p(\mathbf{x})를 모델링하는 것을 의미한다.
관측 불가능한 variables 의 집합 (반대: data) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.