모집단을 계층 구조로 나눠서 각 계층마다 샘플링을 진행하는 방법
예
미국 인구 투표율을 조사할 때 흑인, 백인, 그리고 아시아인으로 나눈 뒤 투표 여부를 샘플링한다.
1 min read
cross-validation 방식 중 하나 각 fold 를 가져올때마다 타겟 class 의 구성 비율이 동일하도록 가져온다. References 3.1.
Inverse Transform Sampling Inverse transform sampling 는 어떤 확률 분포에서 해당 분포의 inverse cumulative distribution (또는 quantile function) F^{-1}(x) 를 활용해서 임의의 값을 생성하는 방법을 의미한다.
집단에 속한 평균을 중심으로 퍼진 정도를 의미한다. 해당 집단이 모 집단인 경우 모 표준편차를 의미하고, 표본 집단을 대상으로 한다면 표본 표준편차를 뜻한다. 계산은 variance(일반적으로 표본 분산) s^2 에 root 를 씌우면 구할 수 있다.
표본 분포란, 임의의 샘플링 결과들에 의해 구해진 확률 분포를 의미한다.
어떤 변수들의 집합에 대한 확률 분포에서, 부분 집합에 대한 확률 분포를 marginal probability distribution 이라고 한다.
Rejection sampling 은 어떤 확률 밀도 함수 p(x) 에 대해, 다음과 같은 조건에서 효율적으로 sampling 을 수행할 수 있는 방법이다. 주어진 확률 분포 p(x) 의 확률 밀도 함수 (pdf) 를 알고 있어야 한다.
residual e i 를 추정된 standard error 으로 나눈 값 -.
많은 변수에 대한 확률 분포를 joint probability distribution 이라고 한다.
관측 불가능한 variables 의 집합 (반대: data) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.
\displaystyle F=\frac{(\mathrm{TSS}-\mathrm{RSS})/p}{\mathrm{RSS}/(n-p-1)} p 는 coefficient 개수, n 은 sample 개수 .