cross-validation 방식 중 하나
각 fold 를 가져올때마다 타겟 class 의 구성 비율이 동일하도록 가져온다.
References
3.1. Cross-validation: evaluating estimator performance — scikit-learn 1.2.2 documentation
1 min read
cross-validation 방식 중 하나
각 fold 를 가져올때마다 타겟 class 의 구성 비율이 동일하도록 가져온다.
3.1. Cross-validation: evaluating estimator performance — scikit-learn 1.2.2 documentation
모집단을 계층 구조로 나눠서 각 계층마다 샘플링을 진행하는 방법 예 미국 인구 투표율을 조사할 때 흑인, 백인, 그리고 아시아인으로 나눈 뒤 투표 여부를 샘플링한다. Related Stratified k-fold
모집단을 계층 구조로 나눠서 각 계층마다 샘플링을 진행하는 방법 예 미국 인구 투표율을 조사할 때 흑인, 백인, 그리고 아시아인으로 나눈 뒤 투표 여부를 샘플링한다. Related Stratified k-fold.
cross-validation 은 데이터를 나눠서 모델을 검증하는 방식을 의미한다. 교차 검증을 사용해야 하는 이유 고정된 training set 에 대한 overfitting 현상을 막기 위해서 사용한다. 즉, 더 일반화된 모델을 학습하기 위해서 사용한다.
linear model 을 학습하는 방법 중 하나로, 계수 추정에 제약을 줘서 계수가 0 으로 shrink 하도록 유도하는 학습 방법이다. II. Related ridge regression lasso regression .
X 가 주어졌을 때 Y 의 conditional entropy 는 다음과 같이 계산된다 \displaystyle\mathrm{H}(Y\mid X)=-\sum {x\in\mathcal{X},y\in\mathcal{Y}}p(x,y)\log\frac{p(x,y)}{p(x)}...
residual e i 를 추정된 standard error 으로 나눈 값 -.
y 축은 residual e {i}=y {i}-\hat{y} {i} 이고, x 축 \hat{y} {i} 인 그래프 예시 아래 그림에서 residual plot 은 U- 모양을 그리고 있다. 이는 데이터가 non-linearity 를 보인다는 증거가 된다.
SMOTE 는 낮은 비율 클래스 데이터들의 최근접 이웃을 이용하여 새로운 데이터를 생성합니다. 완전히 똑같은 특성을 가진 데이터를 복사하는 것은 의미가 없기 때문에, 아래 그림과 같이 근접해 있는 데이터들과 일정한 거리를 떨어진 위치에 데이터를 생성하는 것입니다.
많은 변수에 대한 확률 분포를 joint probability distribution 이라고 한다.
상대도수는 사건이 무한히 반복 가능할 때, 내가 관심 있는 사건의 상대적인 빈도를 뜻한다.
Sufficiency : T(X 1, X 2,…, X n) is said to have ‘sufficiency’ for the parameter, if the conditional of X 1, X 2,… X n given T=t does not rely on the value of the parameter.