Residual
관측된 값과 추정된 값의 차이를 의미한다. 여기서 추정된 값은 표본집단과 같은 곳에서 구해지는 estimated value 를 의미한다.
B) Vs. Error
error 는 실제 값과 관측된 값의 차이를 의미한다. 여기서 실제 값은 모집단과 같은 곳에서 구해지는 true value 를 의미한다.
1 min read
관측된 값과 추정된 값의 차이를 의미한다. 여기서 추정된 값은 표본집단과 같은 곳에서 구해지는 estimated value 를 의미한다.
error 는 실제 값과 관측된 값의 차이를 의미한다. 여기서 실제 값은 모집단과 같은 곳에서 구해지는 true value 를 의미한다.
Gradient Boosting Machine Gradient Boosting Algorithm (GBM) 은 regression 또는 classification 을 수행할 수 있는 예측모형이며 예측모형의 ensemble 방법론 중 boosting 계열에 속하는 알고리즘 여러개의 weak models 을 조합해서 하나의 결과를 만든다. 일반적으로 Decision Trees 를 많이 사용하며,...
Residual Plot
Residual Plot y 축은 residual e {i}=y {i}-\hat{y} {i} 이고, x 축 \hat{y} {i} 인 그래프 예시 아래 그림에서 residual plot 은 U- 모양을 그리고 있다.
Studentized Residuals residual e i 를 추정된 standard error 으로 나눈 값 - Related References.
Residual Sum of Squares estimation 과 실제 값의 차이의 제곱에 대한 합을 나타낸다.
Likelihood likelihood 는 Probability 와 반대되는 개념으로, 랜덤 변수 X 에 따른 샘플 x 이 주어졌을 때, 랜덤 변수가 따르는 parameter 가 \theta 될 확률을 의미한다.
Parameter 관측 불가능한 variables 의 집합 (반대: data) B) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.
Leverage Statistic 데이터 (observation) 의 leverage 를 측정하기 위한 방법 simple linear regression 의 경우, \displaystyle h {i}=\frac{1}{n}+\frac{\left(x {i}-\bar{x}\right)^{2}}{\sum...
Mode The mode (statistics) is the value that appears most often in a set of data values.
상대도수 상대도수는 사건이 무한히 반복 가능할 때, 내가 관심 있는 사건의 상대적인 빈도를 뜻한다. Related References.
밀도 추정(Density Estimation) 밀도 추정이란, 유한한 개수의 관측값 \mathbf{x 1}, \cdots, \mathbf{x N} 이 주어졌을 때, 확률변수 \mathbf{x}의 확률분포 p(\mathbf{x})를 모델링하는 것을 의미한다.
Confidence Interval 신뢰 구간 (confidence interval) 은 알려지지 않은 모수 (parameter) 에 대한 가능한 값 (plausible values) 들의 범위를 의미한다.