관측된 값과 추정된 값의 차이를 의미한다. 여기서 추정된 값은 표본집단과 같은 곳에서 구해지는 estimated value 를 의미한다.
Vs. Error
error 는 실제 값과 관측된 값의 차이를 의미한다. 여기서 실제 값은 모집단과 같은 곳에서 구해지는 true value 를 의미한다.
1 min read
관측된 값과 추정된 값의 차이를 의미한다. 여기서 추정된 값은 표본집단과 같은 곳에서 구해지는 estimated value 를 의미한다.
error 는 실제 값과 관측된 값의 차이를 의미한다. 여기서 실제 값은 모집단과 같은 곳에서 구해지는 true value 를 의미한다.
Gradient Boosting Algorithm (GBM) 은 regression 또는 classification 을 수행할 수 있는 예측모형이며 예측모형의 ensemble 방법론 중 boosting 계열에 속하는 알고리즘 여러개의 weak models 을 조합해서 하나의 결과를 만든다. 일반적으로 Decision Trees 를 많이 사용하며, 이 경우 알고리즘 이름은 gradient-bo...
예시 아래 그림에서 residual plot 은 U- 모양을 그리고 있다. 이는 데이터가 non-linearity 를 보인다는 증거가 된다.
y 축은 residual e {i}=y {i}-\hat{y} {i} 이고, x 축 \hat{y} {i} 인 그래프 예시 아래 그림에서 residual plot 은 U- 모양을 그리고 있다. 이는 데이터가 non-linearity 를 보인다는 증거가 된다.
residual e i 를 추정된 standard error 으로 나눈 값 -.
estimation 과 실제 값의 차이의 제곱에 대한 합을 나타낸다.
likelihood 는 Probability 와 반대되는 개념으로, 랜덤 변수 X 에 따른 샘플 x 이 주어졌을 때, 랜덤 변수가 따르는 parameter 가 \theta 될 확률을 의미한다. 이는 주로 \mathcal{L}(\theta\mid x) 로 표현한다.
관측 불가능한 variables 의 집합 (반대: data) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.
ADMM 은 원래의 convex 최적화 문제보다 최적화가 쉬운 부분문제로 분할하고 이를 취합함으로써 복잡한 원 문제를 해결하는 방식의 근사알고리즘이다.
데이터 (observation) 의 leverage 를 측정하기 위한 방법 simple linear regression 의 경우, \displaystyle h {i}=\frac{1}{n}+\frac{\left(x {i}-\bar{x}\right)^{2}}{\sum {i^{\prime}=1}^{n}\left(x...
evidence X 가 주어졌을 때, A 가 발생할 확률을 나타내며, notation 은 다음과 같이 표기할 수 있다.
연구자들은 연구하고자 하는 대상이 나타내는 현상을 관찰한 후에, 그 현상을 설명하는 가설을 설정한다. 그리고 그 가설 (Hypothesis) 을 통계적인 방식으로 검정 (Testing) 한다.
The mode (statistics) is the value that appears most often in a set of data values.