linear model 을 학습하는 방법 중 하나로, 계수 추정에 제약을 줘서 계수가 0 으로 shrink 하도록 유도하는 학습 방법이다.
1 min read
ridge regression 과 달리 L1-norm 을 regularization term 으로 사용하는 linear 모델이다.
linear regression 의 손실에 계수 크기에 대한 벌점을 더한 모델이다. 벌점으로 계수 제곱합, 즉 L2-norm 의 제곱을 쓴다.
predictor variable 들이 완벽하거나 거의 완벽에 가까운 상관성을 갖는다고 할 때, regression 은 다중공선성 문제를 가지고 있다고 말할 수 있다. 회귀 분석에서는 다중공선성 문제가 사라질 때까지 변수를 제거해야 한다.
ridge 과 lasso regression 을 합친 하이브리드 선형 모델 \mathcal{L}\left(\boldsymbol{w}, \lambda {1}, \lambda {2}\right)=\|\boldsymbol{y}-\mathbf{X} \boldsymbol{w}\|^{2}+\lambda...
기계 학습 방식에서 scale invariant 란, feature 들을 rescaling 하는 경우에도 prediction 에 영향을 주지 않는 특성을 의미한다. 여기서 rescaling 이란 각 column 에 서로 다른 non-zero 값을 곱하는 것을 의미한다.
variance 가 input 마다 다른 것 p(\boldsymbol{y}\mid\boldsymbol{x};\boldsymbol{\theta})=\mathcal{N}\left(\boldsymbol{y}\mid\mathbf{X}\boldsymbol{w},\boldsymbol{\Lambda}^{-1}\right)...
linear regression 에서 Y=\beta {0}+X {1}\beta {1}+\cdots+X {p}\beta {p}+\epsilon 여기서 에러 \epsilon 를 의미한다.
Regularization 은 overfitting 문제를 완화하기 위한 방법이다.
MSE of the estimates \begin{aligned}\operatorname{MSE}&=\mathbb{E}\left[\left(\hat{\theta} {m}-\theta\right)^{2}\right]=\operatorname{Bias}\left(\hat{\theta}...
feature vector x\in\mathbb{R}^{d} 가 주어졌을 때 observation Y 는 평균이 \mu\left(x^{\top}\theta\right) 인 exponential family 분포를 따른다.