Batch Gradient Descent
- gradient descent 를 진행할 때, 모든 training example 을 전부 사용하는 것을 Batch Gradient Descent 라 부른다.
1 min read
Related Newton-Raphson method Batch Gradient Descent References
Gradient Descent ML 모델 h 에 대한 적합한 (\theta i 와 같은) parameter 를 찾기 위한 방법 B) Visualization of Gradient Descent 아래는 parameter \theta 0 와 \theta 1 에 대한 loss function J 의 등고선 그래프이다.
Stochastic Gradient Descent 일반적인 Batch gradient descent(BGD) 를 이용한 방식은 한꺼번에 모든 학습 데이터에 대한 derivative 를 계산하기 때문에 데이터가 클 때 학습 속도가 느리다.
Adam B) Related C) References.
Least Squares Estimation least squares estimation 이란 주어진 데이터의 선형 모델을 풀기 위한 접근 방식들의 통칭을 의미한다.
Loss Function Loss function 은 모델의 예측이 정답과 얼마나 다른지를 숫자로 바꾸는 함수다. 학습은 보통 이 값을 줄이는 방향으로 parameter 를 업데이트하는 과정으로 볼 수 있다.
Global Minimum Global minimum 은 목적 함수 전체 영역에서 가장 작은 값을 가지는 지점이다. x^\ = \arg\min x f(x) 어떤 지점이 주변에서는 가장 작지만 전체에서는 더 작은 지점이 따로 있다면 local minimum 이다.
Reparametrization Trick variational inference 에서 사용하는 sampling z \sim q {\phi}(z \mid x) 값을 잘 변환 (reparameterization) 해서 미분 가능한 것으로 바꾸는 trick 을 의미한다.
Backtracking line search gradient descent 에서 고정 step size 를 사용하게 되면 진행 속도가 항상 동일하기 때문에, 경사가 가파른 구간에서는 최적점을 지나쳐서 진동할 수 있으며 경사가 평평한 구간에서는 진행이 느려질 수가 있다.
KL Annealing 적절한 hyperparameter 를 선택하는 방법. VAE 에서 소개되었으며, 일반적으로 Grid Search 보다는 하위호환이지만, 한번의 training 으로도 나름 최적의 parameter 를 찾을 수 있는 장점이 있다.
BFGS BFGS 알고리즘은 Newton-Raphson method 의 장점을 취하면서 계산 비용을 줄인 방법이다. 이런 관점에서 BFGS 는 conjugate gradients 방식과 비슷하다. 뉴턴 방법의 업데이트는 아래와 같다.