- gradient descent 를 진행할 때, 모든 training example 을 전부 사용하는 것을 Batch Gradient Descent 라 부른다.
1 min read
Related Newton-Raphson method Batch Gradient Descent
ML 모델 h 에 대한 적합한 (\theta i 와 같은) parameter 를 찾기 위한 방법 Visualization of Gradient Descent 아래는 parameter \theta 0 와 \theta 1 에 대한 loss function J 의 등고선 그래프이다.
일반적인 Batch gradient descent(BGD) 를 이용한 방식은 한꺼번에 모든 학습 데이터에 대한 derivative 를 계산하기 때문에 데이터가 클 때 학습 속도가 느리다.
Global minimum 은 목적 함수 전체 영역에서 가장 작은 값을 가지는 지점이다. x^\ = \arg\min x f(x) 어떤 지점이 주변에서는 가장 작지만 전체에서는 더 작은 지점이 따로 있다면 local minimum 이다.
variational inference 와 동일한 아이디어를 채택한 방식이다.
최적화 문제 (Optimization problems) 란 여러개의 선택가능한 후보 중에서 최적의 해 (Optimal value) 또는 최적의 해에 근접한 값을 찾는 문제를 일컫는다.
The standard gbdt is reliable but it is not fast enough on large datasets.
Newton’s method 라고 불리기도 하며, 실수 함수의 approximate 한 해를 빠르게 찾는 방법이다.
tight lowerbound LL(\boldsymbol{\theta}) , Q\left(\boldsymbol{\theta},\boldsymbol{\theta}^{t}\right)\leq LL(\boldsymbol{\theta})...
Jensen’s Inequality For a random variable x, if f(x) is convec (refer. convex function), then E[f(x)]>=f(E[x]).
Newton-Raphson method 대신 사용하는 방식으로, 주어진 함수들에 대한 로컬 maxima 또는 minima 를 찾는 방법이다.