Learning Rate
B) 학습률과 gradient descent 의 관계
비용 함수 에서, parameter 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
위 식에서 는 Learning rate 로, Learning rate 값에 따른 gradient descent 의 변화를 그림으로 표현하면 다음과 같다.

1 min read
비용 함수 J(θ1) 에서, parameter θ1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
θ1:=θ1−α∂θ1∂J(θ1)위 식에서 α 는 Learning rate 로, Learning rate 값에 따른 gradient descent 의 변화를 그림으로 표현하면 다음과 같다.

변화한 순간의 간격이 일정한 듯 보이는데, 이러한 간격 (size of each step) 을 결정하는 것은 α 라는 학습률 (Learning rate) 이 결정한다.
Number of layers Number of hidden units Learning rate decay Mini-batch size Momentum term
...r 논문에서 사용한 방식으로, skip connection 를 적용한 이후에 정규화를 적용하는 방식이다. gradient 가 발산하는 경우가 있으므로 훈련하기 까다롭다. 이에 대비하여 Learning rate 를 작은 값에서 시작해서 최대 값으로 Incremental 하게 증가시키는 learning rate-warm up 방식을 적용한다. (2) Pre Layer Normalization ...
Gradient Descent ML 모델 h 에 대한 적합한 (\theta i 와 같은) parameter 를 찾기 위한 방법 B) Visualization of Gradient Descent 아래는 parameter \theta 0 와 \theta 1 에 대한 loss function J 의 등고선 그래프이다.
Residual Connection 이란 residual connection 은 skip connection 과 동일한 개념으로, gradient 를 non-linear 한 activation function 을 통과시키지 않고 network 로 직접 흘려보내는 방법을 의미한다.
Hyperparameter 주로 최적화하는 Hyperparameter 들 Learning rate \alpha 가장 중요한 hyperparameter Number of layers Number of hidden units Learning rate decay Mini-batch size Momentum term...
Transfer Learning B) In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다.
Regularization Regularization 은 overfitting 문제를 완화하기 위한 방법이다.
Gradient Accumulation Gradient accumulation is a technique where you can train on bigger batch sizes than your machine would normally be able to fit into memory.
Backpropagation Algorithm 다음과 같은 일련의 방법으로 역전파 알고리즘이 진행된다.
Teacher Forcing RNN 을 학습하는 방법 중 하나 학습 과정에서는 ground truth \boldsymbol{y}^{(t)} 를 \boldsymbol{h}^{(t+1)} 의 입력값으로 넣어준다.
Batch Normalization BN 은 neural network 학습 시간을 줄여주고 generalization 을 향상시킨다.
CTR Prediction 굉작히 작은 prediction accuracy 상승이라도 이는 전체 매출에 큰 상승으로 이어진다. 수치로 따지면, 대략 1% 정도의 logloss (또는 AUC) 상승을 의미한다.