학습률과 gradient descent 의 관계
비용 함수 에서, parameter 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
위 식에서 는 Learning rate 로, Learning rate 값에 따른 gradient descent 의 변화를 그림으로 표현하면 다음과 같다.

1 min read
비용 함수 J(θ1) 에서, parameter θ1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
θ1:=θ1−α∂θ1∂J(θ1)위 식에서 α 는 Learning rate 로, Learning rate 값에 따른 gradient descent 의 변화를 그림으로 표현하면 다음과 같다.

변화한 순간의 간격이 일정한 듯 보이는데, 이러한 간격 (size of each step) 을 결정하는 것은 α 라는 학습률 (Learning rate) 이 결정한다.
Number of layers Number of hidden units Learning rate decay Mini-batch size Momentum term
...r 논문에서 사용한 방식으로, skip connection 를 적용한 이후에 정규화를 적용하는 방식이다. gradient 가 발산하는 경우가 있으므로 훈련하기 까다롭다. 이에 대비하여 Learning rate 를 작은 값에서 시작해서 최대 값으로 Incremental 하게 증가시키는 learning rate-warm up 방식을 적용한다. (2) Pre Layer Normalization ...
Batch Normalization 이라고도 불리며, 배치에 있는 각 입력을 평균이 0 이고 분산이 1 을 가지도록 정규화하는 작업을 의미한다.
ML 모델 h 에 대한 적합한 (\theta i 와 같은) parameter 를 찾기 위한 방법 Visualization of Gradient Descent 아래는 parameter \theta 0 와 \theta 1 에 대한 loss function J 의 등고선 그래프이다.
Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.
Backpropagation Algorithm 다음과 같은 일련의 방법으로 역전파 알고리즘이 진행된다.
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
주로 최적화하는 Hyperparameter 들 Learning rate \alpha 가장 중요한 hyperparameter Number of layers Number of hidden units Learning rate decay Mini-batch size Momentum term 일반적으로 0.9...
In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다. 특정 작업에 특화된 입/출력 레이어로 교체한다.
층의 출력에 그 층의 입력을 그대로 더해서 다음 층으로 보내는 연결이다. 중간 변환을 건너뛰는 경로가 하나 더 생긴다는 뜻에서 skip 이라는 이름이 붙었다. y = F(x) + x F 가 층이 수행하는 변환이고, x 가 건너뛰어 더해지는 입력이다.
Tanh function 은 입력을 [-1, 1] 범위로 압축하는 비선형 activation function 이다.
perceptron 으로 이루어진 층 (layer) 여러 개를 순차적으로 붙여놓은 구조다.