Residual Connection 이란
residual connection 은 skip connection 과 동일한 개념으로, gradient 를 non-linear 한 activation function 을 통과시키지 않고 network 로 직접 흘려보내는 방법을 의미한다.

B) 사용하는 이유
vanishing gradients 의 문제를 완화하기 위함
1 min read
residual connection 은 skip connection 과 동일한 개념으로, gradient 를 non-linear 한 activation function 을 통과시키지 않고 network 로 직접 흘려보내는 방법을 의미한다.

vanishing gradients 의 문제를 완화하기 위함
...osition-wise fully connected FFN(feed-forward network) 이다. 두 sub-layers 에 각각 layer normalization 이후 residual connection 를 적용했다. 즉, 각 sub-layer 의 출력은 LayerNorm(x+Sublayer(x)) 와 같다. 여기서 Sublayer(x) 는 sub-layer 자체 function...
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
Learning Rate B) 학습률과 gradient descent 의 관계 비용 함수 J(\theta 1) 에서, parameter \theta 1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
Transfer Learning B) In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다.
Vanishing Gradients gradient 가 backpropagation 을 통해 layer 들을 지날 때 마다 exponential 하게 감소하는 현상 해결책: Gated Recurrent Unit / Long Short-Term Memory / Truncated BTT exploding...
Regularization Regularization 은 overfitting 문제를 완화하기 위한 방법이다.
Gradient Accumulation Gradient accumulation is a technique where you can train on bigger batch sizes than your machine would normally be able to fit into memory.
Gradient Descent ML 모델 h 에 대한 적합한 (\theta i 와 같은) parameter 를 찾기 위한 방법 B) Visualization of Gradient Descent 아래는 parameter \theta 0 와 \theta 1 에 대한 loss function J 의 등고선 그래프이다.
Tanh Function Tanh function 은 입력을 [-1, 1] 범위로 압축하는 비선형 activation function 이다.
Data Augmentation overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.
Backpropagation Algorithm 다음과 같은 일련의 방법으로 역전파 알고리즘이 진행된다.