Teacher Forcing
RNN 을 학습하는 방법 중 하나
학습 과정에서는 ground truth 를 의 입력값으로 넣어준다. 테스트 과정에서는 대신 값을 넣어준다.

B) Pros and Cons
B.1) 장점
학습 속도가 빠르다.
B.2) 단점
배포 과정에서는 ground truth 를 알 수 없으므로 성능이 불안정하다.
1 min read
RNN 을 학습하는 방법 중 하나
학습 과정에서는 ground truth y(t) 를 h(t+1) 의 입력값으로 넣어준다. 테스트 과정에서는 y(t) 대신 o(t) 값을 넣어준다.

학습 속도가 빠르다.
배포 과정에서는 ground truth 를 알 수 없으므로 성능이 불안정하다.
... 새로운 output sequence 를 생성한다. Refer: Notes on Abstractive Summarization: PegasusXSUM and T5 A.2) 학습 방식 teacher forcing 을 이용해서 학습한다. A.3) 모델 사이즈
Recurrent Neural Networks (RNN) A.1) 왜 RNN 을 사용하는가? 일반 neural network(DNN) 보다 RNN 을 사용하는 이유는 무엇일까? 그 이유는 DNN 은 RNN 과 달리 parameter sharing 이 가능하지 않기 때문이다.
Gradient Accumulation Gradient accumulation is a technique where you can train on bigger batch sizes than your machine would normally be able to fit into memory.
Learning Rate B) 학습률과 gradient descent 의 관계 비용 함수 J(\theta 1) 에서, parameter \theta 1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
Transfer Learning B) In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다.
Residual Connection 이란 residual connection 은 skip connection 과 동일한 개념으로, gradient 를 non-linear 한 activation function 을 통과시키지 않고 network 로 직접 흘려보내는 방법을 의미한다.
UNET UNET 은 U 자 모양의 인코더와 디코더를 가지는 구조로 이루어져있다. 각각 4 개의 인코더와 디코더 블록으로 구성되어 있고, fully convolutional neural network .
Perceptron input x 1, x 2, \cdots 을 weights w 1, w 2, \cdots 과 곱해서 threshold 값에 따라 1 또는 0 을 출력하는 인공 뉴런 모델 \text { output }= \begin{cases}0 & \text { if } \sum {j} w {j} x...
Batch Normalization BN 은 neural network 학습 시간을 줄여주고 generalization 을 향상시킨다.
Pooling Pooling 은 여러 값의 local region 을 하나의 값으로 요약하는 연산이다.
seq2seq B) Application of seq2seq Model Translation Image captioning: Example of the Alexnet C) 일반적인 Language 모델과의 비교 일반적인 language 모델과 달리, 주어진 입력이 zero vector 가 아니라, encoder...