RNN 을 학습하는 방법 중 하나
학습 과정에서는 ground truth 를 의 입력값으로 넣어준다. 테스트 과정에서는 대신 값을 넣어준다.

Pros and Cons
장점
학습 속도가 빠르다.
단점
배포 과정에서는 ground truth 를 알 수 없으므로 성능이 불안정하다.
1 min read
RNN 을 학습하는 방법 중 하나
학습 과정에서는 ground truth y(t) 를 h(t+1) 의 입력값으로 넣어준다. 테스트 과정에서는 y(t) 대신 o(t) 값을 넣어준다.

학습 속도가 빠르다.
배포 과정에서는 ground truth 를 알 수 없으므로 성능이 불안정하다.
...der 는 새로운 output sequence 를 생성한다. Refer: Notes on Abstractive Summarization: PegasusXSUM and T5 학습 방식 teacher forcing 을 이용해서 학습한다. 모델 사이즈
Recurrent Neural Networks (RNN) 왜 RNN 을 사용하는가 일반 neural network(DNN) 보다 RNN 을 사용하는 이유는 무엇일까? 그 이유는 DNN 은 RNN 과 달리 parameter sharing 이 가능하지 않기 때문이다.
transfer learning 의 방식 중 하나로, head 레이어만 학습시키고 나머지 기존 모델의 weight 는 얼리는 접근 방법 중 하나다. 이 학습 방식과 다른 방식은 fine tuning 이 존재한다.
Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.
Gradient accumulation is a technique where you can train on bigger batch sizes than your machine would normally be able to fit into memory.
Dropout 방식은 neural network 의 overfitting 문제를 완화하기 위해, 사용자 정의된 확률에 기반하여 각 레이어의 일부 노드들을 계산에 포함시키지 않는 방법을 의미한다. Example 코드 형식으로 dropout 이 적용되는 과정을 소개하겠다.
학습률과 gradient descent 의 관계 비용 함수 J(\theta 1) 에서, parameter \theta 1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다. 특정 작업에 특화된 입/출력 레이어로 교체한다.
Batch Normalization 이라고도 불리며, 배치에 있는 각 입력을 평균이 0 이고 분산이 1 을 가지도록 정규화하는 작업을 의미한다.
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
UNET 은 U 자 모양의 인코더와 디코더를 가지는 구조로 이루어져있다. 각각 4 개의 인코더와 디코더 블록으로 구성되어 있고, fully convolutional neural network .