DRNN
DRNN(Deep RNN) 은 RNN 을 여러 층으로 쌓은 모델을 의미한다.
B) The Figure of DRNN

여기서 의 은 layer 의 번호고, 는 시간을 의미한다.
C) Forward Propagation of DRNN
각 cell 들은 해당 cell 에 있는 왼쪽과 아래의 cell state 를 이용해 계산된다. 위 Figure 에서 그림의 보라색 동그라미 () 는 다음과 같이 계산된다.
1 min read
DRNN(Deep RNN) 은 RNN 을 여러 층으로 쌓은 모델을 의미한다.

여기서 a[l]<t> 의 l 은 layer 의 번호고, t 는 시간을 의미한다.
각 cell 들은 해당 cell 에 있는 왼쪽과 아래의 cell state 를 이용해 계산된다. 위 Figure 에서 그림의 보라색 동그라미 (a[2]⟨3⟩) 는 다음과 같이 계산된다.
a[2]⟨3⟩=g(Wa[2][a[2]<2>,a[1]<3>]+ba[2])Bidirectional RNN (BRNN) Deep RNN (Deep RNN)
Recurrent Neural Networks (RNN) A.1) 왜 RNN 을 사용하는가? 일반 neural network(DNN) 보다 RNN 을 사용하는 이유는 무엇일까? 그 이유는 DNN 은 RNN 과 달리 parameter sharing 이 가능하지 않기 때문이다.
Attention attention 은 일종의 aggregation, pooling 또는 weighted sum function 이다.
Pooling Pooling 은 여러 값의 local region 을 하나의 값으로 요약하는 연산이다.
LSTM GRU 보다 좀 더 복잡하고 강력한 memory cell LSTM 은 GRU 에 비해 gate 가 많아서 성능이 좋지만, 계산량이 많아서 network 사이즈를 늘리기에는 부담이 크다.
Doc2Vec 문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
GloVe global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
Transformer 트랜스포머 (Transformer) 는 2017 년 구글이 발표한 논문인 “Attention Is All You Need” 에서 나온 모델 기존의 seq2seq 의 구조인 인코더 - 디코더를 따르면서도, 논문의 이름처럼 어텐션 (attention) 만으로 인코더와 디코더를 구현한 모델이다.
Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...
Skip Gram Skip Gram 은 중심 단어를 통해 주변단어를 예측하는 Word Embedding 모델이다.
Teacher Forcing RNN 을 학습하는 방법 중 하나 학습 과정에서는 ground truth \boldsymbol{y}^{(t)} 를 \boldsymbol{h}^{(t+1)} 의 입력값으로 넣어준다.