DRNN
DRNN(Deep RNN) 은 RNN 을 여러 층으로 쌓은 모델을 의미한다.
The Figure of DRNN

여기서 의 은 layer 의 번호고, 는 시간을 의미한다.
Forward Propagation of DRNN
각 cell 들은 해당 cell 에 있는 왼쪽과 아래의 cell state 를 이용해 계산된다. 위 Figure 에서 그림의 보라색 동그라미 () 는 다음과 같이 계산된다.
1 min read
DRNN(Deep RNN) 은 RNN 을 여러 층으로 쌓은 모델을 의미한다.

여기서 a[l]<t> 의 l 은 layer 의 번호고, t 는 시간을 의미한다.
각 cell 들은 해당 cell 에 있는 왼쪽과 아래의 cell state 를 이용해 계산된다. 위 Figure 에서 그림의 보라색 동그라미 (a[2]⟨3⟩) 는 다음과 같이 계산된다.
a[2]⟨3⟩=g(Wa[2][a[2]<2>,a[1]<3>]+ba[2])Bidirectional RNN (BRNN) Deep RNN (Deep RNN)
Recurrent Neural Networks (RNN) 왜 RNN 을 사용하는가 일반 neural network(DNN) 보다 RNN 을 사용하는 이유는 무엇일까? 그 이유는 DNN 은 RNN 과 달리 parameter sharing 이 가능하지 않기 때문이다.
Attention attention 은 일종의 aggregation, pooling 또는 weighted sum function 이다.
Application of seq2seq Model Translation Image captioning: Example of the Alexnet 일반적인 Language 모델과의 비교 일반적인 language 모델과 달리, 주어진 입력이 zero vector 가 아니라, encoder 의 output...
Pooling 은 여러 값의 local region 을 하나의 값으로 요약하는 연산이다.
LSTM GRU 보다 좀 더 복잡하고 강력한 memory cell LSTM 은 GRU 에 비해 gate 가 많아서 성능이 좋지만, 계산량이 많아서 network 사이즈를 늘리기에는 부담이 크다.
문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
Natural Language Processing 사람이 쓰는 말과 글을 컴퓨터가 다루게 만드는 분야다. 번역, 요약, 질의응답, 감성 분석, 개체명 인식처럼 겉보기에 다른 작업들이 모두 여기 들어간다.
global vectors for word representation \operatorname{minimize}\sum {i=1}^{V}\sum {j=1}^{V}f\left(X {ij}\right)\left(\theta {i}^{T}e {j}+b {i}+b {j}^{\prime}-\log X...
트랜스포머 (Transformer) 는 2017 년 구글이 발표한 논문인 “Attention Is All You Need” 에서 나온 모델 기존의 seq2seq 의 구조인 인코더 - 디코더를 따르면서도, 논문의 이름처럼 어텐션 (attention) 만으로 인코더와 디코더를 구현한 모델이다.
연속한 n 개의 단위를 하나로 묶은 것이다. 단위는 문맥에 따라 단어일 수도 문자일 수도 있다.