backpropagation 을 쉽게 이해하기 위한 일종의 언어
Graph 구성
graph 의 각 노드들은 variable 을 의미
Variable
variable 은 vector, matrix, scalar, tensor 등이 될 수 있음
Operation
operation: 한개 이상의 variables 에 적용되는 간단한 function
예시
Logistic Regression

1 min read
backpropagation 을 쉽게 이해하기 위한 일종의 언어
graph 의 각 노드들은 variable 을 의미
variable 은 vector, matrix, scalar, tensor 등이 될 수 있음
operation: 한개 이상의 variables 에 적용되는 간단한 function

Related computational graph References
Backpropagation Algorithm 다음과 같은 일련의 방법으로 역전파 알고리즘이 진행된다.
학습률과 gradient descent 의 관계 비용 함수 J(\theta 1) 에서, parameter \theta 1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
신경망의 모든 Weights 와 Bias 를 0 으로 설정하면 무슨일이 일어날까 Symmetric 하다. 즉, 매 iteration 마다 hidden units 들은 모두 같은 값을 출력한다.
class K>2 의 경우에서 generalized linear model (reference) \displaystyle p\left(C {k}\mid\mathbf{x}\right)=\frac{p\left(\mathbf{x}\mid C {k}\right)p\left(C {k}\right)}{\sum...
여러 층을 쌓은 신경망으로 표현 자체를 데이터에서 학습하는 방식이다. machine learning 의 한 갈래이고, “deep” 은 층이 여러 겹이라는 뜻이다. 특징 설계를 학습으로 대체한다 전통적인 머신러닝은 사람이 특징을 만들어 넣는 단계를 전제로 한다.
Batch Normalization 이라고도 불리며, 배치에 있는 각 입력을 평균이 0 이고 분산이 1 을 가지도록 정규화하는 작업을 의미한다.
RBMs are a variant of Boltzmann machines, with the restriction that their neurons must form a bipartite graph.
Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다. 특정 작업에 특화된 입/출력 레이어로 교체한다.