1 min read
ReLU function and Leaky ReLU Function
이 현상을 완화하기 위해 Leaky ReLU Function 을 사용한다.
f(x)=\{\begin{array}{ll}0&\text{for}x\leq0\\x&\text{for}x>0\end{array}=\max\{0,x\} 요즘에 ReLU 를 많이 쓰지 않는 것 같아요.
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
\chi {A}(x)= \begin{cases}1 & \text { if } x \in A \\ 0 & \text { if } x \notin A\end{cases} References en.wikipedia.org/wiki/Step function .
class K>2 의 경우에서 generalized linear model (reference) \displaystyle p\left(C {k}\mid\mathbf{x}\right)=\frac{p\left(\mathbf{x}\mid C {k}\right)p\left(C {k}\right)}{\sum...
\displaystyle f(x)=\sigma(x)=\frac{1}{1+e^{-x}} 미분값 f^{\prime}(x)=f(x)(1-f(x)) Figure 약 -4.5 이하로는 무조건 0 을, 4.5 이상으로는 무조건 1 의 값을 가진다. II.
GELU — PyTorch 2.4 documentation GELU 함수 적용 Gaussian Error Linear Units (GELU) 함수는 다음과 같이 정의됩니다: \operatorname{GELU}(x)=x \Phi(x) 여기서 \Phi(x) 는 Gaussian 분포의 누적 분포 함수 (CDF) 를 의미합니다.
Tanh function 은 입력을 [-1, 1] 범위로 압축하는 비선형 activation function 이다.
inverse of activation function 을 의미한다. 예를 들어 logit 은 sigmoid 함수의 inverse 이고, probit 은 가우시안 분포의 CDF 함수의 inverse 를 의미한다.
학습률과 gradient descent 의 관계 비용 함수 J(\theta 1) 에서, parameter \theta 1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
NN with a Hidden Layer hidden layer 가 한개 있는 neural network 를 살펴보자. 입력 units 은 세개이고, activation function 이 사용된다.
