class 의 경우에서 generalized linear model (reference)
- : 가 클래스 에 속할 확률을 모델링
- Bayes theorem 에 의해서 유도됨
Log-sum-exp Trick (lse function)
일반적으로
1 min read
class K>2 의 경우에서 generalized linear model (reference)
p(Ck∣x)=∑jp(x∣Cj)p(Cj)p(x∣Ck)p(Ck)=∑jexp(aj)exp(ak)일반적으로 m=maxcac
...put 을 생성할때 encoder 에서 건네준 hidden state 를 이용하는데, 계산하려는 output 이 각 hidden state 와 얼마나 관련이 있는지 score 를 계산한다 (softmax). 그리고 계산된 score 를 hidden state 에 적용하고 (vector dot), 이렇게 가중치가 적용된 state 들을 하나로 더하여 context vector 로 완성시킨다....
마지막으로, softmax function output 중 target word 의 확률을 높이는 방향으로 모델을 학습시킵니다.
dropout 은 왜 softmax 이후에 적용하는 걸까? GPT 모델에서 cheating 방지를 위해 masking 하는 방식은 아직도 이해를 잘 못하겠음.
Hierarchical Softmax 는 softmax function 를 전체로 계산하기 보다는 Tree 구조로 Hierarchical 하게 Softmax 를 계산하는 방법이다.
주로 logit 은 Normalization 을 위해 softmax function 의 입력값으로 사용된다.
Related hierarchical softmax
... 정답 하나를 지목하며, 증류의 교사 분포는 토큰마다 vocabulary 전체에 대한 확률을 통째로 준다. 여기서 교사 분포란 그 위치에서 다음 토큰이 무엇일지에 대한 교사의 확률분포, 즉 softmax 출력 전체를 말한다. 어떤 자리에서 SFT가 주는 신호는 “정답은 빠르게” 하나뿐인 one-hot이라, 나머지 vocabulary는 전부 똑같은 무게의 오답이다. 반면 교사는 빠르게 0.4...
...ression단조 증가만 지키는 계단 함수를 자유롭게 학습한다. 유연한 대신 데이터가 적으면 과적합한다temperature scaling신경망의 logit 을 스칼라 T 로 나눈 뒤 softmax function 을 적용한다. 파라미터가 하나라 순위를 전혀 바꾸지 않는다 보정 정도는 예측 확률을 구간별로 묶어 실제 비율과 비교하는 reliability diagram 이나, 그 차이를 하나의 ...
위와 같은 확률들은 softmax function 으로 표현되며, loss function 은 아래와 같이 cross-entropy 형태로 계산된다.
... 토큰을 잘 설명할 수 있는 시퀀스 내 또 다른 토큰을 찾는다. 물론 자기 자신에 대한 내적값도 계산한다 (e.g. q^<3> · k^<3>). 이후 내적값 (정확히는 softmax 값) 에 토큰 별 value vector v 를 곱한 뒤 모두 더하면, 해당 벡터가 attention value 를 표현하는 vector 가 된다. 각 토큰의 attention vector...
odds ratio 에 log 를 취한 값을 logit 이라고 부른다. logit 은 logistic regression 에 의해 유도될 수 있다. 다음과 같은 logistic regression 모델 h \theta(x) 가 있다고 가정하자.
Tanh function 은 입력을 [-1, 1] 범위로 압축하는 비선형 activation function 이다.
logistic regression model 은 classification 문제를 해결하는데 사용하는 모델이다. Logistic 모델 h \theta(x) 는 linear model 을 다음 식과 같이 non-linear model 로 바꾼 것과 같다.
모델이 내놓은 확률값이 실제 발생 빈도와 맞도록 조정하는 작업이다. “확률 0.7 이라고 예측한 사례들을 모아 보면 실제로 그중 약 70% 가 양성” 이면 잘 보정된 것이다. 분류 정확도가 높은 것과 확률이 맞는 것은 다른 문제다.
Leaky ReLU function 은 다음과 같이 생겼다.
\displaystyle f(x)=\sigma(x)=\frac{1}{1+e^{-x}} 미분값 f^{\prime}(x)=f(x)(1-f(x)) Figure 약 -4.5 이하로는 무조건 0 을, 4.5 이상으로는 무조건 1 의 값을 가진다. II.
Negative Sampling 은 skip-gram 모델의 softmax 함수 계산 비용을 절약하기 위해 고안된 Word Embedding 방식이다.
분류기를 학습시키기 위해 사용되는 loss function Maximum-margin 분류 문제를 풀기 위해 주로 사용하며, 가장 유명한 것은 support vector machine.
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
Classification with SVM binary classification 의 핵심은 D 차원 공간에 존재하는 example 들을 레이블에 따라 두 파티션으로 나눈다는 것이다. 이때, 공간을 나누는 역할을 hyperplane 이 맡게된다.