1 min read
OpenAI InstructGPT(GPT3.5) 로 Instruct Set 52k 개 제작후, Llama 7B 모델을 full fine tuning 한 모델 단순히 말을 잇는 것이 아닌, Instruct 에 맞게 행동하는 LM: “모델은 이미 수많은 정보를 알고 있지만, 어떻게 말할지 모를 뿐” KoAlpaca 한국어 Instruc...
LLM 파인 튜닝 용 라이브러리 Arguments Description
FINE-TUNING CAN DISTORT PRETRAINED FEATURES AND UNDERPERFORM OUT-OF-DISTRIBUTION
언어 모델을 사전 학습 (pretraining) 데이터를 모아서 리워드 모델을 학습 강화 학습을 통해 LM 모델을 파인 튜닝
구분목적데이터Domain fine-tuning특정 domain language에 적응domain corpusInstruction tuning/SFT지시를 따르는 답변 형식 학습prompt-response pairPreference ...
Feed-forward hidden layer 에서 ReLU 대신 GeGLU activation function 을 사용 pre-train 과정에서 dropout 을 끄고, fine tuning 과정에서 dropout 을 다시 킴
transfer learning 의 방식 중 하나로, head 레이어만 학습시키고 나머지 기존 모델의 weight 는 얼리는 접근 방법 중 하나다. 이 학습 방식과 다른 방식은 fine tuning 이 존재한다.
In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다. 특정 작업에 특화된 입/출력 레이어로 교체한다.
학습률과 gradient descent 의 관계 비용 함수 J(\theta 1) 에서, parameter \theta 1 을 찾기 위해, 다음과 같은 gradient descent 를 반복한다고 가정하자.
Batch Normalization 이라고도 불리며, 배치에 있는 각 입력을 평균이 0 이고 분산이 1 을 가지도록 정규화하는 작업을 의미한다.
Non-Linear Activation(비 선형 함수) 의 사용 이유 activation function 을 사용하지 않는다면, neural network 에 아무리 많은 layer 들을 사용해도, 그냥 입,출력 레이어만 붙어있는 네트워크와 다를바가 없기 때문이다.
Supervised Fine-Tuning(SFT)은 pretrained language model을 instruction-response 형식의 labeled data로 추가 학습하는 단계다.
perceptron 으로 이루어진 층 (layer) 여러 개를 순차적으로 붙여놓은 구조다.
관측 불가능한 variables 의 집합 (반대: data) In Statistic 모집단에서 계산될 수 있는 통계치를 parameter 라 부르며, 표본집단에서 계산될 수 있는 통계치를 statistic 이라 부른다.
층의 출력에 그 층의 입력을 그대로 더해서 다음 층으로 보내는 연결이다. 중간 변환을 건너뛰는 경로가 하나 더 생긴다는 뜻에서 skip 이라는 이름이 붙었다. y = F(x) + x F 가 층이 수행하는 변환이고, x 가 건너뛰어 더해지는 입력이다.
Backpropagation Algorithm 다음과 같은 일련의 방법으로 역전파 알고리즘이 진행된다.