Zzong's Notes

Home

❯

machine_learning

❯

generative_ai

❯

LLM

❯

GPT-2

GPT-2

2026년 8월 29일1 min read

Let’s reproduce GPT-2 (124M) - YouTube

Questions

  • dropout 은 왜 softmax 이후에 적용하는 걸까?
  • GPT 모델에서 cheating 방지를 위해 masking 하는 방식은 아직도 이해를 잘 못하겠음.

링크된 언급

1
GPT

...trained Transformer. transformer 의 디코더만 쌓아 만든 언어모델 계열로, 다음 토큰을 예측하는 방식으로 사전학습한다. OpenAI 가 2018년 첫 모델을 낸 이후 GPT-2, GPT-3 로 이어졌다. 구조: 디코더만 쓴다 원 transformer 는 인코더와 디코더를 모두 갖는 번역 모델이었다. GPT 는 디코더 쪽만 남기고, attention 에 causal ...

함께 보면 좋은 글

GPT

Generative Pre-trained Transformer. transformer 의 디코더만 쌓아 만든 언어모델 계열로, 다음 토큰을 예측하는 방식으로 사전학습한다. OpenAI 가 2018년 첫 모델을 낸 이후 GPT-2, GPT-3 로 이어졌다.

Train Large Model

배경 Qwen2.5 의 72b 급 대용량 모델을 학습하는 방법에 대해 조사해보자.

Llama

Llama 2 모델 사이즈 7, 13, 34, 70 billion and a Llama chat variant with the same sizes 기존 모델과 비교 increased the size of the pretraining corpus by 40% doubled the context length of...

llm_as_classifier

왜 전통적인 분류 모델을 사용하지 않고, LLM 을 통해 분류 문제를 해결하려 할까? LLM 만의 장점 학습 데이터셋이 많지 않은 경우, 빅 모델이 성능 면에서 더 효율적일 수 있다. 클래스가 자주 바뀌는 경우, LLM 은 자주 재학습시킬 필요가 없다.

Large Language Model

Prompt 종류 Instruction Prompt Extract the name of the author from the quotation below.

Generalized Knowledge Distillation

한줄 요약 GKD(Generalized Knowledge Distillation, Google DeepMind 2023)는 autoregressive LM을 위한 지식 증류 기법으로, 고정된 데이터셋이 아니라 학생이 직접 생성한 문장 위에서 교사의 토큰별 분포를 배우게 한다(on-policy).

DistributedDataParallel

a batch is sent to each GPU worker which has its own copy of the model.

Trainer(huggingface)

언어 모델을 학습하기 위해 사용하는 허깅페이스 클래스. 주로 LLM 을 학습할때 사용한다. Training Arguments steps: 데이터셋에 포함된 배치 개수를 의미.

Open challenges in LLM research

현재 연구되고 있는 LLM 고도화 방향 특정 부분을 개선하면 우리만의 세일즈 포인트를 찾아볼 수 있을지…? 개선 포인트에서 현실성이 떨어지는 부분은 제외함 할루시네이션 감소 창의적인 task 에서는 환각은 일종의 feature 역할을 한다.

T5

Text-to-Text Transfer Transformer 라서 T5 로 불린다. 모든 task 에 대해서 동일한 모델, loss function, hyperparameter, 학습 방식을 적용한다. 다만, 각 task 에 대해서 서로 다른 prefix 를 적용한다.