Zzong's Notes

Home

❯

machine_learning

❯

deep_learning

❯

gradient checkpoint

gradient checkpoint

2026년 9월 04일1 min read

GitHub - cybertronai/gradient-checkpointing: Make huge neural nets fit in memory


함께 보면 좋은 글

gradient accumulation

Gradient accumulation is a technique where you can train on bigger batch sizes than your machine would normally be able to fit into memory.

mixed precision

mixed precision 은 모델 학습시 FP16, FP32 부동 소수점 유형을 상황에 따라 유연하게 사용하여 학습을 더 빠르게 실행하고 메모리를 적게 사용하는 방법이다.

computational graph

backpropagation 을 쉽게 이해하기 위한 일종의 언어 Graph 구성 graph 의 각 노드들은 variable 을 의미 Variable variable 은 vector, matrix, scalar, tensor 등이 될 수 있음 Operation operation: 한개 이상의 variables 에...

layer normalization

Batch Normalization 이라고도 불리며, 배치에 있는 각 입력을 평균이 0 이고 분산이 1 을 가지도록 정규화하는 작업을 의미한다.

reparametrization trick

variational inference 에서 사용하는 sampling z \sim q {\phi}(z \mid x) 값을 잘 변환 (reparameterization) 해서 미분 가능한 것으로 바꾸는 trick 을 의미한다.

teacher forcing

RNN 을 학습하는 방법 중 하나 학습 과정에서는 ground truth \boldsymbol{y}^{(t)} 를 \boldsymbol{h}^{(t+1)} 의 입력값으로 넣어준다.

skip connection

층의 출력에 그 층의 입력을 그대로 더해서 다음 층으로 보내는 연결이다. 중간 변환을 건너뛰는 경로가 하나 더 생긴다는 뜻에서 skip 이라는 이름이 붙었다. y = F(x) + x F 가 층이 수행하는 변환이고, x 가 건너뛰어 더해지는 입력이다.

Xavier initialization

neural network 의 weight 초기화 방법 모든 layer l 에 대해서 다음과 같이 weight 와 bias 값을 초기화 \begin{aligned}W^{[l]}&\sim\mathcal{N}\left(\mu=0,\sigma^{2}=\frac{1}{n^{[l-1]}}\right)\\b^{[l]}&...

Leaky ReLU Function

Leaky ReLU function 은 다음과 같이 생겼다.

linear probing

transfer learning 의 방식 중 하나로, head 레이어만 학습시키고 나머지 기존 모델의 weight 는 얼리는 접근 방법 중 하나다. 이 학습 방식과 다른 방식은 fine tuning 이 존재한다.