Zzong's Notes

Home

❯

machine_learning

❯

large parquet dataset을 위한 PyTorch dataset 및 dataloader 튜닝 일기

large parquet dataset을 위한 PyTorch dataset 및 dataloader 튜닝 일기

2026년 8월 29일1 min read

blog link


링크된 언급

1
tech blogs

research.atspotify.com/ large parquet dataset을 위한 PyTorch dataset 및 dataloader 튜닝 일기

함께 보면 좋은 글

tech blogs

추천 시스템 관련된 여러 기업들의 tech blog 들을 모아놓자 기술 블로그를 모아 놓은 github: github.com/seonggwonyoon/techblog SNS 인스타그램: instagram-engineering.com/tagged/machine-learning 페이스북...

Data Augmentation

overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.

Open Neural Network Exchange

ONNX is an open format built to represent machine learning models. AI tool 을 통해 개발을 진행하는 경우 종종 한가지 프레임워크에 갇혀있는 경우가 많다. ONNX 를 이용하면 서로간 모델을 공유할 수 있다.

fine tuning

Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.

PyTorch

CUDA def run cuda benchmark(num iters: int, profile: bool = False) -> float: torch.cuda.synchronize() if profile: torch.cuda.cudart().cudaProfilerStart() start time =...

pruning

학습된 신경망에서 기여가 작은 부분을 잘라내 모델을 줄이는 압축 기법이다. 잘라낸 뒤에는 보통 재학습을 붙여 떨어진 성능을 회복시킨다. 큰 모델은 파라미터 상당수가 출력에 거의 영향을 주지 않는다.

CTR prediction

굉작히 작은 prediction accuracy 상승이라도 이는 전체 매출에 큰 상승으로 이어진다. 수치로 따지면, 대략 1% 정도의 logloss (또는 AUC) 상승을 의미한다.

Rules of ML

구글에서 제공하는 머신러닝을 활용할때 알아야할 규칙들 좋은 product 를 만들기 위해서는 “”. ? Before Machine Learning (1) ML 없이 product 를 런칭하는 것을 두려워 하지 말라. ML 은 좋지만 데이터가 필요하다.

self-supervised

Self-supervised Learning 사람이 붙인 라벨 없이, 데이터 자체에서 정답을 만들어 지도학습처럼 훈련하는 방식이다. 입력의 일부를 감추거나 변형해 놓고 원래 모습을 맞히게 하면, 정답은 원본에 이미 들어 있으므로 라벨링 비용이 들지 않는다.

기계학습을 이용한 데이터스트림 환경에서의 개념 변화 검출 기법

개념 변화 검출의 중요성 기존의 데이터 마이닝 방법들은 입력되는 데이터들이 고정된 상황에서 데이터들의 경향을 미리 파악한 뒤, 파악한 경향성을 바탕으로 이후의 동작을 수행하는 경우가 많다.