1 min read
research.atspotify.com/ large parquet dataset을 위한 PyTorch dataset 및 dataloader 튜닝 일기
추천 시스템 관련된 여러 기업들의 tech blog 들을 모아놓자 기술 블로그를 모아 놓은 github: github.com/seonggwonyoon/techblog SNS 인스타그램: instagram-engineering.com/tagged/machine-learning 페이스북...
overfitting 에 대응하기 위해서는 많은 training data 를 이용해서 학습하는 것이 좋다. 특히, 이미지 데이터의 경우, 기존 이미지를 변형해서 새로운 이미지 학습 데이터를 만들 수 있다.
ONNX is an open format built to represent machine learning models. AI tool 을 통해 개발을 진행하는 경우 종종 한가지 프레임워크에 갇혀있는 경우가 많다. ONNX 를 이용하면 서로간 모델을 공유할 수 있다.
Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.
CUDA def run cuda benchmark(num iters: int, profile: bool = False) -> float: torch.cuda.synchronize() if profile: torch.cuda.cudart().cudaProfilerStart() start time =...
학습된 신경망에서 기여가 작은 부분을 잘라내 모델을 줄이는 압축 기법이다. 잘라낸 뒤에는 보통 재학습을 붙여 떨어진 성능을 회복시킨다. 큰 모델은 파라미터 상당수가 출력에 거의 영향을 주지 않는다.
굉작히 작은 prediction accuracy 상승이라도 이는 전체 매출에 큰 상승으로 이어진다. 수치로 따지면, 대략 1% 정도의 logloss (또는 AUC) 상승을 의미한다.
구글에서 제공하는 머신러닝을 활용할때 알아야할 규칙들 좋은 product 를 만들기 위해서는 “”. ? Before Machine Learning (1) ML 없이 product 를 런칭하는 것을 두려워 하지 말라. ML 은 좋지만 데이터가 필요하다.
Self-supervised Learning 사람이 붙인 라벨 없이, 데이터 자체에서 정답을 만들어 지도학습처럼 훈련하는 방식이다. 입력의 일부를 감추거나 변형해 놓고 원래 모습을 맞히게 하면, 정답은 원본에 이미 들어 있으므로 라벨링 비용이 들지 않는다.
개념 변화 검출의 중요성 기존의 데이터 마이닝 방법들은 입력되는 데이터들이 고정된 상황에서 데이터들의 경향을 미리 파악한 뒤, 파악한 경향성을 바탕으로 이후의 동작을 수행하는 경우가 많다.