- 정의
- the user behaviour is represented as a chain of implicit feedback (e.g. clicks), which sometimes leads to an explicit feedback (e.g. a rating)
1 min read
데이터를 만들어내는 확률분포가 시간에 따라 변하는 상황을 말한다. 반대로 분포가 시간이 지나도 그대로면 stationary 다. 머신러닝 모델은 대개 “학습 데이터와 앞으로 들어올 데이터가 같은 분포에서 나온다” 는 가정 위에 서 있다.
Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다. 아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.
정의 metric learning 은 데이터 포인트 간의 거리를 측정하는 방법을 학습하는 기법입니다.
UCB란 UCB(Upper Confidence Bound) 알고리즘은 각 팔(arm)의 현재까지의 평균 보상(mean reward)을 추적하면서, 동시에 각 arm 에 대한 상위 신뢰 구간(upper confidence bound, UCB)을 계산합니다.
굉작히 작은 prediction accuracy 상승이라도 이는 전체 매출에 큰 상승으로 이어진다. 수치로 따지면, 대략 1% 정도의 logloss (또는 AUC) 상승을 의미한다.
Joint-training consists of training together multiple networks with different learning objectives in order to benefit from the synergy of the learning.
popularity bias 를 해결하는데 사용한다. basic idea 는 recommender G 와 introduced adversary D 의 min-max game 을 수행하는것 .
사용자가 아이템에 대한 선호를 직접 표현한 신호다. 별점, 좋아요/싫어요, 리뷰 점수가 여기 해당한다. 반대는 implicit feedback 으로, 선호를 말한 적은 없지만 행동에서 추론하는 신호다. 클릭, 시청 시간, 구매, 장바구니 담기 등이다.
class 분류 문제에서 class 당 instance 수의 균형이 맞지 않는 문제를 말하며, 이를 imbalanced data 라고 한다. Solutions 가장 먼저 해볼것은 그냥 전체 데이터를 이용해 학습해 보는 것이다. 만약 모델이 잘 동작한다면 문제 없다.
References [ICR IARC, 2023] EDA and Submission | Kaggle.