Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다.
아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.
1 min read
Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다.
아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.
Bias in Recommendation Collection: Bias in Data Data Bias 정의 Data Bias 참고 Selection Bias (from Explicit feedback) selection bias 는 사용자가 어떤 아이템을 평가할 것인지에서 비롯된다. 그래...
paper link Abstract Blindly fitting the data without considering the inherent biases will result in many serious issues, e.g., the discrepancy between offline evaluation and...
popularity bias 를 해결하는데 사용한다. basic idea 는 recommender G 와 introduced adversary D 의 min-max game 을 수행하는것 .
정의 metric learning 은 데이터 포인트 간의 거리를 측정하는 방법을 학습하는 기법입니다.
데이터를 만들어내는 확률분포가 시간에 따라 변하는 상황을 말한다. 반대로 분포가 시간이 지나도 그대로면 stationary 다. 머신러닝 모델은 대개 “학습 데이터와 앞으로 들어올 데이터가 같은 분포에서 나온다” 는 가정 위에 서 있다.
Exposure bias 는 사용자가 모든 item 을 본 것이 아니라, 노출된 item 에 대해서만 feedback 을 남긴다는 데서 생기는 bias 다.
Joint-training consists of training together multiple networks with different learning objectives in order to benefit from the synergy of the learning.
Abstract 추천 시스템에서 학습 또는 평가를 위한 데이터는 대부분 selection bias 에 취약하다. 이러한 bias 는 RS 의 action 이나 유저들의 self-selection 을 통해 생성된다.
유명한 아이템은 더 많이 노출되어서 학습 데이터의 밸런스가 더욱 무너지는 현상.
bias 는 데이터 내에 있는 모든 정보를 고려하지 않음으로 인해, 지속적으로 잘못된 것들을 학습하는 경향을 말한다. 어떤 모델을 학습시켰을 경우, 그 모델이 예측한 값과 실제 정답이 얼마나 멀리있는지를 나타내는가 생각해보면 된다.
Reference paper: dl.acm.org/doi/pdf/10.1145/3240323.3240372 cailbration 의 목적 In the recommended list of items, calibration ensures that the various (past) areas of interest of...