What is the Pool Shifting
시간이 지남에 따라 추천풀에 새로운 Arm 이 등장하거나 기존에 있던 Arm 이 사라지는 현상
대부분의 Multi-Armed Bandit 문제를 푼 논문들은 전체 Arm Set 이 고정이라고 가정하지만, 추천에서는 pool-shift 이슈가 분명 존재한다.
pool-shift 상황에서는 끊임없이 새로운 optimal 을 찾아서 Exploration 을 진행하여야 한다
1 min read
시간이 지남에 따라 추천풀에 새로운 Arm 이 등장하거나 기존에 있던 Arm 이 사라지는 현상
대부분의 Multi-Armed Bandit 문제를 푼 논문들은 전체 Arm Set 이 고정이라고 가정하지만, 추천에서는 pool-shift 이슈가 분명 존재한다.
pool-shift 상황에서는 끊임없이 새로운 optimal 을 찾아서 Exploration 을 진행하여야 한다
정의 Multi-armed Bandit 은 어떤 슬롯머신이 어떤 수익률을 가지는지 모를 때, 탐색 (Exploration) 과 활용 (Exploitation) 을 적절히 사용하여 최적의 수익을 찾아내고자 하는 Reinforcement Learning 알고리즘을 의미한다.
Mortal Multi Armed Bandit (2008) Mortal MAB Related Reference: Mortal Multi-Armed Bandits Body: 논문을 간략하게 읽고 다시 정리해보는 것이 좋을 것 같다.
연구를 위해 문제를 정의하고 솔루션을 찾는다. 일반적으로 scientific method 를 따른다. Problems A.1) For CBandits cbandit 을 운영하면서 발생할 수 있는 문제들에 대해서 고민해본다.
Challenge of RS 추천 시스템에서 발생할 수 있는 문제점들 nosiy data 일반적으로 historical 데이터는 모두 사용자의 성향을 반영한다고 가정하지만, 사용자는 자신이 선택한 아이템을 좋아하지 않을 수 있다.
Counterfactual Learning 추천 시스템의 학습은 supervised learning 과 다르다. 추천 시스템은 오직 사용자가 선택한 결과만을 가지고 학습하기 때문에, log data 는 partial information 형식을 지닌다.
Sequential Model 단점 새로운 아이템에 대해서는 추천을 제공할 수 없음 popularity bias 가 존재함 (NLP 문제에서 많이 나오는 단어에 대해 반복적으로 등장함) .
Exposure Bias Exposure bias 는 사용자가 모든 item 을 본 것이 아니라, 노출된 item 에 대해서만 feedback 을 남긴다는 데서 생기는 bias 다.
Position Bias 확인하는 방법 A.1) 순서 바꾸기 Alter the order of ranked recommendations or search results in some manner 아이템 순서를 섞은것과 섞지 않은 것을 비교하는 방법 예를 들어 reverse ordering 해서 추천 결과를...
Cold-start Cold start 문제란, 사용자와 아이템 간 interaction 이 없는 신규 유저나 신규 아이템을 추천 대상에서 제외되는 문제를 뜻한다.
Cross-domain Recommendation Merging user preferences: User preferences from both domains are aggregated in such a way that single-domain recommender systems can be used.