1 min read
...이다. 즉, 일부 사용자들에게는 A 로직을 보여주고 다른 일부 사용자들에게 B 로직을 보여주면서 더 반응이 좋은 로직이 무엇인지 비교하는 것이다. 주로 모델의 성능을 측정하기 위한 online evaluation 방법 중 하나로 사용된다. 유의할 점 A/B Test 는 동시에 추천 결과를 노출하는 것이 중요하다. 왜냐하면, 순간적인 유행의 변화, 새로운 콘텐츠의 등장, 요일이나 시간대에 따...
Related online evaluation
Must-read Papers on RS github.com/hongleizhang/RSPapers Top Tier Conferences and Journals WWW, WSDM, SIGIR, KDD, RecSyS, CIKM, TOIS, TKDE, NIPS, ICML, AAAI, IUI, UMAP...
A/B Test 는 사용자들에게 동시에 A 와 B 결과를 노출하고 이 둘의 결과를 비교하는 지표 측정 방법론이다. 즉, 일부 사용자들에게는 A 로직을 보여주고 다른 일부 사용자들에게 B 로직을 보여주면서 더 반응이 좋은 로직이 무엇인지 비교하는 것이다.
현실에 직접 적용하는 대신 정해진 데이터셋에서 성능 평가를 하는 것 일반적으로 사용자들이 관측하지 않은 콘텐츠에 대한 반응을 유추하여 평가하나, 실제 데이터를 사용하지 않았기 때문에 정확한 성능 비교가 어렵다.
Exposure bias 는 사용자가 모든 item 을 본 것이 아니라, 노출된 item 에 대해서만 feedback 을 남긴다는 데서 생기는 bias 다.
Unlike interactive recommendation methods that generate recommendations based on the user’s feedback via constant interactions, sequential recommender systems predict the...
대화형 추천 시스템: 사용자와 실제 대화를 통해 사용자의 성향을 파악하여 추천을 진행함.
단점 새로운 아이템에 대해서는 추천을 제공할 수 없음 popularity bias 가 존재함 (NLP 문제에서 많이 나오는 단어에 대해 반복적으로 등장함) .
Challenge of RS 추천 시스템에서 발생할 수 있는 문제점들 nosiy data 일반적으로 historical 데이터는 모두 사용자의 성향을 반영한다고 가정하지만, 사용자는 자신이 선택한 아이템을 좋아하지 않을 수 있다.
배경 To remedy the selection bias in evaluation, some recent work considers a recommendation as an intervention analogous to treating a patient with a specific drug.
추천 결과 다양성의 종류 inter diversity: 유저 간 추천 결과가 다른것 inner diversity: 추천 결과 내 아이템의 성격이 다른 것 연관 추천에서 강아지 영상을 한번 봤는데, 추천 결과가 모두 강아지와 관련된 영상이면 inner diversity 가 낮다고 할 수 있다.