1 min read
Gradient Boosting Algorithm (GBM) 은 regression 또는 classification 을 수행할 수 있는 예측모형이며 예측모형의 ensemble 방법론 중 boosting 계열에 속하는 알고리즘 여러개의 weak models 을 조합해서 하나의 결과를 만든다. 일반적으로 Decision Trees 를 많이 사용하며, 이 경우 알고리...
...old 는 k-fold cross-validation 의 fold 로, 데이터를 셔플링한 뒤에 균일하게 나눠진 데이터 구간을 fold 로 정해서 사용한다. OOF 예측은 크게 1) 평가, 2) 앙상블 에 활용된다. 평가 (Evaluation) 각 OOF 에 대하여 metric (e.g. accuracy) 을 구한다음 평균내거나, 아니면 예측 결과들을 리스트 같은곳에 모은뒤에 한번에 계산하는...
...지원Azure AI Search✅ vector weighting 지원OpenSearch⏳ 로드맵에 포함Weaviate✅ alpha 파라미터로 조절 추천 시스템 적용 추천 시스템에서 RRF는 ensemble 방식에 활용된다:
여러 모델을 묶는다는 점에서 ensemble과 닿아 있지만, 출력을 사후 평균/투표하는 앙상블과 달리 Trinity는 누구에게 무슨 일을 시킬지를 매 턴 동적으로 라우팅한다는 점이 다르다. 코디네이터 구조 코디네이터는 두 부분으로 이...
분류 및 회귀 문제를 위해서, 여러 bootstrapping 샘플을 가지고 독립적인 모델 (e.g. Decision Tree) 들을 여러개 만든 다음 각 모델에서 나온 예측값을 평균 (분류 문제에서는 과반수 투표) 내는 것을 방식을 의미한다.
랜덤 포레스트는 결정 트리와 다르며, 결정 트리가 모여서 만들어진 숲(Forest) 같은 모델이라고 생각하시면 쉽습니다. 결정 트리 (Decision Tree) 란 결정 트리는 이름 그대로 ‘의사 결정 규칙’을 나무(Tree) 구조로 도식화한 모델입니다.
Gradient Boosting Algorithm (GBM) 은 regression 또는 classification 을 수행할 수 있는 예측모형이며 예측모형의 ensemble 방법론 중 boosting 계열에 속하는 알고리즘 여러개의 weak models 을 조합해서 하나의 결과를 만든다.
여러개의 weak learner 가 만들어낸 결과를 조합해서 최종 결과를 만드는 방식으로, 오분류된 샘플에 더 많은 가중치를 주어 학습하는 순차적 과정이다.
Joint-training consists of training together multiple networks with different learning objectives in order to benefit from the synergy of the learning.
Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다. 아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.
학습에 사용되지 않은 데이터를 이용해서 예측을 수행하는 방식을 의미한다. fold 는 k-fold cross-validation 의 fold 로, 데이터를 셔플링한 뒤에 균일하게 나눠진 데이터 구간을 fold 로 정해서 사용한다.
In NLP 자연어처리 분야에서는 언어의 일반적인 이해를 신경망에 학습시키기 위해 다음과 같은 방식을 수행한다. Generalized pretraining 에서 사용했던 입/출력 레이어를 제거한다. 특정 작업에 특화된 입/출력 레이어로 교체한다.
정의 metric learning 은 데이터 포인트 간의 거리를 측정하는 방법을 학습하는 기법입니다.
데이터를 만들어내는 확률분포가 시간에 따라 변하는 상황을 말한다. 반대로 분포가 시간이 지나도 그대로면 stationary 다. 머신러닝 모델은 대개 “학습 데이터와 앞으로 들어올 데이터가 같은 분포에서 나온다” 는 가정 위에 서 있다.