1 min read
Convolution Neural Network 을 활용하여 데이터스트림 개념 변화 검출
개념 변화 검출의 중요성 기존의 데이터 마이닝 방법들은 입력되는 데이터들이 고정된 상황에서 데이터들의 경향을 미리 파악한 뒤, 파악한 경향성을 바탕으로 이후의 동작을 수행하는 경우가 많다.
If we have a data set consisting of the values a {1},a {2},\ldots,a {n}, then the arithmetic mean A is defined by the formula: A=\frac{1}{n}\sum {i=1}^{n}a {i}=\frac{a {1}+a...
variance 는 평균에서 얼마나 벗어난 것인지의 정도를 측정한 값이다. 랜덤 변수 X 에 대한 Variance 는 expectation 을 활용하면 다음과 같이 두가지 방식으로 표현될 수 있다.
Data Bias 란 수집된 학습 데이터의 분포가 이상적인 테스트 데이터의 분포와 다른 것을 의미한다. 아무리 많은 데이터를 수집하더라도, 분포 자체가 다르면 estimation 과 optimal function 간 gap 이 생길 수 밖에 없다.
covariate shift 는 ML 에서 종종 마주치는 특수한 형태의 데이터 변화를 의미한다. References www.seldon.io/what-is-covariate-shift .
bias 는 데이터 내에 있는 모든 정보를 고려하지 않음으로 인해, 지속적으로 잘못된 것들을 학습하는 경향을 말한다. 어떤 모델을 학습시켰을 경우, 그 모델이 예측한 값과 실제 정답이 얼마나 멀리있는지를 나타내는가 생각해보면 된다.
데이터를 만들어내는 확률분포가 시간에 따라 변하는 상황을 말한다. 반대로 분포가 시간이 지나도 그대로면 stationary 다. 머신러닝 모델은 대개 “학습 데이터와 앞으로 들어올 데이터가 같은 분포에서 나온다” 는 가정 위에 서 있다.
class 분류 문제에서 class 당 instance 수의 균형이 맞지 않는 문제를 말하며, 이를 imbalanced data 라고 한다. Solutions 가장 먼저 해볼것은 그냥 전체 데이터를 이용해 학습해 보는 것이다. 만약 모델이 잘 동작한다면 문제 없다.
학습의 목적이 parameters 가 아닌 학습을 의미한다.즉, 모델을 구축하지 않아서 새로운 데이터가 입력으로 들어왔을 때, 알고리즘을 처음부터 재학습할 필요성이 존재한다. 예) t-SNE 는 고차원 데이터에 대한 최적의 저차원 데이터를 추정한다.
Training data 전체를 메모리상에 보관하면서 test 데이터가 새로 들어왔을 때 바로 학습하는 방법 장점 추가적인 학습 시간 없이, 곧바로 학습 결과를 얻을 수 있다.