- Information Bottleneck 은 신호의 압축률과 정보 손실 간의 trade-off 를 푸는 문제이다
- IB Formalized the problem that finding a short code for X that preserves the maximum information about Y through a ‘bottleneck’
1 min read
Information Bottleneck
dl.acm.org/doi/pdf/10.1145/3460231.3474263 Abstract biased 와 unbiased feedback 생성 과정을 설명 두 과정의 차이는 bias 의 source 때문인데, 이를 confounding bias 라고 부름 biased feedback 이 존재하는 상황에서...
Decision Tree 에서 tree 의 node 를 나눌 때, feature 를 선택하는 기준으로 information gain 을 사용한다.
피셔 정보는 어떤 정보의 양을 측정하는 방법이다. 그 정보란, 랜덤 변수가 가지는 분포의 매개변수에 대해 유추할 수 있는 정보를 말한다.
시간 t 에 대한 RIG 값은 다음과 같다.
References A Sub-linear, Massive-scale Look-alike Audience Extension System (yahoo, 2016) .
두 이산 랜덤 변수 X,Y에 대하여 outcome pair (x,y)의 PMI는 두 값이 독립일 때 기대되는 빈도보다 얼마나 더 자주 또는 덜 자주 함께 나타나는지 를 측정한다.
Mutual Information(MI)은 두 random variable이 얼마나 많은 정보를 공유하는지 를 측정한다. 조금 더 직관적으로 말하면, X를 알게 되었을 때 Y에 대한 불확실성이 얼마나 줄어드는지를 보는 값이다.
최적화 문제 (Optimization problems) 란 여러개의 선택가능한 후보 중에서 최적의 해 (Optimal value) 또는 최적의 해에 근접한 값을 찾는 문제를 일컫는다.
한줄 요약 LLM이 모호한 태스크를 받았을 때, Bayesian Experimental Design (BED) 을 활용해 정보 이득(EIG)이 최대인 clarifying question 을 생성하여 모호성을 능동적으로 해소하는 프레임워크.
한줄 요약 Prompt Compression은 LLM에 넣는 prompt를 더 짧게 줄이되, 답변에 필요한 정보는 최대한 남기려는 input 최적화 방법이다.