Zzong's Notes

Home

❯

Retrieval

❯

sparse

❯

doc2query

doc2query

2026년 6월 14일1 min read

doc2query

550

문서가 주어졌을 때 질의를 생성하도록 학습된 seq2seq transformer 모델로 미리 정의된 합성 질의들을 각 문서마다 생성한다. 이후에 BM25 로 확장된 문서의 retrieval 작업을 수행한다.

B) References

  • Document Expansion by Query Prediction

함께 보면 좋은 글

BM25

BM25 주어진 쿼리에 대해 문서와의 연관성을 평가하는 ranking 알고리즘.

Sparse Retrieval Serving

Sparse retrieval 모델(BM25, SPLADE 등)은 Inverted Index 위에서 동작하며, 기존 검색 엔진 인프라를 그대로 재활용할 수 있다.

SparTerm

SparTerm이란 SparTerm (Yang Bai et al., 2020)은 BERT의 MLM(Masked Language Modeling) Head를 활용하여 문서/쿼리를 vocab 크기의 sparse vector로 변환 하는 learned sparse retrieval 모델이다.

Sparse embedding models

임베딩 모델의 개념 임베딩 모델은 텍스트와 같은 입력 데이터를 의미적 의미를 담은 벡터 표현(임베딩)으로 변환하는 모델입니다.

SPLADE

SPLADE란 SPLADE(SParse Lexical AnD Expansion model)는 NAVER LABS EUROPE에서 개발한 learned sparse retrieval 모델이다. 문장이나 문단을 vocabulary 크기(e.g.

SPLARE

한줄 요약 SPLARE (SParse LAtent REtrieval) 는 Naver Labs Europe에서 제안한 새로운 Learned Sparse Retrieval 방법으로, 기존 SPLADE가 LLM의 vocabulary space로 투영하는 것과 달리, pre-trained Sparse...

SPLATE

한줄 요약 ColBERTv2의 frozen token embedding을 경량 MLM adapter ( 0.6M 파라미터)로 sparse vocabulary 공간에 매핑 하여, inverted index 기반 candidate generation + ColBERT MaxSim re-ranking을 단일...

Bayesian BM25

한줄 요약 BM25 스코어를 Bayesian inference로 calibrated probability [0, 1]로 변환하여, lexical과 vector 시그널을 확률론적으로 결합하는 hybrid search 프레임워크.

An Efficiency Study for SPLADE Models

paper link: 2207.03834 논문 개요 이 논문은 최첨단 검색 성능을 보여주는 SPLADE라는 신경망 정보 검색(IR) 모델의 효율성, 특히 검색 속도(latency)를 개선하는 데 초점을 맞추고 있습니다.

Inverted Index

Inverted Index (역색인) Inverted Index는 검색 엔진의 핵심 자료구조로, “단어 → 해당 단어가 등장하는 문서 목록(+ 가중치)” 를 저장하는 방식이다.

  • doc2query
  • B) References