2025년 retrieval 구성 방식에 따른 트랜드 조사
Lesson Learned
- 네거티브 샘플 수를 늘릴수록 특히 in-domain 환경에서 성능 향상이 두드러지지만, out-of-domain 일반화에는 큰 영향이 없었습니다.
B) Methods
- 여러 cross-encoder re-ranker 앙상블을 활용해 distillation score 를 생성
1 min read
Retrieval Paper List SIGIR 2025 에서 읽어볼만한 페이퍼 리스트 (인더스트리) GRAIN: Group-Reinforced Adaptive Interaction Network for Cold-Start CTR Prediction in E-commerce Search: 이커머스 검색에서 콜드...
A Survey on AI Search with Large Language Models preprints.org/frontend/manuscript/79453d62cbbfce9ac42239071098a3d9/download pub B) References GitHub -...
검색 API의 독자가 바뀌었다 Perplexity의 “Architecting and Evaluating an AI-First Search API”에서 제일 흥미로운 지점은 검색 API를 바라보는 관점이다. 예전 검색 API의 독자는 사람이었다.
doc2query 문서가 주어졌을 때 질의를 생성하도록 학습된 seq2seq transformer 모델로 미리 정의된 합성 질의들을 각 문서마다 생성한다. 이후에 BM25 로 확장된 문서의 retrieval 작업을 수행한다.
Dense Retrieval 모델의 스케일링 법칙: 모델 크기와 데이터가 성능에 미치는 영향 이 연구는 정보 검색 분야의 핵심 기술인 Dense Retrieval(밀집 벡터 기반 검색) 모델의 성능이 모델 크기와 학습 데이터 양에 따라 어떻게 변화하는지를 체계적으로 분석합니다.
BEIR BEIR는 zero-shot retrieval 평가를 위해 자주 쓰이는 benchmark suite다.
Jina-ColBERT-v2: A General Purpose Multilingual Late Interaction Retriever 이 논문은 ColBERT와 같은 다중 벡터(multi-vector) 밀집 리트리버 모델의 효용성을 강조하며 출발합니다.
2508.21038 Query 종류 A.1) 🧭 지시 기반 검색(Instruction-based Retrieval) 지시 기반 검색이란, 단순히 키워드나 문장만으로 정보를 찾는 것을 넘어, 사용자의 의도와 지시를 파악하여 그에 부합하는 문서를 찾아주는 방식입니다.
Evaluating Chunking Strategies for Retrieval | Chroma Research 📘 개요: AI 애플리케이션을 위한 새로운 검색 평가의 필요성 AI 애플리케이션, 특히 검색 증강 생성(RAG)에서 문서 청킹은 핵심 전처리 단계입니다.
2501.17788 WARP: 멀티-벡터 검색을 위한 초고효율 엔진 이해를 돕기 위해, 먼저 정보 검색 기술의 흐름을 간단히 짚어보겠습니다. 1단계: 키워드 검색 (예: BM25) 문서에 특정 단어가 몇 번 나오는지를 세어서 점수를 매기는 방식입니다.