Sentence Transformers
Code Reivew
Encoding
문장이 배치로 주어지면, 문장 길이가 가장 짧은 순서대로 문장을 정렬해서 배치로 가져온다.
length_sorted_idx = np.argsort([-self._text_length(sen) for sen in sentences])
sentences_sorted = [sentences[idx] for idx in length_sorted_idx]1 min read
sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없...
...on이 그대로 posting list와 연결되기 때문에 Active Dimensions와 index size를 같이 봐야 한다. Dense retrieval은 DPR에서 출발해 sentence transformers, m3-embedding, Qwen3 Embedding, LLM2Vec, Gemini Embedding - Generalizable Embeddings from Gemini 같...
Pororo 카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 Related...
배경 이 프로젝트는 대규모 문장 수준 데이터셋을 활용해 문장 임베딩 모델을 학습하는 것을 목표로 합니다. 사전 학습된 microsoft/mpnet-base모델을 기반으로, 10억 쌍의 문장 페어 데이터셋에서 추가로 파인튜닝을 진행하였습니다.
Qwen3 Embedding Qwen3 Embedding은 Qwen3 계열 foundation model을 기반으로 만든 dense embedding model이다.
DPR (Dense Passage Retrieval) Facebook AI Research에서 2020년 발표한 dense retrieval 의 대표적 방법론.
EmbeddingGemma (Arxiv) EmbeddingGemma: Powerful and Lightweight Text Representations EmbeddingGemma is an encoder-only transformer model adapted from a pretrained 300M...
📘 Jina-Embeddings-v4 논문 요약 A.1) 모델 개요 모델 크기: 약 3.8B 파라미터 기반 모델: Qwen2.5-VL-3B-Instruct 입력 범위: 최대 32k 토큰의 텍스트와 최대 20MP 해상도의 이미지 출력 방식: Single-vector 모드: 전체 문서를 하나의 2048차원 벡터로 표현.
LLM2Vec이란 무엇인가 LLM2Vec은 GPT와 같은 ‘디코더-전용(decoder-only)’ 대규모 언어 모델(LLM)을 BERT처럼 텍스트의 의미를 벡터로 잘 추출하는 강력한 ‘텍스트 인코더(text encoder)‘로 변환하는 간단하고 효과적인 비지도 학습 방법론입니다.
M3-Embedding 논문 핵심 요약 이 논문은 M3-Embedding이라는 새로운 텍스트 임베딩 모델을 제안합니다.
Dense Retrieval 모델의 스케일링 법칙: 모델 크기와 데이터가 성능에 미치는 영향 이 연구는 정보 검색 분야의 핵심 기술인 Dense Retrieval(밀집 벡터 기반 검색) 모델의 성능이 모델 크기와 학습 데이터 양에 따라 어떻게 변화하는지를 체계적으로 분석합니다.
2503.07891 🏗️ 모델 구조 입력 처리: 입력 텍스트를 Gemini 기반 Transformer로 처리 Pooling: Mean pooling을 사용해 전체 시퀀스를 하나의 벡터로 요약 투영: 선형 투영층을 통해 원하는 차원의 임베딩 생성 (최대 3072차원) A.1) 🎯 학습 방식 Loss...