개요 (대조 사전학습과 CCPairs)
개요 (대조 사전학습과 CCPairs)
E5는 Microsoft의 약한 지도 대조 사전학습(weakly-supervised contrastive pre-training) 기반 텍스트 임베딩 모델이에요. 핵심 아이디어는 '질문-답변', '제목-본문' 같은 **텍스트 쌍(CCPairs)**을 대조 학습으로 훈련해, 텍스트를 단일 벡터 하나로 잘 압축하는 거예요.
핵심 아이디어
- CCPairs 데이터셋: 인터넷에서 수집한 대규모 텍스트 쌍을 큐레이션해 학습 신호로 써요.
- 대조 학습: 같은 쌍의 임베딩은 가깝게, 다른 쌍은 멀어지도록 훈련해요.
- 단일 벡터 표현: 검색·클러스터링·분류처럼 텍스트를 숫자 하나로 바꾸는 모든 작업에 바로 활용할 수 있어요.
성능
- BEIR 제로샷 검색에서 레이블 데이터 없이 BM25를 넘어선 첫 모델이에요.
- fine-tune 시 BEIR·MTEB 벤치마크에서 기존 모델을 이겼고, 파라미터가 40배 더 큰 모델보다 좋은 결과를 냈어요.
- BEIR·MTEB 56개 데이터셋으로 폭넓게 평가했어요.