사전 훈련 모델
사전 훈련 모델
학습부터 직접 하지 않아도, Hugging Face 허브에는 수천 개의 사전 훈련된 Sentence Transformer 모델이 올라와 있어요. 다국어, 도메인 특화, 임베딩 차원 등 목적에 맞는 모델을 고르면 돼요.
모델 고르는 기준
- 다국어 여부:
paraphrase-multilingual-MiniLM-L12-v2처럼 여러 언어를 지원하는 모델 - 임베딩 차원: 모델마다 차원이 달라서 저장·검색 공간 크기가 달라져요
- 벤치마크 성능: MTEB 리더보드로 모델 간 성능 비교 가능
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2")
확인 포인트
- 모델 ID는 허브의 모델 페이지에 있는 라이브러리 태그가
sentence-transformers인 걸 고르면 돼요. - 임베딩 차원은 코드에서
embeddings.shape[-1]로 확인할 수 있어요.
출처: https://www.sbert.net/docs/sentence_transformer/pretrained_models.html