사전 훈련 모델

사전 훈련 모델

학습부터 직접 하지 않아도, Hugging Face 허브에는 수천 개의 사전 훈련된 Sentence Transformer 모델이 올라와 있어요. 다국어, 도메인 특화, 임베딩 차원 등 목적에 맞는 모델을 고르면 돼요.

모델 고르는 기준

  • 다국어 여부: paraphrase-multilingual-MiniLM-L12-v2처럼 여러 언어를 지원하는 모델
  • 임베딩 차원: 모델마다 차원이 달라서 저장·검색 공간 크기가 달라져요
  • 벤치마크 성능: MTEB 리더보드로 모델 간 성능 비교 가능
from sentence_transformers import SentenceTransformer

model = SentenceTransformer("sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2")

확인 포인트

  • 모델 ID는 허브의 모델 페이지에 있는 라이브러리 태그가 sentence-transformers인 걸 고르면 돼요.
  • 임베딩 차원은 코드에서 embeddings.shape[-1]로 확인할 수 있어요.

출처: https://www.sbert.net/docs/sentence_transformer/pretrained_models.html

더 알아보기