SBERT Training Overview — 왜 파인튜닝해야 하나

SBERT Training Overview — 왜 파인튜닝해야 하나

파인튜닝 은 작업마다 다른 '유사도 개념'이 필요하기 때문에 성능을 크게 높일 수 있어요. 같은 뉴스 두 개도 분류는 비슷해야 하지만 의미론적 텍스트 유사도(STS)에선 달라야 할 수 있어요. 그래서 작업에 맞는 임베딩을 직접 만들면 검색·추천 품질이 좋아져요.

훈련 구성 요소

Sentence Transformer 훈련은 4~6개의 구성 요소로 이루어져요:

  • 모델(Model): SentenceTransformer(...)로 로드하거나 Transformer + Pooling 모듈을 조합해요.
  • 데이터셋(Dataset): datasets.Dataset 형태로 훈련·평가 데이터를 준비해요.
  • 손실 함수(Loss): 데이터 형식과 작업에 맞는 손실을 선택해요.
  • 트레이너(Trainer): SentenceTransformerTrainer가 훈련 루프와 평가를 담당해요.

멀티모달

VLM 체크포인트에서 출발해 텍스트·이미지·오디오·비디오를 함께 다루는 멀티모달 임베딩 모델도 훈련할 수 있어요.

더 알아보기