SBERT Training Overview — 왜 파인튜닝해야 하나
SBERT Training Overview — 왜 파인튜닝해야 하나
파인튜닝 은 작업마다 다른 '유사도 개념'이 필요하기 때문에 성능을 크게 높일 수 있어요. 같은 뉴스 두 개도 분류는 비슷해야 하지만 의미론적 텍스트 유사도(STS)에선 달라야 할 수 있어요. 그래서 작업에 맞는 임베딩을 직접 만들면 검색·추천 품질이 좋아져요.
훈련 구성 요소
Sentence Transformer 훈련은 4~6개의 구성 요소로 이루어져요:
- 모델(Model):
SentenceTransformer(...)로 로드하거나Transformer+Pooling모듈을 조합해요. - 데이터셋(Dataset):
datasets.Dataset형태로 훈련·평가 데이터를 준비해요. - 손실 함수(Loss): 데이터 형식과 작업에 맞는 손실을 선택해요.
- 트레이너(Trainer):
SentenceTransformerTrainer가 훈련 루프와 평가를 담당해요.
멀티모달
VLM 체크포인트에서 출발해 텍스트·이미지·오디오·비디오를 함께 다루는 멀티모달 임베딩 모델도 훈련할 수 있어요.