모델 정의와 태스크 선택

모델 정의와 태스크 선택

MTEB에서 무엇을 어떻게 평가할지 정하는 두 가지 큰 축이 모델 정의태스크·벤치마크 선택이에요. 둘의 역할을 정확히 이해하면 원하는 평가를 정확하게 만들 수 있어요.

벤치마크(Benchmark)

벤치마크는 주어진 용도에 대해 임베딩 모델을 평가하기 위한 도구예요. 예를 들어 mteb(eng)은 영어 텍스트 임베딩 모델의 품질을 검색, 분류, 리랭킹 등 다양한 영어 사용처에 대해 평가하기 위한 벤치마크예요. 벤치마크는 태스크의 모음이고, 모델을 벤치마크에 돌리면 각 태스크를 개별적으로 실행해요.

태스크(Task)

태스크는 평가의 최소 단위예요. MTEB는 1,000개가 넘는 태스크를 다루며, 역사적인 스웨덴 특허 분류부터 파이썬 문서 검색까지 아주 다양한 종류가 있어요. 태스크는 분류·클러스터링 같은 고전 태스크와 법률·코드·헬스케어 검색 같은 사용처 특화 태스크로 나뉘어요.

모델 정의

기존 모델을 쓰고 싶으면 mteb.get_model로 가져오는 걸 권장해요. 커스텀 모델을 정의할 수도 있으며, 이 경우 mteb가 기대하는 인터페이스에 맞춰 모델을 감싸주면 돼요. 모델과 태스크를 정한 뒤 mteb.evaluate(model, tasks=benchmark)로 평가를 실행해요.

리더보드

평가 결과를 커뮤니티와 비교하고 싶다면 Hugging Face의 인터랙티브 **리더보드(Leaderboard)**가 있어요. 어떤 모델이 어떤 태스크에서 얼마나 잘하는지 한눈에 볼 수 있어요.

더 알아보기