평가 실행과 결과 로딩
평가 실행과 결과 로딩
모델과 태스크(또는 벤치마크)를 정했다면 이제 평가를 실행할 차례예요. mteb.evaluate(model, tasks=benchmark) 호출 하나로 태스크별 모델 평가가 돌아가요.
pip install mteb
설치 후에는 모델과 벤치마크를 가져와 평가를 바로 시작할 수 있어요.
import mteb
benchmark = mteb.get_benchmark("MIEB(eng)")
model = mteb.get_model("openai/clip-vit-base-patch16") # example model
results = mteb.evaluate(model, tasks=benchmark)
평가 실행의 세부 요소
- 캐시 관리: 태스크 데이터셋과 평가 결과를 캐시해서 반복 실행을 빠르게
- 평가 가속화: 가능한 경우 멀티프로세싱 등으로 평가 속도를 높임
- 모달리티: 텍스트뿐 아니라 이미지·이미지-텍스트 임베딩도 평가
결과 로딩
결과는 저장 후 mteb가 제공하는 로딩 API로 불러올 수 있어요. 기존 모델 결과를 불러와 비교하거나, 리더보드에 올리기 전에 검토하는 데 쓰여요. 결과 로딩에 대한 자세한 절차는 문서의 Loading Results 섹션에 정리돼 있어요.
컨트리뷰팅
새 모델을 리더보드에 추가하거나, 새 태스크·데이터셋·벤치마크를 MTEB에 기여할 수도 있어요. 각각 Adding a model / Adding a dataset / Adding a benchmark 문서에 절차가 설명돼 있어요.