평가 실행과 결과 로딩

평가 실행과 결과 로딩

모델과 태스크(또는 벤치마크)를 정했다면 이제 평가를 실행할 차례예요. mteb.evaluate(model, tasks=benchmark) 호출 하나로 태스크별 모델 평가가 돌아가요.

pip install mteb

설치 후에는 모델과 벤치마크를 가져와 평가를 바로 시작할 수 있어요.

import mteb

benchmark = mteb.get_benchmark("MIEB(eng)")
model = mteb.get_model("openai/clip-vit-base-patch16")  # example model

results = mteb.evaluate(model, tasks=benchmark)

평가 실행의 세부 요소

  • 캐시 관리: 태스크 데이터셋과 평가 결과를 캐시해서 반복 실행을 빠르게
  • 평가 가속화: 가능한 경우 멀티프로세싱 등으로 평가 속도를 높임
  • 모달리티: 텍스트뿐 아니라 이미지·이미지-텍스트 임베딩도 평가

결과 로딩

결과는 저장 후 mteb가 제공하는 로딩 API로 불러올 수 있어요. 기존 모델 결과를 불러와 비교하거나, 리더보드에 올리기 전에 검토하는 데 쓰여요. 결과 로딩에 대한 자세한 절차는 문서의 Loading Results 섹션에 정리돼 있어요.

컨트리뷰팅

새 모델을 리더보드에 추가하거나, 새 태스크·데이터셋·벤치마크를 MTEB에 기여할 수도 있어요. 각각 Adding a model / Adding a dataset / Adding a benchmark 문서에 절차가 설명돼 있어요.

더 알아보기