Evaluate와 허브에서의 평가

Evaluate와 허브에서의 평가 (Evaluate on the Hub)

Hugging Face 허브에서는 AI 모델을 여러 방식으로 평가할 수 있어요. 이 페이지는 그 다양한 옵션을 안내해 줘요.

  • Community Leaderboards — 특정 작업·도메인의 최고 모델을 한데 모아 순위를 매겨 모두가 접근할 수 있게 해줘요.
  • Model Cards — 저자의 관점에서 모델의 능력을 포괄적으로 정리해 주는 개요예요.
  • Libraries and Packages — 허브에서 모델을 평가할 수 있는 도구들을 제공해요.

Community Leaderboards

커뮤니티 리더보드는 모델이 특정 작업·도메인에서 얼마나 잘하는지 보여줘요. 질의응답, 추론, 분류, 비전, 오디오용 리더보드가 대표적이에요. 새로운 작업을 시작할 때 리더보드를 보면 어떤 모델을 쓸지 판단하는 데 큰 도움이 돼요.

리더보드 모델 유형 설명
MTEB 임베딩 Massive Text Embedding Benchmark. 1000개 이상 언어에 걸쳐 100개 이상의 텍스트·이미지 임베딩 모델을 비교해요.
Open ASR Leaderboard 오디오 허브의 음성 인식 모델을 순위 매기고 평가해요. 평균 WER을 낮은 것부터 높은 것 순으로 순위를 매겨요.
LLM-Perf Leaderboard LLM 성능 품질과 성능의 교차점에 있는 리더보드. Optimum-Benchmark로 다양한 하드웨어·백엔드·최적화에서 LLM의 성능(지연, 처리량, 메모리, 에너지)을 벤치마크해요.

리더보드는 허브에 훨씬 많아요. 이 검색으로 모든 리더보드를 확인하거나, 전용 스페이스에서 내 작업에 맞는 리더보드를 찾아보세요.

Model Cards

모델 카드는 커뮤니티나 모델 저자가 평가한 모델의 능력 개요를 제공해요. 모델의 강점과 한계를 이해하는 데 아주 좋은 자료예요. 리더보드와 달리 모델 카드의 평가 점수는 커뮤니티가 아닌 저자가 만드는 경우가 많아요.

결과를 보고하는 방법은 Model Card Evaluation Results 메타데이터에서 자세히 확인할 수 있어요.

라이브러리와 패키지

허브에서 모델을 평가하는 데 쓸 수 있는 오픈소스 라이브러리와 패키지가 여럿 있어요. 커스텀 모델이나 커스텀 평가 작업의 성능을 평가하고 싶을 때 유용하죠.

LightEval

LightEval은 LLM을 평가하기 위한 라이브러리예요. 포괄적이면서도 커스터마이즈 가능하게 설계됐는데, 자세한 내용은 LightEval 저장소에서 확인할 수 있어요. 허브에서 최근 더 활발히 유지보수되는 접근법을 찾는다면 LightEval을 살펴보세요.

🤗 Evaluate

머신러닝 모델과 데이터셋을 쉽게 평가하기 위한 라이브러리예요. 한 줄의 코드만으로 NLP, 컴퓨터비전, 강화학습 등 여러 도메인의 수십 가지 평가 방법에 접근할 수 있어요. 로컬 머신이든 분산 학습 환경이든, 모델을 일관되고 재현 가능한 방식으로 평가할 수 있답니다.

사용 가능한 메트릭 전체 목록은 🤗 Evaluate 조직에서 확인할 수 있어요. 각 메트릭은 인터랙티브 데모가 있는 전용 스페이스와, 메트릭의 한계와 사용법을 다루는 문서 카드를 갖고 있어요.

출처: https://huggingface.co/docs/evaluate/index