Evaluate와 허브에서의 평가
Evaluate와 허브에서의 평가 (Evaluate on the Hub)
Hugging Face 허브에서는 AI 모델을 여러 방식으로 평가할 수 있어요. 이 페이지는 그 다양한 옵션을 안내해 줘요.
- Community Leaderboards — 특정 작업·도메인의 최고 모델을 한데 모아 순위를 매겨 모두가 접근할 수 있게 해줘요.
- Model Cards — 저자의 관점에서 모델의 능력을 포괄적으로 정리해 주는 개요예요.
- Libraries and Packages — 허브에서 모델을 평가할 수 있는 도구들을 제공해요.
Community Leaderboards
커뮤니티 리더보드는 모델이 특정 작업·도메인에서 얼마나 잘하는지 보여줘요. 질의응답, 추론, 분류, 비전, 오디오용 리더보드가 대표적이에요. 새로운 작업을 시작할 때 리더보드를 보면 어떤 모델을 쓸지 판단하는 데 큰 도움이 돼요.
| 리더보드 | 모델 유형 | 설명 |
|---|---|---|
| MTEB | 임베딩 | Massive Text Embedding Benchmark. 1000개 이상 언어에 걸쳐 100개 이상의 텍스트·이미지 임베딩 모델을 비교해요. |
| Open ASR Leaderboard | 오디오 | 허브의 음성 인식 모델을 순위 매기고 평가해요. 평균 WER을 낮은 것부터 높은 것 순으로 순위를 매겨요. |
| LLM-Perf Leaderboard | LLM 성능 | 품질과 성능의 교차점에 있는 리더보드. Optimum-Benchmark로 다양한 하드웨어·백엔드·최적화에서 LLM의 성능(지연, 처리량, 메모리, 에너지)을 벤치마크해요. |
리더보드는 허브에 훨씬 많아요. 이 검색으로 모든 리더보드를 확인하거나, 전용 스페이스에서 내 작업에 맞는 리더보드를 찾아보세요.
Model Cards
모델 카드는 커뮤니티나 모델 저자가 평가한 모델의 능력 개요를 제공해요. 모델의 강점과 한계를 이해하는 데 아주 좋은 자료예요. 리더보드와 달리 모델 카드의 평가 점수는 커뮤니티가 아닌 저자가 만드는 경우가 많아요.
결과를 보고하는 방법은 Model Card Evaluation Results 메타데이터에서 자세히 확인할 수 있어요.
라이브러리와 패키지
허브에서 모델을 평가하는 데 쓸 수 있는 오픈소스 라이브러리와 패키지가 여럿 있어요. 커스텀 모델이나 커스텀 평가 작업의 성능을 평가하고 싶을 때 유용하죠.
LightEval
LightEval은 LLM을 평가하기 위한 라이브러리예요. 포괄적이면서도 커스터마이즈 가능하게 설계됐는데, 자세한 내용은 LightEval 저장소에서 확인할 수 있어요. 허브에서 최근 더 활발히 유지보수되는 접근법을 찾는다면 LightEval을 살펴보세요.
🤗 Evaluate
머신러닝 모델과 데이터셋을 쉽게 평가하기 위한 라이브러리예요. 한 줄의 코드만으로 NLP, 컴퓨터비전, 강화학습 등 여러 도메인의 수십 가지 평가 방법에 접근할 수 있어요. 로컬 머신이든 분산 학습 환경이든, 모델을 일관되고 재현 가능한 방식으로 평가할 수 있답니다.
사용 가능한 메트릭 전체 목록은 🤗 Evaluate 조직에서 확인할 수 있어요. 각 메트릭은 인터랙티브 데모가 있는 전용 스페이스와, 메트릭의 한계와 사용법을 다루는 문서 카드를 갖고 있어요.