리더보드와 평가
리더보드와 평가 (Leaderboards and Evaluations)
허브에는 LLM, 챗봇 등을 포함한 머신러닝 모델의 리더보드와 평가가 준비돼 있어요. 리더보드는 크게 세 종류로 나뉘어요.
- Eval Results — GPQA, MMLU-Pro 같은 공식 벤치마크 데이터셋이나 학술 논문에 쓰이는 데이터셋에서 나온 평가 결과예요. 모델 저장소에 결과가 공개되면 그 점수가 모델 페이지에 표시돼요.
- Community Managed Leaderboards — 스페이스에 살아 있고, 특정 유스케이스에 맞춰 커뮤니티가 관리하는 리더보드예요.
- Open LLM Leaderboard — Hugging Face 팀이 큐레이션한 프로젝트로, 오픈소스 LLM과 챗봇을 평가하고 순위를 매겨 재현 가능한 점수를 제공했어요. 마케팅의 과장과 실제 연구 진전을 구분해 주는 역할을 했죠.
