평가 결과

평가 결과 (Evaluation Results)

이 기능은 현재 작업 진행 중(work in progress)인 기능이에요.

허브는 모델 평가 결과를 추적하는 분산 시스템을 제공해요. 벤치마크 데이터셋이 리더보드를 호스팅하고, 모델 저장소는 평가 점수를 저장해 두면 그 점수가 모델 페이지와 벤치마크 리더보드 양쪽에 자동으로 표시돼요.

벤치마크 데이터셋

데이터셋 저장소는 벤치마크(Benchmark) 로 정의될 수 있어요(예: MMLU-Pro, HLE, GPQA). 이런 저장소에는 "Benchmark" 태그가 표시되고, 허브 곳곳의 모델 저장소에서 평가 결과를 자동으로 모아 상위 모델의 리더보드를 보여줘요.

모델 평가 결과

평가 점수는 모델 저장소의 .eval_results/ 폴더에 YAML 파일로 저장돼요. 이 결과는:

  • 모델 페이지에 표시되고, 벤치마크 리더보드로 연결되는 링크가 함께 붙어요.
  • 벤치마크 데이터셋의 리더보드에 집계돼요.
  • PR을 통해 제출되며 "community-provided(커뮤니티 제공)"로 표시될 수 있어요.

평가 결과 추가하기

모델에 평가 결과를 추가하려면 .eval_results/ 폴더에 YAML 파일을 담아 모델 저장소에 PR을 제출하면 돼요.

모델 저장소의 .eval_results/*.yaml에 YAML 파일을 만드세요.

- dataset:
    id: cais/hle                  # 필수. 허브 데이터셋 ID (Benchmark여야 함)
    task_id: default              # 필수. 데이터셋의 eval.yaml에 정의된 Task ID
    revision: <hash>              # 선택. 데이터셋 리비전 해시
  value: 20.90                    # 필수. 메트릭 값
  verifyToken: <token>            # 선택. 감사 가능한 평가의 암호학적 증명
  date: "2025-01-15"              # 선택. 평가가 실행된 ISO-8601 날짜·시간 (기본은 git 커밋 시각)
  source:                         # 선택. 이 결과의 출처 (출력 트레이스를 담은 저장소나 논문 등)
    url: https://huggingface.co/spaces/SaylorTwift/smollm3-mmlu-pro  # source 제공 시 필수
    name: Eval traces             # 선택. 표시 이름
    user: SaylorTwift             # 선택. HF 사용자명/조직
  notes: "no-tools"               # 선택. 평가 설정에 대한 세부 정보 (예: "tools", "no-tools")

출처: https://huggingface.co/docs/hub/eval-results