LM Evaluation Harness — LLM 평가 프레임워크 (EleutherAI)
LM Evaluation Harness — LLM 평가 프레임워크 (EleutherAI)
LM Evaluation Harness는 EleutherAI가 만든 통합 LLM 평가 프레임워크예요. 생성형 언어 모델을 수십~수백 개의 표준 평가 작업에서 재현 가능하고 투명하게 테스트할 수 있게 해 줍니다.
60개 이상의 공개 벤치마크와 수백 개의 서브태스크를 구현했고, transformers·vLLM·SGLang·상용 API 등 다양한 백엔드를 지원해요. Hugging Face의 Open LLM Leaderboard도 이 하네스를 백엔드로 씁니다. 아래 페이지에서 CLI 사용법, Python API, 커스텀 모델 확장을 살펴볼게요.