Harbor

Harbor

Harbor는 Terminal-Bench 제작자들이 만든, 에이전트와 언어 모델을 평가·최적화하기 위한 프레임워크예요. 100개 이상의 LLM 프로바이더를 호출하기 위해 LiteLLM을 사용해요.

출처: 문서

본문

Harbor는 Terminal-Bench 제작자들이 만든, 에이전트와 언어 모델을 평가·최적화하기 위한 프레임워크예요. 100개 이상의 LLM 프로바이더를 호출하기 위해 LiteLLM을 사용해요.

# Install
uv add harbor

# Run a benchmark with any LiteLLM-supported model
harbor run --dataset [email protected] \
   --agent claude-code \
   --model anthropic/claude-opus-5 \
   --n-concurrent 4

주요 기능:

  • Claude Code, OpenHands, Codex CLI 같은 에이전트 평가

  • 벤치마크와 환경 구축 및 공유

  • 클라우드 프로바이더(Daytona, Modal)에서 병렬로 실험 실행

  • RL 최적화를 위한 롤아웃(rollouts) 생성

  • GitHub

  • 문서

더 알아보기 (Learn more)