Harbor
Harbor
Harbor는 Terminal-Bench 제작자들이 만든, 에이전트와 언어 모델을 평가·최적화하기 위한 프레임워크예요. 100개 이상의 LLM 프로바이더를 호출하기 위해 LiteLLM을 사용해요.
출처: 문서
본문
Harbor는 Terminal-Bench 제작자들이 만든, 에이전트와 언어 모델을 평가·최적화하기 위한 프레임워크예요. 100개 이상의 LLM 프로바이더를 호출하기 위해 LiteLLM을 사용해요.
# Install
uv add harbor
# Run a benchmark with any LiteLLM-supported model
harbor run --dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-5 \
--n-concurrent 4
주요 기능:
-
Claude Code, OpenHands, Codex CLI 같은 에이전트 평가
-
벤치마크와 환경 구축 및 공유
-
클라우드 프로바이더(Daytona, Modal)에서 병렬로 실험 실행
-
RL 최적화를 위한 롤아웃(rollouts) 생성