Giskard (LLM 에이전트 테스트·평가)

Giskard (LLM 에이전트 테스트·평가)

Giskard는 에이전틱(agentic) 시스템을 테스트하고 평가하기 위한 오픈소스 파이썬 라이브러리예요. Giskard v3는 동적이고 멀티턴(multi-turn)인 AI 에이전트 테스트를 위해 새로 다시 쓰인 버전으로, 무거운 의존성을 덜어내 효율을 높이고 강력한 AI 취약점 스캐너와 RAG 평가를 내장했어요.

v3는 모듈형 구조로, 각각 필요한 의존성만 담은 여러 개의 집중된 패키지로 나뉘어요. LLM, 블랙박스 에이전트, 멀티스텝 파이프라인 등 무엇이든 감싸서(wrap) 테스트할 수 있어요.

핵심 개념

  • Target — 테스트 대상 시스템. 동기·비동기 callable (inputs) -> outputs, 선택적으로 trace 포함
  • Scenario — 하나의 평가(interaction + checks)
  • Suite — 시나리오 모음. 스캔 결과도 Suite로 반환돼요
  • Scan — 에이전트를 문장 한 줄로 설명하면 그에 맞는 테스트 케이스를 자동 생성·실행해 어떤 시나리오가 에이전트를 깨뜨리는지 보고

이 카테고리의 문서

  • 스캔(Scan): 자동 취약점·레드팀 테스트
  • 체크(Checks): 스캔이나 수동으로 테스트를 작성하는 라이브러리
  • 빠른 시작: 설치·구성·허브 연동

출처: https://docs.giskard.ai