콘텐츠로 이동

테스팅 (Testing)

크루(Crew)를 만들고 나면, 정말 원하는 대로 움직이는지 궁금해지죠. 개발 과정에서 테스트는 빠질 수 없는 단계인데요, crewAI에는 이걸 쉽게 해 주는 기본 내장 테스트 기능이 들어 있어요. 크루가 어떻게 수행되는지 확인하고, 성능을 평가해 볼 수 있어요.

테스트 기능 사용하기

crewAI에서는 명령줄(CLI)에서 crewai test 라는 명령어를 하나 추가해서 테스트를 아주 손쉽게 만들었어요. 이 명령을 실행하면 크루가 지정한 횟수만큼 반복 실행되면서, 자세한 성능 지표를 보여줍니다.

매개변수는 n_iterationsmodel 두 가지가 있어요. 둘 다 선택(optional) 항목이고, 기본값은 각각 2gpt-4o-mini예요. 그리고 현재로서는 제공 업체(provider)가 OpenAI 하나뿐이라는 점을 꼭 기억해 두세요.

기본 형태로 그냥 실행하면 이렇게 하면 됩니다.

crewai test

반복 횟수를 늘리거나 다른 모델을 쓰고 싶다면, 매개변수를 지정하면 돼요.

crewai test --n-iterations 5 --model gpt-4o

짧은 형태로도 쓸 수 있어요.

crewai test -n 5 -m gpt-4o

참고로 예전에 쓰던 --n_iterations 플래그는 여전히 동작하지만, 이제는 사용이 권장되지 않는(deprecated) 상태라 --help 목록에서도 숨겨져 있어요. 새로 작성할 땐 --n-iterations(혹은 -n)를 쓰시는 게 맞아요.

crewai test를 돌리면 크루가 지정한 횟수만큼 실행되고, 실행이 끝나면 성능 지표가 화면에 표시됩니다. 점수 표가 마지막에 나오는데, 크루의 성능을 다음 지표들로 보여줘요.

Tasks/Crew/Agents Run 1 Run 2 Avg. Total Agents Additional Info
Task 1 9.0 9.5 9.2 Professional Insights
Researcher
Task 2 9.0 10.0 9.5 Company Profile Investigator
Task 3 9.0 9.0 9.0 Automation Insights
Specialist
Task 4 9.0 9.0 9.0 Final Report Compiler Automation Insights Specialist
Crew 9.00 9.38 9.2
Execution Time (s) 126 145 135

위 예시는 작업(Task)이 여러 개인 크루를 두 번(두 번의 실행) 돌린 결과예요. 각 작업과 크루 전체의 평균 총점(평균 총 점수)이 나타나 있죠.

실무 관점

  • 반복 실행이 곧 테스트의 본질이에요. 한 번 실행으로는 크루가 '운이 좋아서' 잘했는지 알 수 없으니, 여러 번 돌려 평균을 보는 게 안정적인 판단 기준이 됩니다.
  • 모델 선택은 성능에 직접 영향을 줘요. 평가용으로 gpt-4o-mini 같은 가벼운 모델을 먼저 써 보고, 실제 운영에서는 더 강한 모델로 바꿔가며 비교해 보는 흐름을 추천해요.
  • 현재 OpenAI만 지원한다는 제약이 있어요. 다른 제공 업체를 쓰고 싶다면, 그때의 crewAI 문서나 릴리스 노트를 확인해 보세요.
  • 결과 표의 "Execution Time (s)" 행은 실행 시간까지 보여주니, 정확도와 속도 사이의 트레이드오프를 함께 볼 수 있어요.

더 알아보기