테스팅 (Testing)¶
크루(Crew)를 만들고 나면, 정말 원하는 대로 움직이는지 궁금해지죠. 개발 과정에서 테스트는 빠질 수 없는 단계인데요, crewAI에는 이걸 쉽게 해 주는 기본 내장 테스트 기능이 들어 있어요. 크루가 어떻게 수행되는지 확인하고, 성능을 평가해 볼 수 있어요.
테스트 기능 사용하기¶
crewAI에서는 명령줄(CLI)에서 crewai test 라는 명령어를 하나 추가해서 테스트를 아주 손쉽게 만들었어요. 이 명령을 실행하면 크루가 지정한 횟수만큼 반복 실행되면서, 자세한 성능 지표를 보여줍니다.
매개변수는 n_iterations와 model 두 가지가 있어요. 둘 다 선택(optional) 항목이고, 기본값은 각각 2와 gpt-4o-mini예요. 그리고 현재로서는 제공 업체(provider)가 OpenAI 하나뿐이라는 점을 꼭 기억해 두세요.
기본 형태로 그냥 실행하면 이렇게 하면 됩니다.
반복 횟수를 늘리거나 다른 모델을 쓰고 싶다면, 매개변수를 지정하면 돼요.
짧은 형태로도 쓸 수 있어요.
참고로 예전에 쓰던 --n_iterations 플래그는 여전히 동작하지만, 이제는 사용이 권장되지 않는(deprecated) 상태라 --help 목록에서도 숨겨져 있어요. 새로 작성할 땐 --n-iterations(혹은 -n)를 쓰시는 게 맞아요.
crewai test를 돌리면 크루가 지정한 횟수만큼 실행되고, 실행이 끝나면 성능 지표가 화면에 표시됩니다. 점수 표가 마지막에 나오는데, 크루의 성능을 다음 지표들로 보여줘요.
| Tasks/Crew/Agents | Run 1 | Run 2 | Avg. Total | Agents | Additional Info |
|---|---|---|---|---|---|
| Task 1 | 9.0 | 9.5 | 9.2 | Professional Insights | |
| Researcher | |||||
| Task 2 | 9.0 | 10.0 | 9.5 | Company Profile Investigator | |
| Task 3 | 9.0 | 9.0 | 9.0 | Automation Insights | |
| Specialist | |||||
| Task 4 | 9.0 | 9.0 | 9.0 | Final Report Compiler | Automation Insights Specialist |
| Crew | 9.00 | 9.38 | 9.2 | ||
| Execution Time (s) | 126 | 145 | 135 |
위 예시는 작업(Task)이 여러 개인 크루를 두 번(두 번의 실행) 돌린 결과예요. 각 작업과 크루 전체의 평균 총점(평균 총 점수)이 나타나 있죠.
실무 관점¶
- 반복 실행이 곧 테스트의 본질이에요. 한 번 실행으로는 크루가 '운이 좋아서' 잘했는지 알 수 없으니, 여러 번 돌려 평균을 보는 게 안정적인 판단 기준이 됩니다.
- 모델 선택은 성능에 직접 영향을 줘요. 평가용으로
gpt-4o-mini같은 가벼운 모델을 먼저 써 보고, 실제 운영에서는 더 강한 모델로 바꿔가며 비교해 보는 흐름을 추천해요. - 현재 OpenAI만 지원한다는 제약이 있어요. 다른 제공 업체를 쓰고 싶다면, 그때의 crewAI 문서나 릴리스 노트를 확인해 보세요.
- 결과 표의 "Execution Time (s)" 행은 실행 시간까지 보여주니, 정확도와 속도 사이의 트레이드오프를 함께 볼 수 있어요.