Arize Phoenix란 무엇인가요?

Arize Phoenix란 무엇인가요?

Arize Phoenix는 AI 애플리케이션이 실제로 어떻게 동작했는지 들여다보고 개선하는 데 쓰는 오픈소스 관찰(observability) 플랫폼이에요. 앱이 실행되는 동안 만들어지는 상세 로그인 트레이스(trace)를 보내면 한 번의 실행에서 무슨 일이 있었는지 단계별로 확인할 수 있고, 평가(evaluation) 테스트로 출력 품질을 점수화해 실패와 회귀를 찾아낼 수 있어요. 실제 운영 예시로 프롬프트를 반복하고, 같은 입력에서 변경 전후를 비교하는 실험(experiments)으로 앱을 다듬기도 하죠. 이런 도구들이 모여 개별 실행을 들여다보는 일에서 '증거 기반으로 품질을 개선'하는 작업으로 자연스럽게 이동하게 도와줘요.

출처: Arize Phoenix - What is Arize Phoenix?

트레이싱(Tracing)

트레이싱은 한 번의 실행에서 무엇이 일어났는지 단계별로 보여줘요. 모델 호출, 검색, 도구 사용, 커스텀 로직까지 트레이스로 잡아내서 문제가 어디서 생겼는지, 시간이 어디에 쓰이는지 파악할 수 있어요. Phoenix는 OpenTelemetry 프로토콜(OTLP)로 트레이스를 받고, LlamaIndex·LangChain·DSPy·Mastra·Vercel AI SDK 같은 인기 프레임워크와 OpenAI·Bedrock·Anthropic 같은 프로바이더, 그리고 Python·TypeScript·Java 같은 언어에 대한 자동 계측(auto-instrumentation)을 제공해요.

평가(Evaluation)

평가는 앱 출력의 품질을 측정하는 일이에요. LLM 기반 평가자로 트레이스와 스팬을 점수화하거나, 코드 기반 체크를 쓰거나, 사람이 직접 라벨링하는 방식으로 실패를 일관되게 추적하고 성능을 파악할 수 있어요. 평가 결과가 쌓이면 어떤 영역이 반복적으로 실패하는지 숫자로 보이기 시작하죠.

프롬프트 엔지니어링(Prompt Engineering)

프롬프트 변형을 데이터셋에 대해 테스트하고, 호출을 재생(replay)해서 변경 사항이 출력에 어떤 영향을 주는지 배포 전에 확인해요. 프롬프트 관리(Prompt Management), 프롬프트 플레이그라운드(Prompt Playground), 스팬 재생(Span Replay), 코드 내 프롬프트 동기화(Prompts in Code) 같은 기능이 함께 제공돼요.

데이터셋 & 실험(Datasets & Experiments)

같은 입력을 사용해 변경 사항을 체계적으로 테스트할 수 있어요. 트레이스를 데이터셋으로 모으고, 앱의 다른 버전으로 다시 실행해 평가 결과를 비교해서 변경이 실제로 성능을 개선했는지 확인하죠.

더 알아보기

  • 시작하기: 퀵스타트로 첫 트레이스를 Phoenix에 보내기
  • LLM 트레이싱: 트레이스와 스팬이 어떻게 동작하는지
  • LLM 평가: LLM 평가자로 출력 품질 측정하기