모델 비교 플레이그라운드 UI

모델 비교 플레이그라운드 UI (Model Compare Playground UI)

여러 LLM 모델을 대화형 플레이그라운드 인터페이스에서 나란히 비교할 수 있어요. 모델 응답, 성능 지표, 비용을 평가해서 어떤 모델이 사용 사례에 가장 적합한지 판단할 수 있어요.

이 기능은 v1.80.0-stable 이상에서 사용할 수 있어요.

출처: 문서

본문

개요 (Overview)

Model Compare Playground UI는 최대 3개의 서로 다른 LLM 모델을 동시에 나란히 비교할 수 있게 해줘요. 모델, 파라미터, 테스트 프롬프트를 구성하고, 지연 시간·토큰 사용량·비용을 포함한 상세 지표와 함께 모델 응답을 평가·비교해요.

시작하기 (Getting Started)

Model Compare UI 접근하기

1. 플레이그라운드로 이동하기

Admin UI의 Playground 페이지로 가세요 (PROXY_BASE_URL/ui/?login=success&page=llm-playground)

2. Compare 탭으로 전환하기

Playground 인터페이스에서 Compare 탭을 클릭하세요.

구성 (Configuration)

모델 설정하기

1. 비교할 모델 선택하기

최대 3개의 모델을 동시에 비교할 수 있어요. 각 비교 패널에서:

  • 모델 드롭다운을 클릭해 사용 가능한 모델을 확인해요
  • 설정된 엔드포인트에서 모델을 선택해요
  • 모델은 LiteLLM 프록시 설정에서 로드돼요

2. 모델 파라미터 구성하기

각 모델 패널은 개별 파라미터 구성을 지원해요:

기본 파라미터:

  • Temperature : 무작위성을 제어 (0.0 ~ 2.0)
  • Max Tokens : 응답의 최대 토큰 수

고급 파라미터:

  • "Use Advanced Params"를 켜면 추가 모델별 파라미터를 구성할 수 있어요
  • 선택한 모델/공급자에서 사용 가능한 모든 파라미터를 지원해요

3. 모델 간 파라미터 적용하기

"Sync Settings Across Models" 토글을 사용해 파라미터(태그, 가드레일, temperature, max tokens 등)를 모든 비교 패널에 동기화해 일관된 테스트를 할 수 있어요.

가드레일 (Guardrails)

플레이그라운드에서 직접 가드레일을 구성하고 테스트할 수 있어요:

  1. 모델 패널에서 가드레일 선택기를 클릭해요
  2. 설정된 목록에서 하나 이상의 가드레일을 선택해요
  3. 각 모델이 가드레일 필터링에 어떻게 반응하는지 테스트해요
  4. 모델 간 가드레일 동작을 비교해요

태그 (Tags)

비교를 정리하고 필터링할 태그를 적용해요:

  1. 태그 드롭다운에서 태그를 선택해요
  2. 태그는 다양한 테스트 시나리오를 분류하고 추적하는 데 도움을 줘요

벡터 스토어 (Vector Stores)

RAG(Retrieval Augmented Generation) 비교를 위한 벡터 스토어 검색을 구성해요:

  1. 드롭다운에서 벡터 스토어를 선택해요
  2. 각 모델이 검색된 컨텍스트를 어떻게 사용하는지 비교해요
  3. 모델 간 RAG 성능을 평가해요

비교 실행하기 (Running Comparisons)

1. 프롬프트 입력하기

메시지 입력 영역에 테스트 프롬프트를 입력해요. 다음을 할 수 있어요:

  • 모든 모델에 단일 메시지 입력
  • 빠른 테스트를 위해 제안된 프롬프트 사용
  • 다중 턴 대화 구성

2. 요청 보내기

보내기 버튼(또는 Enter)을 클릭해 비교를 시작해요. 선택한 모든 모델이 요청을 동시에 처리해요.

3. 응답 보기

응답이 각 모델 패널에 나란히 나타나므로 쉽게 비교할 수 있어요:

  • 응답 품질과 내용
  • 응답 길이와 구조
  • 모델별 형식

비교 지표 (Comparison Metrics)

각 비교 패널은 모델 성능 평가를 돕는 상세 지표를 표시해요:

첫 토큰까지의 시간 (Time To First Token, TTFT)

요청 제출부터 첫 토큰 수신까지의 지연을 측정해요. 값이 낮을수록 초기 응답이 더 빠르다는 뜻이에요.

토큰 사용량 (Token Usage)

  • Input Tokens : 프롬프트/요청의 토큰 수
  • Output Tokens : 모델 응답의 토큰 수
  • Reasoning Tokens : reasoning에 사용된 토큰 (해당 시, 예: o1 모델)

총 지연 (Total Latency)

스트리밍 시간을 포함해 요청부터 최종 응답까지 걸린 전체 시간.

비용 (Cost)

LiteLLM 설정에서 비용 추적을 켰다면 다음을 볼 수 있어요:

  • 요청당 비용
  • 입력/출력 토큰별 비용 분해
  • 모델 간 비용 비교

사용 사례 (Use Cases)

모델 선택 (Model Selection)

같은 프롬프트에서 여러 모델을 비교해 특정 사용 사례에 가장 잘 맞는 모델을 결정해요:

  • 응답 품질
  • 응답 시간
  • 비용 효율
  • 토큰 사용량

파라미터 튜닝 (Parameter Tuning)

최적의 설정을 찾기 위해 모델 간에 서로 다른 파라미터 구성을 테스트해요:

  • Temperature 변화
  • Max token 한도
  • 고급 파라미터 조합

가드레일 테스트 (Guardrail Testing)

각 모델이 안전 필터와 가드레일에 어떻게 반응하는지 평가해요:

  • 필터 효과
  • 오탐(false positive) 비율
  • 모델별 가드레일 동작

A/B 테스트

태그와 여러 비교를 사용해 구조화된 A/B 테스트를 실행해요:

  • 모델 버전 비교
  • 프롬프트 변형 테스트
  • 기능 롤아웃 평가

더 알아보기 (Learn more)