모델 비교 플레이그라운드 UI
모델 비교 플레이그라운드 UI (Model Compare Playground UI)
여러 LLM 모델을 대화형 플레이그라운드 인터페이스에서 나란히 비교할 수 있어요. 모델 응답, 성능 지표, 비용을 평가해서 어떤 모델이 사용 사례에 가장 적합한지 판단할 수 있어요.
이 기능은 v1.80.0-stable 이상에서 사용할 수 있어요.
출처: 문서
본문
개요 (Overview)
Model Compare Playground UI는 최대 3개의 서로 다른 LLM 모델을 동시에 나란히 비교할 수 있게 해줘요. 모델, 파라미터, 테스트 프롬프트를 구성하고, 지연 시간·토큰 사용량·비용을 포함한 상세 지표와 함께 모델 응답을 평가·비교해요.

시작하기 (Getting Started)
Model Compare UI 접근하기
1. 플레이그라운드로 이동하기
Admin UI의 Playground 페이지로 가세요 (PROXY_BASE_URL/ui/?login=success&page=llm-playground)

2. Compare 탭으로 전환하기
Playground 인터페이스에서 Compare 탭을 클릭하세요.
구성 (Configuration)
모델 설정하기
1. 비교할 모델 선택하기
최대 3개의 모델을 동시에 비교할 수 있어요. 각 비교 패널에서:
- 모델 드롭다운을 클릭해 사용 가능한 모델을 확인해요
- 설정된 엔드포인트에서 모델을 선택해요
- 모델은 LiteLLM 프록시 설정에서 로드돼요

2. 모델 파라미터 구성하기
각 모델 패널은 개별 파라미터 구성을 지원해요:
기본 파라미터:
- Temperature : 무작위성을 제어 (0.0 ~ 2.0)
- Max Tokens : 응답의 최대 토큰 수
고급 파라미터:
- "Use Advanced Params"를 켜면 추가 모델별 파라미터를 구성할 수 있어요
- 선택한 모델/공급자에서 사용 가능한 모든 파라미터를 지원해요

3. 모델 간 파라미터 적용하기
"Sync Settings Across Models" 토글을 사용해 파라미터(태그, 가드레일, temperature, max tokens 등)를 모든 비교 패널에 동기화해 일관된 테스트를 할 수 있어요.

가드레일 (Guardrails)
플레이그라운드에서 직접 가드레일을 구성하고 테스트할 수 있어요:
- 모델 패널에서 가드레일 선택기를 클릭해요
- 설정된 목록에서 하나 이상의 가드레일을 선택해요
- 각 모델이 가드레일 필터링에 어떻게 반응하는지 테스트해요
- 모델 간 가드레일 동작을 비교해요

태그 (Tags)
비교를 정리하고 필터링할 태그를 적용해요:
- 태그 드롭다운에서 태그를 선택해요
- 태그는 다양한 테스트 시나리오를 분류하고 추적하는 데 도움을 줘요

벡터 스토어 (Vector Stores)
RAG(Retrieval Augmented Generation) 비교를 위한 벡터 스토어 검색을 구성해요:
- 드롭다운에서 벡터 스토어를 선택해요
- 각 모델이 검색된 컨텍스트를 어떻게 사용하는지 비교해요
- 모델 간 RAG 성능을 평가해요

비교 실행하기 (Running Comparisons)
1. 프롬프트 입력하기
메시지 입력 영역에 테스트 프롬프트를 입력해요. 다음을 할 수 있어요:
- 모든 모델에 단일 메시지 입력
- 빠른 테스트를 위해 제안된 프롬프트 사용
- 다중 턴 대화 구성

2. 요청 보내기
보내기 버튼(또는 Enter)을 클릭해 비교를 시작해요. 선택한 모든 모델이 요청을 동시에 처리해요.
3. 응답 보기
응답이 각 모델 패널에 나란히 나타나므로 쉽게 비교할 수 있어요:
- 응답 품질과 내용
- 응답 길이와 구조
- 모델별 형식

비교 지표 (Comparison Metrics)
각 비교 패널은 모델 성능 평가를 돕는 상세 지표를 표시해요:
첫 토큰까지의 시간 (Time To First Token, TTFT)
요청 제출부터 첫 토큰 수신까지의 지연을 측정해요. 값이 낮을수록 초기 응답이 더 빠르다는 뜻이에요.
토큰 사용량 (Token Usage)
- Input Tokens : 프롬프트/요청의 토큰 수
- Output Tokens : 모델 응답의 토큰 수
- Reasoning Tokens : reasoning에 사용된 토큰 (해당 시, 예: o1 모델)
총 지연 (Total Latency)
스트리밍 시간을 포함해 요청부터 최종 응답까지 걸린 전체 시간.
비용 (Cost)
LiteLLM 설정에서 비용 추적을 켰다면 다음을 볼 수 있어요:
- 요청당 비용
- 입력/출력 토큰별 비용 분해
- 모델 간 비용 비교

사용 사례 (Use Cases)
모델 선택 (Model Selection)
같은 프롬프트에서 여러 모델을 비교해 특정 사용 사례에 가장 잘 맞는 모델을 결정해요:
- 응답 품질
- 응답 시간
- 비용 효율
- 토큰 사용량
파라미터 튜닝 (Parameter Tuning)
최적의 설정을 찾기 위해 모델 간에 서로 다른 파라미터 구성을 테스트해요:
- Temperature 변화
- Max token 한도
- 고급 파라미터 조합
가드레일 테스트 (Guardrail Testing)
각 모델이 안전 필터와 가드레일에 어떻게 반응하는지 평가해요:
- 필터 효과
- 오탐(false positive) 비율
- 모델별 가드레일 동작
A/B 테스트
태그와 여러 비교를 사용해 구조화된 A/B 테스트를 실행해요:
- 모델 버전 비교
- 프롬프트 변형 테스트
- 기능 롤아웃 평가
관련 기능 (Related Features)
- Playground Chat UI - 단일 모델 테스트 인터페이스
- Model Management - 모델 구성·관리
- Guardrails - 안전 필터 설정
- AI Hub - 조직과 모델·에이전트 공유