Opik 개요 — 측정·개선의 끝에서 끝까지
Opik 개요 — 측정·개선의 끝에서 끝까지
LLM 앱은 단일 API 호출이 아니에요. 검색 단계, 도구 호출, 프롬프트 조립, 여러 번의 LLM 호출, 후처리가 엉켜서 런타임에는 어떻게 돌아가는지 잘 안 보이죠. Opik은 그 전체 사슬을 기록·검색·분석할 수 있게 해줍니다.
세 가지 질문
Opik 문서는 이렇게 말해요. 무엇을 하고 있는지 보기 → 얼마나 잘 하고 있는지 측정하기 → 체계적으로 더 좋게 만들기. 여기에 맞춰 기능이 배치돼 있어요.
- 관측(Observability): 모든 LLM 호출·도구 호출·에이전트 단계를 기록해 어떤 출력이 나온 경위를 추적.
- 평가(Evaluation): 데이터셋을 만들어 자동 평가를 돌리고, 프롬프트·모델별 결과를 비교.
- 가드레일(Guardrails): 프롬프트 주입 같은 위험을 막는 정책·가드.
주요 기능 흐름
- 코드 몇 줄로 트레이스 로깅을 시작해 모든 요청·응답 로그를 남긴다.
- 화면에서 트레이스를 열어 각 단계의 입력·출력·지연·비용을 본다.
- 평가와 피드백 스코어로 품질을 측정하고 Prompt Playground에서 모델을 비교한다.
코드 몇 줄로 시작
import opik
@opik.track
def my_agent(user_message):
context = retrieve_context(user_message)
response = call_llm(user_message, context)
return response
@opik.track 데코레이터 하나로 함수 실행이 트레이스로 기록돼요. 50개 이상의 제공사·프레임워크(OpenAI, Anthropic, LangChain 등)와 통합됩니다.
더 알아보기
https://www.comet.com/docs/opik/tracing/getting-started— 5분 트레이싱 시작https://github.com/comet-ml/opik— 오픈소스 저장소