Agent Observability 조사 가이드
Agent Observability 조사 가이드 (Investigate)
트레이스가 쌓이기 시작하면 이제 "쌓인 데이터로 뭘 할 수 있을까"가 궁금해져요. Investigate 문서는 프로덕션에서 돌고 있는 LLM 앱을 쿼리·시각화·상관 분석으로 들여다보고, 성능을 모니터링하고, 오류를 디버깅하고, 품질을 평가하는 도구들을 한곳에 모아 설명해 줘요. 여기서는 그 장면들을 정리해 볼게요.
실시간 성능 모니터링
LLM 앱의 운영 상태를 기본 제공 지표와 대시보드로 모니터링할 수 있어요.
- 요청량과 지연 시간: 모델·운영·엔드포인트별 초당 요청 수, 응답 시간, 성능 병목을 추적
- 오류 추적: HTTP 오류, 모델 타임아웃, 실패 요청을 상세 오류 컨텍스트와 함께 모니터링
- 토큰 사용량: 프롬프트·캐시드·컴플리션 토큰과 총 사용량을 추적해 비용 최적화
- 모델 사용 분석: 어떤 모델이 얼마나 자주 호출되는지, 성능 특성은 어떤지 파악
기본 제공 Agent Observability Operational Insights 대시보드는 트레이스 수준·스팬 수준 지표, 오류율, 지연 시간 분석, 토큰 사용 추이, 트리거된 모니터를 한 화면에 모아 보여줘요.
프로덕션 디버깅과 트러블슈팅
복잡한 LLM 워크플로우를 상세 실행 가시성으로 디버깅할 수 있어요.
- 엔드투엔드 트레이스 분석: 사용자 입력부터 모델 호출, 도구 호출, 응답 생성까지 전체 요청 흐름을 시각화
- 스팬 수준 디버깅: 체인 내 개별 작업(전처리 단계, 모델 호출, 후처리 로직)을 하나씩 검사
- 오류 근본 원인 찾기: 다단계 체인·워크플로우·에이전트 운영에서 실패 지점을 오류 컨텍스트와 타이밍 정보로 특정
- 성능 병목 식별: 워크플로우 구성 요소 간 지연 시간 분석으로 느린 작업을 찾아 최적화
품질·안전 평가
LLM 에이전트나 앱이 품질 기준을 충족하는지 **온라인 평가(online evaluations)**로 확인할 수 있어요. Datadog 호스팅·관리 평가, 커스텀 평가 수집, 안전 모니터링 기능의 종합적인 내용은 Evaluations 문서에서 다룬답니다.
트레이스·스팬 쿼리
Agent Observability의 쿼리 인터페이스로 LLM 앱이 만든 트레이스와 스팬을 검색·필터·분석할 수 있어요. 예를 들어 이런 쿼리를 쓸 수 있어요:
ml_app:shopist-chat-v2 'purchase' -'discount' @trace.total_tokens:>=20
- 모델·사용자·오류 상태 같은 속성으로 트레이스·스팬을 필터
- 특정 LLM 운영이나 시간대에 집중하는 고급 필터
- 트레이스 상세를 시각화·검사해 트러블슈팅과 최적화
APM과의 상관 분석
Datadog APM으로 계측한 앱이라면 SDK를 통해 APM과 Agent Observability를 상관시킬 수 있어요. 이렇게 하면 앱 이슈에서 LLM 특유의 근본 원인까지 이어지는 종단간 가시성을 얻을 수 있죠.
Patterns와 에이전트 모니터링
- Patterns: 프로덕션 트래픽을 계층적 주제로 자동 클러스터링해 사용자가 뭘 묻는지, 평가 데이터셋의 커버리지에 빈틈은 없는지, 실패 모드가 뭔지 파악
- Agent Monitoring: 여러 도구나 추론 체인을 쓰는 에이전틱 LLM 앱은 전용 가이드가 있어요. 에이전트의 행동, 도구 사용, 추론 단계를 추적해 복잡한 LLM 워크플로우를 트러블슈팅·최적화
프롬프트 관리
프롬프트 관리(Prompt Management)는 LLM 앱이 쓰는 프롬프트의 중앙 레지스트리를 제공해요. Datadog UI, Python SDK, 또는 API로 프롬프트를 만들고 버전을 관리한 뒤, 런타임에 SDK로 가져올 수 있어요. 프롬프트 반복을 앱 배포 주기에서 분리해 주는 게 핵심이에요.