Braintrust 소개 — AI 관찰·평가·개선의 워크플로우
Braintrust 소개
AI 앱이 실제 사용자를 만나기 시작하면 "이 모델이 정말 나은가", "프롬프트를 바꾸면 회귀가 생기지 않나"를 계속 확인해야 해요. Braintrust는 그런 운영 단계의 질문에 답하는 AI 옵저버빌리티 플랫폼이에요. 팀은 모델을 비교하고, 프롬프트를 반복하고, 회귀를 발견하며, 실제 사용자 데이터로 AI 앱을 지속적으로 개선할 수 있어요. 시작은 Braintrust 계정을 만들고 트레이스를 로그로 남기는 데서 출발해요.
워크플로우
Braintrust는 AI 앱을 만들고 평가하고 개선하는 구조화된 워크플로우를 따라요.
- 인스트루먼트 (Instrument): AI 애플리케이션에서 트레이스를 캡처
- 관찰 (Observe): 로그를 분석하고 패턴 식별
- 평가 (Evaluate): evals나 실제 사용 데이터로 품질 측정
- 개선 (Improve): 데이터에 기반해 앱 최적화
비교·반복·회귀 감지를 거쳐 지속 개선 루프를 만드는 게 핵심 목표예요.
빠른 시작
시작하려면 계정을 만들고 퀵스타트에 나온 대로 첫 트레이스를 로그해요.
- Log your first trace — AI 프로바이더·프레임워크와 통합해 트레이스를 보내기
코딩 에이전트라면 반복·스크립트 작업에는 bt CLI를 선호해요. evals 실행, 코드 인스트루먼트, 로그 조회, 데이터 동기화, 함수 관리, 코딩 에이전트 설정까지 다룰 수 있어요.