LangSmith RAG 평가 — 검색과 생성을 따로 채점한다
LangSmith RAG 평가 — 검색과 생성을 따로 채점한다
LangSmith는 RAG 파이프라인을 추적(trace)하면서 리트리버와 생성기를 별도로 평가하게 해줘요. 어느 단계가 문제인지 데이터로 좁혀가며 개선할 수 있어요.
RAG 평가의 흐름
- 전체 파이프라인 추적: 검색·생성을 분리해 어떤 문서가 검색됐고 답변에 어떻게 영향을 줬는지 봐요.
- 검색·생성 따로 채점:
context_precision,context_recall,faithfulness같은 지표로 리트리버 품질과 생성 품질을 각각 점수화해요. - 데이터로 개선: 실제 쿼리로 평가 데이터셋을 만들고, 프로덕션 반영 전 구조적 평가를 돌려 회귀를 잡아요.
개념 요소
LangSmith 평가 개념은 레퍼런스 데이터셋, 평가 결과(점수·코멘트), 비교 실험 등으로 구성돼요. 평가기를 프롬프트 변형·모델 버전마다 돌려 정량 비교할 수 있어요.
이점
단순히 "안 좋다"가 아니라 "검색이 70%에서 80%로" 같은 구체적 수치로 개선 방향을 확인해요. 팀 단위로 배포 게이트로 활용할 수 있어요.