컴포넌트별 평가
컴포넌트별 평가 (Component Wise Evaluation)
워크플로를 개별 구성 요소로 나눠 평가하면 복잡한 실패 원인을 격리할 수 있어요. 검색 평가와 쿼리 엔진 구성 요소 평가를 BEIR, HotpotQA 같은 벤치마크로 수행하는 방법을 배워봅시다.
출처: 문서
본문
워크플로에 대해 더 심층적인 평가를 하려면 이를 개별 구성 요소의 평가로 나누는 것이 도움이 됩니다.
예를 들어 특정 실패 사례는 올바른 문서를 검색하지 못한 것과 LLM이 컨텍스트를 잘못 이해해 잘못된 결과를 환각한 것의 조합 때문일 수 있습니다. 이러한 문제를 분리해 각각 처리할 수 있다면 복잡성을 줄이고 만족스러운 전체 결과를 향해 단계별로 안내받을 수 있습니다.
공개 벤치마크 활용
초기 모델 선택을 할 때 표준화되고 다양한 도메인 또는 태스크 집합에서 모델이 얼마나 잘 수행하는지 보는 것이 도움이 됩니다.
임베딩에 유용한 벤치마크는 MTEB 리더보드입니다.
검색 평가
BEIR 데이터셋
BEIR은 특정 검색 모델이 제로샷(zeroshot) 설정에서 틈새 도메인에 잘 일반화되는지 벤치마킹하는 데 유용합니다.
대부분의 공개 임베딩/검색 모델은 이미 BEIR로 벤치마킹되어 있으므로(예: MTEB 벤치마크를 통해), BEIR은 평가하려는 고유한 모델이 있을 때 더 유용합니다.
예를 들어 데이터셋에서 임베딩 모델을 파인튜닝한 뒤 다양한 도메인 집합에서 성능이 얼마나, 그리고 어느 정도로 저하되는지 보는 것이 도움이 될 수 있습니다. 이는 파인튜닝 학습 분포 밖의 문서를 RAG 시스템에 추가할 때 데이터 드리프트가 검색 정확도에 얼마나 영향을 미칠지 알려줄 수 있습니다.
다음은 BEIR 데이터셋을 검색 흐름과 함께 사용하는 방법을 보여주는 노트북입니다.
곧 검색을 평가하는 더 많은 방법을 추가할 예정입니다. 여기에는 자체 데이터셋에서 검색을 평가하는 것도 포함됩니다.
쿼리 엔진 구성 요소 평가 (예: 검색 없이)
이 경우 (하위 질문이나 후속 질문을 생성할 수 있는) 쿼리 엔진의 특정 구성 요소가 표준 벤치마크에서 어떻게 수행하는지 평가하고 싶을 수 있습니다. 이는 검색 흐름이 대체 흐름이나 모델에 비해 얼마나 뒤처지거나 앞서 있는지에 대한 지표를 제공할 수 있습니다.
HotpotQA 데이터셋
HotpotQA 데이터셋은 여러 검색 단계를 요구하는 쿼리를 평가하는 데 유용합니다.
예시:
한계:
- HotpotQA는 Wikipedia 코퍼스에서 평가됩니다. LLM, 특히 GPT4는 Wikipedia의 정보를 비교적 잘 기억하는 경향이 있습니다. 따라서 이 벤치마크는 GPT4 같은 지식이 많은 모델로 검색 + 리랭크 시스템을 평가하기에 특히 좋지 않습니다.