GPTCache — 쿼리만으로 답을 재활용한다
GPTCache — 쿼리만으로 답을 재활용한다
GPTCache 는 Zilliz가 만든 오픈소스 의미 캐시 라이브러리예요. LLM 호출을 줄여 비용·지연을 낮추고, 답변 품질도 더 일관되게 만들어요.
핵심 아이디어
질문이 오면 쿼리를 벡터로 인코딩해 저장된 질문과 유사도를 비교해요. 유사도가 임계값을 넘으면 LLM을 호출하지 않고 이전 답변을 재사용해요.
- 벡터 유사도 기반: 문구가 달라도 의미가 같으면 hit.
- 임계값 조정: 거리/유사도 임계값을 조절해 hit율과 정확도를 맞춰요.
- 저장소 유연성: Redis, SQLite, 벡터 DB 등 다양한 서드파티 캐시를 지원해요.
어떤 데이터에 좋나요
자주 반복되고 비교적 변하지 않는 질문(FAQ, 문서 조회, 튜토리얼)에 탁월해요. hit 시 모델 호출이 0이 되므로 토큰 비용이 크게 줄어요. 응답도 이전 것과 동일하게 나와 일관성이 올라가요.
시작하기
pip install gptcache 후 cache.init() 을 통해 임베딩·저장소를 설정하고, 캐시 객체를 통해 질문하듯 사용해요. 기존 OpenAI 호출을 감싸는 형태로 붙일 수 있어요.