LiteLLM Caching — 프록시 수준 캐싱
LiteLLM Caching — 프록시 수준 캐싱
LiteLLM의 Caching 기능은 프록시 계층에서 LLM 응답을 캐시해요. 같은 질문이 다시 오면 모델을 호출하지 않고 저장된 응답을 돌려줘서 비용과 지연을 줄여요.
캐시의 종류
- 정확 일치 캐시: 이전과 정확히 같은 프롬프트의 응답을 재사용해요. 구현이 간단하고 즉시 효과가 있어요.
- 의미 캐시(semantic): 프롬프트를 벡터로 바꿔 유사한 질문도 캐시로 처리해요. 문구가 달라도 의미가 같으면 재사용돼요.
실전 설정
LiteLLM Proxy 설정에 캐시 타입(redis, s3, in-memory 등)과 정책을 지정해요. 호출 간 일관성을 위해 temperature 등 생성 파라미터를 캐시 키에 포함하는 게 좋아요.
주의점
- 신선도: 자주 바뀌는 정보는 TTL을 짧게 두거나 캐시를 빼야 해요.
- 개인화: 사용자별로 달라야 할 응답은 캐시 키에 사용자 식별자를 넣어 격리해요.
- 부정확 위험: 의미 캐시는 유사도 임계값을 잘 못 두면 틀린 답을 재사용할 수 있어요.