컨텍스트 캐싱

컨텍스트 캐싱

전형적인 AI 워크플로에서는 같은 입력 토큰을 모델에 계속 반복해서 보낼 수 있어요. Gemini API는 성능과 비용을 최적화하기 위해 암시적 캐싱(implicit caching)을 제공해요.

참고: Interactions API는 암시적 캐싱만 지원해요. 명시적 캐싱(캐시 객체를 수동으로 만들고 관리하는 것)은 Interactions API에서 지원되지 않아요. 명시적 캐싱을 쓰려면 generateContent API로 전환하세요.

출처: 원문

본문

암시적 캐싱

암시적 캐싱은 모든 Gemini 2.5 이상 모델에서 기본으로 활성화돼요. 상태 저장(previous_interaction_id 사용)과 무상태 대화 모드 둘 다 지원해요. 요청이 캐시에 적중하면 비용 절감이 자동으로 적용돼요. 활성화하기 위해 할 일은 없어요. 컨텍스트 캐싱의 최소 입력 토큰 수는 모델별로 다음 표와 같아요.

모델 최소 토큰 한도
Gemini 3.8 Flash 4,096
Gemini 3.7 Flash 4,096
Gemini 3.6 Flash 4,096
Gemini 3.5 Flash 4,096
Gemini 3.1 Pro Preview 4,096
Gemini 2.5 Flash 2,048
Gemini 2.5 Pro 2,048

암시적 캐시 적중 가능성을 높이려면:

  • 크고 공통적인 내용을 프롬프트 맨 앞에 두세요.
  • 비슷한 프리픽스의 요청을 짧은 시간 안에 보내세요.

응답 객체의 usage.total_cached_tokens(Python과 JavaScript) 필드에서 캐시 적중된 토큰 수를 확인할 수 있어요.

더 알아보기 (Learn more)