컨텍스트 캐싱
컨텍스트 캐싱
전형적인 AI 워크플로에서는 같은 입력 토큰을 모델에 계속 반복해서 보낼 수 있어요. Gemini API는 성능과 비용을 최적화하기 위해 암시적 캐싱(implicit caching)을 제공해요.
참고: Interactions API는 암시적 캐싱만 지원해요. 명시적 캐싱(캐시 객체를 수동으로 만들고 관리하는 것)은 Interactions API에서 지원되지 않아요. 명시적 캐싱을 쓰려면 generateContent API로 전환하세요.
출처: 원문
본문
암시적 캐싱
암시적 캐싱은 모든 Gemini 2.5 이상 모델에서 기본으로 활성화돼요. 상태 저장(previous_interaction_id 사용)과 무상태 대화 모드 둘 다 지원해요. 요청이 캐시에 적중하면 비용 절감이 자동으로 적용돼요. 활성화하기 위해 할 일은 없어요. 컨텍스트 캐싱의 최소 입력 토큰 수는 모델별로 다음 표와 같아요.
| 모델 | 최소 토큰 한도 |
|---|---|
| Gemini 3.8 Flash | 4,096 |
| Gemini 3.7 Flash | 4,096 |
| Gemini 3.6 Flash | 4,096 |
| Gemini 3.5 Flash | 4,096 |
| Gemini 3.1 Pro Preview | 4,096 |
| Gemini 2.5 Flash | 2,048 |
| Gemini 2.5 Pro | 2,048 |
암시적 캐시 적중 가능성을 높이려면:
- 크고 공통적인 내용을 프롬프트 맨 앞에 두세요.
- 비슷한 프리픽스의 요청을 짧은 시간 안에 보내세요.
응답 객체의 usage.total_cached_tokens(Python과 JavaScript) 필드에서 캐시 적중된 토큰 수를 확인할 수 있어요.