Gemini API 최적화 및 추론
Gemini API 최적화 및 추론
Gemini API는 특정 워크로드 요구에 따라 속도, 비용, 신뢰성을 균형 있게 조절하는 데 도움이 되는 다양한 최적화 메커니즘을 제공해요. 실시간 대화형 봇을 만들든 무거운 오프라인 데이터 처리 파이프라인을 실행하든, 올바른 패러다임을 선택하면 비용을 크게 줄이거나 성능을 높일 수 있어요.
| 기능 | 표준 | Flex | 우선순위 | 배치 | 캐싱 |
|---|---|---|---|---|---|
| 가격 | 정가 | 50% 할인 | 표준 대비 75%~100% 추가 | 50% 할인 | 90% 할인 + 비례 토큰 저장 |
| 지연 시간 | 초~분 | 분(목표 1~15분) | 초 | 최대 24시간 | 첫 토큰 도달 시간 단축 |
| 신뢰성 | 높음 / 중간~높음 | 최선 노력(버릴 수 있음) | 높음(버릴 수 없음) | 높음(처리량 기준) | N/A |
| 인터페이스 | 동기 | 동기 | 동기 | 비동기 | 저장 상태 |
| 최적 사용 사례 | 일반 애플리케이션 워크플로 | 긴급하지 않은 연쇄 작업 | 프로덕션, 사용자 대면 앱 | 대규모 데이터셋, 오프라인 평가 | 같은 파일에 대한 반복 쿼리 |
출처: 원문
본문
추론 서비스 계층(동기)
표준 생성 호출에서 service_tier 매개변수를 전달하여 신뢰성 최적화 트래픽과 비용 최적화 동기 트래픽 사이를 전환할 수 있어요.
표준 추론(기본값)
표준 계층은 순차 콘텐츠 생성의 기본 옵션이에요. 추가 요금이나 과도한 대기열 없이 정상적인 응답 시간을 제공해요.
- 신뢰성: 표준 중요도
- 가격: 표준 요금
- 최적 용도: 대부분의 대화형 일상 애플리케이션
우선순위 추론(지연 시간 최적화)
Priority 처리는 요청을 고중요도 컴퓨팅 대기열로 라우팅해요. 이 트래픽은 엄격히 버릴 수 없으며(다른 계층에 의해 선점되지 않음) 가장 높은 신뢰성을 제공해요. 동적 우선순위 한도를 초과하면 시스템은 오류로 실패하는 대신 요청을 표준 처리로 우아하게 다운그레이드해요.
- 신뢰성: 가장 높은 중요도
- 가격: 표준 요금 대비 75%~100% 추가
- 최적 용도: 고객 챗봇, 실시간 사기 탐지, 비즈니스 핵심 코파일럿
Flex 추론(비용 최적화)
Flex 추론은 기회적이고 비수요 시간대의 컴퓨팅 용량을 활용해 표준 요금 대비 50% 할인을 제공해요. 요청은 동기적으로 처리되므로 배치 객체를 관리하기 위해 코드를 다시 작성할 필요가 없어요. "버릴 수 있는(sheddable)" 트래픽이므로 시스템에 표준 트래픽 급증이 발생하면 요청이 선점될 수 있어요.
- 신뢰성: 비보장, 버릴 수 있는 중요도
- 가격: 표준 요금의 50%(토큰당 청구)
- 최적 용도: N+1 호출이 N 호출의 출력에 의존하는 다단계 에이전트 워크플로, 백그라운드 CRM 업데이트, 오프라인 평가
배치 API(대량, 비동기)
배치 API는 표준 비용의 50%로 대량의 요청을 비동기적으로 처리하도록 설계되었어요. 인라인 딕셔너리 또는 JSONL 입력 파일(최대 2GB)로 요청을 제출할 수 있어요. 목표 처리 시간 24시간의 백그라운드 처리량 대기열을 사용해 요청을 처리해요.
- 신뢰성: 버릴 수 있지만 24시간 자동 재시도 및 대기열 시스템 포함
- 가격: 표준 요금의 50%
- 최적 용도: 대규모 데이터셋 전처리, 주기적 회귀 테스트 스위트 실행, 대용량 이미지 또는 임베딩 생성
컨텍스트 캐싱(입력 비용 절감)
컨텍스트 캐싱은 상당한 초기 컨텍스트가 더 짧은 요청에 의해 반복적으로 참조될 때 사용돼요.
- 암시적 캐싱: Gemini 2.5 이상 모델에서 자동 활성화돼요. 공통 프롬프트 접두사를 기반으로 기존 캐시에 요청이 적중하면 시스템이 비용 절감을 전달해요.
- 명시적 캐싱: 특정 TTL(수명)로 캐시 객체를 수동으로 만들 수 있어요. 생성 후 후속 요청에서 캐시된 토큰을 참조해 동일한 말뭉치 페이로드를 반복 전달하지 않아도 돼요.
- 가격: 캐시 토큰 수와 저장 기간(TTL)을 기준으로 청구
- 최적 용도: 광범위한 시스템 지침이 있는 챗봇, 긴 비디오 파일의 반복 분석, 대규모 문서 집합에 대한 쿼리
에이전트 처리로 비디오 입력 비용 줄이기
장시간 비디오 콘텐츠의 경우 에이전트 처리는 응답 품질을 높이면서 입력 토큰 비용을 최대 88%까지 줄일 수 있어요. 모델은 1 FPS로 모든 프레임을 추출하는 대신(정적 처리), 프롬프트와 관련된 트랜스크립트 및/또는 프레임 및/또는 오디오를 로드하며 비디오를 동적으로 탐색해요. 지연 시간이 중요한 5분 미만의 짧은 클립에서는 에이전트 모드가 생성을 시작하기 전에 내부 추론과 도구 왕복을 수행하므로 정적 처리가 더 빠른 첫 토큰 도달 시간(TTFT)을 제공할 수 있어요.
Gemini 3.7 Flash, 3.6 Flash 또는 3.5 Flash Lite에서 에이전트 처리를 사용하려면 비디오 입력에 processing: "agentic"(Interactions API) 또는 media_processing: "AGENTIC"(GenerateContent API)을 설정하세요. 모델이 에이전트 처리를 지원하지 않으면 오류를 반환해요.
코드 예시는 에이전트 비디오 이해를 참조하세요.