Priority inference
Priority inference
Gemini Priority API는 비즈니스에 중요한 워크로드(lower latency와 최고 수준의 안정성)를 위해 설계된 프리미엄 추론 계층이에요. Priority 계층 트래픽은 표준 API 및 Flex 계층 트래픽보다 우선 처리돼요. Priority inference는 GenerateContent API와 Interactions API 엔드포인트에서 Tier 2 & Tier 3 사용자에게 제공돼요.
출처: 원문
본문
Priority 사용 방법
Priority 계층을 사용하려면 요청 본문의 service_tier 필드를 priority로 설정하면 돼요. 이 필드를 생략하면 기본 계층은 표준(standard)이에요.
Python
from google import genai
client = genai.Client()
try:
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Triage this critical customer support ticket immediately.",
config={"service_tier": "priority"},
)
# Validate for graceful downgrade
if response.sdk_http_response.headers.get("x-gemini-service-tier") == "standard":
print("Warning: Priority limit exceeded, processed at Standard tier.")
print(response.text)
except Exception as e:
# Standard error handling (e.g., DEADLINE_EXCEEDED)
print(f"Error during API call: {e}")
JavaScript
import {GoogleGenAI} from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
try {
const result = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: "Triage this critical customer support ticket immediately.",
config: {serviceTier: "priority"},
});
// Validate for graceful downgrade
if (result.sdkHttpResponse.headers.get("x-gemini-service-tier") === "standard") {
console.log("Warning: Priority limit exceeded, processed at Standard tier.");
}
console.log(result.text);
} catch (e) {
console.log(`Error during API call: ${e}`);
}
}
await main();
Go
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
defer client.Close()
resp, err := client.Models.GenerateContent(
ctx,
"gemini-3.8-flash",
genai.Text("Triage this critical customer support ticket immediately."),
&genai.GenerateContentConfig{
ServiceTier: "priority",
},
)
if err != nil {
log.Fatalf("Error during API call: %v", err)
}
// Validate for graceful downgrade
if resp.SDKHTTPResponse.Header.Get("x-gemini-service-tier") == "standard" {
fmt.Println("Warning: Priority limit exceeded, processed at Standard tier.")
}
fmt.Println(resp.Text())
}
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts":[{"text": "Analyze user sentiment in real time"}]
}],
"service_tier": "priority"
}'
Priority inference의 동작 방식
Priority inference는 요청을 높은 중요도의 컴퓨팅 큐로 라우팅해서 사용자 대면 애플리케이션에 예측 가능하고 빠른 성능을 제공해요. 핵심 메커니즘은 동적 한도를 초과하는 트래픽을 요청을 실패시키는 대신 표준 처리로 서버 측에서 우아하게(graceful) 다운그레이드하는 것이에요. 이로써 애플리케이션 안정성을 보장해요.
| 기능 | Priority | Standard | Flex | Batch |
|---|---|---|---|---|
| 가격 | Standard보다 75–100% 비쌈 | 정가 | 50% 할인 | 50% 할인 |
| 지연 시간 | 초 단위 | 초~분 단위 | 분 단위 (1–15분 목표) | 최대 24시간 |
| 안정성 | 높음 (Non-sheddable) | 높음 / 중간-높음 | Best-effort (Sheddable) | 높음 (처리량 기준) |
| 인터페이스 | 동기(Synchronous) | 동기(Synchronous) | 동기(Synchronous) | 비동기(Asynchronous) |
주요 장점
- 낮은 지연 시간: 인터랙티브하고 사용자 대면인 AI 도구를 위해 초 단위 응답 시간에 맞춰 설계됐어요.
- 높은 안정성: 트래픽이 가장 높은 중요도로 처리되며 절대 shed되지 않아요(non-sheddable).
- 우아한 성능 저하(Graceful degradation): 동적 한도를 초과하는 트래픽 폭증은 실패 대신 자동으로 Standard 계층으로 다운그레이드되어 처리되므로 서비스 중단을 막아줘요.
- 낮은 진입 장벽: 표준 및 Flex 계층과 동일한 동기식
generateContent메서드를 사용해요.
사용 사례
Priority 처리는 성능과 안정성이 가장 중요한 비즈니스 크리티컬 워크플로에 이상적이에요.
- 인터랙티브 AI 애플리케이션: 사용자가 프리미엄을 지불하고 빠르고 일관된 응답을 기대하는 고객 서비스 챗봇과 코파일럿.
- 실시간 의사결정 엔진: 실시간 티켓 트리아지나 사기 탐지처럼 매우 안정적이고 지연 시간이 낮은 결과가 필요한 시스템.
- 프리미엄 고객 기능: 유료 고객에게 더 높은 서비스 수준 목표(SLO)를 보장해야 하는 개발자.
요금 한도(Rate limits)
Priority 사용량은 전체 인터랙티브 트래픽 요금 한도에 포함되더라도 자체 요금 한도를 가져요. Priority inference의 기본 요금 한도는 모델/티어당 표준 요금 한도의 0.3배예요.
우아한 다운그레이드 로직
혼잡으로 Priority 한도를 초과하면 초과 요청은 503 또는 429 오류로 실패하는 대신 자동으로 그리고 우아하게 표준 처리로 다운그레이드돼요. 다운그레이드된 요청은 Priority 프리미엄 요금이 아닌 표준 요금으로 청구돼요.
클라이언트 책임
- 응답 모니터링: 개발자는 API 응답의
x-gemini-service-tier헤더를 모니터링해서 요청이standard로 자주 다운그레이드되는지 감지해야 해요. - 재시도: 클라이언트는
DEADLINE_EXCEEDED같은 표준 오류에 대해 재시도 로직/지수 백오프(exponential backoff)를 구현해야 해요.
가격(Pricing)
Priority inference는 표준 API보다 75–100% 비싸며 토큰당 청구돼요.
지원 모델
다음 모델이 Priority inference를 지원해요:
| 모델 | Priority inference |
|---|---|
| Gemini 3.8 Flash | ✔️ |
| Gemini 3.7 Flash | ✔️ |
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.5 Flash | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro Preview | ✔️ |
| Gemini 3 Flash Preview | ✔️ |
| Gemini 3 Pro Image Preview | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash Image | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |
더 알아보기 (Learn more)
Gemini의 다른 추론 및 최적화 옵션을 살펴보세요:
- 비용을 50% 줄이는 Flex inference
- 24시간 내 비동기 처리를 위한 Batch API
- 입력 토큰 비용을 줄이는 Context caching