Priority 추론(Priority inference)
Priority 추론(Priority inference)
비즈니스에 중요한 워크로드를 위해 더 낮은 지연 시간과 최고의 안정성을 원하는 경우, Interactions API의 Priority 추론 티어로 지연 시간을 최적화하는 방법을 배워 보아요.
출처: 원문
본문
Preview: Gemini Priority API는 Preview 단계예요.
Gemini Priority API는 더 낮은 지연 시간과 최고의 안정성을 프리미엄 가격에 제공하도록 설계된 프리미엄 추론 티어예요. Priority 티어 트래픽은 표준 API와 Flex 티어 트래픽보다 우선 처리돼요.
Priority 추론은 Interactions API 엔드포인트 전반에서 사용할 수 있어요.
Priority 사용 방법
Priority 티어를 사용하려면 요청의 service_tier 필드를 priority로 설정하세요. 필드를 생략하면 기본 티어는 standard예요.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Triage this critical customer support ticket immediately.",
service_tier='priority'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: "Triage this critical customer support ticket immediately.",
service_tier: "priority"
});
console.log(interaction.output_text);
}
await main();
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
Client client = new Client();
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-3.8-flash"))
.input(InteractionsInput.of("Perform a priority inference task."))
.serviceTier(ServiceTier.PRIORITY)
.build();
Interaction interaction =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(interaction.outputText().orElse(""));
Go
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
"google.golang.org/genai/interactions/models/interactions"
"google.golang.org/genai/interactions/models/operations"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
Model: interactions.Model("gemini-3.8-flash"),
Input: interactions.NewInteractionsInput("Perform a priority inference task."),
ServiceTier: interactions.ServiceTierPriority.ToPointer(),
}),
})
if err != nil {
log.Fatal(err)
}
if res.Interaction.OutputText != nil {
fmt.Println(*res.Interaction.OutputText)
}
}
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: *** \
-d '{
"model": "gemini-3.8-flash",
"input": "Triage this critical customer support ticket immediately.",
"service_tier": "priority"
}'
Priority 추론의 동작 방식
Priority 추론은 요청을 고중요도 컴퓨팅 큐로 라우팅해서 사용자 대면 애플리케이션에 예측 가능하고 빠른 성능을 제공해요. 핵심 메커니즘은 동적 한도를 초과하는 트래픽을 표준 처리로 우아하게 서버 측 다운그레이드해서, 요청을 실패시키는 대신 애플리케이션 안정성을 보장하는 거예요.
| 기능 | Priority | Standard | Flex | Batch |
|---|---|---|---|---|
| 가격 | Standard보다 75–100% 비쌈 | 정가 | 50% 할인 | 50% 할인 |
| 지연 시간 | 초 단위 | 초~분 단위 | 분 단위 (목표 1–15분) | 최대 24시간 |
| 안정성 | 높음 (Non-sheddable) | 높음 / 중상 | Best-effort (Sheddable) | 높음 (처리량 기준) |
| 인터페이스 | 동기식 | 동기식 | 동기식 | 비동기식 |
주요 이점
- 낮은 지연 시간: 대화형·사용자 대면 AI 도구를 위해 초 단위 응답 시간으로 설계됐어요.
- 높은 안정성: 트래픽을 가장 높은 중요도로 처리하며 엄격히 non-sheddable(폐기 불가)이에요.
- 우아한 성능 저하: 동적 한도를 초과하는 트래픽 급증은 실패 대신 자동으로 Standard 티어로 다운그레이드되어 서비스 중단을 방지해요.
- 낮은 마찰: 표준·Flex 티어와 동일한 동기식
create메서드를 사용해요.
사용 사례
Priority 처리는 성능과 안정성이 가장 중요한 비즈니스 크리티컬 워크플로에 적합해요.
- 대화형 AI 애플리케이션: 고객 서비스 챗봇과 코파일럿. 사용자가 프리미엄을 지불하고 빠르고 일관된 응답을 기대하는 경우요.
- 실시간 결정 엔진: 실시간 티켓 분류나 사기 탐지처럼 신뢰성 높고 저지연 결과가 필요한 시스템.
- 프리미엄 고객 기능: 유료 고객에게 더 높은 서비스 수준 목표(SLO)를 보장해야 하는 개발자.
속도 제한
Priority 소비는 소비가 전체 대화형 트래픽 속도 제한에 계산되더라도 자체 속도 제한을 가져요. Priority 추론의 기본 속도 제한은 모델/티어당 표준 속도 제한의 0.3배예요.
우아한 다운그레이드 로직
혼잡으로 Priority 한도를 초과하면, 초과 요청은 503이나 429 오류로 실패하는 대신 자동으로 우아하게 Standard 처리로 다운그레이드돼요. 다운그레이드된 요청은 Priority 프리미엄 요금이 아닌 표준 요금으로 청구돼요.
클라이언트 책임
- 응답 모니터링: 개발자는 API 응답의
x-gemini-service-tier헤더를 모니터링해서 요청이standard로 자주 다운그레이드되는지 감지해야 해요. - 재시도: 클라이언트는
DEADLINE_EXCEEDED같은 표준 오류에 대한 재시도 로직/지수 백오프를 구현해야 해요.
가격
Priority 추론은 표준 API보다 75–100% 비싸며 토큰당 청구돼요.
지원 모델
다음 모델이 Priority 추론을 지원해요:
| 모델 | Priority 추론 |
|---|---|
| Gemini 3.8 Flash | ✔️ |
| Gemini 3.7 Flash | ✔️ |
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.5 Flash | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro Preview | ✔️ |
| Gemini 3 Flash Preview | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |