Fast mode

Fast mode

Fast mode는 pay-as-you-go 유연성을 유지하면서 최대 2.5배 빠른 속도와 더 일관된 지연 시간을 제공합니다. Fast mode는 지연 시간이 중요한, 정기 트래픽이 있는 고가치의 사용자 대면 애플리케이션에 적합합니다.

Priority processing은 2026년 7월 30일에 Fast mode로 이름이 바뀌었습니다. 또한 gpt-5.6-sol의 Fast mode 작동 속도를 높여 Standard processing보다 최대 2.5배 빠르게 만들었습니다. API 요청에서 service_tier: "priority" 또는 service_tier: "fast"를 사용해 이 기능에 접근할 수 있습니다.

출처: 문서

본문

Fast mode 구성하기

Responses API 또는 Chat Completions API 요청을 요청 매개변수나 프로젝트 설정을 통해 Fast mode로 구성할 수 있습니다.

개별 요청에 대해 Fast mode를 선택하려면 service_tier 매개변수를 fast로 설정하세요. 지원되는 모델에서는 service_tier를 priority로 설정해도 동일한 동작을 제공합니다.

Fast mode로 응답 만들기

import OpenAI from "openai";

const openai = new OpenAI();

const response = await openai.responses.create({
  model: "gpt-5.6-sol",
  input: "What does 'fit check for my napalm era' mean?",
  service_tier: "fast",
});

console.log(response);
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="What does 'fit check for my napalm era' mean?",
    service_tier="fast",
)
print(response)
package main

import (
	"context"
	"fmt"

	"github.com/openai/openai-go/v3"
	"github.com/openai/openai-go/v3/responses"
)

func main() {
	client := openai.NewClient()
	response, err := client.Responses.New(context.Background(), responses.ResponseNewParams{
		Model:       "gpt-5.6-sol",
		ServiceTier: "fast",
		Input:       responses.ResponseNewParamsInputUnion{OfString: openai.String("What does 'fit check for my napalm era' mean?")},
	})
	if err != nil {
		panic(err)
	}
	fmt.Println(response.OutputText())
}
import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.responses.ResponseCreateParams;

ResponseCreateParams params =
    ResponseCreateParams.builder()
        .model("gpt-5.6-sol")
        .input("What does 'fit check for my napalm era' mean?")
        .serviceTier(ResponseCreateParams.ServiceTier.of("fast"))
        .build();

client.responses().create(params).output().stream()
    .flatMap(item -> item.message().stream())
    .flatMap(message -> message.content().stream())
    .flatMap(content -> content.outputText().stream())
    .forEach(text -> System.out.println(text.text()));
require "openai"

client = OpenAI::Client.new

response = client.responses.create(
  model: "gpt-5.6-sol",
  service_tier: :fast,
  input: "What does 'fit check for my napalm era' mean?"
)

puts(response.output_text)
curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer ***" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "input": "What does 'fit check for my napalm era' mean?",
    "service_tier": "fast"
  }'

프로젝트 수준에서 선택하려면 Settings를 열고 Project 아래에서 General을 선택한 뒤 Project Service Tier를 Fast로 변경하세요. 그러면 service_tier를 지정하지 않은 요청은 기본적으로 Fast mode로 처리됩니다. 프로젝트 요청은 시간이 지나면서 점진적으로 Fast mode로 전환됩니다.

Responses 또는 Chat Completions 응답 객체의 service_tier 필드는 요청 처리에 사용된 티어를 식별합니다. GPT-5.6 및 이전 모델의 경우, 요청이 priority를 지정하든 fast를 지정하든 응답은 priority를 반환합니다.

속도 제한과 램프 속도

기준 한도(Baseline limits)

Fast mode 사용량은 Standard processing과 동일한 방식으로 속도 제한에 집계됩니다. 평소처럼 재시도 로직을 사용하고 시도 사이에 대기하세요. 특정 모델에 대해 Standard processing과 Fast mode는 동일한 속도 제한을 공유합니다.

램프 속도 제한(Ramp rate limit)

트래픽이 너무 빨리 증가하면 시스템이 일부 Fast mode 요청을 표준 속도로 낮추고 표준 요금을 청구할 수 있습니다. 이 경우 응답에 service_tier: "default"가 포함됩니다. 경험상 트래픽이 분당 1백만 입력 토큰(TPM)에 도달하면 15분마다 50% 이하로만 늘리세요. 램프 속도 제한이 적용되는 정확한 지점은 모델과 트래픽 상황에 따라 달라질 수 있습니다.

램프 속도 제한을 피하려면:

  • 모델이나 스냅샷을 변경할 때는 점진적으로 늘리세요.
  • 기능 플래그를 사용해 트래픽을 즉시가 아니라 수 시간에 걸쳐 옮기세요.
  • 대규모 extract, transform, load(ETL) 또는 배치 작업을 Fast mode에서 실행하지 마세요.

사용 시 고려 사항

  • Fast mode는 Standard processing보다 토큰당 프리미엄을 부과합니다. 자세한 내용과 지원되는 모델은 가격 페이지를 참고하세요.
  • Fast mode 요청에도 캐시된 입력 할인(cached input discounts)이 적용됩니다.
  • Fast mode는 이미지 입력을 포함한 멀티모달 요청을 지원합니다.
  • 사용 대시보드에서 Fast mode 요청을 보려면 service tier별로 그룹화하는 옵션을 선택하세요. GPT-5.6 및 이전 모델의 경우 fast를 지정해도 이러한 요청은 priority로 표시됩니다.
  • GPT-5.6 모델은 long context를 지원합니다. Fast mode는 파인튜닝된 모델이나 embeddings는 지원하지 않습니다.

자주 묻는 질문

계정 및 정책 정보는 Fast mode FAQ를 참고하세요.

Fast mode는 모든 지역에서 사용 가능한가요?

가용성은 각 관할권의 법률과 규정에 따라 달라집니다. 해당 지역의 가용성에 대해 질문이 있으면 계정 담당자에게 문의하세요.

Fast mode는 Scale Tier와 어떻게 상호작용하나요?

Scale Tier와 Fast mode는 별개입니다. Fast mode 요청은 별도로 청구되며 구매한 Scale Tier TPM 번들에 집계되지 않습니다. Scale Tier 스필오버 트래픽은 자동으로 Fast mode로 이동하지 않습니다.

Fast mode는 어떻게 청구되나요?

Fast mode는 Standard processing에 비해 토큰당 프리미엄을 부과합니다. 모든 처리 모드는 연간 Enterprise 지출 약정에 집계되며, 자격이 되는 캐시된 입력 토큰은 Standard processing과 동일한 할인을 받습니다.

GPT-5.6 Sol의 경우 Fast mode 비용은 해당 Standard 요금의 2배입니다. 짧은 컨텍스트 요청은 입력 토큰 1백만 개당 $8, 출력 토큰 1백만 개당 $40이고, 긴 컨텍스트 요청은 입력 토큰 1백만 개당 $16, 출력 토큰 1백만 개당 $60입니다. GPT-5.6 Sol의 프로모션 가격은 최소 2026년 11월 21일까지 제공됩니다. 가격 세부 정보를 참고하세요.

사용량을 확인하려면 사용 대시보드를 열고 Responses 또는 Chat Completions를 선택한 뒤 service tier별로 그룹화하세요. 비용을 확인하려면 line item별로 그룹화하세요.

어떤 모델과 모달리티가 Fast mode를 지원하나요?

Fast mode는 Standard processing에서 사용할 수 있는 멀티모달 기능(이미지 입력 포함)을 지원합니다. GPT-5.6 모델은 long context를 지원합니다. Fast mode는 파인튜닝된 모델이나 embeddings를 지원하지 않습니다. 향후 GPT 모델이 Fast mode를 지원할 수 있지만 모든 모델에 지원이 보장되지는 않습니다.

램프 속도 제한은 프로젝트나 조직 간에 공유되나요?

네. 모든 트래픽이 동일한 램프 속도 제한에 기여합니다. 램프 속도 제한을 자주 겪는다면 Scale Tier 할당량 구매를 고려하세요.

Fast mode가 지연 시간 목표를 충족하지 못하면 어떻게 되나요?

GPT-6 Astra의 Fast mode는 지연 시간 SLA를 포함하지 않습니다. GPT-5.6 및 이전 모델의 경우 Fast mode와 Scale Tier는 동일한 서비스 수준 계약 처리를 받으며, 자격이 되는 Enterprise 계약은 지연 시간 목표를 충족하지 못할 때 서비스 크레딧을 제공할 수 있습니다. 질문이나 우려 사항이 있으면 계정 담당자에게 문의하세요.

Fast mode는 데이터 상주성, Zero Data Retention, BAA와 호환되나요?

Fast mode는 모델별 가용성에 따라 데이터 상주성, Zero Data Retention, Business Associate Agreement(BAA)와 호환됩니다. GPT-6 Astra, Sol, Luna의 경우 EU 데이터 상주는 Standard processing에서만 사용할 수 있습니다. 기존 엔드포인트·도구·자격·계약 요구 사항은 계속 적용됩니다. 자세한 내용은 데이터 가이드를 참고하세요.

더 알아보기 (Learn more)