프로비저닝 처리량(PTU) 이해하기
프로비저닝 처리량(PTU) 이해하기
토큰 단위 과금이 부담될 만큼 트래픽이 많거나, 응답 지연이 채팅·코파일럿·에이전트 같은 서비스의 사용자 경험을 좌우한다면 **프로비저닝 처리량(Provisioned Throughput)**을 고려해봐요. 고정된 처리 용량을 미리 예약해서 일관된 지연 시간과 보장된 처리량을 얻는 방식이에요. 이 문서는 PTU 단위부터 할당량·용량·과금 구조까지 한 번에 정리해줘요.
배포 유형 비교
| 배포 유형 | 과금 | 지연 SLA | 어울리는 워크로드 |
|---|---|---|---|
| Provisioned | PTU당 시간당(또는 Azure reservations 사용) | 모델별 정의된 지연 목표 | 보장된 처리량과 일관된 지연이 필수인 미션 크리티컬·대규모 프로덕션 |
언제 프로비저닝 처리량을 써야 하나
- 프로덕션 규모의 볼륨: 토큰당 과금이 비싸지는 고처리량 사용 사례.
- 실시간 또는 인터랙티브 시나리오: 응답 시간이 변하면 사용자 경험이 나빠지는 채팅 앱·코파일럿·에이전트.
프로비저닝 처리량 단위(PTU)
**PTU(Provisioned Throughput Unit)**는 프로비저닝 처리량의 측정 단위예요. PTU 하나는 고정된 양의 모델 처리 용량을 나타내고, 프로비저닝 배포를 만들 때 PTU를 몇 개 할당할지 지정하면 Foundry가 그만큼의 컴퓨팅을 예약해서 배포에 붙잡아 둬요.
- 모델 비종속: 같은 PTU 할당량으로 어떤 지원 모델이든 배포할 수 있어요. 특정 모델을 위해 PTU를 사는 게 아니에요.
- 리전별: PTU 할당량은 구독·리전·배포 유형별로 부여돼요. East US의 할당량이 West Europe으로 넘어가지 않아요.
할당량(Quota)과 용량(Capacity)
할당량과 용량은 서로 다르지만, 둘 다 배포를 만들 수 있는지에 영향을 줘요.
- PTU quota: 구독·리전·배포 유형별로 배포할 수 있는 최대 PTU 수예요. Azure가 시행하는 정책 한도이고 비용은 없어요.
- 할당량 받기: 적격 구독에는 기본 할당량이 여러 리전에 배정돼 있어요. 더 필요한 경우 할당량 요청 양식으로 요청하거나, Foundry 포털의 Quota 페이지에서 요청할 수 있어요.
- 가용 용량 확인: 모델 용량 API(Model Capacities API)로 특정 모델·리전에서 배포 가능한 최대 PTU 수를 프로그래밍 방식으로 조회할 수 있어요. 리전에 용량이 없다면 할당량을 요청하거나, 더 적은 PTU로 배포하거나, 나중에 다시 시도하세요(용량은 하루 중에도 동적으로 변해요).
PTU 크기 산정
각 모델은 용량 계산을 위해 입력 토큰 1개가 출력 토큰 몇 개와 맞먹는지를 나타내는 비율을 가져요. GPT-4.1 이후 Azure OpenAI 모델은 이 비율이 모델의 글로벌 표준 과금 비율(출력/입력 토큰)과 일치해요.
산정은 예상 토큰 규모를 하나의 정규화된 TPM 수치로 변환한 뒤, 모델의 PTU당 Input TPM 값으로 나눠 필요한 PTU 수를 구하는 방식이에요. 공식과 모델별 값을 직접 사용해 수동으로 산정하거나, Foundry 포털의 용량 계산기로 가이드된 추정을 받을 수 있어요.
프로비저닝 배포 유형
프로비저닝 처리량은 세 가지 배포 유형으로 제공되는데, 모두 배포 후에는 전용 용량과 예측 가능한 지연을 제공해요. 차이는 추론 트래픽이 어디에서 처리되느냐예요.
| 배포 유형 | CLI의 sku-name |
데이터 라우팅 | 어울리는 상황 |
|---|---|---|---|
| Data Zone Provisioned | DataZoneProvisionedManaged |
지리적 존(US 또는 EU) 안에 유지 | 존 단위 데이터 거주 요건 + 리전 단위보다 높은 가용성 |
| Regional Provisioned | ProvisionedManaged |
배포가 있는 특정 Azure 리전에 유지 | 엄격한 단일 리전 데이터 거주 요건 |
시간당 과금과 Azure Reservations
모든 프로비저닝 배포 유형은 소비한 토큰 수와 무관하게 **배포된 PTU 수 기준의 시간당 요금($/PTU/hr)**으로 과금돼요. 미터는 배포를 만들 때 시작되고 삭제할 때 멈춰요. 장기 사용 예정이라면 Azure reservations로 비용을 아낄 수 있어요.