Azure OpenAI 할당량과 제한 이해하기

Azure OpenAI 할당량과 제한 이해하기

모델을 배포하고 운영하다 보면 "왜 이 모델은 이만큼밖에 요청을 못 받지?" 하고 막히는 순간이 있어요. 그 배경이 바로 **할당량(quota)과 제한(limit)**이에요. 이 문서는 Azure OpenAI의 할당량이 어디에 적용되는지, 티어가 어떻게 자동 상향되는지, 그리고 운영할 때 알아둘 대표 제한 값까지 정리해서 부딪힘을 줄여줘요.

출처: 공식 문서 - Quotas and limits

할당량의 적용 범위

할당량과 제한은 테넌트(tenant) 수준에서 시행되지 않아요. 가장 높은 할당량 제한의 범위는 Azure 구독(subscription) 수준이에요.

구독 수준 할당량 관리

구독 수준 할당량 관리는 2026년 5월 7일 이후부터 시작됐어요. Realtime Translate와 Realtime Whisper부터 시작해 곧 모든 모델에 걸쳐, Foundry는 배포 단위가 아니라 구독 단위로 할당량을 추적해요. 구독 안의 모든 리소스·리전이 같은 할당량 풀을 공유하므로 일관되고 예측 가능한 관리가 돼요.

할당량은 공유 풀로 묶여요.

  • Global Standard: 같은 모델·버전의 배포가 구독 내 모든 리전에서 하나의 할당량 풀을 공유.
  • Data Zone Standard: 같은 모델·버전의 배포가 데이터 존(예: US, EU)별로 하나의 할당량 풀을 공유.

할당량 티어(Quota Tiers)

Microsoft는 워크로드가 커져도 마찰을 줄이도록 할당량 티어를 도입하고 있어요. 사용량이 늘면 할당량이 자동으로 올라가서 rate limit 오류를 줄이고, 모든 사용자에게 더 공정한 환경을 만드는 구조예요. Free Tier와 Tier 1~6(Tier 6이 가장 높음)의 일곱 단계가 있어요. 처음 배정되는 티어는 해당 모델의 현재 사용량과 Microsoft와의 관계(예: 기업계약 EA/MCA-E)를 기준으로 정해져요.

  • 자동 상향: 사용량이 늘어 현재 티어가 한계가 되면 시스템이 다음 상위 티어로 자동 승격해요. Microsoft와의 관계와 결제 이력도 고려돼요.
  • 자동 상향 거부: NoAutoUpgrade 플래그를 설정하면 현재 티어에 머물 수 있어요. 이 기능은 미리보기라 추후 변경·제거될 수 있어요.
curl -X PATCH \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
  -H "Content-Type: application/json" \
  -d '{
    "properties": {
      "tierUpgradePolicy": "NoAutoUpgrade"
    }
  }'
  • 할당량 추가 요청: 할당량 요청 양식으로 항상 더 요청할 수 있어요. 승인되면 현재 티어는 그대로 두고 할당량만 더 부여돼요.
  • 티어 확인: 컨트롤 플레인 API로 티어를 조회할 수 있어요(api-version=2025-10-01-preview).

대표 할당량·제한 값

제한 이름 제한 값
Azure 구독당 Azure OpenAI 리소스 수 30
리소스당 최대 표준 배포 수 32
미세조정 모델 배포 최대 수 10
리소스당 총 훈련 작업 수 100
리소스당 동시 실행 훈련 작업 최대 수 표준·글로벌 3 / Developer 5
대기 중 훈련 작업 최대 수 20
리소스당 파일 최대 수(미세조정) 100
리소스당 전체 파일 크기(미세조정) 1 GB
훈련 작업 최대 시간(초과 시 실패) 720시간
훈련 작업 최대 크기 (훈련 파일 토큰 수) x (epoch 수) 20억
/embeddings 배열의 최대 입력 수 2,048

사용량 티어(Usage tiers)

사용량 한도는 그 수준을 넘으면 응답 지연의 변동성이 커질 수 있는 임계값이에요. 테넌트의 모든 구독·리전·배포에서 소비한 총 토큰 수로 모델별로 정의돼요.

참고: 사용량 티어는 Standard, Data Zone Standard, Global Standard 배포 유형에만 적용돼요. global batch와 provisioned throughput 배포에는 적용되지 않아요.

예시: gpt-5 320억 토큰/월, gpt-5-nano 8000억 토큰/월, o3-mini 500억 토큰/월, gpt-4.1-nano 5500억 토큰/월.

rate limit 안에 머무르는 관례

  • 애플리케이션에 재시도(retry) 로직을 넣어요.
  • 워크로드를 갑자기 바꾸지 말고 점진적으로 늘려요.
  • 여러 가지 부하 증가 패턴을 테스트해요.
  • 필요하면 다른 배포에서 할당량을 옮겨 배포에 더 배정해요.

자세한 best practice와 재시도·백오프 코드, 429 트러블슈팅은 할당량 관리 가이드에서 볼 수 있어요.

더 알아보기 (Learn more)