비용 최적화

비용 최적화 (Cost optimization)

OpenAI 모델을 사용할 때 비용을 줄이는 방법은 여러 가지가 있어요. 비용과 지연 시간은 대개 서로 연결되어 있어서, 토큰과 요청 수를 줄이면 일반적으로 처리도 빨라져요. OpenAI의 Batch API와 flex processing도 비용을 낮추는 추가 방법이에요.

출처: 문서

본문

비용과 지연 시간 (Cost and latency)

지연 시간과 비용을 줄이려면 다음 전략을 고려해 보세요:

  • 요청 줄이기: 과제 완료에 필요한 요청 수를 최소한으로 제한하세요.
  • 토큰 최소화하기: 입력 토큰 수를 줄이고 모델 출력이 더 짧아지도록 최적화하세요.
  • 더 작은 모델 선택하기: 비용과 지연 시간을 줄이면서 정확도는 유지하는 모델을 사용하세요.

이 주제를 더 깊이 보려면 지연 시간 최적화 가이드를 참고하세요.

Batch API

작업을 비동기로 처리하세요. Batch API는 요청 집합을 단일 파일로 모으고, 배치 처리 작업을 시작해 그 요청들을 실행하고, 기본 요청이 실행되는 동안 배치 상태를 조회하고, 배치가 완료되면 모인 결과를 가져올 수 있는 간단한 엔드포인트 집합을 제공해요.

Batch API 시작하기 →

Flex processing

응답 시간이 느리고 리소스를 가끔 못 쓰는 대신 Chat Completions 또는 Responses 요청의 비용을 크게 낮춰요. 모델 평가, 데이터 강화, 비동기 워크로드 같은 비프로덕션 또는 우선순위가 낮은 작업에 적합해요.

flex processing 시작하기 →

더 알아보기 (Learn more)