Batch Inference — 비동기 일괄 처리로 비용을 줄인다

Batch Inference

온라인 호출로 많은 요청을 보내면 지연과 비용이 커져요. Batch API(batch inference) 는 대량 요청을 파일로 모아 24시간 내에 처리해 비용을 최대 절반까지 줄여주는 비동기 방식이에요. OpenAI·Anthropic·Gemini가 모두 지원해요.

이 카테고리의 문서

  • 개요: OpenAI Batch API — JSONL 파일 기반 일괄 처리
  • 핵심 기능: Anthropic Message Batches — 비동기 일괄 요청
  • 실전·API: Gemini Batch — 비동기·동기 일괄 처리

출처: https://platform.openai.com/docs/guides/batch