Batch Inference — 비동기 일괄 처리로 비용을 줄인다
Batch Inference
온라인 호출로 많은 요청을 보내면 지연과 비용이 커져요. Batch API(batch inference) 는 대량 요청을 파일로 모아 24시간 내에 처리해 비용을 최대 절반까지 줄여주는 비동기 방식이에요. OpenAI·Anthropic·Gemini가 모두 지원해요.
이 카테고리의 문서
- 개요: OpenAI Batch API — JSONL 파일 기반 일괄 처리
- 핵심 기능: Anthropic Message Batches — 비동기 일괄 요청
- 실전·API: Gemini Batch — 비동기·동기 일괄 처리