RunPod
RunPod
RunPod는 클라우드 GPU 인프라 위에서 AI/ML 애플리케이션을 배포하고 서빙하기 위한 플랫폼이에요. 서버없이 GPU를 빌려 쓰는 Serverless와 상시 실행하는 Pod 두 방식을 중심으로, LLM 추론을 비롯한 컴퓨팅 집약적 워크로드를 요청량에 맞춰 자동 확장하며 사용한 만큼만 과금해요.
핵심 특징
- Serverless: 사용량 기반 GPU 컴퓨팅 — 요청이 없으면 유휴 비용이 들지 않아요
- vLLM 워커: 대규모 언어 모델을 고속 추론 + 자동 확장으로 서빙
- OpenAI 호환 API: 클라이언트 라이브러리를 그대로 재사용
- Pod: 상시 실행하는 원격 GPU 인스턴스
이 카테고리의 문서
- Serverless 개요·빠른 시작: 핸들러 함수부터 엔드포인트 테스트까지
- vLLM 추론: 모델 배포, 요청 전송, OpenAI 호환성