Lambda (Lambda Labs) — GPU 클라우드 & LLM 서빙
Lambda (Lambda Labs) — GPU 클라우드 & LLM 서빙
Lambda는 NVIDIA GPU를 사양 단위(온디맨드)로 빌려 쓰거나 1-Click Cluster 형태로 클러스터를 통째로 띄우는 미국의 GPU 클라우드 기업이에요. 자체 학습/추론 인프라를 운용하던 회사답게, vLLM·Ollama·KubeAI 같은 오픈소스 서빙 스택을 쓰는 LLM 추론 실무 가이드가 잘 갖춰져 있어요. 이 분류에서는 Lambda Cloud 위에서 대형 언어 모델을 내려받고 서버로 띄워 실제로 요청을 주고받는 과정, 그리고 GPU 사용률을 관찰하는 방법까지 다뤄요.
이 카테고리의 문서
- Llama 3 추론 엔드포인트: 온디맨드 인스턴스에서 vLLM으로 모델 서버를 띄우고 curl로 질의하기
- 1-Click Cluster 서빙: H100 클러스터에서 Llama 3.1 405B 같은 대형 모델을 파이프라인 병렬로 서빙하기
- Kubernetes 서빙: KubeAI로 Hermes 3·Nemotron을 배포하고 NVTOP으로 GPU 활용률 관찰하기
- Ollama/Docker: 온디맨드 인스턴스에서 컨테이너 기반으로 모델을 가볍게 실행하기