NVIDIA NIM

NVIDIA NIM

NVIDIA NIM은 NVIDIA GPU 위에서 파운데이션 모델을 어디서든 빠르게 서빙할 수 있게 해 주는 추론 마이크로서비스 세트예요. TensorRT-LLM, vLLM, SGLang 같은 고성능 추론 엔진을 감싸서 컨테이너 하나로 모델을 배포하고 OpenAI 호환 API로 호출할 수 있어요. 검증된 모델 가중치와 설정, 보안 업데이트까지 함께 제공돼요.

이 카테고리의 문서

  • 개요와 아키텍처: NIM LLM이 어떻게 구성되고 요청이 흐르는지
  • 시작하기: 컨테이너 실행과 첫 추론까지
  • 서빙 설정: 병렬 처리, 캐시, SSL/TLS 등 고급 구성
  • API 사용법: OpenAI 호환 추론 엔드포인트와 관리 엔드포인트
  • 환경 변수: 배포를 조정하는 NIM 전용 변수

출처: https://docs.nvidia.com/nim/large-language-models/latest/