배포·사용법 (NIM과 오픈 프레임워크)

배포·사용법 (NIM과 오픈 프레임워크)

Nemotron 모델은 여러 방식으로 배포할 수 있어요. 가장 간단한 건 NVIDIA NIM 마이크로서비스나 build.nvidia.com의 호스팅 API를 쓰는 거예요.

오픈 프레임워크 배포

Nemotron은 오픈 가중치 모델이라 다음 오픈 프레임워크로 NVIDIA GPU 어디서든 배포할 수 있어요.

  • vLLM
  • SGLang
  • Ollama
  • llama.cpp

NVIDIA NIM

Nemotron 모델은 NVIDIA NIM™ 마이크로서비스로 제공돼요. 보안·프라이버시·이식성을 갖춘 프로덕션 배포에 적합하며, NVIDIA AI Enterprise 라이선스가 필요해요. build.nvidia.com에서 모델을 체험하고 NIM 마이크로서비스를 내려받을 수 있어요.

파인튜닝 (NeMo)

NeMo Customizer는 Llama Nemotron 모델 파인튜닝을 지원해요. 예를 들어 LoRA 파인튜닝은 1x 80GB GPU(텐서 병렬 1)로, 전체 SFT는 4x 80GB GPU(텐서 병렬 2)로 구성할 수 있어요. 사용되는 NIM 이미지는 nvcr.io/nim/nvidia/llm-nim:1.15.5, GPU는 1x 80GB예요.

NeMo 2.0 파인튜닝 레시피는 llm/recipes 폴더에 있어요. 기본 레시피는 모든 선형 레이어에 LoRA를 적용하고, peft_scheme='none'으로 두면 전체 모델을 파인튜닝하며, packed_sequence=True로 시퀀스 패킹을 켜 처리량을 높일 수 있어요.

더 알아보기