NVIDIA Jetson Orin

NVIDIA Jetson Orin

이 문서는 NVIDIA Jetson Orin 디바이스에서 SGLang을 설치하고 실행하는 방법을 안내해요. Jetson 보드의 제한된 리소스에 맞춰 양자화와 짧은 컨텍스트 길이를 기본으로 사용해요.

출처: 문서

본문

사전 요구 사항 (Prerequisites)

시작하기 전에 다음을 확인하세요:

  • NVIDIA Jetson AGX Orin DevkitJetPack 6.1 이상으로 설정되어 있는지
  • CUDA ToolkitcuDNN 이 설치되어 있는지
  • Jetson AGX Orin이 고성능 모드 인지:
sudo nvpmodel -m 0

Jetson Containers로 SGLang 설치 및 실행

jetson-containers GitHub 저장소를 클론하세요:

git clone https://github.com/dusty-nv/jetson-containers.git

설치 스크립트를 실행하세요:

bash jetson-containers/install.sh

컨테이너 이미지를 빌드하세요:

jetson-containers build sglang

컨테이너를 실행하세요:

jetson-containers run $(autotag sglang)

또는 다음 명령으로 직접 컨테이너를 실행할 수도 있어요:

docker run --runtime nvidia -it --rm --network=host IMAGE_NAME

추론 실행 (Running Inference)

서버를 실행하세요:

python -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-R1-Distill-Llama-8B \
  --device cuda \
  --dtype half \
  --attention-backend flashinfer \
  --mem-fraction-static 0.8 \
  --context-length 8192

양자화와 제한된 컨텍스트 길이(--dtype half --context-length 8192)는 Nvidia jetson kit의 제한된 컴퓨팅 리소스 때문이에요. 자세한 설명은 서버 인자에서 확인할 수 있어요.

엔진 실행 후에는 채팅 컴플리션을 참고해 사용성을 테스트하세요.


XGrammar로 구조화된 출력 (Structured output with XGrammar)

SGLang 구조화된 출력 문서를 참고하세요.


Nurgaliyev Shakhizat, Dustin Franklin, Johnny Núñez Cano 분들의 지원에 감사드려요.

참고 자료 (References)

더 알아보기 (Learn more)