NVIDIA Jetson Orin
NVIDIA Jetson Orin
이 문서는 NVIDIA Jetson Orin 디바이스에서 SGLang을 설치하고 실행하는 방법을 안내해요. Jetson 보드의 제한된 리소스에 맞춰 양자화와 짧은 컨텍스트 길이를 기본으로 사용해요.
출처: 문서
본문
사전 요구 사항 (Prerequisites)
시작하기 전에 다음을 확인하세요:
- NVIDIA Jetson AGX Orin Devkit 이 JetPack 6.1 이상으로 설정되어 있는지
- CUDA Toolkit 과 cuDNN 이 설치되어 있는지
- Jetson AGX Orin이 고성능 모드 인지:
sudo nvpmodel -m 0
Jetson Containers로 SGLang 설치 및 실행
jetson-containers GitHub 저장소를 클론하세요:
git clone https://github.com/dusty-nv/jetson-containers.git
설치 스크립트를 실행하세요:
bash jetson-containers/install.sh
컨테이너 이미지를 빌드하세요:
jetson-containers build sglang
컨테이너를 실행하세요:
jetson-containers run $(autotag sglang)
또는 다음 명령으로 직접 컨테이너를 실행할 수도 있어요:
docker run --runtime nvidia -it --rm --network=host IMAGE_NAME
추론 실행 (Running Inference)
서버를 실행하세요:
python -m sglang.launch_server \
--model-path deepseek-ai/DeepSeek-R1-Distill-Llama-8B \
--device cuda \
--dtype half \
--attention-backend flashinfer \
--mem-fraction-static 0.8 \
--context-length 8192
양자화와 제한된 컨텍스트 길이(--dtype half --context-length 8192)는 Nvidia jetson kit의 제한된 컴퓨팅 리소스 때문이에요. 자세한 설명은 서버 인자에서 확인할 수 있어요.
엔진 실행 후에는 채팅 컴플리션을 참고해 사용성을 테스트하세요.
XGrammar로 구조화된 출력 (Structured output with XGrammar)
SGLang 구조화된 출력 문서를 참고하세요.
Nurgaliyev Shakhizat, Dustin Franklin, Johnny Núñez Cano 분들의 지원에 감사드려요.