NVIDIA 공용 드라이버 설치하기
NVIDIA 공용 드라이버 설치하기 (Install NVIDIA public drivers)
"Use AMIs that include NVIDIA drivers"에 설명된 AWS Marketplace AMI가 사용 사례에 맞지 않으면 공용 드라이버를 직접 설치하고 라이선스를 직접 가져올 수 있어요. 설치 옵션은 다음과 같아요.
- 옵션 1: 드라이버만 설치
- 옵션 2: CUDA 툴킷과 함께 설치(Linux 배포판에 권장)
출처: 문서
본문
P6-B200 및 P6-B300 인스턴스 유형 고려 사항
P6-B200과 P6-B300 플랫폼은 Mellanox ConnectX 네트워크 인터페이스 카드(NIC)를 PCIe 장치로 인스턴스에 노출한다는 점에서 독특해요. 이 NIC는 일반적인 네트워크 인터페이스로 동작하지 않고, NVSwitch 브리지로 동작해 NVFabric(GPU 상호 연결의 NVLink 토폴로지)을 초기화·구성하는 제어 경로를 제공해요.
시스템을 완전히 초기화하려면 NVIDIA Fabric Manager가 NVFabric을 구성하고 NVSwitch 토폴로지를 수립해야 해요. 이렇게 해야 InfiniBand 커널 모듈이 Mellanox ConnectX NIC와 통신할 수 있어요.
NVIDIA Fabric Manager는 CUDA 툴킷에 포함돼 있어요. 이 인스턴스 유형에는 옵션 2(CUDA 툴킷과 함께 설치)를 권장해요.
옵션 1: 드라이버만 설치 (Option 1: Driver-only install)
특정 드라이버를 설치하려면 인스턴스에 로그온하고 http://www.nvidia.com/Download/Find.aspx 에서 인스턴스 유형용 64비트 NVIDIA 공용 드라이버를 다운로드해요. Product Type, Product Series, Product에는 다음 표의 옵션을 사용해요. 그런 다음 "NVIDIA Driver Installation Guide"의 "Local Repository Installation" 지침을 따라요.
| 인스턴스 | 제품 유형 | 제품 시리즈 | 제품 | 최소 드라이버 버전 |
|---|---|---|---|---|
| G3 | Tesla | M-Class | M60 | -- |
| G4dn | Tesla | T-Series | T4 | -- |
| G5 | Tesla | A-Series | A10 | 470.00 이상 |
| G5g ¹ | Tesla | T-Series | T4G | 470.82.01 이상 |
| G6 | Tesla | L-Series | L4 | 525.0 이상 |
| G6e | Tesla | L-Series | L40S | 535.0 이상 |
| Gr6 | Tesla | L-Series | L4 | 525.0 이상 |
| G7 | Tesla | RTX series | RTX PRO 4500 Blackwell | 595 이상 |
| G7e | Tesla | RTX series | RTX PRO 6000 Blackwell | 575.0 이상 |
| P3 | Tesla | V-Series | V100 | -- |
| P4d | Tesla | A-Series | A100 | -- |
| P4de | Tesla | A-Series | A100 | -- |
| P5 | Tesla | H-Series | H100 | 530 이상 |
| P5e | Tesla | H-Series | H200 | 550 이상 |
| P5en | Tesla | H-Series | H200 | 550 이상 |
| P6-B200 ² | Tesla | HGX-Series | B200 | 570 이상 |
| P6e-GB200 | Tesla | HGX-Series | B200 | 570 이상 |
| P6-B300 ² | Tesla | HGX-Series | B300 | 580 이상 |
¹ G5g 인스턴스의 운영 체제는 Linux aarch64예요. ² P6-B200과 P6-B300 인스턴스 유형에는 NVIDIA Fabric Manager를 구성하기 위한 추가 설치 요구사항이 있어요.
옵션 2: CUDA 툴킷과 함께 설치 (Option 2: Install with the CUDA toolkit)
설치 지침은 운영 체제에 따라 조금씩 달라요. NVIDIA CUDA 툴킷으로 인스턴스에 공용 드라이버를 설치하려면 인스턴스 운영 체제에 해당하는 지침을 따라요. 여기에 없는 운영 체제는 NVIDIA Developer 웹사이트에서 운영 체제와 인스턴스 유형 아키텍처에 맞는 지침을 따르세요.
이 섹션은 Amazon Linux 2023 인스턴스에서 NVIDIA CUDA 툴킷 설치를 다루며, 명령 예시는 x86_64 아키텍처 기준이에요. arm64-sbsa 명령은 "CUDA Toolkit Downloads"를 참고하세요.
전제 조건 — 툴킷과 드라이버를 설치하기 전에 올바른 버전의 커널 헤더와 개발 패키지가 있는지 다음 명령으로 확인해요.
[ec2-user ~]$ sudo dnf install kernel-devel-$(uname -r) kernel-headers-$(uname -r) -y
툴킷과 드라이버 다운로드 — 인스턴스에 사용할 설치 유형을 선택하고 관련 단계를 따라요.
- AL2023 NVIDIA 리포지토리 – Amazon Linux 2023은 AWS가 유지 관리하는 전용 리포지토리를 통해 NVIDIA GPU 드라이버와 CUDA 툴킷 패키지를 제공해요. AWS는 이 리포지토리를 AL2023 릴리스 후보로 검증하고 Amazon Linux Security Center를 통해 보안 권고를 제공해요. 표준
dnf update워크플로로 설치를 단순화하고 드라이버를 최신으로 유지하므로 AL2023 인스턴스에 권장해요. - RPM 로컬 설치 – CUDA 툴킷 설치 프로그램 리포지토리 번들을 인스턴스에 다운로드한 뒤 추출·등록해요.
[ec2-user ~]$ wget https://developer.download.nvidia.com/compute/cuda/13.0.0/local_installers/cuda-repo-amzn2023-13-0-local-13.0.0_580.65.06-1.x86_64.rpm [ec2-user ~]$ sudo rpm -i cuda-repo-amzn2023-13-0-local-13.0.0_580.65.06-1.x86_64.rpm - RPM 네트워크 설치 – 인스턴스의 패키지 관리자에 CUDA 리포지토리를 등록해요. 설치 단계를 실행하면 패키지 관리자가 필요한 패키지만 다운로드해요.
[ec2-user ~]$ sudo dnf config-manager --add-repo https://developer.download.nvidia.com/compute/cuda/repos/amzn2023/x86_64/cuda-amzn2023.repo
RPM 로컬·네트워크 설치의 나머지 단계는 동일해요.
- CUDA 툴킷 설치 완료:
[ec2-user ~]$ sudo dnf clean all [ec2-user ~]$ sudo dnf install cuda-toolkit -y - 드라이버의 오픈 커널 모듈 변형 설치:
[ec2-user ~]$ sudo dnf module install nvidia-driver:open-dkms -y - GPUDirect Storage와 Fabric Manager 설치:
[ec2-user ~]$ sudo dnf install nvidia-gds -y [ec2-user ~]$ sudo dnf install nvidia-fabric-manager -y - Fabric Manager와 드라이버 지속성 활성화:
[ec2-user ~]$ sudo systemctl enable nvidia-fabricmanager [ec2-user ~]$ sudo systemctl enable nvidia-persistenced - (P6-B200 및 P6-B300만) 이 인스턴스 유형은 NVIDIA CUDA 툴킷에 번들로 포함된 추가 패키지의 설치·구성이 필요해요.
- NVIDIA Link Subnet Manager와
ibstat설치:[ec2-user ~]$ sudo dnf install nvlink5 - 시작 시 Infiniband 모듈 자동 로드 활성화:
[ec2-user ~]$ echo "ib_umad" | sudo tee -a /etc/modules-load.d/modules.conf
- NVIDIA Link Subnet Manager와
- 인스턴스 재부팅:
[ec2-user ~]$ sudo reboot
Ubuntu 24.04 인스턴스에서 CUDA 툴킷 설치
전제 조건:
$ apt install linux-headers-$(uname -r)
Deb 로컬 설치:
$ wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-ubuntu2404.pin
$ sudo mv cuda-ubuntu2404.pin /etc/apt/preferences.d/cuda-repository-pin-600
$ wget https://developer.download.nvidia.com/compute/cuda/13.0.0/local_installers/cuda-repo-ubuntu2404-13-0-local_13.0.0-580.65.06-1_amd64.deb
$ sudo dpkg -i cuda-repo-ubuntu2404-13-0-local_13.0.0-580.65.06-1_amd64.deb
$ sudo cp /var/cuda-repo-ubuntu2404-13-0-local/cuda-*-keyring.gpg /usr/share/keyrings/
Deb 네트워크 설치:
$ wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb
$ sudo dpkg -i cuda-keyring_1.1-1_all.deb
로컬·네트워크 설치의 나머지 단계는 동일해요.
- CUDA 툴킷 설치 완료:
$ sudo apt update $ sudo apt install cuda-toolkit -y - 드라이버의 오픈 커널 모듈 변형 설치:
$ sudo apt install nvidia-open -y - GPUDirect Storage와 Fabric Manager 설치:
$ sudo apt install nvidia-gds -y $ sudo apt install nvidia-fabricmanager -y - Fabric Manager와 드라이버 지속성 활성화:
$ sudo systemctl enable nvidia-fabricmanager $ sudo systemctl enable nvidia-persistenced - (P6-B200 및 P6-B300만) — 최신 InfiniBand 전용 장치 드라이버와 진단 유틸리티 설치:
NVIDIA Link Subnet Manager 설치:$ sudo apt install linux-modules-extra-$(uname -r) -y $ sudo apt install infiniband-diags -y$ sudo apt install nvlsm -y - 인스턴스 재부팅:
sudo reboot - 경로를 업데이트하고 다음 환경 변수를 추가해요:
$ export PATH=${PATH}:/usr/local/cuda-13.0/bin $ export LD_LIBRARY_PATH=${LD_LIBRARY_PATH}:/usr/local/cuda-13.0/lib64
Windows에 NVIDIA 드라이버 설치
- 드라이버를 다운로드한 폴더를 열고 설치 파일을 실행한 다음 지침에 따라 드라이버를 설치하고 필요에 따라 인스턴스를 재부팅해요.
- 장치 관리자(Device Manager)에서 경고 아이콘이 표시된 Microsoft Basic Display Adapter라는 디스플레이 어댑터를 비활성화해요. 다음 Windows 기능을 설치해요: Media Foundation과 Quality Windows Audio Video Experience.
중요: Microsoft Remote Display Adapter는 비활성화하지 마세요. 비활성화하면 연결이 중단될 수 있고, 재부팅 후 인스턴스에 연결하려는 시도가 실패할 수 있어요.
- 장치 관리자로 GPU가 올바르게 동작하는지 확인해요.
- GPU에서 최고의 성능을 얻으려면 "Optimize GPU settings on Amazon EC2 instances"의 최적화 단계를 완료해요.