GPU 가속 인스턴스 시작하기
GPU 가속 인스턴스 시작하기
딥 러닝과 고성능 컴퓨팅(HPC) 애플리케이션을 위한 최고 성능을 제공하는 최신 세대 GPU 가속 인스턴스 유형에 대해 알아볼게요. 이 절에서는 권장되는 인스턴스 유형과 함께 필요한 최소 소프트웨어 버전을 정리해 드려요.
출처: 문서
본문
딥 러닝과 고성능 컴퓨팅(HPC) 애플리케이션에 최고의 성능을 제공하는 최신 세대 GPU 가속 인스턴스 유형이 있어요. 각 인스턴스 유형 링크를 선택하면 그 성능을 자세히 알 수 있어요.
가속 인스턴스 유형의 전체 사양 목록은 Amazon EC2 Instance Types 참조의 Accelerated computing을 참고하세요.
소프트웨어 구성
최신 세대 GPU 가속 인스턴스 유형을 시작하는 가장 쉬운 방법은 필요한 모든 소프트웨어가 미리 구성된 AWS Deep Learning AMI에서 인스턴스를 시작하는 거예요. GPU 가속 인스턴스 유형에 사용할 최신 AWS Deep Learning AMI는 AWS Deep Learning AMIs Developer Guide의 P6 Supported DLAMI를 참고하세요.
딥 러닝이나 HPC 애플리케이션을 호스팅하는 인스턴스를 시작하기 위해 사용자 지정 AMI를 만들어야 한다면, 기본 이미지 위에 다음 최소 소프트웨어 버전을 설치할 것을 권장해요.
| 인스턴스 유형 | NVIDIA 드라이버 | CUDA | NVIDIA GDRCopy | EFA 설치 프로그램 | NCCL | EFA K8s ¹ |
|---|---|---|---|---|---|---|
| G7 | 595 | 13.2 | 2.5.1 | 1.48.0 | 2.29.7-1 | 0.5.10 |
| G7e | 575 | 12.9 | 2.5 | 1.45.0 | 2.28.3 | 0.5.10 |
| P5 | 530 | 12.1 | 2.3 | 1.24.1 | 2.18.3 | 0.4.4 |
| P5.4xlarge | 530 | 12.1 | 2.3 | 1.43.1 ² | 2.18.3 | 0.4.4 |
| P5e | 550 | 12.1 | 2.3 | 1.24.1 | 2.18.3 | 0.5.5 |
| P5en | 550 | 12.1 | 2.3 | 1.24.1 | 2.18.3 | 0.5.6 |
| P6-B200 | 570 | 12.8 | 2.5 | 1.41.0 | 2.26.2-1 | 0.5.10 |
| P6e-GB200 | 570 | 12.8 | 2.5 | 1.41.0 | 2.26.2-1 | 0.5.10 |
| P6-B300 | 580 | 13.0 | 2.5 | 1.44.0 | 2.28.3 | 0.5.10 |
¹ EFA K8s 열에는 aws-efa-k8s-device-plugin의 권장 최소 버전이 들어 있어요.
² GPU 간 통신이 Elastic Fabric Adapter(EFA)와 NVIDIA Collective Communications Library(NCCL)를 사용할 때 P5.4xlarge 인스턴스에 영향을 주는 호환성 문제가 있어요. 이 문제를 완화하려면 환경 변수 FI_HMEM_DISABLE_P2P를 1로 설정하고 EFA 버전 1.43.1 이상을 설치하세요.
참고
EFA 설치 프로그램 버전 1.41.0을 사용하면 aws-ofi-nccl 플러그인이 함께 제공돼요. 이전 버전의 EFA 설치 프로그램을 사용한다면 aws-ofi-nccl 플러그인 버전 1.7.2-aws 이상을 사용하세요.
또한 인스턴스가 더 깊은 C-states를 사용하지 않도록 구성할 것을 권장해요. 자세한 내용은 Amazon Linux 2 User Guide의 High performance and low latency by limiting deeper C-states를 참고하세요. 최신 AWS Deep Learning Base GPU AMI는 더 깊은 C-states를 사용하지 않도록 미리 구성되어 있어요.
네트워킹과 Elastic Fabric Adapter(EFA) 구성은 Maximize network bandwidth on Amazon EC2 instances with multiple network cards를 참고하세요.