분산 배포 문제 해결
분산 배포 문제 해결 (Troubleshooting Distributed Deployments)
분산 배포에서 발생하는 문제를 해결하는 방법을 설명합니다. 일반적인 문제 해결은 Troubleshooting 문서를, 분산 배포 특유의 GPU 통신·Ray 리소스·관측성 문제는 이 페이지를 참고합니다.
출처: 문서
본문
일반적인 문제 해결은 Troubleshooting을 참고하세요.
노드 간 GPU 통신 검증 (Verify inter-node GPU communication)
Ray 클러스터를 시작한 뒤 노드 간 GPU-to-GPU 통신을 검증하세요. 올바른 구성은 사소하지 않을 수 있습니다. 자세한 내용은 troubleshooting script를 참고하세요. 통신 구성에 추가 환경 변수가 필요하다면 examples/ray_serving/run_cluster.sh에 예를 들어 -e NCCL_SOCKET_IFNAME=eth0처럼 추가하세요. 클러스터 생성 시 환경 변수를 설정하는 것이 권장됩니다. 변수가 모든 노드에 전파되기 때문입니다. 반면 셸에서 환경 변수를 설정하면 로컬 노드에만 영향을 줍니다. 자세한 내용은 Issue #6803을 참고하세요.
리소스 요청을 충족할 노드 타입이 없음 (No available node types can fulfill resource request)
클러스터에 충분한 GPU가 있어도 Error: No available node types can fulfill resource request 오류 메시지가 나타날 수 있습니다. 이 문제는 노드에 IP 주소가 여러 개 있고 vLLM이 올바른 것을 선택하지 못할 때 자주 발생합니다. examples/ray_serving/run_cluster.sh에 VLLM_HOST_IP를 설정해(각 노드마다 다른 값으로) vLLM과 Ray가 같은 IP 주소를 사용하도록 보장하세요. 선택된 IP 주소를 확인하려면 ray status와 ray list nodes를 사용하세요. 자세한 내용은 Issue #7815를 참고하세요.
Ray 관측성 (Ray observability)
분산 시스템은 규모와 복잡성 때문에 디버깅이 어려울 수 있습니다. Ray는 Ray 애플리케이션과 클러스터를 모니터링·디버그·최적화하는 도구 모음을 제공합니다. Ray 관측성에 대한 자세한 내용은 공식 Ray observability 문서를, Ray 애플리케이션 디버깅은 Ray Debugging Guide를 방문하세요. Kubernetes 클러스터 문제 해결은 공식 KubeRay troubleshooting 가이드를 참고하세요.