fastsafetensors로 모델 가중치 로드하기
fastsafetensors로 모델 가중치 로드하기
fastsafetensors 라이브러리를 사용하면 GPU 직접 저장(GPU direct storage)을 활용해 모델 가중치를 GPU 메모리로 로드할 수 있어요. 이 방식은 대형 모델을 로딩할 때 시간을 크게 줄여줍니다. 자세한 내용은 GitHub 저장소를 참고하세요.
이 기능을 켜려면 명령줄 인자로 --load-format fastsafetensors를 사용하면 됩니다.
사용 방법 (Usage)
vllm serve <model> --load-format fastsafetensors
--load-format fastsafetensors— 모델 가중치를 fastsafetensors 방식으로 GPU에 직접 로드해요.- GPU가 GDS(GPUDirect Storage)를 지원하면 그 장점을 활용해 더 빠르게 로드할 수 있어요.