fastsafetensors로 모델 가중치 로드하기

fastsafetensors로 모델 가중치 로드하기

fastsafetensors 라이브러리를 사용하면 GPU 직접 저장(GPU direct storage)을 활용해 모델 가중치를 GPU 메모리로 로드할 수 있어요. 이 방식은 대형 모델을 로딩할 때 시간을 크게 줄여줍니다. 자세한 내용은 GitHub 저장소를 참고하세요.

이 기능을 켜려면 명령줄 인자로 --load-format fastsafetensors를 사용하면 됩니다.

출처: vLLM 공식 문서 — models-extensions-fastsafetensor

사용 방법 (Usage)

vllm serve <model> --load-format fastsafetensors
  • --load-format fastsafetensors — 모델 가중치를 fastsafetensors 방식으로 GPU에 직접 로드해요.
  • GPU가 GDS(GPUDirect Storage)를 지원하면 그 장점을 활용해 더 빠르게 로드할 수 있어요.

더 알아보기 (Learn more)