TGI 멀티 백엔드 지원

TGI 멀티 백엔드 지원

TGI에서 서빙 백엔드를 고르는 일은 생각보다 유연해요. 성능을 우선할지, 사용 편의성을 우선할지, 특정 하드웨어와의 호환성을 우선할지에 따라 원하는 백엔드를 선택할 수 있거든요. 중요한 건 어느 백엔드를 쓰든 API와의 상호작용 방식은 동일하다는 점이에요. 그래서 백엔드를 바꿔도 클라이언트 코드는 크게 건드리지 않고 전환할 수 있어요. 어떤 백엔드들이 있는지 함께 살펴볼게요.

출처: Hugging Face Text Generation Inference Multi-backend support

지원되는 백엔드

TGI가 지원하는 백엔드는 네 가지예요.

  • TGI CUDA backend: Nvidia GPU에 최적화된 고성능 백엔드로, TGI 안에서 기본값(default)으로 동작해요. 자체 개발한 만큼 수많은 최적화가 들어 있고, Hugging Face를 비롯한 여러 프로젝트에서 운영 환경에 쓰이고 있어요.
  • TGI TRTLLM backend: Nvidia의 TensorRT 라이브러리를 활용해 LLM 추론을 가속해요. 특수한 최적화와 커스텀 커널을 사용해 성능을 높이지만, GPU 아키텍처마다 모델별 컴파일 단계가 필요해요.
  • TGI Llamacpp backend: CPU와 GPU 계산 모두에 최적화된 추론 엔진인 llama.cpp를 통합해 LLM을 배포할 수 있게 해 줘요.
  • TGI Neuron backend: AWS Neuron SDK를 활용해 AWS Trainium과 Inferentia 칩에서 LLM을 배포할 수 있게 해 줘요.

더 알아보기