모델 서빙 개요 — TGI와 고성능 추론

모델 서빙 개요

Text Generation Inference(TGI)는 LLM을 배포하고 서빙하기 위한 툴킷이에요. Llama·Falcon·StarCoder·BLOOM 등 인기 오픈소스 LLM을 위한 고성능 텍스트 생성 서버를 제공해요.

TGI가 제공하는 것

  • 가장 인기 있는 LLM을 띄우기 위한 간단한 런처
  • 분산 트레이싱(OpenTelemetry)·Prometheus 메트릭으로 프로덕션 준비
  • 다중 GPU에서 텐서 병렬 처리
  • SSE(Server-Sent Events) 기반 토큰 스트리밍
  • 연속 배칭(continuous batching)으로 전체 처리량 증가
  • Flash Attention·Paged Attention 적용된 추론 최적화
  • bitsandbytes·GPT-Q 양자화, safetensors 가중치 로딩
  • 함수 호출·도구 사용을 위한 Guidance 지원

왜 서빙 전용 엔진인가

단순히 model.generate()를 서버로 감싸기보다, 배칭·스트리밍·병렬화·양자화를 엔진 차원에서 최적화해야 실서비스 처리량이 나와요. TGI는 이걸 한번에 해주는 엔진이에요.

참고

최근에는 vLLM·SGLang처럼 같은 최적화 아이디어를 계승한 엔진도 많이 쓰여요. 목적(배포·서빙)에 맞는 엔진을 고르면 돼요.

더 알아보기