Text Generation Inference (TGI) 인퍼런스 엔진

Text Generation Inference (TGI) 인퍼런스 엔진

TGI(Text Generation Inference)는 Rust와 Python으로 만들어진 프로덕션급 추론 엔진이에요. LLaMA, Falcon, StarCoder, BLOOM 같은 오픈소스 LLM을 고성능으로 서빙하기 위해 설계됐죠. 다만 이 글을 읽는 시점에 TGI는 유지보수 모드에 들어와 있어서, 신규 배포라면 vLLM이나 SGLang 같은 대안 엔진을 먼저 고려해 보시는 걸 권해요.

먼저 알아둘 것: TGI는 유지보수 모드

2025/12/11 기준으로 TGI는 유지보수 모드에 있어요. 앞으로는 사소한 버그 수정, 문서 개선, 가벼운 유지보수 작업에 해당하는 PR만 받는다는 뜻이에요. Inference Endpoints에서 새로 배포한다면 vLLM이나 SGLang 같은 대안을 쓰는 걸 추천해요.

만약 이미 TGI로 배포한 엔드포인트가 있다면, 아래 마이그레이션 가이드를 참고하세요.

TGI → vLLM 마이그레이션

사실 런타임에 인퍼런스 엔진을 바꿀 수는 없어서, 전환하려면 어차피 새 엔드포인트를 만들어야 해요. 기존 TGI 엔드포인트를 vLLM으로 옮기고 싶다면 새 엔드포인트를 만들어 전환을 완료하면 됩니다.

TGI가 선택되는 이유

TGI가 좋은 선택이 되는 핵심 기능은 이래요.

  • 고성능 오픈소스 LLM 서빙에 특화 (LLaMA, Falcon, StarCoder, BLOOM 등 다수)
  • 연속 배치와 같은 추론 최적화 기술 지원
  • 프로덕션에서 바로 쓰기 좋은 안정성

지원 모델

어떤 모델이 TGI로 돌아가는지는 몇 가지 경로로 확인할 수 있어요.

TGI로 지원되는 모델이라면 Inference Endpoints UI에서 Container Type 설정 시 해당 옵션이 활성화/비활성화되는 걸로 바로 알 수 있어요. 엔진에 대한 더 깊은 내용은 TGI 문서를 함께 읽어 보는 걸 추천해요.

더 알아보기

  • TGI 공식 문서에서 엔진 내부 동작을 더 볼 수 있어요
  • 새로 배포할 때는 vLLM이나 SGLang 문서를 먼저 확인해 보세요