TGI 지원 모델

TGI 지원 모델

TGI로 어떤 모델을 서빙할 수 있을까요? TGI는 사전에 최적화된 모델들을 바로 서빙할 수 있게 해 줘요. 이 글에서는 공식 문서에서 지원한다고 명시된 LLM과 VLM 목록을 정리하고, 목록에 없는 모델을 써야 할 때 어떻게 접근하면 좋을지도 함께 설명할게요.

출처: Hugging Face Text Generation Inference Supported Models

지원 목록

TGI가 지원하는 모델은 다음과 같아요. 멀티모달(VLM) 모델은 따로 표시했어요.

  • Deepseek V2, Deepseek V3
  • Idefics 2, Idefics 3 (Multimodal)
  • Llava Next (1.6) (Multimodal)
  • Llama, Llama4
  • Phi 3
  • Granite
  • Gemma, PaliGemma, Gemma2, Gemma3, Gemma3 Text
  • Cohere (예: CohereForAI/c4ai-command-r-plus)
  • Dbrx
  • Mamba
  • Mistral, Mixtral
  • Gpt Bigcode, StarCoder 2
  • Phi, PhiMoe
  • Baichuan
  • Falcon
  • Qwen 2, Qwen 2 VL, Qwen 2.5 VL
  • Opt, T5, Galactica, SantaCoder, Bloom, Mpt, Gpt2, Gpt Neox, Gptj
  • Idefics (Multimodal), Mllama (Multimodal)

목록에 없는 모델은 어떻게?

위 목록에 없어도 서빙 자체는 시도해 볼 수 있어요. 다만 지원되는 모델이 아니므로 성능은 보장되지 않아요. 모델의 파이프라인 타입에 따라 두 가지 방식 중 하나로 초기화할 수 있어요.

# causal LMs / text-generation 모델
AutoModelForCausalLM.from_pretrained(<model>, device_map="auto")
# 또는 text-to-text 생성 모델
AutoModelForSeq2SeqLM.from_pretrained(<model>, device_map="auto")

이미 로컬 폴더에 있는 지원 모델을 서빙할 때는 모델 ID 대신 로컬 폴더 경로를 가리키면 돼요.

text-generation-launcher --model-id <PATH-TO-LOCAL-BLOOM>

더 알아보기