TGI 지원 모델
TGI 지원 모델
TGI로 어떤 모델을 서빙할 수 있을까요? TGI는 사전에 최적화된 모델들을 바로 서빙할 수 있게 해 줘요. 이 글에서는 공식 문서에서 지원한다고 명시된 LLM과 VLM 목록을 정리하고, 목록에 없는 모델을 써야 할 때 어떻게 접근하면 좋을지도 함께 설명할게요.
지원 목록
TGI가 지원하는 모델은 다음과 같아요. 멀티모달(VLM) 모델은 따로 표시했어요.
- Deepseek V2, Deepseek V3
- Idefics 2, Idefics 3 (Multimodal)
- Llava Next (1.6) (Multimodal)
- Llama, Llama4
- Phi 3
- Granite
- Gemma, PaliGemma, Gemma2, Gemma3, Gemma3 Text
- Cohere (예:
CohereForAI/c4ai-command-r-plus) - Dbrx
- Mamba
- Mistral, Mixtral
- Gpt Bigcode, StarCoder 2
- Phi, PhiMoe
- Baichuan
- Falcon
- Qwen 2, Qwen 2 VL, Qwen 2.5 VL
- Opt, T5, Galactica, SantaCoder, Bloom, Mpt, Gpt2, Gpt Neox, Gptj
- Idefics (Multimodal), Mllama (Multimodal)
목록에 없는 모델은 어떻게?
위 목록에 없어도 서빙 자체는 시도해 볼 수 있어요. 다만 지원되는 모델이 아니므로 성능은 보장되지 않아요. 모델의 파이프라인 타입에 따라 두 가지 방식 중 하나로 초기화할 수 있어요.
# causal LMs / text-generation 모델
AutoModelForCausalLM.from_pretrained(<model>, device_map="auto")
# 또는 text-to-text 생성 모델
AutoModelForSeq2SeqLM.from_pretrained(<model>, device_map="auto")
이미 로컬 폴더에 있는 지원 모델을 서빙할 때는 모델 ID 대신 로컬 폴더 경로를 가리키면 돼요.
text-generation-launcher --model-id <PATH-TO-LOCAL-BLOOM>