Model Serving — LLM을 서버로 배포하고 스트리밍하기

Model Serving

모델을 '만드는 것'과 '서비스하는 것'은 다릅니다. **모델 서빙(serving)**은 학습한 LLM을 고성능 추론 서버로 배포해 API로 호출할 수 있게 하는 단계예요. Hugging Face TGI를 기준으로, 배포·스트리밍·메시지 API까지 살펴봐요.

이 카테고리의 문서

  • 개요: TGI란 무엇이고 어떤 최적화를 제공하는가
  • 핵심 기능: OpenAI 호환/스트리밍 방식
  • 실전·API: 메시지 API로 상호작용하기

출처: https://huggingface.co/docs/text-generation-inference/en/index