Hugging Face Text Generation Inference (TGI)
Hugging Face Text Generation Inference (TGI)
TGI(Hugging Face Text Generation Inference)는 대규모 언어 모델(LLM)을 고속으로 서빙하기 위한 오픈소스 추론 서버예요. Hugging Face가 만들었고, 단일 GPU부터 대규모 분산 환경까지 확장하면서 OpenAI 호환 API, 토큰 스트리밍, 연속 배치 등 프로덕션에 필요한 기능을 갖췄어요.
이 카테고리의 문서
- 시작하기: 설치, Docker 빠른 시작, 모델 실행
- 추론/서빙: 텍스트 생성, 스트리밍, 추론 파라미터
- 고급: 양자화, 분산 추론, 커스텀 로직