Text Generation Inference(TGI) 연동
Text Generation Inference(TGI) 연동
Hugging Face의 Text Generation Inference(TGI) 서버는 FlashAttention을 백엔드 어텐션 구현으로 사용해요. LLM 서빙에서 긴 컨텍스트를 빠르고 메모리 효율적으로 처리하기 위한 선택이에요.
TGI는 단순히 어텐션 연산을 가속할 뿐 아니라, KV 캐시·배치·연속 시퀀스 처리와 결합해 실제 서빙 성능을 끌어올려요. FlashAttention을 직접 호출하는 쪽보다 서빙 스택(TGI·vLLM 등)에 통합해 쓰는 경우가 많아요.
출처: https://huggingface.co/docs/text-generation-inference/en/conceptual/flash_attention
TGI에서의 역할
- 어텐션 커널 가속 — 표준 scaled dot-product attention을 IO-aware 방식으로.
- 긴 컨텍스트 지원 — 메모리 선형화로 더 긴 입력 처리.
- 대규모 배치 — 많은 동시 요청을 메모리 이득으로 수용.
왜 서빙 프레임워크에 통합하나
FlashAttention 함수 자체는 커널이지만, 프로덕션에서는 KV 캐시 관리·프리필/디코드 분리·연속 배치(paged attention) 같은 서빙 레이어가 함께 필요해요. TGI·vLLM·SGLang 등이 이 전체를 묶어 제공해요.