LLM Inference Optimization — 추론 가속화 기법
LLM Inference Optimization
모델을 실제로 서빙할 때는 추론이 얼마나 빠르고 메모리를 적게 쓰는지가 곧 비용이에요. LLM 추론 최적화는 컴파일·어텐션 백엔드·커널·양자화·캐싱·병렬화·연속 배칭을 쌓아 성능을 최대화하는 기법들이에요. Transformers와 vLLM 공식 문서를 기준으로 정리했어요.
이 카테고리의 문서
- 개요: Transformers 추론 최적화 기법 표
- 핵심 기능: vLLM 자동 프리픽스 캐싱(APC)
- 실전·API: GPU 추론 가속 코드
출처: https://huggingface.co/docs/transformers/perf_infer_gpu_one