Inference Optimization — 서빙 시간 성능 최적화
Inference Optimization
모델이 아무리 뛰어나도, 실제 서빙에서 토큰이 느리게 나오면 쓸 수 없어요. 추론 최적화는 프리필·디코딩, 배칭, 컴파일, 벤치마킹을 종합해 지연(Latency)과 처리량(Throughput)을 끌어올리는 영역이에요. vLLM은 최적화 레벨과 벤치마크 스위트를, TensorRT-LLM은 모델별 처리량 레퍼런스를 제공해요.
이 카테고리의 문서
- 핵심 기능: Optimization Levels — 최적화 수준 -O0~O3
- 실전·API: Benchmark Suites — 성능 측정과 튜닝
- 레퍼런스: TensorRT-LLM 성능 개요 — 모델별 처리량
출처: https://docs.vllm.ai/en/latest/design/optimization_levels/