추론 최적화 개요 — 기법 선택표

추론 최적화 개요

Transformers는 모델을 빠르고 저렴하게 만들기 위한 여러 추론 최적화 기법을 제공해요. 대안 어텐션(메모리 트래픽 감소), 커널(처리량 향상), 양자화, 캐싱, 병렬화, 연속 배칭 등을 겹쳐 쓰는 방식이에요.

기법 선택표

기법 속도 메모리
컴파일(torch.compile)
어텐션 백엔드
커널
양자화
캐싱
병렬화
연속 배칭

메모리와 속도는 밀접하지만 같지 않아요. 메모리가 줄면 이동할 데이터가 적어져 '빨라지지만', 순수 속도 최적화가 메모리를 늘리는 경우도 있어요. 목표에 맞춰 조합하는 게 핵심이에요.

주요 기법

  • 컴파일: torch.compile로 파이썬 오버헤드를 줄이고 연산 퓨즈
  • 어텐션 백엔드: FlashAttention 등으로 메모리 트래픽 감소
  • 커널: 연산을 퓨즈해 처리량·메모리 개선
  • 캐싱: 과거 K/V 재사용으로 생성 가속

정리

Transformers 추론 최적화는 '한 가지 마법'이 아니라 여러 기법을 쌓는 전략이에요. 하드웨어와 워크로드에 맞춰 골라 조합하면 되고, 자세한 코드는 perf_infer_gpu_one 가이드에서 확인할 수 있어요.

더 알아보기