FlashAttention (IO-aware 어텐션)
FlashAttention (IO-aware 어텐션)
FlashAttention은 빠르고 메모리 효율적인 정확(Exact) 어텐션 알고리즘이에요. Tri Dao(Stanford)가 이끄는 Dao-AILab에서 공식 구현을 제공해요. 2022년 NeurIPS에 처음 발표된 FlashAttention에서 시작해 FlashAttention-2, FlashAttention-3(Hopper GPU), FlashAttention-4(CuTeDSL)로 이어졌어요.
핵심 아이디어는 IO-aware(I/O 인지) 연산이에요 — GPU의 고대역폭 메모리(HBM)와 온칩 SRAM 사이의 읽기·쓰기를 타일링으로 줄여서, 시퀀스 길이에 대해 어텐션의 시간·메모리 복잡도가 제곱(O(n²))이 되는 문제를 실질적으로 완화해요.
핵심 개념
- Exact attention — 근사가 아니라 정확 계산 유지
- IO-aware tiling — HBM↔SRAM 전송 최소화
- 선형 메모리 — 시퀀스 길이 대비 메모리 선형화
- 2/3/4 버전 — 병렬성·Hopper·Blackwell 최적화
이 카테고리의 문서
- 라이브러리 개요: FlashAttention 공식 구현
- 논문 원리: IO-awareness·타일링·성능지표
- TGI 연동: 텍스트 생성 인퍼런스에서의 적용