xFormers 핵심 기능 — 메모리 효율 어텐션과 퓨즈드 연산
xFormers 핵심 기능
xFormers의 키 기능은 PyTorch 기본 프리미티브를 넘어서는 최적화된 빌딩 블록이에요. 특히 어텐션의 메모리·속도 개선이 중심이에요.
메모리 효율 어텐션
핵심 API는 xformers.ops.memory_efficient_attention이에요. 완전한 정확도(exact attention)를 유지하면서 메모리 사용을 크게 줄여, 벤치마크 기준 최대 10배까지 빠를 수 있어요 (A100, f16, forward+backward 기준).
지원하는 어텐션 종류
- 메모리 효율 정확한 어텐션 — 근사가 아닌 정확한 연산
- sparse attention — 희소 어텐션
- block-sparse attention — 블록 단위 희소 어텐션
퓨즈드(fused) 연산
커널을 하나로 합쳐 오버헤드를 줄인 연산들도 제공해요.
- fused softmax
- fused linear layer (선형 레이어)
- fused layer norm (레이어노름)
- fused dropout(activation(x+bias))
- fused SwiGLU
설치 확인
설치한 환경에서 어떤 커널이 빌드·가용한지 다음과 같이 확인할 수 있어요.
python -m xformers.info