xFormers 핵심 기능 — 메모리 효율 어텐션과 퓨즈드 연산

xFormers 핵심 기능

xFormers의 키 기능은 PyTorch 기본 프리미티브를 넘어서는 최적화된 빌딩 블록이에요. 특히 어텐션의 메모리·속도 개선이 중심이에요.

메모리 효율 어텐션

핵심 API는 xformers.ops.memory_efficient_attention이에요. 완전한 정확도(exact attention)를 유지하면서 메모리 사용을 크게 줄여, 벤치마크 기준 최대 10배까지 빠를 수 있어요 (A100, f16, forward+backward 기준).

지원하는 어텐션 종류

  • 메모리 효율 정확한 어텐션 — 근사가 아닌 정확한 연산
  • sparse attention — 희소 어텐션
  • block-sparse attention — 블록 단위 희소 어텐션

퓨즈드(fused) 연산

커널을 하나로 합쳐 오버헤드를 줄인 연산들도 제공해요.

  • fused softmax
  • fused linear layer (선형 레이어)
  • fused layer norm (레이어노름)
  • fused dropout(activation(x+bias))
  • fused SwiGLU

설치 확인

설치한 환경에서 어떤 커널이 빌드·가용한지 다음과 같이 확인할 수 있어요.

python -m xformers.info

더 알아보기