FlexAttention — 커스텀 어텐션을 커널 하나로

FlexAttention

어텐션 패턴(슬라이딩 윈도우, 접두사 마스크, 문서 마스크 등)을 몇 줄의 파이썬 함수로 정의하면 torch.compile이 이를 하나의 융합된 FlashAttention 커널로 바꿔주는 PyTorch API가 FlexAttention이에요. 유연성과 성능을 동시에 얻는 게 핵심이에요.

이 카테고리의 문서

  • 개요: FlexAttention 소개 — 유연성과 성능
  • 핵심 기능: FlexAttention API — score_mod · mask_mod
  • 실전·API: FlexAttention Part II — 추론·디코딩

출처: https://pytorch.org/blog/flexattention/