FSDP — 파라미터를 쪼개는 완전 샤딩 데이터 병렬
Fully Sharded Data Parallel (FSDP)
모델이 커서 GPU 하나에 다 못 들어갈 때, 파라미터·그래디언트·옵티마이저 상태를 데이터 병렬 워커들에 쪼개(shard) 담는 기법이 Fully Sharded Data Parallel(FSDP) 예요. DDP의 all-reduce를 reduce-scatter와 all-gather로 분해해 메모리를 아껴, 큰 모델 학습을 한 장비에 담을 수 있게 해줘요. PyTorch FSDP(FSDP2)가 대표적이에요.
이 카테고리의 문서
- 개요: PyTorch FSDP2 튜토리얼 — 완전 샤딩 데이터 병렬 시작하기
- 핵심 기능: PyTorch FSDP API — 파라미터 샤딩·오프로드
- 실전·API: PyTorch 블로그 — FSDP 도입 배경과 벤치마크
출처: https://pytorch.org/tutorials/intermediate/FSDP_tutorial.html