Ring-SP 성능
Ring-SP 성능 (Ring-SP Performance)
이 페이지는 Ascend NPU에서 torch_npu==2.10.0을 사용했을 때 Ring-SP 성능을 보고해요. Ring-SP(Ulysses 시퀀스 병렬 + Ring 순환 병렬)가 실제로 얼마나 효과가 있는지 숫자로 확인할 수 있게 정리했어요.
출처: 문서
본문
벤치마크 설정 (Benchmark Setup)
- 모델:
Wan2.1-T2V-1.3B-Diffusers - 프롬프트:
"a cat is playing piano" - 프레임워크 명령:
sglang generate - 런타임:
torch_npu==2.10.0
생성 명령 (Generate Commands)
기본 설정 (u1r1)
차례대로 실행하면 돼요. ulysses=1, ring=1 조합을 기준 성능으로 삼아요.
sglang generate --model-path /nas/disk1/Wan2.1-T2V-1.3B-Diffusers \
--prompt "a cat is playing piano" --num-gpus 1 --ring-degree 1 \
--save-output
Ring-SP (u1r2)
Ring-SP 설정은 ulysses=1, ring=2 조합을 사용해요. --ring-degree 2만 바꿔 주면 되어요.
sglang generate --model-path /nas/disk1/Wan2.1-T2V-1.3B-Diffusers \
--prompt "a cat is playing piano" --num-gpus 2 --ring-degree 2 \
--save-output
벤치마크 (Benchmarks)
벤치마크 고지 사항 (Benchmark Disclaimer)
이 숫자들은 하나의 고정된 설정과 하나의 프롬프트 케이스에서 얻은 결과예요. 실제 성능은 모델 설정, 환경, 작업 부하에 따라 달라질 수 있어요.
스테이지별 시간 분해 (Stage Time Breakdown)
| 스테이지 / 지표 | u1r2 (s) |
u1r1 기준 (s) |
속도 향상 |
|---|---|---|---|
| InputValidation | 0.0003 | 0.0002 | 0.67x |
| TextEncoding | 3.5936 | 3.5820 | 1.00x |
| LatentPreparation | 0.0007 | 0.0055 | 7.86x |
| TimestepPreparation | 0.0008 | 0.0007 | 0.88x |
| Denoising | 121.2788 | 239.2580 | 1.97x |
| Decoding | 13.8685 | 16.4969 | 1.19x |
| 총합 (생성된 픽셀 데이터) | 141.86 | 266.50 | 1.88x |
요약 (Summary)
torch_npu==2.10.0환경에서 이 케이스의 Ring-SP(u1r2)는 NPU에서 성공적으로 실행돼요.- 엔드투엔드 생성 시간이
266.50s에서141.86s로 약1.88x개선되었어요. - 주요 이득은
DenoisingStage(1.97x)에서 나오고, 디코딩도1.19x로 함께 개선되었어요.