용어집
용어집 (Glossary)
이 페이지는 Ascend NPU 문서 전반에서 마주치게 될 하드웨어 개념, 통신 라이브러리, 배포 용어, 그리고 흔히 쓰이는 약어를 다루어요. 낯선 용어가 나오면 여기로 돌아와 확인하세요.
출처: 문서
본문
하드웨어 (Hardware)
지원 디바이스 (Supported devices)
SGLang은 다음과 같은 Ascend 추론 하드웨어를 지원해요:
| 하드웨어 | 디바이스 | 카드당 다이 | 메모리 구성 |
|---|---|---|---|
| Ascend A2 Series 제품 | 8 | 1 | 8(카드) × 1(다이/카드) × 64(GB/다이) |
| Ascend A3 Series 제품 | 16 | 2 | 8(카드) × 2(다이/카드) × 64(GB/다이) |
문서 전체에서 A2 Series와 A3 Series는 위 하드웨어를 가리키는 약어로 사용돼요. Docker 이미지 태그는 A2 Series에
910b, A3 Series에a3를 사용해요. 예를 들어cann9.0.0-910b-v0.5.16과cann9.0.0-a3-v0.5.16이에요.A3 Series에서는 각 카드에 2개의 다이가 있어서 A2 Series의 8개와 달리 16개 디바이스가 돼요. 벤치마크 페이지에서는 물리적 카드를 가리키는 "Cards"를 사용하므로, A3 Series에서
Cards: 4는--tp-size 8을 의미해요.배포 관점에서 A2 Series와 A3 Series의 두 가지 핵심 차이는:
- 카드당 다이 수 — 총 메모리와
--tp-size구성 모두를 결정해요- PD 분리 — A2 Series는
export ASCEND_MF_TRANSFER_PROTOCOL="device_rdma"설정이 필요하고, A3 Series는 기본 프로토콜을 사용해요.
NPU
NPU는 Neural Processing Unit(신경 처리 장치)을 뜻해요. 각 NPU 디바이스는 단일 davinci 코어예요. 명령과 에러 로그에서는 "NPU"와 "davinci" 용어가 서로 바꿔 사용돼요.
A2 Series에서 디바이스는 /dev/davinci0부터 /dev/davinci7까지(8개 디바이스) 번호가 매겨져요. A3 Series에서는 /dev/davinci0부터 /dev/davinci15까지(16개 디바이스)예요.
A2 Series든 A3 Series든 서버에서 npu-smi info를 실행하면 디바이스 상태, 메모리 사용량, 칩 상태 같은 NPU 정보를 볼 수 있어요. 명령을 찾을 수 없거나 디바이스가 없다고 표시되면 드라이버가 설치되지 않았을 가능성이 높아요. Ascend 드라이버 설치 가이드를 따라 설치하세요.
통신 라이브러리 (Communication libraries)
| 라이브러리 | 설명 |
|---|---|
| HCCL (Huawei Collective Communication Library) | Ascend NPU의 다중 카드 데이터 전송을 위한 주요 통신 백엔드예요. NVIDIA NCCL과 동일한 역할이에요. --nnodes, --tp-size 및 모든 분산 시나리오에서 사용돼요. |
| GLOO | Meta의 집합 통신 라이브러리예요. 분산 초기화와 조정을 위해 HCCL과 함께 사용돼요. |
| DeepEP (Deep Expert Parallelism) | Mixture-of-Experts(MoE) all-to-all 디스패치와 컴바인 연산에 최적화된 통신 라이브러리예요. --moe-a2a-backend deepep와 함께 사용돼요. |
| RDMA (Remote Direct Memory Access) | InfiniBand 또는 RoCE 네트워크를 통해 노드 간 직접 메모리 접근을 가능하게 해요. 다중 노드 PD 분리에 필요해요. |
양자화와 정밀도 (Quantization and precision)
| 표기 | 의미 |
|---|---|
| W8A8 | 8비트 가중치, 8비트 활성화 |
| W4A8 | 4비트 가중치, 8비트 활성화 |
| W4A16 | 4비트 가중치, 16비트 활성화 |
| BF16 | Brain Floating Point 16 — ML 작업부하에 최적화된 16비트 형식 |
| FP8 | 8비트 부동소수점 — A2/A3 Series에서는 지원되지 않아요 |
| INT8 | 8비트 정수 양자화 |
양자화를 적용하려면 W8A8 INT8에 --quantization modelslim을 사용하거나, 모델 허브에서 사전 양자화된 체크포인트를 직접 불러오세요.
배포 용어 (Deployment terminology)
Prefill-Decode (PD) 분리 (PD disaggregation)
PD 분리는 추론을 서로 다른 노드에서 실행되는 두 단계로 나눠요:
- Prefill (P): 입력 프롬프트 전체를 한 번에 처리해요. 컴퓨트 바운드(계산 중심)예요.
- Decode (D): 토큰을 하나씩 생성해요. 메모리 대역폭 바운드예요.
PD Mixed: 두 단계가 같은 노드 집합에서 실행돼요.
| 약어 | 의미 |
|---|---|
| 1P1D | 1 prefill 노드 + 1 decode 노드 |
| 2P1D | 2 prefill 노드 + 1 decode 노드 |
| 1P2D | 1 prefill 노드 + 2 decode 노드 |
이런 약어는 Best Practice 섹션 제목에서 볼 수 있어요. 예를 들어 W8A8 2P1D 32P는 "W8A8 양자화, 2 prefill 노드 + 1 decode 노드, 총 32 카드"를 의미해요.
병렬화 전략 (Parallelism strategies)
| 전략 | 플래그 | 설명 |
|---|---|---|
| Tensor Parallelism (TP) | --tp-size |
노드 내 NPU들에 모델 가중치를 분할해요 |
| Data Parallelism (DP) | --dp-size |
더 높은 처리량을 위해 노드들에 모델을 복제해요 |
| Expert Parallelism (EP) | --ep-size |
MoE 전문가를 디바이스에 분산해요. --moe-a2a-backend가 필요해요 |
| Context Parallelism (CP) | --attn-cp-size |
긴 컨텍스트 윈도우를 디바이스에 분할해 긴 시퀀스를 처리해요 |
| Pipeline Parallelism (PP) | --pp-size |
모델 레이어를 디바이스에 순차적으로 분할해요 |
투기적 디코딩 (Speculative decoding)
| 알고리즘 | 설명 |
|---|---|
| EAGLE3 | 외부 드래프트 모델(--speculative-draft-model-path로 지정)을 사용해 후보 토큰을 제안해요. top-k 샘플링을 지원해요. |
| NEXTN | 모델의 내장 Multi-Token Prediction(MTP) 헤드를 사용해요 — 별도의 드래프트 모델이 필요 없어요. 네이티브 MTP 지원 모델에서 사용 가능해요. |
| MTP (Multi-Token Prediction) | 모델이 스텝당 여러 미래 토큰을 예측하는 모델 아키텍처 기능이에요. NEXTN 투기적 디코딩의 기반이에요. |
성능 지표 (Performance metrics)
| 지표 | 설명 |
|---|---|
| TPOT (Time Per Output Token) | 출력 토큰 하나를 생성하는 평균 시간이에요. 낮을수록 좋아요. |
| TTFT (Time To First Token) | 요청 도착부터 첫 토큰 생성까지의 지연이에요. 인터랙티브 사용에 중요해요. |
모델 아키텍처 용어 (Model architecture terms)
| 용어 | 설명 |
|---|---|
| MoE (Mixture of Experts) | 토큰당 파라미터의 일부(전문가)만 활성화해 계산량을 줄이는 모델 아키텍처예요. DeepSeek, Qwen3-30B-A3B, MiMo 모델에서 흔해요. |
| MLA (Multi-head Latent Attention) | 키-값 표현을 더 낮은 차원의 잠재 공간으로 압축하는 어텐션 변형이에요. DeepSeek 모델이 사용해요. |
| GQA (Grouped-Query Attention) | 여러 쿼리 헤드가 단일 키-값 헤드를 공유하는 어텐션 변형이에요. Qwen3 전체(dense) 모델이 사용해요. |
| DSA (DeepSeek Sparse Attention) | DeepSeek의 희소 어텐션 메커니즘이에요. 긴 컨텍스트의 KV 캐시 오버헤드를 줄여요. |
| FFN (Feed-Forward Network) | 각 트랜스포머 레이어의 비어텐션 구성 요소예요. MoE 모델에서는 FFN이 라우터가 선택한 여러 전문가 FFN 레이어로 대체돼요. |
기타 흔한 약어 (Other common abbreviations)
| 약어 | 원문 |
|---|---|
| ACL (Ascend Computing Language) | 저수준 Ascend 컴퓨트 API — 에러 로그에서 볼 수 있어요 |
| DVFS (Dynamic Voltage and Frequency Scaling) | 성능 안정성을 유지하기 위한 하드웨어 주파수 스케일링 |
| NUMA (Non-Uniform Memory Access) | 멀티 소켓 성능에 영향을 주는 메모리 아키텍처 |
| KV Cache (Key-Value Cache) | 디코드 중 재계산을 피하기 위한 캐시된 어텐션 키-값 텐서 |
| LoRA (Low-Rank Adaptation) | 파라미터 효율적 파인튜닝 방법 |
| HF (Hugging Face) | 모델 허브 — HF_TOKEN / HF_ENDPOINT가 모델 다운로드 접근을 제어해요 |
| UB (Unified Buffer) | 온칩 NPU 메모리 — 연산자 최적화에서 참조돼요 |
| DMA (Direct Memory Access) | 호스트와 디바이스 메모리 간 데이터 전송 메커니즘 |
다음으로 어디로 (Where to go next)
- 퀵스타트 — 첫 서버 실행하기
- 설치 가이드 — 컴포넌트 버전 매핑 포함 전체 설치
- 지원 기능 — 파라미터별 Ascend 지원 상태
- 지원 모델 — Ascend NPU에서 검증된 모델
- 모델 튜토리얼 — 단계별 배포 가이드
- Best Practice — 벤치마크 구성과 결과