용어집

용어집 (Glossary)

이 페이지는 Ascend NPU 문서 전반에서 마주치게 될 하드웨어 개념, 통신 라이브러리, 배포 용어, 그리고 흔히 쓰이는 약어를 다루어요. 낯선 용어가 나오면 여기로 돌아와 확인하세요.

출처: 문서

본문

하드웨어 (Hardware)

지원 디바이스 (Supported devices)

SGLang은 다음과 같은 Ascend 추론 하드웨어를 지원해요:

하드웨어 디바이스 카드당 다이 메모리 구성
Ascend A2 Series 제품 8 1 8(카드) × 1(다이/카드) × 64(GB/다이)
Ascend A3 Series 제품 16 2 8(카드) × 2(다이/카드) × 64(GB/다이)

문서 전체에서 A2 SeriesA3 Series는 위 하드웨어를 가리키는 약어로 사용돼요. Docker 이미지 태그는 A2 Series에 910b, A3 Series에 a3를 사용해요. 예를 들어 cann9.0.0-910b-v0.5.16cann9.0.0-a3-v0.5.16이에요.

A3 Series에서는 각 카드에 2개의 다이가 있어서 A2 Series의 8개와 달리 16개 디바이스가 돼요. 벤치마크 페이지에서는 물리적 카드를 가리키는 "Cards"를 사용하므로, A3 Series에서 Cards: 4--tp-size 8을 의미해요.

배포 관점에서 A2 Series와 A3 Series의 두 가지 핵심 차이는:

  1. 카드당 다이 수 — 총 메모리와 --tp-size 구성 모두를 결정해요
  2. PD 분리 — A2 Series는 export ASCEND_MF_TRANSFER_PROTOCOL="device_rdma" 설정이 필요하고, A3 Series는 기본 프로토콜을 사용해요.

NPU

NPU는 Neural Processing Unit(신경 처리 장치)을 뜻해요. 각 NPU 디바이스는 단일 davinci 코어예요. 명령과 에러 로그에서는 "NPU"와 "davinci" 용어가 서로 바꿔 사용돼요.

A2 Series에서 디바이스는 /dev/davinci0부터 /dev/davinci7까지(8개 디바이스) 번호가 매겨져요. A3 Series에서는 /dev/davinci0부터 /dev/davinci15까지(16개 디바이스)예요.

A2 Series든 A3 Series든 서버에서 npu-smi info를 실행하면 디바이스 상태, 메모리 사용량, 칩 상태 같은 NPU 정보를 볼 수 있어요. 명령을 찾을 수 없거나 디바이스가 없다고 표시되면 드라이버가 설치되지 않았을 가능성이 높아요. Ascend 드라이버 설치 가이드를 따라 설치하세요.

통신 라이브러리 (Communication libraries)

라이브러리 설명
HCCL (Huawei Collective Communication Library) Ascend NPU의 다중 카드 데이터 전송을 위한 주요 통신 백엔드예요. NVIDIA NCCL과 동일한 역할이에요. --nnodes, --tp-size 및 모든 분산 시나리오에서 사용돼요.
GLOO Meta의 집합 통신 라이브러리예요. 분산 초기화와 조정을 위해 HCCL과 함께 사용돼요.
DeepEP (Deep Expert Parallelism) Mixture-of-Experts(MoE) all-to-all 디스패치와 컴바인 연산에 최적화된 통신 라이브러리예요. --moe-a2a-backend deepep와 함께 사용돼요.
RDMA (Remote Direct Memory Access) InfiniBand 또는 RoCE 네트워크를 통해 노드 간 직접 메모리 접근을 가능하게 해요. 다중 노드 PD 분리에 필요해요.

양자화와 정밀도 (Quantization and precision)

표기 의미
W8A8 8비트 가중치, 8비트 활성화
W4A8 4비트 가중치, 8비트 활성화
W4A16 4비트 가중치, 16비트 활성화
BF16 Brain Floating Point 16 — ML 작업부하에 최적화된 16비트 형식
FP8 8비트 부동소수점 — A2/A3 Series에서는 지원되지 않아요
INT8 8비트 정수 양자화

양자화를 적용하려면 W8A8 INT8에 --quantization modelslim을 사용하거나, 모델 허브에서 사전 양자화된 체크포인트를 직접 불러오세요.

배포 용어 (Deployment terminology)

Prefill-Decode (PD) 분리 (PD disaggregation)

PD 분리는 추론을 서로 다른 노드에서 실행되는 두 단계로 나눠요:

  • Prefill (P): 입력 프롬프트 전체를 한 번에 처리해요. 컴퓨트 바운드(계산 중심)예요.
  • Decode (D): 토큰을 하나씩 생성해요. 메모리 대역폭 바운드예요.

PD Mixed: 두 단계가 같은 노드 집합에서 실행돼요.

약어 의미
1P1D 1 prefill 노드 + 1 decode 노드
2P1D 2 prefill 노드 + 1 decode 노드
1P2D 1 prefill 노드 + 2 decode 노드

이런 약어는 Best Practice 섹션 제목에서 볼 수 있어요. 예를 들어 W8A8 2P1D 32P는 "W8A8 양자화, 2 prefill 노드 + 1 decode 노드, 총 32 카드"를 의미해요.

병렬화 전략 (Parallelism strategies)

전략 플래그 설명
Tensor Parallelism (TP) --tp-size 노드 내 NPU들에 모델 가중치를 분할해요
Data Parallelism (DP) --dp-size 더 높은 처리량을 위해 노드들에 모델을 복제해요
Expert Parallelism (EP) --ep-size MoE 전문가를 디바이스에 분산해요. --moe-a2a-backend가 필요해요
Context Parallelism (CP) --attn-cp-size 긴 컨텍스트 윈도우를 디바이스에 분할해 긴 시퀀스를 처리해요
Pipeline Parallelism (PP) --pp-size 모델 레이어를 디바이스에 순차적으로 분할해요

투기적 디코딩 (Speculative decoding)

알고리즘 설명
EAGLE3 외부 드래프트 모델(--speculative-draft-model-path로 지정)을 사용해 후보 토큰을 제안해요. top-k 샘플링을 지원해요.
NEXTN 모델의 내장 Multi-Token Prediction(MTP) 헤드를 사용해요 — 별도의 드래프트 모델이 필요 없어요. 네이티브 MTP 지원 모델에서 사용 가능해요.
MTP (Multi-Token Prediction) 모델이 스텝당 여러 미래 토큰을 예측하는 모델 아키텍처 기능이에요. NEXTN 투기적 디코딩의 기반이에요.

성능 지표 (Performance metrics)

지표 설명
TPOT (Time Per Output Token) 출력 토큰 하나를 생성하는 평균 시간이에요. 낮을수록 좋아요.
TTFT (Time To First Token) 요청 도착부터 첫 토큰 생성까지의 지연이에요. 인터랙티브 사용에 중요해요.

모델 아키텍처 용어 (Model architecture terms)

용어 설명
MoE (Mixture of Experts) 토큰당 파라미터의 일부(전문가)만 활성화해 계산량을 줄이는 모델 아키텍처예요. DeepSeek, Qwen3-30B-A3B, MiMo 모델에서 흔해요.
MLA (Multi-head Latent Attention) 키-값 표현을 더 낮은 차원의 잠재 공간으로 압축하는 어텐션 변형이에요. DeepSeek 모델이 사용해요.
GQA (Grouped-Query Attention) 여러 쿼리 헤드가 단일 키-값 헤드를 공유하는 어텐션 변형이에요. Qwen3 전체(dense) 모델이 사용해요.
DSA (DeepSeek Sparse Attention) DeepSeek의 희소 어텐션 메커니즘이에요. 긴 컨텍스트의 KV 캐시 오버헤드를 줄여요.
FFN (Feed-Forward Network) 각 트랜스포머 레이어의 비어텐션 구성 요소예요. MoE 모델에서는 FFN이 라우터가 선택한 여러 전문가 FFN 레이어로 대체돼요.

기타 흔한 약어 (Other common abbreviations)

약어 원문
ACL (Ascend Computing Language) 저수준 Ascend 컴퓨트 API — 에러 로그에서 볼 수 있어요
DVFS (Dynamic Voltage and Frequency Scaling) 성능 안정성을 유지하기 위한 하드웨어 주파수 스케일링
NUMA (Non-Uniform Memory Access) 멀티 소켓 성능에 영향을 주는 메모리 아키텍처
KV Cache (Key-Value Cache) 디코드 중 재계산을 피하기 위한 캐시된 어텐션 키-값 텐서
LoRA (Low-Rank Adaptation) 파라미터 효율적 파인튜닝 방법
HF (Hugging Face) 모델 허브 — HF_TOKEN / HF_ENDPOINT가 모델 다운로드 접근을 제어해요
UB (Unified Buffer) 온칩 NPU 메모리 — 연산자 최적화에서 참조돼요
DMA (Direct Memory Access) 호스트와 디바이스 메모리 간 데이터 전송 메커니즘

다음으로 어디로 (Where to go next)

더 알아보기 (Learn more)