Intel Gaudi
Intel Gaudi
Intel Gaudi AI 가속기 제품군에는 Intel Gaudi 1, Intel Gaudi 2, Intel Gaudi 3가 있어요. 서버마다 Habana Processing Unit(HPU) 8개가 있고, 메모리는 Gaudi 3에서 128GB, Gaudi 2에서 96GB, 1세대 Gaudi에서 32GB입니다. Gaudi 아키텍처 개요에서 하드웨어를 자세히 다룹니다.
출처: 문서
본문
TrainingArguments, Trainer, Pipeline은 Intel Gaudi 기기를 자동으로 감지해 백엔드를 hpu로 설정해요.
환경 변수 (Environment variables)
HPU 레이지 모드(lazy mode)는 모든 Transformers 모델링 코드와 호환되지 않습니다. 오류가 나면 아래 환경 변수를 설정해 이어(egar) 모드로 전환하세요.
export PT_HPU_LAZY_MODE=0
긴 정수(long integer) 캐스팅 문제를 피하려면 int64 지원을 켜야 할 수도 있어요.
export PT_ENABLE_INT64_SUPPORT=1
혼합 정밀도 (Mixed precision)
모든 Gaudi 세대는 bf16을 기본 지원합니다.
from transformers import TrainingArguments
training_args = TrainingArguments(
output_dir="./outputs",
bf16=True, # supported on all Gaudi generations
)
torch.compile
Gaudi는 torch.compile을 지원해요. TrainingArguments는 HPU가 감지되면 torch_compile_backend를 자동으로 "hpu_backend"로 설정합니다.
from transformers import TrainingArguments
training_args = TrainingArguments(
output_dir="./outputs",
torch_compile=True,
)
분산 훈련 (Distributed training)
멀티 HPU 훈련은 분산 백엔드로 HCCL(Habana Collective Communications Library)을 사용합니다. HCCL이 기본값이지만, ddp_backend를 명시적으로 설정할 수도 있어요.
from transformers import TrainingArguments
training_args = TrainingArguments(
output_dir="./outputs",
ddp_backend="hccl",
)
다음 단계 (Next steps)
- 훈련에 대한 더 자세한 정보는 Gaudi 문서를 보세요.
- 훈련·추론 시 Gaudi에 최적화된 모델 구현을 원한다면 Optimum for Intel Gaudi를 사용해 보세요.
더 알아보기 (Learn more)
- Gaudi 문서: 훈련에 대한 심층 정보
- Optimum for Intel Gaudi: Gaudi 최적화 모델 라이브러리