CTranslate2 개요 — 고속 트랜스포머 추론
CTranslate2 개요 — 고속 트랜스포머 추론
CTranslate2는 Transformer 계열 모델의 추론을 전용으로 가속하는 엔진이에요. PyTorch 같은 범용 프레임워크와 달리 추론에 특화되어, 높은 처리량과 낮은 메모리 사용을 목표로 해요.
주요 특징
- 층 융합(layer fusion): 여러 연산을 하나로 합쳐 호출·메모리 오버헤드를 줄여요.
- 패딩 제거: 시퀀스 내 불필요한 패딩 계산을 건너뛰어요.
- 양자화 지원: FP16/BF16/INT16/INT8, 그리고 AWQ(INT4)까지 지원해요.
- 배치 재정렬(batch reordering): 동일 길이끼리 모아 처리 효율을 높여요.
호환 모델
- OpenNMT-py, OpenNMT-tf, Fairseq, Marian, OPUS-MT, 그리고 HuggingFace Transformers 모델을 변환해 사용할 수 있어요.
- 변환 후에는 학습 환경 없이 CTranslate2 전용 포맷으로 실행돼요.