Triton으로 HSTU 생성형 추천 모델 서빙하기

Triton으로 HSTU 생성형 추천 모델 서빙하기

Hierarchical Sequential Transduction Units(HSTU)생성형 추천(Generative Recommenders, GRs) 을 뒷받침해요. 추천 워크로드를 고차원·비정상 이벤트 스트림에 대한 생성 모델링으로 재구성한 것이죠. HSTU는 retrieval 방식과 ranking 방식 작업을 모두 지원합니다.

Triton Inference Server는 PyTorch 백엔드를 통해 HSTU 모델을 서빙할 수 있어요. 이때 사전 컴파일된 AOT(Ahead-Of-Time) Inductor 패키지(platform: "torch_aoti")를 사용합니다. 훈련, 내보내기(export), KV-cache 런타임, 그리고 end-to-end 예시는 이 tutorials 트리 대신 NVIDIA의 recsys-examples 저장소에 있어요.

다음으로 볼 것

참고: HSTU 모델의 빌드·내보내기·검증은 recsys-examples 가이드를 사용하세요. 이 페이지는 그 워크플로와 Torch AOTI 서빙 경로만 Triton 사용자에게 안내합니다.