스케줄러

스케줄러 (Schedulers)

Triton은 개별 추론 요청이 입력 배치를 지정할 수 있게 해서 배치 추론을 지원해요. 입력 배치에 대한 추론은 동시에 수행되는데, 특히 GPU에서는 추론 처리량을 크게 높일 수 있어서 매우 중요해요. 많은 사용 사례에서 개별 추론 요청은 배치가 아니므로 배치의 처리량 이점을 누리지 못해요.

인퍼런스 서버에는 다양한 모델 유형과 사용 사례를 지원하는 여러 스케줄링·배치 알고리즘이 들어 있어요. 모델 유형과 스케줄러에 대한 더 자세한 내용은 Models And Schedulers에서 찾을 수 있어요.

기본 스케줄러 (Default Scheduler)

기본 스케줄러는 모델 구성에 scheduling_choice 속성이 하나도 지정되지 않으면 해당 모델에 사용돼요. 기본 스케줄러는 단순히 추론 요청을 모델에 구성된 모든 모델 인스턴스에 분배해요.

앙상블 스케줄러 (Ensemble Scheduler)

앙상블 스케줄러는 앙상블 모델에만 사용해야 하고 다른 유형의 모델에는 사용할 수 없어요.

앙상블 스케줄러는 모델 구성의 ModelEnsembleScheduling 속성으로 모델별로 독립적으로 켜고 설정해요. 설정은 앙상블에 포함된 모델들과 모델 사이의 텐서 값 흐름을 설명해요. 자세한 내용과 예제는 Ensemble Models를 참고하세요.

더 알아보기 (Learn more)

출처: 공식문서 (Schedulers)