Hugging Face Inference Endpoints

Hugging Face Inference Endpoints

Hugging Face Inference Endpoints는 허브에 올린 모델을 몇 번의 클릭으로 보안된 전용 추론 엔드포인트로 바꿔주는 관리형 서비스예요. GPU 인프라나 로드밸런싱을 직접 관리할 필요 없이, 원하는 하드웨어와 리전을 고르면 자동으로 모델이 서빙돼요.

이 카테고리의 문서로는 엔드포인트 만들기, 커스텀 서빙, 운영, vLLM 가속 추론 등을 다뤄요.

출처: https://huggingface.co/docs/inference-endpoints