Inference Endpoints 동작 원리

Inference Endpoints 동작 원리 (About)

Inference Endpoints는 AI 모델을 프로덕션에 배포하는 관리형 서비스예요. 인프라가 관리·구성되어 있어서 여러분은 AI 애플리케이션 구축에 집중할 수 있어요.

AI 모델을 프로덕션에 올리려면 세 가지 핵심 구성 요소가 필요해요:

  1. 모델 가중치와 아티팩트(Model Weights and Artifacts): AI 모델을 정의하는 훈련된 파라미터와 파일로, Hugging Face Hub에 저장·버저닝돼요.

  2. 추론 엔진(Inference Engine): 모델을 불러와서 예측을 생성하는 소프트웨어예요. 인기 있는 엔진으로 vLLM, TGI 등이 있고, 각각 용도와 성능 요구에 맞게 최적화되어 있어요.

  3. 프로덕션 인프라(Production Infrastructure): 이것이 바로 Inference Endpoints예요. 모델이 실행되는 확장 가능하고 안전하며 신뢰할 수 있는 환경 — 요청 처리, 수요에 맞는 스케일링, 가동 시간 보장.

Inference Endpoints는 이 모든 요소를 하나의 관리형 서비스로 묶어 줘요. Hub에서 모델을 선택하고, 추론 엔진을 고르면, Inference Endpoints가 나머지 — 인프라 프로비저닝, 모델 배포, 간단한 API로 접근 가능하게 만들기 — 를 처리합니다. 이렇게 하면 여러분은 앱 구축에 집중하고, 프로덕션 AI 배포의 복잡성은 우리가 처리해요.

추론 엔진 (Inference Engines)

이를 위해 Inference Endpoints를 고성능 오픈소스 추론 엔진을 배포하는 중심지로 만들었어요.

현재 네이티브로 지원하는 엔진:

  • vLLM
  • Text-generation-inference (TGI)
  • SGLang
  • llama.cpp
  • Text-embeddings-inference (TEI)

네이티브 지원 엔진에는 합리적인 기본값을 설정하고, 가장 관련 있는 구성 설정을 노출하며, 엔진을 유지보수하는 팀과 긴밀히 협력해 프로덕션 성능에 최적화되도록 하고 있어요. 선호하는 엔진이 여기 없다면 [email protected]로 연락해 주세요.

내부 동작 (Under the Hood)

엔드포인트를 배포하면, 선택한 추론 엔진(예: vLLM, TGI, SGLang 등)은 미리 빌드된 Docker 컨테이너로 패키징·런칭돼요. 이 컨테이너에는 추론 엔진 소프트웨어, 선택한 모델 가중치·아티팩트(Hugging Face Hub에서 직접 다운로드), 그리고 지정한 구성·환경변수가 담겨 있습니다.

우리는 컨테이너의 전체 라이프사이클 — 시작, 정지, 스케일링(오토스케일링·스케일투제로 포함), 헬스·성능 모니터링 — 을 관리해요. 이 오케스트레이션은 완전히 관리되므로, 컨테이너화·네트워킹·클라우드 리소스 관리의 복잡성은 신경 쓸 필요가 없죠.

엔터프라이즈 또는 팀 구독

더 많은 기능을 원하면 Team or Enterprise 구독을 고려해 보세요.

조직에 접근 제어에 대한 더 많은 제어, 전담 지원 등을 제공해요. 기능:

  • 가장 성능 좋은 GPU에 대한 더 높은 쿼터
  • Single Sign-on (SSO)
  • 감사 로그(Audit Logs) 접근
  • Resource Groups로 팀·프로젝트 접근 제어 관리
  • 저장소의 프라이빗 스토리지
  • 공개 저장소 생성 비활성화(또는 기본적으로 프라이빗으로)
  • 계약 기반 인보이스 견적 요청(더 많은 결제 옵션 + 선불 크레딧)
  • 등등!

더 알아보기 (Learn more)

출처: 공식문서