엔드포인트 구성 가이드
엔드포인트 구성 가이드 (Configuration)
이 섹션은 새 inference endpoint를 만들 때 사용할 수 있는 구성 옵션을 설명해요. 인터페이스의 각 섹션은 모델이 어떻게 배포·접근·스케일링되는지 세밀하게 제어할 수 있게 해 줍니다.
엔드포인트 이름, 모델, 조직
왼쪽 위에서:
- inference endpoint의 이름을 바꿀 수 있고
- 어떤 조직에 이 모델을 배포하는지 확인할 수 있고
- 어떤 모델을 배포하는지 확인할 수 있고
- 어떤 Hugging Face Hub repo에서 이 모델을 배포하는지 확인할 수 있어요
하드웨어 구성 (Hardware Configuration)
Hardware Configuration 섹션은 모델을 호스팅하는 데 사용할 컴퓨트 백엔드를 고르는 곳이에요. 세 주요 클라우드 제공자 중에서 선택할 수 있어요:
- Amazon Web Services (AWS)
- Microsoft Azure
- Google Cloud Platform
또한 액셀러레이터 유형도 선택해야 해요:
- CPU
- GPU
- INF2 (AWS Inferentia)
추가로 드롭다운 메뉴로 배포 지역(예: East US)을 선택할 수 있어요. 제공자·액셀러레이터·지역을 고르면 사용 가능한 인스턴스 유형 목록이 표시됩니다. 각 인스턴스 타일에는 다음이 포함돼요:
- GPU 유형과 개수
- 메모리 (예: 48 GB)
- vCPUs와 RAM
- 시간당 가격 (예: $1.80 / h)
타일을 선택해 배포에 그 인스턴스 유형을 선택할 수 있어요. 선택한 지역에서 호환되지 않거나 사용 불가능한 인스턴스는 회색으로 비활성화되어 클릭할 수 없어요.
인증 (Authentication)
이 섹션은 누가 배포한 엔드포인트에 접근할 수 있는지 결정해요. 옵션:
- Private (기본): 개인 HF 액세스 토큰으로 여러분 또는 Hugging Face 조직 멤버만 접근 가능.
- Public: 인증 없이 누구나 접근 가능.
- Authenticated: Hugging Face 계정이 있는 사람이면 누구나 개인 HF 액세스 토큰으로 접근 가능.
추가로 AWS에 Inference Endpoint를 배포하면, AWS VPN에 대해 리전 내 보안 연결을 위해 AWS PrivateLink를 사용할 수 있어요.
오토스케일링 (Autoscaling)
Autoscaling 섹션은 모델의 복제본을 몇 개 실행할지, 그리고 비활성 기간에 시스템이 0으로 스케일링되는지 여부를 구성해요. 자세한 내용은 오토스케일링 심층 가이드를 읽어 보세요.
- Automatic Scale-to-Zero: 드롭다운으로 마지막 요청 후 0으로 스케일다운하기까지 기다리는 시간을 고를 수 있어요. 기본은 1시간 활동 없음 후입니다.
- Number of Replicas:
- Min: 유지할 최소 복제본 수. 자동 scale-to-zero를 활성화하려면 이 값을 0으로 설정해야 해요.
- Max: 허용할 최대 복제본 수 (예: 1)
- Autoscaling strategy:
- 하드웨어 사용 기반: 예를 들어 평균 하드웨어 사용률(%)이 20초 이상 임계값을 초과하면 스케일업이 트리거돼요.
- 대기 요청: 평균 대기 요청 수가 20초 이상 임계값을 초과하면 스케일업 이벤트가 트리거돼요.
추론 엔진 구성 (Inference Engine Configuration)
이 섹션은 모델을 호스팅하는 컨테이너의 동작 방식을 지정하게 해 줘요. 이 설정은 선택한 추론 엔진에 따라 달라집니다. 구성 상세는 Inference Engine 섹션을 읽어 주세요.
컨테이너 구성 (Container Configuration)
여기서 컨테이너 인자(container arguments)와 컨테이너 명령(container command)을 편집할 수 있어요.
환경변수 (Environment Variables)
환경변수는 컨테이너 동작을 커스터마이즈하거나 시크릿을 전달하는 데 쓸 수 있어요.
- Default Env: 일반 환경변수로 전달되는 키-값 쌍.
- Secret Env: 안전하게 저장되고 런타임에 주입되는 키-값 쌍.
각 섹션은 Add 버튼으로 여러 항목을 추가할 수 있어요.
엔드포인트 태그 (Endpoint Tags)
엔드포인트에 태그(예: for-testing)를 붙여 환경·팀 전반의 배포를 구성·관리하는 데 도움을 줄 수 있어요. 대시보드에서 이 태그로 엔드포인트를 필터·정렬할 수 있습니다. 태그는 Add 버튼으로 추가하는 일반 텍스트 라벨이에요.
네트워크 (Network)
이 섹션은 배포한 엔드포인트를 어디서부터 접근할 수 있는지 결정해요.
기본적으로 엔드포인트는 인터넷에서 접근 가능하며 TLS/SSL로 보호됩니다. AWS 인스턴스에 배포된 엔드포인트는 AWS PrivateLink를 사용해 특정 VPC로 접근을 제한할 수 있어요. 구성하려면:
- 엔드포인트에 AWS PrivateLink를 활성화하는 체크박스를 켭니다.
- AWS Account ID 추가: 접근을 제한하려는 VPC를 소유한 계정의 AWS ID를 제공해야 해요.
선택적으로 PrivateLink Sharing을 활성화할 수 있어요. 그러면 서로 다른 엔드포인트 간에 동일한 PrivateLink를 공유할 수 있습니다.
고급 설정 (Advanced Settings)
Advanced Settings는 배포에 대한 더 세밀한 제어를 제공해요.
- Commit Revision: 필요에 따라 Hugging Face Hub의 모델 저장소 중 어떤 리비전에서 모델 아티팩트를 내려받을지 커밋 해시로 지정.
- Task: 모델 작업 유형을 정의. 보통 모델 저장소에서 추론됨.
- Container Arguments: 컨테이너 엔트리포인트에 CLI 스타일 인자 전달.
- Container Command: 컨테이너 엔트리포인트를 완전히 오버라이드.
- Download Pattern: 어떤 모델 파일을 내려받을지 정의.
더 알아보기 (Learn more)
출처: 공식문서