Quick Start: Inference Endpoints로 모델 배포
Quick Start: Inference Endpoints로 모델 배포
이 가이드에서는 Inference Endpoints로 프로덕션 레디 AI 모델을 몇 분 만에 배포해 볼게요. 먼저 Inference Endpoints UI에 Hugging Face 계정으로 로그인할 수 있고, 결제 수단이 설정되어 있어야 해요. 안 되어 있다면 빌링 설정에서 유효한 결제 수단과 크레딧을 빠르게 추가하세요 — 가급적 자동 충전(automatic recharge)을 활성화해서 끊김 없는 사용과 최상의 경험을 보장하세요.
엔드포인트 만들기
Inference Endpoints UI로 이동해서 로그인한 뒤 Catalog 버튼을 클릭하세요.
거기서 카탈로그로 이동해요. Model Catalog는 원클릭 배포에 맞게 튜닝된 설정을 갖춘 인기 모델들로 구성되어 있어요. 이름, 작업, 하드웨어 가격 등으로 필터링할 수 있습니다.
이 예시에서는 meta-llama/Llama-3.2-3B-Instruct 모델을 배포할 거예요. 검색창에 llama-3.2-3b를 입력해서 찾고, 카드를 클릭해 배포하세요.
다음으로 하드웨어와 배포 설정을 고를 거예요. 카탈로그 모델이라 사전 선택된 옵션이 전부 좋은 기본값이라서, 이 경우엔 아무것도 바꿀 필요가 없어요. 각 설정이 무슨 의미인지 더 깊이 알고 싶다면 configuration 가이드를 확인하세요.
이 모델엔 Nvidia L4가 권장 선택이에요. 테스트에 완벽하고, 성능 좋으면서도 가격이 합리적이죠. 기본적으로 엔드포인트는 1시간 사용이 없으면 idle로 스케일다운되는 scale-to-zero가 적용된다는 점도 알아 두세요.
이제 "Create Endpoint" 🚀를 클릭하면 돼요.
이제 Inference Endpoint가 초기화되는데, 보통 3~5분 정도 걸려요. 원한다면 브라우저 알림을 허용해서 엔드포인트가 running 상태에 도달하면 알림을 받을 수 있어요.
엔드포인트 테스트하기
모든 게 실행되면 Overview 탭에서 Endpoint URL을 볼 수 있어요 — 이게 엔드포인트를 호출하고 요청을 보낼 때 쓰는 주소예요.
Playground 탭으로 가면 모델이 동작하는지 빠르게 시각적으로 테스트할 수 있어요. Playground의 "API" 섹션에서 모델을 호출하는 코드 스니펫을 복사해 붙여 넣을 수도 있어요. API Token을 클릭하면 액세스 토큰을 붙여 넣어 모델을 호출할 수 있습니다. 기본적으로 모든 Inference Endpoint는 인증이 필요한 프라이빗으로 생성되며, 모든 데이터는 TLS/SSL로 전송 중 암호화돼요.
축하해요, Inference Endpoints에서 프로덕션 레디 AI 모델을 배포했어요 🔥
테스트가 만족스러우면 엔드포인트를 일시 정지(pause)하거나 삭제할 수 있어요. 또는 그대로 두면 1시간 후에 scale-to-zero로 내려갑니다.
더 알아보기 (Learn more)
출처: 공식문서