추론 제공자
추론 제공자 (Inference Providers)
Hugging Face의 모델 페이지는 수천 개 모델에 대해 종량제(pay-as-you-go) 추론을 제공해서 브라우저에서 바로 모두 시험해볼 수 있어요. 서비스는 Inference Providers로 구동되며 무료 티어도 포함합니다.
출처: 문서
본문
Hugging Face의 모델 페이지는 수천 개 모델에 대해 종량제 추론을 제공하므로 브라우저에서 바로 모두 시험해볼 수 있어요. 서비스는 Inference Providers로 구동되며 무료 티어를 포함합니다.
Inference Providers는 최고의 서버리스 추론 파트너들이 구동하는 수백 개의 머신러닝 모델에 대해 개발자에게 간결하고 통합된 접근을 제공합니다. 👉 전체 문서는 Inference Providers Documentation을 참고하세요.
Hub에서의 Inference Providers (Inference Providers on the Hub)
Inference Providers는 Hugging Face Hub와 깊게 통합되어 있으며, 여러 방식으로 사용할 수 있어요:
- 대화형 위젯 (Interactive Widgets) — 내부적으로 Inference Providers를 사용하는 대화형 위젯으로 모델 페이지에서 모델을 직접 테스트합니다. 예시는 DeepSeek-R1-0528 모델 페이지를 참고하세요.
- Inference Playground — 자신의 프롬프트로 chat completion 모델을 쉽게 테스트하고 비교합니다. Inference Playground에서 시작해 보세요.
- 검색 (Search) — 모델 페이지에서 추론 제공자별로 모델을 필터링해 특정 제공자가 제공하는 모델을 찾습니다.
- Data Studio — AI로 Hub의 데이터셋을 탐색합니다. 좋아하는 데이터셋에서 Data Studio를 확인해 보세요.
Inference Providers로 빌드하기 (Build with Inference Providers)
SDK나 HTTP 클라이언트를 사용해 Inference Providers를 자신의 애플리케이션에 통합할 수 있어요. Python과 JavaScript 퀵스타트입니다. 자세한 내용은 Inference Providers Documentation을 참고하세요.
Python SDK로 Inference Providers와 상호작용할 수 있습니다.
from huggingface_hub import InferenceClient
import os
client = InferenceClient(
api_key=os.environ["HF_TOKEN"],
provider="auto", # Automatically selects best provider
)
# Chat completion
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": "A story about hiking in the mountains"}]
)
# Image generation
image = client.text_to_image(
prompt="A serene lake surrounded by mountains at sunset, photorealistic style",
model="black-forest-labs/FLUX.1-dev"
)
또는 OpenAI API 호환 클라이언트를 사용할 수도 있어요.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[
{
"role": "user",
"content": "A story about hiking in the mountains"
}
],
)
[!WARNING] OpenAI API 호환 클라이언트는 이미지 생성(image generation)을 지원하지 않습니다.
JavaScript SDK로 Inference Providers와 상호작용할 수 있어요.
import { InferenceClient } from "@huggingface/inference";
const client = new InferenceClient(process.env.HF_TOKEN);
const chatCompletion = await client.chatCompletion({
provider: "auto", // Automatically selects best provider
model: "deepseek-ai/DeepSeek-V3-0324",
messages: [{ role: "user", content: "Hello!" }]
});
const imageBlob = await client.textToImage({
model: "black-forest-labs/FLUX.1-dev",
inputs:
"A serene lake surrounded by mountains at sunset, photorealistic style",
});
또는 OpenAI API 호환 클라이언트를 사용할 수 있어요.
import { OpenAI } from "openai";
const client = new OpenAI({
baseURL: "https://router.huggingface.co/v1",
apiKey: process.env.HF_TOKEN,
});
const completion = await client.chat.completions.create({
model: "meta-llama/Llama-3.1-8B-Instruct",
messages: [{ role: "user", content: "A story about hiking in the mountains" }],
});
[!WARNING] OpenAI API 호환 클라이언트는 이미지 생성(image generation)을 지원하지 않습니다.
추론 권한이 있는 Hugging Face 토큰이 필요해요. Settings > Tokens에서 만들 수 있습니다.
Inference Providers 동작 방식 (How Inference Providers works)
Inference Providers를 더 깊이 파고들려면 Inference Providers Documentation을 확인하세요. 주요 리소스:
HF-Inference API란 무엇이었나? (What was the HF-Inference API?)
HF-Inference API는 Inference Providers를 통해 사용 가능한 제공자 중 하나입니다. 이전에는 "Inference API (serverless)"라고 불렸으며 내부적으로 Inference Endpoints로 구동됩니다.
HF-Inference 제공자에 대한 자세한 내용은 전용 페이지를 확인하세요.
더 알아보기 (Learn more)
추론 권한이 있는 토큰(HF_TOKEN)을 발급받아 InferenceClient를 provider="auto"로 쓰면 Hub에서 수천 개 모델을 한 번의 API로 호출할 수 있어요. OpenAI 호환 base_url="https://router.huggingface.co/v1"도 지원하니 기존 코드를 쉽게 이식할 수 있습니다. 제공자별 가격·통합 상세는 Inference Providers 문서에서 확인하세요.