추론 제공자 요금과 청구 (Pricing & Billing)

추론 제공자 요금과 청구 (Pricing & Billing)

선도적인 AI 추론 제공자의 200개 이상 모델에, 중앙화되고 투명한 사용한 만큼 내는(pay-as-you-go) 요금으로 접근할 수 있어요. 인프라 관리는 필요 없어요. 쓴 만큼만 내면 되고, Hugging Face는 마크업을 붙이지 않아요.

시작을 위한 무료 크레딧

모든 허깅페이스 사용자는 Inference Providers를 실험할 수 있는 월간 크레딧을 받아요.

계정 유형 월간 크레딧 사용처 추가 사용(pay-as-you-go)
무료 사용자 $0.10 (변경 가능) Inference Providers 가능 (크레딧 구매 필요)
PRO 사용자 $2.00 모든 허깅페이스 컴퓨트 서비스 가능
Team 또는 Enterprise 조직 좌석당 $2.00 모든 허깅페이스 컴퓨트 서비스 가능

PRO·Team·Enterprise 구독에 포함된 크레딧은 범용 컴퓨트 크레딧이에요. Inference Providers뿐 아니라 Inference Endpoints, Spaces의 업그레이드 CPU·GPU 하드웨어(ZeroGPU 사용량 초과 포함), Jobs에도 쓸 수 있죠. 매달 적립되며, pay-as-you-go 사용이 청구되기 전에 자동으로 적용돼요.

월간 크레딧은 요청을 Hugging Face 경유로 라우팅할 때 자동으로 적용돼요. Team 또는 Enterprise 조직에서는 크레딧이 모든 멤버가 공유해요.

청구 방식: 어떤 방식을 고를까

Inference Providers는 청구 방식에 유연성을 제공해요. 옵션을 미리 이해하면 자신에게 맞는 방식을 고르는 데 도움이 돼요.

기능 Hugging Face 경유(Routed by HF) 커스텀 제공자 키(Custom Provider Key)
작동 방식 요청이 HF를 거쳐 제공자로 라우팅 HF 설정에서 커스텀 제공자 키를 지정
청구 HF 계정에서 pay-as-you-go 제공자가 직접 청구
월간 크레딧 ✅ 크레딧 적용 ❌ 크레딧 미적용
제공자 계정 필요 ❌ 불필요 ✅ 필요
적합한 경우 단순함, 실험, 통합 청구 더 많은 청구 제어, 비통합 제공자 사용
통합 SDK, Playground, 위젯, Data AI Studio SDK, Playground, 위젯, Data AI Studio

어떤 옵션을 골라야 할까요?

  • 단순함과 월간 크레딧을 쓰고 싶다면 Hugging Face 경유로 시작하세요.
  • 특정 제공자 기능이 필요하거나 같은 제공자를 꾸준히 쓴다면 커스텀 제공자 키를 쓰세요.

Pay-as-you-Go 세부사항

Team 또는 Enterprise의 포함 크레딧을 누리려면, 추론 요청을 할 때 청구할 조직을 명시적으로 지정해야 해요. 자세한 내용은 아래 조직 청구 섹션을 보세요.

모든 사용자는 월간 크레딧을 소진한 뒤에도 추가 크레딧을 구매해 API를 계속 쓸 수 있어요. 프로덕션 워크로드에 대한 중단 없는 접근을 보장해 주죠.

Hugging Face는 제공자와 같은 요율로 요금을 부과하며 추가 수수료가 없어요. 제공자 비용을 그대로 전달할 뿐이에요.

지출은 언제든 청구 페이지에서 확인할 수 있어요.

Inference Providers 사용 내역

Inference Providers 설정에서 지난 한 달의 사용 내역을 모델과 제공자별로 확인할 수 있어요. 유료 플랜에 구독한 조직도 조직 설정에서 같은 상세 내역을 볼 수 있어요.

Hugging Face 청구 vs 커스텀 제공자 키 (상세 비교)

위 문서는 외부 제공자로 요청을 라우팅하는 경우를 가정했어요. 실제로 추론을 실행하는 방법은 두 가지며, 각각 청구 방식이 달라요.

  • Hugging Face 경유 요청: Inference Providers를 쓰는 기본 방법이에요. JavaScript 또는 Python InferenceClient를 쓰거나, Hugging Face 사용자 액세스 토큰으로 원시 HTTP 요청을 하면 돼요. 요청은 자동으로 Hugging Face를 거쳐 제공자 플랫폼으로 라우팅돼요. 별도 제공자 계정이 필요 없고, 청구는 Hugging Face가 직접 관리해요. 추가 설정 없이 제공자를 자연스럽게 전환할 수 있죠.
  • 커스텀 제공자 키: Inference Providers에서 사용할 제공자 키를 직접 가져올 수 있어요. 이미 어떤 제공자와 계정이 있고 이를 Inference Providers에서 쓰고 싶다면 유용해요. 이 경우 Hugging Face는 호출에 대해 요금을 부과하지 않아요.

지금까지 본 내용을 표로 정리하면 다음과 같아요.

HF 경유 청구 주체 무료 티어 포함 Pay-as-you-go 통합
경유 요청 Hugging Face 예 (크레딧 구매 필요) SDK, Playground, 위젯, Data AI Studio
커스텀 제공자 키 제공자 아니요 SDK, Playground, 위젯, Data AI Studio

커스텀 제공자 키는 허브의 설정 페이지나 JavaScript·Python SDK의 InferenceClient에서 설정할 수 있어요. 커스텀 키로 경유 요청을 해도 코드는 그대로예요. 여전히 Hugging Face 사용자 액세스 토큰을 넘기면, Hugging Face가 라우팅할 때 인증을 자동으로 바꿔 줘요.

HF-Inference 비용

눈치챘을 수 있는데, "hf-inference" 제공자를 선택해서 작업할 수 있어요. 이 서비스는 Inference Providers 이전에 "Inference API (serverless)"라고 불렸어요. 사용자 관점에서 HF Inference는 다른 제공자와 똑같아요. 무료 티어 크레딧을 지나면, 컴퓨트 시간 × 기본 하드웨어의 가격으로 모든 추론 요청에 요금이 부과돼요.

예를 들어 black-forest-labs/FLUX.1-dev에 대한 요청이 초당 $0.00012인 GPU 머신에서 10초 걸린다면, $0.0012로 청구돼요.

2025년 7월 기준으로, hf-inference는 주로 CPU 추론(임베딩, 텍스트 랭킹, 텍스트 분류, 또는 BERT·GPT-2처럼 역사적 의미가 있는 더 작은 LLM)에 집중하고 있어요.

Team과 Enterprise 조직의 청구

Team & Enterprise 조직은 모든 사용자의 청구를 중앙화할 수 있어요. 각 사용자는 여전히 자신의 사용자 액세스 토큰을 쓰지만, 요청은 조직에 청구돼요. HTTP 요청에 "X-HF-Bill-To: my-org-name" 헤더를 넘기면 됩니다.

Resource Groups을 설정한 엔터프라이즈 조직은 조직 이름 대신 리소스 그룹 ID를 넘겨 추론 비용을 특정 리소스 그룹에 귀속시킬 수도 있어요: "X-HF-Bill-To: <resource-group-id>". 사용자의 토큰은 반드시 리소스 그룹의 멤버여야 해요.

Team & Enterprise 조직은 구독의 좌석 수에 기반한 무료 사용 크레딧 풀을 받아요. Inference Providers 사용량은 조직의 청구 페이지에서 추적할 수 있어요. 관리자는 조직 설정에서 지출 한도를 설정하고 특정 Inference Providers를 비활성화할 수도 있어요.

조직에 청구하려면 클라이언트를 초기화할 때 bill_to 파라미터를 쓰세요.

from huggingface_hub import InferenceClient

client = InferenceClient(bill_to="my-org-name")

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[
        {
            "role": "user",
            "content": "How many 'G's in 'huggingface'?"
        }
    ],
)

print(completion.choices[0].message)

JavaScript InferenceClient를 쓴다면 클라이언트 수준에서 billTo 속성을 설정해 조직에 청구할 수 있어요.

import { InferenceClient } from "@huggingface/inference";

const client = new InferenceClient(process.env.HF_TOKEN, { billTo: "my-org-name" });

const completion = await client.chat.completions.create({
  model: "deepseek-ai/DeepSeek-V3-0324",
  messages: [
    {
      role: "user",
      content: "How many 'G's in 'huggingface'?",
    },
  ],
});

console.log(completion.choices[0].message.content);