Tencent TokenHub

Tencent TokenHub

https://www.tencentcloud.com/products/tokenhub

모든 Tencent TokenHub 모델을 지원해요. completion 요청 시 tencent/ 접두어를 붙이면 돼요.

TokenHub는 텐센트 클라우드의 통합 LLM 게이트웨이예요. OpenAI 호환 Chat Completions 엔드포인트와 Anthropic 호환 Messages 엔드포인트를 제공해서, 단일 API 키로 DeepSeek, GLM, Kimi, MiniMax, Hunyuan 모델에 접근할 수 있어요.

API 키 (API Key)

# env variable
os.environ['TENCENT_API_KEY']

샘플 사용법 (Sample Usage)

from litellm import completion
import os

os.environ['TENCENT_API_KEY'] = ""
response = completion(
    model="tencent/deepseek-v4-pro",
    messages=[
       {"role": "user", "content": "hello from litellm"}
   ],
)
print(response)

샘플 사용법 - 스트리밍 (Sample Usage - Streaming)

from litellm import completion
import os

os.environ['TENCENT_API_KEY'] = ""
response = completion(
    model="tencent/deepseek-v4-pro",
    messages=[
       {"role": "user", "content": "hello from litellm"}
   ],
    stream=True
)

for chunk in response:
    print(chunk)

지원 모델 (Supported Models)

TokenHub 국제 엔드포인트에서 사용 가능한 모든 모델을 지원해요.

모델명 함수 호출
deepseek-v4-flash-202605 completion(model="tencent/deepseek-v4-flash-202605", messages)
deepseek-v4-pro-202606 completion(model="tencent/deepseek-v4-pro-202606", messages)
deepseek-v4-flash completion(model="tencent/deepseek-v4-flash", messages)
deepseek-v4-pro completion(model="tencent/deepseek-v4-pro", messages)
deepseek-v3.2 completion(model="tencent/deepseek-v3.2", messages)
glm-5.1 completion(model="tencent/glm-5.1", messages)
glm-5v-turbo completion(model="tencent/glm-5v-turbo", messages)
glm-5-turbo completion(model="tencent/glm-5-turbo", messages)
glm-5 completion(model="tencent/glm-5", messages)
kimi-k2.6 completion(model="tencent/kimi-k2.6", messages)
kimi-k2.5 completion(model="tencent/kimi-k2.5", messages)
minimax-m3 completion(model="tencent/minimax-m3", messages)
minimax-m2.7 completion(model="tencent/minimax-m2.7", messages)
minimax-m2.5 completion(model="tencent/minimax-m2.5", messages)
hy-mt2-plus completion(model="tencent/hy-mt2-plus", messages)

커스텀 API Base (Custom API Base)

기본적으로 LiteLLM은 싱가포르 지역 엔드포인트를 사용해요. TENCENT_API_BASE로 재정의할 수 있어요.

import os

os.environ['TENCENT_API_BASE'] = "https://tokenhub.tencentcloudmaas.com/v1"  # Guangzhou region

사고 / 추론 모드 (Thinking / Reasoning Mode)

많은 TokenHub 모델이 확장 사고(extended thinking)를 지원해요. LiteLLM은 thinkingreasoning_effort 파라미터를 모두 지원해요.

  • thinking 파라미터
  • reasoning_effort 파라미터
from litellm import completion
import os

os.environ['TENCENT_API_KEY'] = ""

resp = completion(
    model="tencent/deepseek-v4-pro",
    messages=[{"role": "user", "content": "What is 2+2?"}],
    thinking={"type": "enabled"},
)

print(resp.choices[0].message.reasoning_content)
print(resp.choices[0].message.content)
from litellm import completion
import os

os.environ['TENCENT_API_KEY'] = ""

resp = completion(
    model="tencent/deepseek-v4-pro",
    messages=[{"role": "user", "content": "What is 2+2?"}],
    reasoning_effort="medium",
)

print(resp.choices[0].message.reasoning_content)
print(resp.choices[0].message.content)

참고: reasoning_effort가 "none" 이외의 값이면 LiteLLM이 자동으로 thinking={"type": "enabled"}로 매핑해요.

기본 사용법 (Basic Usage)

  • SDK
  • PROXY
from litellm import completion
import os

os.environ['TENCENT_API_KEY'] = ""
resp = completion(
    model="tencent/deepseek-v4-pro",
    messages=[{"role": "user", "content": "Tell me a joke."}],
)

print(
    resp.choices[0].message.reasoning_content
)
  • config.yaml 설정:
model_list:
  - model_name: deepseek-v4-pro
    litellm_params:
        model: tencent/deepseek-v4-pro
        api_key: os.environ/TENCENT_API_KEY
  • 프록시 실행:
python litellm/proxy/main.py
  • 테스트해 보세요!
curl -L -X POST 'http://0.0.0.0:4000/v1/chat/completions' \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer ***" \
-d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {
        "role": "user",
        "content": "hello from litellm proxy"
      }
    ]
}'

Anthropic 호환 Messages API

TokenHub는 Anthropic 호환 Messages API도 제공해요. LiteLLM은 가능할 때 이 엔드포인트로 요청을 라우팅해요.

os.environ['TENCENT_API_KEY'] = ""

Chat Completions 엔드포인트와 별도로 Anthropic 호환 base URL을 재정의하려면:

os.environ['TENCENT_ANTHROPIC_API_BASE'] = "https://tokenhub-intl.tencentcloudmaas.com"

TENCENT_ANTHROPIC_API_BASETENCENT_API_BASE가 모두 설정되면, Messages API 호출에서는 Anthropic 전용이 우선해요.

출처: 문서

본문

더 알아보기 (Learn more)