Tencent TokenHub
Tencent TokenHub
https://www.tencentcloud.com/products/tokenhub
모든 Tencent TokenHub 모델을 지원해요. completion 요청 시 tencent/ 접두어를 붙이면 돼요.
TokenHub는 텐센트 클라우드의 통합 LLM 게이트웨이예요. OpenAI 호환 Chat Completions 엔드포인트와 Anthropic 호환 Messages 엔드포인트를 제공해서, 단일 API 키로 DeepSeek, GLM, Kimi, MiniMax, Hunyuan 모델에 접근할 수 있어요.
API 키 (API Key)
# env variable
os.environ['TENCENT_API_KEY']
샘플 사용법 (Sample Usage)
from litellm import completion
import os
os.environ['TENCENT_API_KEY'] = ""
response = completion(
model="tencent/deepseek-v4-pro",
messages=[
{"role": "user", "content": "hello from litellm"}
],
)
print(response)
샘플 사용법 - 스트리밍 (Sample Usage - Streaming)
from litellm import completion
import os
os.environ['TENCENT_API_KEY'] = ""
response = completion(
model="tencent/deepseek-v4-pro",
messages=[
{"role": "user", "content": "hello from litellm"}
],
stream=True
)
for chunk in response:
print(chunk)
지원 모델 (Supported Models)
TokenHub 국제 엔드포인트에서 사용 가능한 모든 모델을 지원해요.
| 모델명 | 함수 호출 |
|---|---|
deepseek-v4-flash-202605 |
completion(model="tencent/deepseek-v4-flash-202605", messages) |
deepseek-v4-pro-202606 |
completion(model="tencent/deepseek-v4-pro-202606", messages) |
deepseek-v4-flash |
completion(model="tencent/deepseek-v4-flash", messages) |
deepseek-v4-pro |
completion(model="tencent/deepseek-v4-pro", messages) |
deepseek-v3.2 |
completion(model="tencent/deepseek-v3.2", messages) |
glm-5.1 |
completion(model="tencent/glm-5.1", messages) |
glm-5v-turbo |
completion(model="tencent/glm-5v-turbo", messages) |
glm-5-turbo |
completion(model="tencent/glm-5-turbo", messages) |
glm-5 |
completion(model="tencent/glm-5", messages) |
kimi-k2.6 |
completion(model="tencent/kimi-k2.6", messages) |
kimi-k2.5 |
completion(model="tencent/kimi-k2.5", messages) |
minimax-m3 |
completion(model="tencent/minimax-m3", messages) |
minimax-m2.7 |
completion(model="tencent/minimax-m2.7", messages) |
minimax-m2.5 |
completion(model="tencent/minimax-m2.5", messages) |
hy-mt2-plus |
completion(model="tencent/hy-mt2-plus", messages) |
커스텀 API Base (Custom API Base)
기본적으로 LiteLLM은 싱가포르 지역 엔드포인트를 사용해요. TENCENT_API_BASE로 재정의할 수 있어요.
import os
os.environ['TENCENT_API_BASE'] = "https://tokenhub.tencentcloudmaas.com/v1" # Guangzhou region
사고 / 추론 모드 (Thinking / Reasoning Mode)
많은 TokenHub 모델이 확장 사고(extended thinking)를 지원해요. LiteLLM은 thinking과 reasoning_effort 파라미터를 모두 지원해요.
- thinking 파라미터
- reasoning_effort 파라미터
from litellm import completion
import os
os.environ['TENCENT_API_KEY'] = ""
resp = completion(
model="tencent/deepseek-v4-pro",
messages=[{"role": "user", "content": "What is 2+2?"}],
thinking={"type": "enabled"},
)
print(resp.choices[0].message.reasoning_content)
print(resp.choices[0].message.content)
from litellm import completion
import os
os.environ['TENCENT_API_KEY'] = ""
resp = completion(
model="tencent/deepseek-v4-pro",
messages=[{"role": "user", "content": "What is 2+2?"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.reasoning_content)
print(resp.choices[0].message.content)
참고:
reasoning_effort가 "none" 이외의 값이면 LiteLLM이 자동으로thinking={"type": "enabled"}로 매핑해요.
기본 사용법 (Basic Usage)
- SDK
- PROXY
from litellm import completion
import os
os.environ['TENCENT_API_KEY'] = ""
resp = completion(
model="tencent/deepseek-v4-pro",
messages=[{"role": "user", "content": "Tell me a joke."}],
)
print(
resp.choices[0].message.reasoning_content
)
- config.yaml 설정:
model_list:
- model_name: deepseek-v4-pro
litellm_params:
model: tencent/deepseek-v4-pro
api_key: os.environ/TENCENT_API_KEY
- 프록시 실행:
python litellm/proxy/main.py
- 테스트해 보세요!
curl -L -X POST 'http://0.0.0.0:4000/v1/chat/completions' \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer ***" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{
"role": "user",
"content": "hello from litellm proxy"
}
]
}'
Anthropic 호환 Messages API
TokenHub는 Anthropic 호환 Messages API도 제공해요. LiteLLM은 가능할 때 이 엔드포인트로 요청을 라우팅해요.
os.environ['TENCENT_API_KEY'] = ""
Chat Completions 엔드포인트와 별도로 Anthropic 호환 base URL을 재정의하려면:
os.environ['TENCENT_ANTHROPIC_API_BASE'] = "https://tokenhub-intl.tencentcloudmaas.com"
TENCENT_ANTHROPIC_API_BASE와 TENCENT_API_BASE가 모두 설정되면, Messages API 호출에서는 Anthropic 전용이 우선해요.
출처: 문서