Baseten
Baseten
LiteLLM은 Baseten Model API와 dedicated 배포를 자동 라우팅으로 모두 지원해요.
출처: 문서
본문
API 유형 (API Types)
Model API (기본)
- URL:
https://inference.baseten.co/v1 - 형식:
baseten/<model-name>(예:baseten/openai/gpt-oss-120b) - 용도: 인기 모델에 빠른 접근
Dedicated 배포
- URL:
https://model-{id}.api.baseten.co/environments/production/sync/v1 - 형식:
baseten/{8-digit-alphanumeric-code}(예:baseten/abcd1234) - 용도: 사용자 지정 모델, 지연 SLA
자동 라우팅: LiteLLM이 모델 형식에 따라 유형을 감지해요:
- 8자리 영숫자 코드 → Dedicated 배포
- 그 외 모든 형식 → Model API
빠른 시작 (Quick Start)
import os
from litellm import completion
os.environ['BASETEN_API_KEY'] = "your-api-key"
# Model API (default)
response = completion(
model="baseten/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Hello!"}]
)
# Dedicated deployment (8-digit ID)
response = completion(
model="baseten/abcd1234",
messages=[{"role": "user", "content": "Hello!"}]
)
예시 (Examples)
기본 사용법
# Model API
response = completion(
model="baseten/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Explain quantum computing"}],
max_tokens=500,
temperature=0.7
)
# Dedicated deployment
response = completion(
model="baseten/abcd1234",
messages=[{"role": "user", "content": "Explain quantum computing"}],
max_tokens=500,
temperature=0.7
)
스트리밍 (Model API 전용)
response = completion(
model="baseten/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Write a poem"}],
stream=True,
stream_options={"include_usage": True}
)
for chunk in response:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
LiteLLM Proxy
model_list:
- model_name: baseten-model
litellm_params:
model: baseten/openai/gpt-oss-120b
api_key: your-baseten-api-key
import openai
client = openai.OpenAI(
api_key="sk-<your-litellm-api-key>",
base_url="http://0.0.0.0:4000"
)
response = client.chat.completions.create(
model="baseten-model",
messages=[{"role": "user", "content": "Hello!"}]
)