GMI Cloud
GMI Cloud
GMI Cloud는 Claude, GPT, DeepSeek, Gemini 등 최고 AI 모델에 OpenAI 호환 API로 접근을 제공하는 GPU 클라우드 인프라 제공자예요.
출처: 문서
본문
개요 (Overview)
| 속성 | 설명 |
|---|---|
| 설명 | Claude, GPT, DeepSeek, Gemini 등을 OpenAI 호환 API로 제공하는 GPU 클라우드 인프라 제공자 |
| LiteLLM 라우트 | gmi/ |
| 공급자 문서 | GMI Cloud Docs |
| 기본 URL | https://api.gmi-serving.com/v1 |
| 지원 작업 | /chat/completions, /models |
GMI Cloud란?
GMI Cloud는 벤처 투자 지원 디지털 인프라 회사($82M+ 펀딩)로 다음을 제공해요:
- 최상위 GPU 접근: AI 워크로드용 NVIDIA H100 GPU
- 여러 AI 모델: Claude, GPT, DeepSeek, Gemini, Kimi, Qwen 등
- OpenAI 호환 API: OpenAI SDK의 드롭인 대체
- 글로벌 인프라: 미국(콜로라도)과 APAC(대만) 데이터 센터
필수 변수
os.environ["GMI_API_KEY"] = "" # your GMI Cloud API key
console.gmicloud.ai에서 GMI Cloud API 키를 가져와요.
LiteLLM Python SDK 사용법
비스트리밍 (Non-streaming)
import os
import litellm
from litellm import completion
os.environ["GMI_API_KEY"] = "" # your GMI Cloud API key
messages = [{"content": "What is the capital of France?", "role": "user"}]
# GMI Cloud call
response = completion(
model="gmi/deepseek-ai/DeepSeek-V3.2",
messages=messages
)
print(response)
스트리밍 (Streaming)
import os
import litellm
from litellm import completion
os.environ["GMI_API_KEY"] = "" # your GMI Cloud API key
messages = [{"content": "Write a short poem about AI", "role": "user"}]
# GMI Cloud call with streaming
response = completion(
model="gmi/anthropic/claude-sonnet-4.5",
messages=messages,
stream=True
)
for chunk in response:
print(chunk)
LiteLLM Proxy Server 사용법
1. 환경에 키 저장
export GMI_API_KEY=""
2. Proxy 시작
model_list:
- model_name: deepseek-v3
litellm_params:
model: gmi/deepseek-ai/DeepSeek-V3.2
api_key: os.environ/GMI_API_KEY
- model_name: claude-sonnet
litellm_params:
model: gmi/anthropic/claude-sonnet-4.5
api_key: os.environ/GMI_API_KEY
지원 모델 (Supported Models)
| 모델 | 모델 ID | 컨텍스트 길이 |
|---|---|---|
| Claude Opus 4.5 | gmi/anthropic/claude-opus-4.5 | 409K |
| Claude Sonnet 4.5 | gmi/anthropic/claude-sonnet-4.5 | 409K |
| Claude Sonnet 4 | gmi/anthropic/claude-sonnet-4 | 409K |
| Claude Opus 4 | gmi/anthropic/claude-opus-4 | 409K |
| GPT-5.2 | gmi/openai/gpt-5.2 | 409K |
| GPT-5.1 | gmi/openai/gpt-5.1 | 409K |
| GPT-5 | gmi/openai/gpt-5 | 409K |
| GPT-4o | gmi/openai/gpt-4o | 131K |
| GPT-4o-mini | gmi/openai/gpt-4o-mini | 131K |
| DeepSeek V3.2 | gmi/deepseek-ai/DeepSeek-V3.2 | 163K |
| DeepSeek V3 0324 | gmi/deepseek-ai/DeepSeek-V3-0324 | 163K |
| Gemini 3 Pro | gmi/google/gemini-3-pro-preview | 1M |
| Gemini 3 Flash | gmi/google/gemini-3-flash-preview | 1M |
| Kimi K2 Thinking | gmi/moonshotai/Kimi-K2-Thinking | 262K |
| MiniMax M2.1 | gmi/MiniMaxAI/MiniMax-M2.1 | 196K |
| Qwen3-VL 235B | gmi/Qwen/Qwen3-VL-235B-A22B-Instruct-FP8 | 262K |
| GLM-4.7 | gmi/zai-org/GLM-4.7-FP8 | 202K |
지원되는 OpenAI 파라미터
GMI Cloud는 모든 표준 OpenAI 호환 파라미터를 지원해요:
| 파라미터 | 타입 | 설명 |
|---|---|---|
| messages | array | 필수. 'role'과 'content'가 있는 메시지 객체 배열 |
| model | string | 필수. 사용 가능한 모델의 Model ID |
| stream | boolean | 선택. 스트리밍 응답 활성화 |
| temperature | float | 선택. 샘플링 온도 |
| top_p | float | 선택. Nucleus sampling 파라미터 |
| max_tokens | integer | 선택. 생성할 최대 토큰 수 |
| frequency_penalty | float | 선택. 빈번한 토큰에 패널티 |
| presence_penalty | float | 선택. 존재에 기반한 토큰 패널티 |
| stop | string/array | 선택. 중지 시퀀스 |
| response_format | object | 선택. {"type": "json_object"}를 사용한 JSON mode |