OpenLLM으로 Qwen 배포하기
OpenLLM으로 Qwen 배포하기
OpenLLM을 사용하면 다양한 크기의 Qwen2.5 모델을 단 하나의 명령으로 OpenAI 호환 API로 실행할 수 있어요. 내장된 채팅 UI, 최첨단 추론 백엔드, 그리고 Qwen2.5로 엔터프라이즈급 클라우드 배포를 만드는 간소화된 워크플로우를 갖추고 있답니다.
출처: 문서
본문
⚠️ 주의: 이 페이지는 Qwen3 기준으로 업데이트 예정이에요.
OpenLLM은 개발자가 다양한 크기의 Qwen2.5 모델을 단일 명령으로 OpenAI 호환 API로 실행할 수 있게 해줘요. 내장된 채팅 UI, 최첨단 추론 백엔드, 그리고 Qwen2.5로 엔터프라이즈급 클라우드 배포를 만드는 간소화된 워크플로우를 갖추고 있어요. 더 자세한 내용은 OpenLLM 저장소를 참고하세요.
설치
pip로 OpenLLM을 설치하세요.
pip install openllm
설치를 확인하고 도움말 정보를 표시해 보세요:
openllm --help
퀵스타트
Qwen2.5 모델을 실행하기 전에 모델 저장소를 OpenLLM의 최신 공식 저장소와 동기화해 최신 상태로 유지하세요.
openllm repo update
지원되는 Qwen2.5 모델 목록을 확인하세요:
openllm model list --tag qwen2.5
결과에는 필요한 GPU 리소스와 지원 플랫폼도 함께 표시돼요:
model version repo required GPU RAM platforms
------- --------------------- ------- ------------------ -----------
qwen2.5 qwen2.5:0.5b default 12G linux
qwen2.5:1.5b default 12G linux
qwen2.5:3b default 12G linux
qwen2.5:7b default 24G linux
qwen2.5:14b default 80G linux
qwen2.5:14b-ggml-q4 default macos
qwen2.5:14b-ggml-q8 default macos
qwen2.5:32b default 80G linux
qwen2.5:32b-ggml-fp16 default macos
qwen2.5:72b default 80Gx2 linux
qwen2.5:72b-ggml-q4 default macos
모델 중 하나로 서버를 시작하려면 아래처럼 openllm serve를 사용하세요:
openllm serve qwen2.5:7b
기본적으로 서버는 http://localhost:3000/에서 시작돼요.
모델 서버와 상호작용하기
모델 서버가 실행 중이면 다음 방법으로 API를 호출할 수 있어요.
CURL
CURL을 통해 /generate 엔드포인트에 HTTP 요청을 보내세요:
curl -X 'POST' \
'http://localhost:3000/api/generate' \
-H 'accept: text/event-stream' \
-H 'Content-Type: application/json' \
-d '{
"prompt": "Tell me something about large language models.",
"model": "Qwen/Qwen2.5-7B-Instruct",
"max_tokens": 2048,
"stop": null
}'
Python 클라이언트
OpenAI API 프로토콜을 지원하는 프레임워크와 도구로 OpenAI 호환 엔드포인트를 호출하세요. 예시는 다음과 같아요:
from openai import OpenAI
client = OpenAI(base_url='http://localhost:3000/v1', api_key='na')
# Use the following func to get the available models
# model_list = client.models.list()
# print(model_list)
chat_completion = client.chat.completions.create(
model="Qwen/Qwen2.5-7B-Instruct",
messages=[
{
"role": "user",
"content": "Tell me something about large language models."
}
],
stream=True,
)
for chunk in chat_completion:
print(chunk.choices[0].delta.content or "", end="")
채팅 UI
OpenLLM은 LLM 서버의 /chat 엔드포인트에 채팅 UI를 제공해요: http://localhost:3000/chat.
모델 저장소
OpenLLM의 모델 저장소는 사용 가능한 LLM의 카탈로그를 나타내요. 특정 요구에 맞는 커스텀 Qwen2.5 변형을 담은 나만의 저장소를 OpenLLM에 추가할 수 있어요. 자세한 내용은 우리 문서를 참고하세요.