OpenLLM으로 Qwen 배포하기

OpenLLM으로 Qwen 배포하기

OpenLLM을 사용하면 다양한 크기의 Qwen2.5 모델을 단 하나의 명령으로 OpenAI 호환 API로 실행할 수 있어요. 내장된 채팅 UI, 최첨단 추론 백엔드, 그리고 Qwen2.5로 엔터프라이즈급 클라우드 배포를 만드는 간소화된 워크플로우를 갖추고 있답니다.

출처: 문서

본문

⚠️ 주의: 이 페이지는 Qwen3 기준으로 업데이트 예정이에요.

OpenLLM은 개발자가 다양한 크기의 Qwen2.5 모델을 단일 명령으로 OpenAI 호환 API로 실행할 수 있게 해줘요. 내장된 채팅 UI, 최첨단 추론 백엔드, 그리고 Qwen2.5로 엔터프라이즈급 클라우드 배포를 만드는 간소화된 워크플로우를 갖추고 있어요. 더 자세한 내용은 OpenLLM 저장소를 참고하세요.

설치

pip로 OpenLLM을 설치하세요.

pip install openllm

설치를 확인하고 도움말 정보를 표시해 보세요:

openllm --help

퀵스타트

Qwen2.5 모델을 실행하기 전에 모델 저장소를 OpenLLM의 최신 공식 저장소와 동기화해 최신 상태로 유지하세요.

openllm repo update

지원되는 Qwen2.5 모델 목록을 확인하세요:

openllm model list --tag qwen2.5

결과에는 필요한 GPU 리소스와 지원 플랫폼도 함께 표시돼요:

model    version                repo     required GPU RAM    platforms
-------  ---------------------  -------  ------------------  -----------
qwen2.5  qwen2.5:0.5b           default  12G                 linux
         qwen2.5:1.5b           default  12G                 linux
         qwen2.5:3b             default  12G                 linux
         qwen2.5:7b             default  24G                 linux
         qwen2.5:14b            default  80G                 linux
         qwen2.5:14b-ggml-q4    default                      macos
         qwen2.5:14b-ggml-q8    default                      macos
         qwen2.5:32b            default  80G                 linux
         qwen2.5:32b-ggml-fp16  default                      macos
         qwen2.5:72b            default  80Gx2               linux
         qwen2.5:72b-ggml-q4    default                      macos

모델 중 하나로 서버를 시작하려면 아래처럼 openllm serve를 사용하세요:

openllm serve qwen2.5:7b

기본적으로 서버는 http://localhost:3000/에서 시작돼요.

모델 서버와 상호작용하기

모델 서버가 실행 중이면 다음 방법으로 API를 호출할 수 있어요.

CURL

CURL을 통해 /generate 엔드포인트에 HTTP 요청을 보내세요:

curl -X 'POST' \
   'http://localhost:3000/api/generate' \
   -H 'accept: text/event-stream' \
   -H 'Content-Type: application/json' \
   -d '{
   "prompt": "Tell me something about large language models.",
   "model": "Qwen/Qwen2.5-7B-Instruct",
   "max_tokens": 2048,
   "stop": null
}'

Python 클라이언트

OpenAI API 프로토콜을 지원하는 프레임워크와 도구로 OpenAI 호환 엔드포인트를 호출하세요. 예시는 다음과 같아요:

from openai import OpenAI

client = OpenAI(base_url='http://localhost:3000/v1', api_key='na')

# Use the following func to get the available models
# model_list = client.models.list()
# print(model_list)

chat_completion = client.chat.completions.create(
   model="Qwen/Qwen2.5-7B-Instruct",
   messages=[
      {
            "role": "user",
            "content": "Tell me something about large language models."
      }
   ],
   stream=True,
)
for chunk in chat_completion:
   print(chunk.choices[0].delta.content or "", end="")

채팅 UI

OpenLLM은 LLM 서버의 /chat 엔드포인트에 채팅 UI를 제공해요: http://localhost:3000/chat.

모델 저장소

OpenLLM의 모델 저장소는 사용 가능한 LLM의 카탈로그를 나타내요. 특정 요구에 맞는 커스텀 Qwen2.5 변형을 담은 나만의 저장소를 OpenLLM에 추가할 수 있어요. 자세한 내용은 우리 문서를 참고하세요.

더 알아보기 (Learn more)