Chatbox — vLLM 배포

Chatbox — vLLM 배포

Chatbox는 Windows, Mac, Linux에서 사용할 수 있는 LLM 데스크톱 클라이언트입니다. vLLM을 백엔드로 하는 LLM 서버를 배포하면 OpenAI 호환 엔드포인트가 노출되고, Chatbox가 그 엔드포인트를 커스텀 프로바이더로 연결해 사용할 수 있습니다.

출처: 문서

본문

사전 준비 (Prerequisites)

vLLM 환경을 먼저 설정합니다.

pip install vllm

배포 (Deploy)

  1. 지원되는 채팅 완성 모델로 vLLM 서버를 시작합니다.
vllm serve qwen/Qwen1.5-0.5B-Chat
  1. Chatbox 데스크톱 앱을 내려받아 설치합니다.
  2. 설정 왼쪽 하단에서 Add Custom Provider를 선택하고, 다음 값을 입력합니다.
    • API Mode: OpenAI API Compatible
    • Name: vllm
    • API Host: http://{vllm 서버 호스트}:{vllm 서버 포트}/v1
    • API Path: /chat/completions
    • Model: qwen/Qwen1.5-0.5B-Chat
  3. Just chat로 가서 채팅을 시작합니다.

Chatbox는 OpenAI 호환 프로바이더를 추가하는 방식으로 vLLM에 연결하므로, 여러 모델을 추가하거나 로컬/원격 vLLM 서버로 전환하기 쉽습니다.

구성 시 가장 흔한 실수는 API Path를 배는 /v1까지만 넣고 끝내는 것입니다. Chatbox는 Host의 /v1 뒤에 Path(/chat/completions)를 이어붙여 요청하므로, Host는 /v1로 끝나게 하고 Path는 /chat/completions로 두는 것이 올바른 형태입니다. Model 이름은 vllm serve에 준 모델 이름(또는 --served-model-name으로 지정한 이름)과 일치해야 합니다.

# 여러 모델을 번갈아 쓰고 싶다면
vllm serve meta-llama/Llama-3-8B-Instruct --served-model-name llama3
# Chatbox의 Model 항목에 llama3 를 입력

더 알아보기 (Learn more)