Open WebUI — vLLM 배포

Open WebUI — vLLM 배포

Open WebUI는 완전히 오프라인에서 동작하도록 설계된 확장 가능하고 기능이 풍부하며 사용하기 쉬운 셀프 호스팅 AI 플랫폼입니다. Ollama와 OpenAI 호환 API 같은 다양한 LLM 러너를 지원하고 내장 RAG 기능을 갖춰 강력한 AI 배포 솔루션입니다.

출처: 문서

본문

Open WebUI를 vLLM과 함께 사용하는 단계:

  1. Docker를 설치합니다.
  2. 지원되는 채팅 완성 모델로 vLLM 서버를 시작합니다:
vllm serve Qwen/Qwen3-0.6B-Chat

참고: vLLM 서버를 시작할 때 --host--port 플래그로 호스트와 포트를 반드시 지정하세요. 예:

vllm serve <model> --host 0.0.0.0 --port 8000
  1. Open WebUI Docker 컨테이너를 시작합니다:
docker run -d \
--name open-webui \
-p 3000:8080 \
-v open-webui:/app/backend/data \
-e OPENAI_API_BASE_URL=http://0.0.0.0:8000/v1 \
--restart always \
ghcr.io/open-webui/open-webui:main
  1. 브라우저에서 엽니다:
http://open-webui-host:3000/

페이지 상단에 Qwen/Qwen3-0.6B-Chat 모델이 보이면 정상입니다.

OpenAI 호환 엔드포인트와 연결 (OpenAI 호환 엔드포인트와 연결)

Open WebUI는 OpenAI 호환 OPENAI_API_BASE_URL을 지원하므로, vLLM 서버만 별도로 띄워 두면 WebUI에서 곧바로 모델을 선택해 채팅·RAG(문서 임베딩) 기능을 쓸 수 있습니다.

핵심 포인트:

  • vLLM 서버는 --host 0.0.0.0으로 바인딩해 컨테이너(Open WebUI)에서 접근 가능하게 해야 합니다.
  • Open WebUI 컨테이너의 OPENAI_API_BASE_URL 환경 변수가 vLLM 서버의 /v1 엔드포인트를 가리키도록 설정합니다.
  • vLLM 서버와 Open WebUI 컨테이너가 서로 다른 호스트에 있다면 0.0.0.0 대신 실제 호스트 IP 또는 서비스 DNS를 지정하세요.

더 알아보기 (Learn more)