Streamlit — vLLM 배포

Streamlit — vLLM 배포

Streamlit을 쓰면 Python 스크립트를 몇 주가 아니라 몇 분 만에 인터랙티브 웹 앱으로 바꿀 수 있습니다. 대시보드를 만들고, 리포트를 생성하고, 채팅 앱을 만들 수 있습니다.

vLLM을 백엔드 API 서버로 빠르게 통합해 API 호출로 강력한 LLM 추론을 가능하게 합니다.

출처: 문서

본문

사전 준비 (Prerequisites)

필요한 모든 패키지를 설치해 vLLM 환경을 설정합니다:

pip install vllm streamlit openai

배포 (Deploy)

  • 지원되는 채팅 완성 모델로 vLLM 서버를 시작합니다. 예:
vllm serve Qwen/Qwen1.5-0.5B-Chat
streamlit run streamlit_openai_chatbot_webserver.py

# or specify the VLLM_API_BASE or VLLM_API_KEY
VLLM_API_BASE="http://vllm-server-host:vllm-server-port/v1" \
    streamlit run streamlit_openai_chatbot_webserver.py

# start with debug mode to view more details
streamlit run streamlit_openai_chatbot_webserver.py --logger.level=debug

동작 방식 (동작 방식)

Streamlit 앱은 openai Python 클라이언트를 사용해 vLLM 서버의 OpenAI 호환 /v1 엔드포인트로 채팅 요청을 보냅니다. VLLM_API_BASE 환경 변수로 vLLM 서버 주소를, VLLM_API_KEY로 선택적 API 키를 지정할 수 있습니다. vLLM 서버가 기본 localhost:8000에서 실행된다면 그대로 연결되며, 다른 호스트·포트면 VLLM_API_BASE를 설정합니다. 대화는 Streamlit 위젯에 누적되며 각 메시지가 API 호출로 전달됩니다.

더 알아보기 (Learn more)