Streamlit — vLLM 배포
Streamlit — vLLM 배포
Streamlit을 쓰면 Python 스크립트를 몇 주가 아니라 몇 분 만에 인터랙티브 웹 앱으로 바꿀 수 있습니다. 대시보드를 만들고, 리포트를 생성하고, 채팅 앱을 만들 수 있습니다.
vLLM을 백엔드 API 서버로 빠르게 통합해 API 호출로 강력한 LLM 추론을 가능하게 합니다.
출처: 문서
본문
사전 준비 (Prerequisites)
필요한 모든 패키지를 설치해 vLLM 환경을 설정합니다:
pip install vllm streamlit openai
배포 (Deploy)
- 지원되는 채팅 완성 모델로 vLLM 서버를 시작합니다. 예:
vllm serve Qwen/Qwen1.5-0.5B-Chat
- 스크립트를 사용합니다: examples/applications/chatbot/streamlit_openai_chatbot_webserver.py
- Streamlit 웹 UI를 시작하고 채팅합니다:
streamlit run streamlit_openai_chatbot_webserver.py
# or specify the VLLM_API_BASE or VLLM_API_KEY
VLLM_API_BASE="http://vllm-server-host:vllm-server-port/v1" \
streamlit run streamlit_openai_chatbot_webserver.py
# start with debug mode to view more details
streamlit run streamlit_openai_chatbot_webserver.py --logger.level=debug
동작 방식 (동작 방식)
Streamlit 앱은 openai Python 클라이언트를 사용해 vLLM 서버의 OpenAI 호환 /v1 엔드포인트로 채팅 요청을 보냅니다. VLLM_API_BASE 환경 변수로 vLLM 서버 주소를, VLLM_API_KEY로 선택적 API 키를 지정할 수 있습니다. vLLM 서버가 기본 localhost:8000에서 실행된다면 그대로 연결되며, 다른 호스트·포트면 VLLM_API_BASE를 설정합니다. 대화는 Streamlit 위젯에 누적되며 각 메시지가 API 호출로 전달됩니다.
더 알아보기 (Learn more)
- 모든 배포 프레임워크 — vLLM과 연동되는 프레임워크 목록
- Streamlit — 파이썬 웹 앱 프레임워크
- Streamlit 챗봇 예제 — 예제 스크립트