AnythingLLM — vLLM 배포
AnythingLLM — vLLM 배포
AnythingLLM은 문서·리소스·콘텐츠를 어떤 LLM이든 채팅 시 참조로 쓸 수 있는 컨텍스트로 바꿔 주는 풀스택 애플리케이션입니다. vLLM을 백엔드로 하는 LLM 서버를 배포하여 OpenAI 호환 엔드포인트를 노출시킬 수 있습니다.
출처: 문서
본문
사전 준비 (Prerequisites)
vLLM 환경을 먼저 설정합니다.
pip install vllm
배포 (Deploy)
- 지원되는 채팅 완성(chat-completion) 모델로 vLLM 서버를 시작합니다.
vllm serve Qwen/Qwen1.5-32B-Chat-AWQ --max-model-len 4096
- AnythingLLM 데스크톱 앱을 내려받아 설치합니다.
- AI 프로바이더를 구성합니다.
- 하단의 🔧 렌치 아이콘 클릭 → Open settings → AI Providers → LLM.
- 다음 값을 입력합니다.
- LLM Provider:
Generic OpenAI - Base URL:
http://{vllm 서버 호스트}:{vllm 서버 포트}/v1 - Chat Model Name:
Qwen/Qwen1.5-32B-Chat-AWQ
- LLM Provider:
- 워크스페이스를 만듭니다.
- 하단의 ↺ 뒤로 가기 아이콘을 눌러 워크스페이스 목록으로 돌아갑니다.
- 워크스페이스(예:
vllm)를 만들고 채팅을 시작합니다.
- 문서를 추가합니다.
- 📎 첨부 아이콘 클릭 → 문서 업로드 → 워크스페이스로 이동·선택 → 저장 후 임베딩(embed)합니다.
- 문서를 컨텍스트로 사용해 채팅을 진행합니다.
AnythingLLM은 vLLM이 노출하는 /v1 OpenAI 호환 API를 그대로 사용하므로, Base URL만 맞추면 별도 어댑터 없이 문서 기반 RAG 채팅을 구성할 수 있습니다.
더 알아보기 (Learn more)
- 모든 배포 프레임워크 — vLLM과 연동되는 프레임워크 목록
- CLI 가이드 —
vllm serve옵션 - served-model-name 설정 — 서빙 모델 이름 지정