AnythingLLM — vLLM 배포

AnythingLLM — vLLM 배포

AnythingLLM은 문서·리소스·콘텐츠를 어떤 LLM이든 채팅 시 참조로 쓸 수 있는 컨텍스트로 바꿔 주는 풀스택 애플리케이션입니다. vLLM을 백엔드로 하는 LLM 서버를 배포하여 OpenAI 호환 엔드포인트를 노출시킬 수 있습니다.

출처: 문서

본문

사전 준비 (Prerequisites)

vLLM 환경을 먼저 설정합니다.

pip install vllm

배포 (Deploy)

  1. 지원되는 채팅 완성(chat-completion) 모델로 vLLM 서버를 시작합니다.
vllm serve Qwen/Qwen1.5-32B-Chat-AWQ --max-model-len 4096
  1. AnythingLLM 데스크톱 앱을 내려받아 설치합니다.
  2. AI 프로바이더를 구성합니다.
    • 하단의 🔧 렌치 아이콘 클릭 → Open settings → AI Providers → LLM.
    • 다음 값을 입력합니다.
      • LLM Provider: Generic OpenAI
      • Base URL: http://{vllm 서버 호스트}:{vllm 서버 포트}/v1
      • Chat Model Name: Qwen/Qwen1.5-32B-Chat-AWQ
  3. 워크스페이스를 만듭니다.
    • 하단의 ↺ 뒤로 가기 아이콘을 눌러 워크스페이스 목록으로 돌아갑니다.
    • 워크스페이스(예: vllm)를 만들고 채팅을 시작합니다.
  4. 문서를 추가합니다.
    • 📎 첨부 아이콘 클릭 → 문서 업로드 → 워크스페이스로 이동·선택 → 저장 후 임베딩(embed)합니다.
    • 문서를 컨텍스트로 사용해 채팅을 진행합니다.

AnythingLLM은 vLLM이 노출하는 /v1 OpenAI 호환 API를 그대로 사용하므로, Base URL만 맞추면 별도 어댑터 없이 문서 기반 RAG 채팅을 구성할 수 있습니다.

더 알아보기 (Learn more)