PrivateGPT + Ollama — 가장 쉬운 로컬 LLM 조합

PrivateGPT + Ollama — 가장 쉬운 로컬 LLM 조합

PrivateGPT를 처음 시작할 때 권장되는 가장 쉬운 방법이 Ollama예요. Ollama는 명령 한 번으로 대형 언어 모델을 로컬에서 실행해 주고, 모델 다운로드·GPU 오프로딩·OpenAI 호환 API(포트 11434)까지 알아서 처리해요.

출처: https://docs.privategpt.dev/providers/ollama

Ollama의 제약

Ollama는 토크나이저 엔드포인트(/tokenize)를 노출하지 않아요. 그래서 PrivateGPT는 문자 기반 추정(4자 = 1토큰)으로 토큰 수를 세요. 입력이 길면 컨텍스트 윈도우 오버플로우가 날 수 있어요.

권장: 상세 모델 프로필에서 실제 모델 한도에 맞게 context_window를 명시적으로 설정하세요. 기본적으로 Ollama는 VRAM에 따라 컨텍스트를 가정해요.

  • < 24 GiB VRAM: 4k 컨텍스트
  • 24–48 GiB VRAM: 32k 컨텍스트
  • ≥ 48 GiB VRAM: 256k 컨텍스트

설정

모델을 받고 서버를 시작해요.

ollama pull qwen3.5:35b        # LLM (~24 GB)
ollama pull mxbai-embed-large  # Embeddings (~670 MB)
ollama serve

API는 http://localhost:11434/v1에서 제공돼요.

PrivateGPT 연결

OPENAI_API_BASE=http://localhost:11434/v1 private-gpt serve

Docker로는 host.docker.internal를 써야 해요.

docker run -p 8080:8080 \
  -e OPENAI_API_BASE=http://host.docker.internal:11434/v1 \
  zylonai/private-gpt:latest

capability 요약

기능 상태
모델 발견 (/v1/models)
토크나이저 엔드포인트 (/tokenize)
임베딩
툴/함수 호출 ✅ 모델 의존
구조적 출력
스트리밍
비전/이미지 입력 ✅ 모델 의존

고급: context_window 명시

Ollama는 토크나이저가 없으니 context_window를 명시하는 게 특히 유용해요. 모델 발견 스크립트로 프로필을 만들고 편집해요.

OPENAI_API_BASE=http://localhost:11434/v1 \
  uv run python scripts/auto_discover_models.py --out settings-model.yaml

더 알아보기

LM Studio·LlamaCPP Server·vLLM 등 다른 제공사 비교는 Providers overview 문서에서 확인할 수 있어요.