PrivateGPT + Ollama — 가장 쉬운 로컬 LLM 조합
PrivateGPT + Ollama — 가장 쉬운 로컬 LLM 조합
PrivateGPT를 처음 시작할 때 권장되는 가장 쉬운 방법이 Ollama예요. Ollama는 명령 한 번으로 대형 언어 모델을 로컬에서 실행해 주고, 모델 다운로드·GPU 오프로딩·OpenAI 호환 API(포트 11434)까지 알아서 처리해요.
Ollama의 제약
Ollama는 토크나이저 엔드포인트(/tokenize)를 노출하지 않아요. 그래서 PrivateGPT는 문자 기반 추정(4자 = 1토큰)으로 토큰 수를 세요. 입력이 길면 컨텍스트 윈도우 오버플로우가 날 수 있어요.
권장: 상세 모델 프로필에서 실제 모델 한도에 맞게 context_window를 명시적으로 설정하세요. 기본적으로 Ollama는 VRAM에 따라 컨텍스트를 가정해요.
- < 24 GiB VRAM: 4k 컨텍스트
- 24–48 GiB VRAM: 32k 컨텍스트
- ≥ 48 GiB VRAM: 256k 컨텍스트
설정
모델을 받고 서버를 시작해요.
ollama pull qwen3.5:35b # LLM (~24 GB)
ollama pull mxbai-embed-large # Embeddings (~670 MB)
ollama serve
API는 http://localhost:11434/v1에서 제공돼요.
PrivateGPT 연결
OPENAI_API_BASE=http://localhost:11434/v1 private-gpt serve
Docker로는 host.docker.internal를 써야 해요.
docker run -p 8080:8080 \
-e OPENAI_API_BASE=http://host.docker.internal:11434/v1 \
zylonai/private-gpt:latest
capability 요약
| 기능 | 상태 |
|---|---|
모델 발견 (/v1/models) |
✅ |
토크나이저 엔드포인트 (/tokenize) |
❌ |
| 임베딩 | ✅ |
| 툴/함수 호출 | ✅ 모델 의존 |
| 구조적 출력 | ❌ |
| 스트리밍 | ✅ |
| 비전/이미지 입력 | ✅ 모델 의존 |
고급: context_window 명시
Ollama는 토크나이저가 없으니 context_window를 명시하는 게 특히 유용해요. 모델 발견 스크립트로 프로필을 만들고 편집해요.
OPENAI_API_BASE=http://localhost:11434/v1 \
uv run python scripts/auto_discover_models.py --out settings-model.yaml
더 알아보기
LM Studio·LlamaCPP Server·vLLM 등 다른 제공사 비교는 Providers overview 문서에서 확인할 수 있어요.