GPT4All 로컬 API 서버

GPT4All 로컬 API 서버

GPT4All이 제공하는 로컬 API 서버를 쓰면 내 하드웨어에서 모델을 HTTP API로 실행할 수 있어요. OpenAI 호환 엔드포인트를 제공하기 때문에, 이미 OpenAI 규격 클라이언트나 도구를 쓰고 있다면 그걸 그대로 로컬 모델에 연결해 쓸 수 있죠. 프라이버시와 오프라인 사용이 목표라면 이 방식이 꽤 유용해요.

출처: GPT4All API 서버 - 공식 문서

주요 특징

  • 로컬 실행: 모델을 내 하드웨어에서 실행해 프라이버시와 오프라인 사용이 가능해요.
  • LocalDocs 통합: LocalDocs 컬렉션에서 뽑은 관련 텍스트 조각을 LLM에 함께 제공하며 API를 실행할 수 있어요.
  • OpenAI API 호환: 기존 OpenAI 호환 클라이언트·도구를 로컬 모델과 함께 쓸 수 있어요.

API 서버 활성화

  1. GPT4All 채팅 데스크톱 앱을 엽니다.
  2. Settings > Application으로 가서 Advanced까지 내려갑니다.
  3. "Enable Local API Server" 설정에 체크합니다.
  4. 서버는 기본적으로 포트 4891에서 듣습니다. "API Server Port" 설정으로 다른 포트를 고를 수도 있어요.

API 서버 연결

API 서버의 기본 URL은 http://localhost:4891/v1예요(다른 포트를 쓰면 http://localhost:<PORT_NUM>/v1).

서버는 HTTPS가 아닌 HTTP 연결만 받고, localhost(127.0.0.1)에서만 듣습니다. IPv6 localhost 주소(::1)는 받지 않아요.

예시 호출

curl -X POST http://localhost:4891/v1/chat/completions \
  -d '{
    "model": "Phi-3 Mini Instruct",
    "messages": [{"role":"user","content":"Who is Lionel Messi?"}],
    "max_tokens": 50,
    "temperature": 0.28
  }'

API 엔드포인트

메서드 경로 설명
GET /v1/models 사용 가능한 모델 목록
GET /v1/models/<name> 특정 모델의 상세 정보
POST /v1/completions 텍스트 완성 생성
POST /v1/chat/completions 채팅 완성 생성

LocalDocs 통합

API 서버와 함께 LocalDocs를 쓸 수도 있어요.

  1. GPT4All 앱에서 Chats 뷰를 엽니다.
  2. 채팅 기록 사이드바 맨 아래로 내려갑니다.
  3. 서버 채팅(배경색이 다른 항목)을 선택합니다.
  4. 오른쪽 사이드바에서 LocalDocs 컬렉션을 활성화합니다.

참고로 LocalDocs는 현재 GPT4All UI를 통해서만 활성화할 수 있고, API로는 할 수 없어요. 준비가 되면 로컬 LLM으로 보내는 API 호출에 LocalDocs 컬렉션에서 뽑은 관련 참조가 입력 메시지에 담겨 함께 전달돼요.

더 알아보기