LocalAI 퀵스타트(Quickstart)

LocalAI 퀵스타트(Quickstart)

LocalAI는 OpenAI(및 Anthropic)의 무료 오픈소스 대안으로, 로컬 추론을 위한 드롭인 대체 REST API예요. LLM 실행, 이미지 생성, 오디오 생성까지 컨슈머급 하드웨어로 로컬·온프레미스에서 지원해요. 이 문서는 LocalAI를 시작하고 첫 채팅을 받는 흐름을 보여줘요. 설치가 끝났다고 가정해요.

LocalAI 시작

Docker 설치의 경우 이렇게 시작해요.

docker run -p 8080:8080 --name local-ai -ti localai/localai:latest

출처: https://localai.io/docs/basics/getting_started/

웹 인터페이스 사용

브라우저에서 http://localhost:8080을 열면 웹 인터페이스가 나와요.

  • 설치된 모델로 채팅하기
  • 내장 갤러리(Discover 페이지)에서 모델 설치하기
  • 이미지·오디오 생성
  • MCP 도구를 지원하는 AI 에이전트 생성·관리
  • 시스템 리소스와 로드된 모델 모니터링
  • GPU 가속 포함 설정 구성

첫 채팅을 받는 방법은 이래요.

  1. Models 페이지에서 qwen3-4b를 검색하고 Install을 눌러 다운로드를 기다려요. (qwen3-4b는 CPU 친화적인 작은 Qwen3 모델로, 도구 호출도 지원해요.)
  2. Chat 페이지에서 모델 드롭다운으로 qwen3-4b를 선택하고 메시지를 보내요. 몇 초 안에 답변이 와요.

CLI로 모델 다운로드

LocalAI를 시작할 때 인자로 모델 목록을 지정하면 API 시작 전에 자동 설치도 가능해요.

local-ai run qwen3-4b
local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf
local-ai run ollama://gemma:2b

CLI로 모델을 관리할 수도 있어요.

local-ai models list          # 갤러리의 모델 목록
local-ai models install <name> # 모델 설치

API 사용

LocalAI는 OpenAI 호환 API를 노출해요. 어떤 OpenAI SDK·클라이언트든 http://localhost:8080을 가리키면 됩니다.

curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{ "model": "qwen3-4b", "messages": [{"role": "user", "content": "How are you doing?"}] }'

더 알아보기