콘텐츠로 이동

Ollama 로컬 실행 (Setup)

개요

오픈소스 모델을 로컬에서 돌리려면 보통 실행 환경을 일일이 맞춰야 해요. Ollama는 설치만 하면 모델을 내려받고 서버를 띄우는 일을 명령 몇 줄로 줄여줍니다. 이 페이지는 Ollama를 설치·실행하고, 서버를 백그라운드 서비스로 띄우는 흐름을 공식 문서 기준으로 설명해요. 개발 머신이나 가벼운 로컬 서빙에서 쓰는 우리 운영 경로예요.

핵심 개념

설치 — 플랫폼별 두 갈래

설치 방법은 OS에 따라 두 갈래예요.

  • macOSOllama.dmg 앱을 내려받아 설치합니다(문서는 macOS 14 Sonoma 이상을 요구). 앱을 설치하면 명령줄 ollama도 함께 있어요.
  • Linux — 설치 스크립트 한 줄이 표준 경로입니다.
curl -fsSL https://ollama.com/install.sh | sh

수동 설치는 압축 패키지를 받아 풀고, ollama serve로 서버를 직접 띄워요. 그대로 둬도 되지만 문서는 systemd 서비스로 등록해 부팅 시 자동 시작되게 하는 걸 권장합니다.

sudo systemctl daemon-reload
sudo systemctl enable ollama
sudo systemctl start ollama
sudo systemctl status ollama

서버 실행 — ollama serve

설치 후 ollama serve가 로컬에서 Ollama 서버를 띄워요. 이 서버가 모델을 내려받고, 추론하고, API로 요청을 받는 모든 일을 담당합니다. 기본적으로 로컬 포트(11434)에서 동작해요.

모델 내려받고 돌리기

설치가 끝나면 서버가 실행 중인 상태에서 ollama pull <모델>로 모델을 받고, ollama run <모델>으로 대화를 시작할 수 있어요. 여러 모델을 받아두고 상황에 맞게 갈아 끼우는 식입니다.

Windows

Windows는 별도 설치 프로그램을 제공해요. GPU 가속(NVIDIA CUDA 등)과 CPU 실행을 모두 지원하고, 설치 후 명령줄과 서버가 함께 셋업됩니다. 기본 사용 흐름은 나머지 플랫폼과 같아요.

실제 적용 (데이터스케쳐스)

  • 개발·테스트 환경 — 개발 중 LLM 동작을 확인할 때, 외부 API 비용 없이 로컬 모델로 빠르게 검증해요. 설치는 한 번만 해두면 되고 ollama serve로 상시 대기시켜 둬요.
  • Linux 서버 등록 — 팀 공용 리눅스 머신에는 systemd 서비스로 등록해 재부팅 후에도 자동으로 뜨게 해요.
  • 민감 데이터 처리 — 데이터를 밖으로 보내기 어려운 상황에서 로컬 실행으로 처리해요.

GPU가 있는 개발 머신이면 추론이 훨씬 빨라져요. GPU가 없는 머신에서는 가벼운 모델을 CPU로 돌리는 대안이 됩니다.

더 알아보기