콘텐츠로 이동

Ollama

큰 LLM API를 쓰는 대신, 가벼운 오픈소스 모델을 우리 컴퓨터에서 직접 돌리고 싶을 때가 있어요. 비용을 아끼거나, 데이터를 밖으로 보내기 싫거나, 개발 중에 빠르게 테스트하고 싶을 때죠. 그런데 오픈소스 모델을 받아다 실행 환경을 직접 맞추는 건 번거롭습니다.

Ollama는 오픈소스 모델을 로컬에서 쉽게 내려받고 돌리는 실행 도구입니다. 명령 한 줄로 모델을 받고 서버를 띄워, 로컬에서 LLM을 바로 쓸 수 있어요. 우리는 개발 환경이나 간단한 서빙에 오픈소스 모델을 로컬로 돌릴 때 Ollama를 쓰고 있습니다.


하위 페이지

  • 로컬 실행 (Setup) 🟢 — Ollama를 설치·실행하고 서버를 시스템 서비스로 띄우는 흐름을 다뤄요.
  • 모델 관리 (Modelfile) 🟢 — Modelfile로 베이스 모델·파라미터·프롬프트 템플릿·시스템 메시지를 조립하는 법을 설명해요.
  • Ollama API 🟢 — /api/generate·/api/chat과 모델 관리 엔드포인트, 스트리밍·옵션을 소개해요.

핵심 개념

로컬 모델 서빙

Ollama는 모델을 로컬에 받아두고, OpenAI 호환 API로 답변을 제공합니다. 외부 LLM API처럼 요청을 보내되, 실제 연산은 우리 장비 안에서 일어나요. 데이터가 밖으로 나가지 않는다는 장점이 있습니다.

CPU / NPU 실행

모델 크기와 장비 사양에 따라 CPU, NPU(신경망 전용 칩) 같은 하드웨어에서도 추론합니다. GPU가 없는 개발 머신에서도 가벼운 모델을 돌려보거나, 소형 모델을 온디바이스로 처리할 수 있어요.

모델 내려받기와 실행

ollama pull <모델>로 모델을 받고 ollama run으로 실행합니다. 여러 오픈소스 모델을 상황에 맞게 갈아 끼울 수 있고, 실행 형식·로딩을 Ollama가 관리해줍니다.


사용 사례 / 실제 적용

  • 개발·테스트 환경 — 개발 중 LLM 동작을 확인할 때 외부 API 비용 없이 로컬 모델로 빠르게 검증합니다.
  • 간단한 로컬 서빙 — 가벼운 분류·파싱 모델을 로컬에서 서빙해, 응답 지연과 비용을 우리가 관리합니다.
  • 민감 데이터 처리 — 데이터를 외부로 보내기 어려운 상황에서 로컬 실행으로 처리합니다.

Ollama는 로컬 실행 도구예요. 규모가 큰 생성 모델의 자체 GPU 서빙(프로덕션)은 vLLM·TGI 쪽 로드맵으로 나눠서 접근합니다.


더 알아보기