모델 다운로드 API (Pull a model)

모델 다운로드 API (Pull a model)

커맨드라인에서 ollama pull로 모델을 받았다면, 이번엔 API로 같은 일을 하는 법을 볼게요. POST /api/pull 엔드포인트가 모델 다운로드를 담당해요. 다운로드 진행 상황이 스트리밍 상태로 돌아오는 점이 특징입니다.

요청

모델 이름과 함께 POST 요청을 보내면 모델을 다운로드해요.

curl http://localhost:11434/api/pull -d '{
  "model": "gemma4"
}'

스트리밍을 끄고 싶다면 stream: false를 추가하면 됩니다.

curl http://localhost:11434/api/pull -d '{
  "model": "gemma4",
  "stream": false
}'

요청 파라미터

PullRequest 스키마 기준이에요.

  • model (필수, string) — 다운로드할 모델의 이름
  • insecure (boolean) — 기본값은 false

응답

200 응답으로 다운로드 상태 업데이트가 스트리밍됩니다. 상태 응답은 성공 여부(status: success), 상황에 따라 콘텐츠 다이제스트, 총 예상 바이트(total), 지금까지 전송된 바이트(completed)를 담아요.

Ollama의 모델 다운로드는 GGUF 기반 모델을 로컬로 끌어오는 작업이라, 큰 모델일수록 시간이 걸려요. 실행과 조합하면 이 API는 자동으로 모델을 받아 온 뒤 바로 추론까지 이어지게 할 수 있어서, 파이프라인에서 유용하죠.