docker model run
docker model run
docker model run 명령은 모델을 실행하고 제출한 프롬프트 또는 채팅 모드로 상호작용합니다.
출처: 문서
본문
모델을 실행하면 Docker는 Docker Desktop을 통해 Model Runner가 호스팅하는 추론 서버 API 엔드포인트를 호출해요. 모델은 다른 모델이 요청되거나 미리 정의된 비활성 타임아웃(현재 5분)에 도달할 때까지 메모리에 남아 있어요.
호스트 프로세스 또는 컨테이너 안에서 특정 모델과 상호작용하기 전에 반드시 docker model run을 사용해야 하는 건 아니에요. Model Runner는 요청 시 모델을 on-demand로 투명하게 로드하며, pull 되어 로컬에 있다면 그렇게 동작해요.
Docker Desktop 대시보드의 Models 탭에서 모델을 고르면 채팅 모드도 사용할 수 있어요.
옵션 (Options)
| 옵션 | 기본값 | 설명 |
|---|---|---|
--color |
no |
색상 출력 사용 (auto|yes|no) |
--debug |
디버그 로깅 활성화 | |
-d, --detach |
상호작용 없이 백그라운드에서 모델 로드 | |
--openaiurl |
채팅할 OpenAI 호환 API 엔드포인트 URL | |
--websearch |
채팅 중 웹 검색 도구 활성화 |
예시 (Examples)
일회성 프롬프트
docker model run ai/smollm2 "Hi"
출력:
Hello! How can I assist you today?
대화형 채팅
docker model run ai/smollm2
출력:
> Hi
Hi there! It's SmolLM, AI assistant. How can I help you today?
> /bye
모델 사전 로드
docker model run --detach ai/smollm2
이렇게 하면 상호작용 없이 모델을 메모리에 로드해 이후 요청에 대한 최대 성능을 보장해요.