OpenAI 호환 웹 서버 운영하기
OpenAI 호환 웹 서버 운영하기
llama-cpp-python은 단순한 라이브러리를 넘어, OpenAI 호환 API를 제공하는 웹 서버도 같이 돌릴 수 있어요. 덕분에 기존 OpenAI 기반 클라이언트를 그대로 로컬 LLM에 연결할 수 있죠.
서버 기능은 로컬 Copilot 대체(code completion), 함수 호출(Function Calling), 비전 API(multimodal models), 그리고 여러 모델 동시 지원(multi-model)까지 갖추고 있어요. 서버를 사용하려면 설치할 때 서버 의존성을 함께 설치하는 걸 추천해요.
pip install llama-cpp-python[server]
이렇게 설치하면 llama-server나 파이썬에서 서버를 띄울 수 있어요. 서버가 뜨면 http://localhost:8080 같은 주소로 /v1/chat/completions, /v1/completions 같은 OpenAI 호환 엔드포인트가 열려요. 따라서 OpenAI SDK를 쓰는 코드에서 base_url만 로컬 서버로 바꾸면 바로 동작해요.
함수 호출을 지원하기 때문에 에이전트 스타일의 애플리케이션에서도 쓸 수 있고, 멀티모달 모델을 쓰면 이미지 입력을 받는 비전 태스크도 처리할 수 있어요. 여러 모델을 한 서버에서 구성해 두면 용도별로 모델을 골라 서빙할 수도 있죠.
이 서버 덕분에 클라우드 API에 묶이지 않고, GGUF 모델을 로컬에서 OpenAI 표준 인터페이스로 서빙하는 게 매우 쉬워져요.