구성 옵션
구성 옵션 (Configuration Options)
vLLM을 실제로 돌려본다면, 어느 시점에 "이 옵션들은 어떻게 정리되지?" 하는 궁금증이 생길 거예요. 이 페이지는 vLLM 실행과 관련된 가장 흔한 구성 옵션들을 한눈에 정리해 주는 입구 같은 곳이에요. 각 옵션이 어느 단계에서, 어떤 우선순위로 적용되는지를 이해하면 디버깅도 훨씬 수월해지죠.
세 가지 구성 수준 (Three levels of configuration)
vLLM에서 설정을 잡는 방법은 크게 세 가지가 있어요. 그리고 이 세 수준 사이에는 우선순위가 존재합니다. 높은 우선순위부터 낮은 우선순위 순서로 보면 이렇죠.
- 환경 변수 (Environment variables) — 시스템 전체에 걸쳐 적용되는 환경 수준의 설정
- 엔진 인자 (Engine arguments) — vLLM 엔진 동작 자체를 제어하는 인자
- 요청 파라미터 / 입력 인자 (Request parameters and input arguments) — 개별 요청이나 입력에 대해 지정하는 값
이 순서가 중요한 이유는, 낮은 우선순위의 설정이 높은 우선순위의 설정과 충돌할 때 높은 우선순위가 이기기 때문이에요. 예를 들어 환경 변수로 정해진 값을 특정 요청에서 바꿔 덮어쓰려면, 그 값은 요청 파라미터보다 환경 변수가 우선하게 됩니다.
어떤 페이지를 봐야 할까요?
구성 옵션 하나하나의 상세 내용은 아래 하위 페이지들에서 자세히 다뤄져요. 목적에 맞는 페이지를 골라 들어가면 됩니다.
- 엔진 인자 (Engine Arguments) —
vllm serve나 오프라인 추론에서 엔진 동작을 제어하는 옵션들 - 서브 인자 (Serve Arguments) — OpenAI 호환 서버를 띄울 때 사용하는 인자와 YAML 설정 파일
- 환경 변수 (Environment Variables) —
VLLM_접두사를 가진 환경 변수 목록 - 메모리 절약 (Conserving Memory) — OOM(메모리 부족)을 피하기 위한 실용적인 조치들
- 모델 해석 (Model Resolution) — 모델이 어떤 아키텍처로 로드되는지, 충돌 시 해결하는 방법
- 최적화 (Optimization) — 성능 튜닝과 병렬 처리 전략