Granite 서빙 — vLLM 배포와 파서 설정

Granite 서빙

Granite 4.2는 vLLM(v0.20+) 으로 배포하는 것이 최적화된 경로예요. 추론·도구 호출을 제대로 파싱하려면 커스텀 파서 설정이 중요해요.

vLLM 서빙

  • vLLM v0.20+ 사용 권장
  • 추론 파서: granite_thinking_parser 사용 — 각 모델의 Hugging Face 저장소에서 받을 수 있어요. 내장 nemotron_v3 파서로도 동작하지만, granite_thinking_parser가 추론 출력 포맷을 더 잘 정리해 줘요.
  • 도구 호출 파서: qwen3_coder 사용

배포 시 주의

생성 파라미터는 temperature=1.0, top_p=0.95모든 서빙 백엔드에 동일하게 적용해요. 생각 태그와 도구 호출을 정확히 파싱해 응답 구조가 깨지지 않게 하는 것이 배포의 핵심이에요.

참고

이 문서 사이트는 더 이상 업데이트되지 않으며, 최신 Granite 문서·모델은 **Hugging Face(ibm-granite)**와 **GitHub(ibm-granite)**에서 봐야 해요.

더 알아보기