Granite 서빙 — vLLM 배포와 파서 설정
Granite 서빙
Granite 4.2는 vLLM(v0.20+) 으로 배포하는 것이 최적화된 경로예요. 추론·도구 호출을 제대로 파싱하려면 커스텀 파서 설정이 중요해요.
vLLM 서빙
- vLLM v0.20+ 사용 권장
- 추론 파서:
granite_thinking_parser사용 — 각 모델의 Hugging Face 저장소에서 받을 수 있어요. 내장nemotron_v3파서로도 동작하지만,granite_thinking_parser가 추론 출력 포맷을 더 잘 정리해 줘요. - 도구 호출 파서:
qwen3_coder사용
배포 시 주의
생성 파라미터는 temperature=1.0, top_p=0.95를 모든 서빙 백엔드에 동일하게 적용해요. 생각 태그와 도구 호출을 정확히 파싱해 응답 구조가 깨지지 않게 하는 것이 배포의 핵심이에요.
참고
이 문서 사이트는 더 이상 업데이트되지 않으며, 최신 Granite 문서·모델은 **Hugging Face(ibm-granite)**와 **GitHub(ibm-granite)**에서 봐야 해요.