프롬프트 & 컨텍스트
프롬프트 & 컨텍스트 (Prompts & Context)
프롬프트 캐싱, 트리밍, 포매팅, assistant prefill, 예측 출력 등 컨텍스트를 다루는 방법을 정리한 가이드 묶음이에요.
출처: 문서
본문
📄️ Pre-fix Assistant Messages (assistant 메시지 선행 고정)
모델이 응답하기 전에 어떤 프로바이더에서 지원하는지 확인하며 assistant 메시지를 prefilled하는 방법을 다뤄요.
- 지원 대상: 프로바이더 목록을 확인하세요.
📄️ Predicted Outputs (예측 출력)
| 속성 | 설명 |
|---|---|
prediction |
모델 출력을 예측해 토큰 비용과 지연 시간을 줄입니다. |
📄️ Prompt Compression (compress()) (프롬프트 압축)
이 기능은 beta 상태예요. 일반 공개(GA) 전까지 API와 동작이 바뀔 수 있어요.
📄️ Trimming Input Messages (입력 메시지 트리밍)
litellm.trim_messages()를 사용하면 메시지가 모델의 토큰 제한이나 지정한 max_tokens를 넘지 않도록 보장할 수 있어요.
📄️ Prompt Caching (프롬프트 캐싱)
지원되는 프로바이더 목록과 캐싱 설정 방법을 다뤄요.
📄️ Prompt Formatting (프롬프트 포매팅)
LiteLLM은 OpenAI ChatCompletions 프롬프트 형식을 다른 모델 형식으로 자동 변환해요. 모델에 커스텀 프롬프트 템플릿을 설정해서 이 동작을 제어할 수도 있어요.