입력 메시지 자르기
입력 메시지 자르기 (Trimming Input Messages)
litellm.trim_messages()를 사용하면 메시지가 모델의 토큰 한도나 지정한 max_tokens를 넘지 않도록 자동으로 잘라줘요. 컨텍스트 윈도우 초과 오류를 미리 막는 데 유용하답니다.
출처: 문서
본문
litellm.trim_messages()를 사용해 메시지가 모델의 토큰 한도 또는 지정한 max_tokens를 초과하지 않게 할 수 있어요.
사용 방법 (Usage)
from litellm import completion
from litellm.utils import trim_messages
response = completion(
model=model,
messages=trim_messages(messages, model) # trim_messages ensures tokens(messages) < max_tokens(model)
)
사용 방법 - max_tokens 설정
from litellm import completion
from litellm.utils import trim_messages
response = completion(
model=model,
messages=trim_messages(messages, model, max_tokens=10), # trim_messages ensures tokens(messages) < max_tokens
)
파라미터 (Parameters)
이 함수는 다음 파라미터를 사용해요:
messages: [필수] 입력 메시지의 리스트예요.model: [선택] 사용 중인 LiteLLM 모델이에요.max_tokens파라미터를 지정할 수도 있으므로 선택 사항이에요.max_tokens: [선택] 메시지에 대한 수동 상한을 지정하는 int예요.trim_ratio: [선택] 자르기 후 사용할 토큰의 목표 비율이에요. 기본값은0.75로, 메시지가 약 75% 정도만 사용하도록 잘라요.