입력 메시지 자르기

입력 메시지 자르기 (Trimming Input Messages)

litellm.trim_messages()를 사용하면 메시지가 모델의 토큰 한도나 지정한 max_tokens를 넘지 않도록 자동으로 잘라줘요. 컨텍스트 윈도우 초과 오류를 미리 막는 데 유용하답니다.

출처: 문서

본문

litellm.trim_messages()를 사용해 메시지가 모델의 토큰 한도 또는 지정한 max_tokens를 초과하지 않게 할 수 있어요.

사용 방법 (Usage)

from litellm import completion
from litellm.utils import trim_messages

response = completion(
    model=model, 
    messages=trim_messages(messages, model) # trim_messages ensures tokens(messages) < max_tokens(model)
) 

사용 방법 - max_tokens 설정 ​

from litellm import completion
from litellm.utils import trim_messages

response = completion(
    model=model, 
    messages=trim_messages(messages, model, max_tokens=10), # trim_messages ensures tokens(messages) < max_tokens
) 

파라미터 (Parameters)

이 함수는 다음 파라미터를 사용해요:

  • messages : [필수] 입력 메시지의 리스트예요.
  • model : [선택] 사용 중인 LiteLLM 모델이에요. max_tokens 파라미터를 지정할 수도 있으므로 선택 사항이에요.
  • max_tokens : [선택] 메시지에 대한 수동 상한을 지정하는 int예요.
  • trim_ratio : [선택] 자르기 후 사용할 토큰의 목표 비율이에요. 기본값은 0.75로, 메시지가 약 75% 정도만 사용하도록 잘라요.

더 알아보기 (Learn more)