chat completions 레퍼런스 — 파라미터 살펴보기
chat completions 레퍼런스 — 파라미터 살펴보기
실제 프로덕션에서는 요청 파라미터를 세밀하게 조정해야 할 때가 많아요. Together AI chat.completions의 핵심 파라미터를 짚어볼게요.
model(필수): 호출할 모델 이름이에요. 채팅 모델 목록에서 골라요.max_tokens: 생성할 최대 토큰 수예요.stop: 텍스트 생성을 중단시킬 문자열 목록이에요.n: 프롬프트당 생성할 완성 개수예요. 범위는 1 <= n <= 128이에요.logprobs: 각 생성 단계에서 상위 후보 토큰의 로그 확률을 반환할지 결정해요. 모델의 신뢰도를 확인할 때 유용해요. 범위는 0 <= logprobs <= 20이에요.top_k,top_p,min_p: 샘플링 전략을 조절하는 파라미터예요.reasoning_effort: 추론 성능의 강도를 조절하는 enum이에요.low,medium,high값을 받고, 모델이 추론을 더 깊게 할지 결정해요. 값이 높을수록 응답이 사려 깊어지지만 시간이 더 걸려요.context_length_exceeded_behavior:max_tokens가 모델의 최대 컨텍스트 길이를 넘길 때 동작을 정해요.error로 두면 400 오류를,truncate로 두면 최대 컨텍스트 길이로max_tokens를 덮어써요.
이런 파라미터는 요청이 늘어나는 서비스에서 응답 품질과 비용을 함께 조율하는 데 쓰여요. 예를 들어 추론형 모델에서는 reasoning_effort를 낮추면 지연 시간을 아낄 수 있고, 디버깅할 때는 logprobs를 켜서 토큰별 확률을 확인하는 식이에요.
더 알아보기
- https://docs.together.ai/reference/chat-completions — chat completions 레퍼런스
- https://docs.together.ai/docs/models — 사용 가능한 모델 목록