지연 최적화 추론으로 응답 속도 높이기

지연 최적화 추론으로 응답 속도 높이기

AI 애플리케이션에서 응답이 조금만 늦어도 사용자 경험이 눈에 띄게 나빠지죠. Amazon Bedrock의 지연 최적화 추론(Latency-optimized inference) 은 파운데이션 모델의 응답 시간을 크게 줄여주는 옵션이에요. 별도 설정이나 파인튜닝 없이 기존 애플리케이션에 바로 적용할 수 있다는 점이 장점이에요. 이 페이지에서는 활성화 방법과 적용 가능한 모델·리전을 안내해 드릴게요.

출처: https://docs.aws.amazon.com/bedrock/latest/userguide/latency-optimized-inference.html

어떻게 켜나요

지연 최적화는 추가 설정이나 모델 파인튜닝이 필요 없어요. Amazon Bedrock runtime API를 호출할 때 Latency 파라미터를 optimized로 설정하면 돼요. 호출 옵션으로 standard를 선택하면 요청은 기본 추론(standard inference)으로 처리되고, 기본적으로 모든 요청은 standard로 라우팅돼요.

"performanceConfig" : {
    "latency" : "standard | optimized"
}

지연 최적화 사용량 할당량(usage quota)에 도달하면 Standard 지연으로 요청을 처리하려고 시도하고, 이 경우 요금도 Standard 지연 요금으로 부과돼요. 서빙된 요청의 지연 구성은 API 응답과 AWS CloudTrail 로그에서 확인할 수 있어요.

지연 최적화 요청의 지표는 Amazon CloudWatch 로그에서 "model-id+latency-optimized" 이름으로 확인할 수 있어요.

어떤 모델에서 쓸 수 있나요

지연 최적화 추론은 크로스 리전 추론(cross-Region inference)을 통해 다음 모델에 제공돼요.

  • Meta Llama 3.1 70B 및 405B — US East (Ohio), US West (Oregon) 리전
  • Anthropic Claude 3.5 Haiku — US East (Ohio), US West (Oregon) 리전
  • Amazon Nova Pro — US East (N. Virginia), US East (Ohio), US West (Oregon) 리전

가격과 관련한 자세한 내용은 Amazon Bedrock 가격 페이지에서 확인할 수 있어요.

더 알아보기