서버리스 추론
서버리스 추론 (Serverless Inference)
Together AI에서 가장 빠르게 추론을 돌리는 방식이 서버리스 모델이에요. 지원되는 모델을 즉시 호출할 수 있고, 최소 비용이나 프로비저닝 대기 시간이 없어요. 사용한 토큰, 메가픽셀, 또는 오디오·비디오·음성 처리 초만큼만 지불하면 돼요. 프로토타입부터 평가까지, 그리고 변동이 큰 운영 트래픽까지 커버하는 가장 가벼운 진입점이에요.
시작하기
- Quickstart — 몇 분 만에 첫 API 요청을 보내요.
- Available models — 서버리스 모델 카탈로그와 요율을 둘러봐요.
- Recommended models — 어디서 시작할지 모르겠다면 사용 사례별 추천을 봐요.
- Inference APIs — 채팅, 이미지, 오디오, 임베딩 등을 하나의 API로 호출해요.
- Batch inference — 최대 50% 저렴한 비동기 워크로드를 돌려요.
서버리스는 전용 모델 추론과 동일한 추론 API를 공유해요. 그래서 서버리스로 프로토타입을 만들고, 나중에 예약 하드웨어로 옮겨도 애플리케이션 코드를 바꿀 필요가 없어요.
속도 제한
서버리스 모델은 속도 제한이 있어요. 그래서 프로토타이핑·모델 평가, 또는 트래픽이 변동적이거나 폭발적이거나 낮아서 토큰당 과금이 효율적인 운영 상황에 가장 잘 맞아요. 트래픽이 꾸준하고 속도 제한이 더 필요하거나 예약 하드웨어를 원한다면, 프로비저닝된 처리량을 요청하거나 전용 엔드포인트를 쓰면 돼요.
리전 선택
Together AI는 서버리스 요청을 자체 인프라 전체에 라우팅하고, 서빙 리전을 선택할 수 없어요. 특정 리전에서 요청이 실행되길 원한다면(지연·데이터 보관·규정 준수 이유) 전용 엔드포인트를 쓰고 하드웨어를 대상 리전에 고정하면 돼요.
요금
서버리스 모델은 최소 사용량이나 프로비저닝 비용 없이, 사용량 기준으로 과금돼요. 작업 단위당 지불하며, 단위는 모델 유형에 따라 달라져요.
- 채팅, 언어, 임베딩, rerank: 입력·출력 토큰당.
- 이미지 생성: 출력 메가픽셀당.
- 비디오 생성: 출력 초당.
- 음성-텍스트·텍스트-음성: 오디오 초당.
모델별 요율은 카탈로그 표와 together.ai/pricing에 있어요.
실시간 응답이 필요 없다면, 일부 모델은 배치 워크로드로 실행할 때 최대 50% 할인돼요.
캐시 입력 할인
일부 서버리스 채팅 모델은 캐시된 입력 토큰을 크게 할인해줘요. 캐싱은 이렇게 동작해요.
- 자동: 활성화할 헤더·파라미터·계정 토글 같은 게 없어요. 같은 프롬프트 프리픽스를 다시 보내면, 공유 캐시에서 여전히 유효한 부분은 캐시 요율로 과금돼요.
- 프리픽스 기반: 입력 중 가장 긴 일치 프리픽스만 캐시로 간주돼요. 첫 차이 뒤의 토큰은 표준 입력 요율로 과금돼요.
- 최선 노력·단기: 서버리스 캐시는 플릿 전체에 공유되고 트래픽 이동에 따라 항목이 퇴거되므로, 캐시 히트가 보장되지 않고 구성 가능한 보존 기간도 없어요. 예측 가능한 캐시 동작이 필요하면 전용 엔드포인트를 쓰세요. 전용 엔드포인트는 프롬프트 캐싱이 기본 활성화되어 있고 자기 복제본에 한정돼요.
- 지원 모델로 제한: 채팅 모델 표의 Cached input pricing 열에 값이 있는 모델만 캐시 입력 과금을 지원해요. 캐시 가격이 없는 모델은 모든 입력 토큰을 표준 요율로 과금해요.
더 알아보기 (Learn more)
- 채팅 완성 보내기 — 서버리스 채팅 모델을 호출하는 기본 방법이에요.
- OpenAI 호환성 — 기존 OpenAI 클라이언트로 서버리스 모델에 접근하는 법이에요.
- 생성 임베딩 — 서버리스 임베딩 모델을 쓰는 법이에요.
- Available models — 서버리스 모델 카탈로그와 요율을 봐요.