지원 모델

지원 모델 (Supported Models)

GroqCloud에서 지금 바로 쓸 수 있는 모델을 한눈에 정리해요. 모델마다 추론 속도, 가격, 속도 제한, 컨텍스트 창이 달라서, 목적에 맞는 모델 ID를 고르는 게 첫 단계예요. 아래 테이블의 MODEL ID를 그대로 API 요청의 model 값에 넣으면 돼요.

출처: GroqCloud — Supported Models

프로덕션 모델 (Production Models)

프로덕션 모델은 실제 운영 환경에서 쓰라고 만든 모델들이에요. Groq이 정한 속도·품질·안정성 기준을 충족하거나 그 이상을 보장해요. 주요 모델을 보면 이래요.

MODEL ID 속도(T/초) 1M 토큰당 가격 컨텍스트 창 최대 생성 토큰
llama-3.1-8b-instant 560 연락 필요 131,072 131,072
llama-3.3-70b-versatile 280 연락 필요 131,072 32,768
openai/gpt-oss-120b 500 입력 $0.15 / 출력 $0.60 131,072 65,536
openai/gpt-oss-20b 1000 입력 $0.075 / 출력 $0.30 131,072 65,536
whisper-large-v3 - 시간당 $0.111 - -
whisper-large-v3-turbo - 시간당 $0.04 - -

이 밖에도 OpenAI Whisper 계열의 음성 인식 모델이 있어요. whisper-large-v3는 최대 파일 크기 100MB를 지원해요.

openai/ 프리픽스가 붙은 모델 ID는 OpenAI가 공개한 오픈웨이트 모델인 GPT-OSS 시리즈예요. 슬래시('/')가 포함된 모델 ID도 그대로 하나의 모델 식별자로 쓰면 돼요.

프로덕션 시스템 (Production Systems)

시스템(System)은 여러 모델과 도구가 함께 움직여 하나의 질문에 답하는 묶음을 말해요. 웹 검색, 코드 실행 같은 내장 도구를 상황에 맞게 골라 쓰는 구조예요.

MODEL ID 속도(T/초) 컨텍스트 창 최대 생성 토큰
groq/compound 450 131,072 8,192
groq/compound-mini 450 131,072 8,192

프리뷰 모델 (Preview Models)

프리뷰 모델은 평가용으로만 쓰는 게 원칙이에요. 언제든 단기 공지로 서비스가 중단될 수 있어서 프로덕션에는 넣지 않는 게 좋아요. qwen/qwen3.6-27b, qwen/qwen3.8-27b, minimaxai/minimax-m2.7, openai/gpt-oss-safeguard-20b 같은 모델이 여기 포함돼요. meta-llama/llama-prompt-guard-2-22m처럼 프롬프트 가드 모델도 프리뷰로 제공돼요.

모든 모델 목록 가져오기

Groq에 호스팅된 활성 모델 전체 목록은 https://api.groq.com/openai/v1/models 엔드포인트로 JSON 리스트로 받을 수 있어요.

curl -X GET "https://api.groq.com/openai/v1/models" \
     -H "Authorization: Bearer $GROQ_API_KEY" \
     -H "Content-Type: application/json"

위 표의 MODEL ID를 그대로 이 리스트의 모델 ID와 비교해 보면, 어떤 모델이 현재 서빙 중인지 정확히 확인할 수 있어요.

더 알아보기