지원 모델
지원 모델 (Supported Models)
GroqCloud에서 지금 바로 쓸 수 있는 모델을 한눈에 정리해요. 모델마다 추론 속도, 가격, 속도 제한, 컨텍스트 창이 달라서, 목적에 맞는 모델 ID를 고르는 게 첫 단계예요. 아래 테이블의 MODEL ID를 그대로 API 요청의 model 값에 넣으면 돼요.
프로덕션 모델 (Production Models)
프로덕션 모델은 실제 운영 환경에서 쓰라고 만든 모델들이에요. Groq이 정한 속도·품질·안정성 기준을 충족하거나 그 이상을 보장해요. 주요 모델을 보면 이래요.
| MODEL ID | 속도(T/초) | 1M 토큰당 가격 | 컨텍스트 창 | 최대 생성 토큰 |
|---|---|---|---|---|
llama-3.1-8b-instant |
560 | 연락 필요 | 131,072 | 131,072 |
llama-3.3-70b-versatile |
280 | 연락 필요 | 131,072 | 32,768 |
openai/gpt-oss-120b |
500 | 입력 $0.15 / 출력 $0.60 | 131,072 | 65,536 |
openai/gpt-oss-20b |
1000 | 입력 $0.075 / 출력 $0.30 | 131,072 | 65,536 |
whisper-large-v3 |
- | 시간당 $0.111 | - | - |
whisper-large-v3-turbo |
- | 시간당 $0.04 | - | - |
이 밖에도 OpenAI Whisper 계열의 음성 인식 모델이 있어요. whisper-large-v3는 최대 파일 크기 100MB를 지원해요.
openai/ 프리픽스가 붙은 모델 ID는 OpenAI가 공개한 오픈웨이트 모델인 GPT-OSS 시리즈예요. 슬래시('/')가 포함된 모델 ID도 그대로 하나의 모델 식별자로 쓰면 돼요.
프로덕션 시스템 (Production Systems)
시스템(System)은 여러 모델과 도구가 함께 움직여 하나의 질문에 답하는 묶음을 말해요. 웹 검색, 코드 실행 같은 내장 도구를 상황에 맞게 골라 쓰는 구조예요.
| MODEL ID | 속도(T/초) | 컨텍스트 창 | 최대 생성 토큰 |
|---|---|---|---|
groq/compound |
450 | 131,072 | 8,192 |
groq/compound-mini |
450 | 131,072 | 8,192 |
프리뷰 모델 (Preview Models)
프리뷰 모델은 평가용으로만 쓰는 게 원칙이에요. 언제든 단기 공지로 서비스가 중단될 수 있어서 프로덕션에는 넣지 않는 게 좋아요. qwen/qwen3.6-27b, qwen/qwen3.8-27b, minimaxai/minimax-m2.7, openai/gpt-oss-safeguard-20b 같은 모델이 여기 포함돼요. meta-llama/llama-prompt-guard-2-22m처럼 프롬프트 가드 모델도 프리뷰로 제공돼요.
모든 모델 목록 가져오기
Groq에 호스팅된 활성 모델 전체 목록은 https://api.groq.com/openai/v1/models 엔드포인트로 JSON 리스트로 받을 수 있어요.
curl -X GET "https://api.groq.com/openai/v1/models" \
-H "Authorization: Bearer $GROQ_API_KEY" \
-H "Content-Type: application/json"
위 표의 MODEL ID를 그대로 이 리스트의 모델 ID와 비교해 보면, 어떤 모델이 현재 서빙 중인지 정확히 확인할 수 있어요.
더 알아보기
- Model Permissions — 특정 모델 접근 권한 설정
- Model Migration — 모델 간 마이그레이션 가이드
- Rate Limits — 모델별 속도 제한