핵심 요청 & 응답 패턴
핵심 요청 & 응답 패턴 (Core Request & Response Patterns)
요청을 보내고 응답을 다루는 핵심 패턴들 — 스트리밍, 배칭, 구조화된 출력, 추론 콘텐츠까지 살펴볼 수 있는 가이드 묶음이에요.
출처: 문서
본문
📄️ Streaming + Async (스트리밍 + 비동기)
| 기능 | LiteLLM SDK | LiteLLM Proxy |
|---|---|---|
| 스트리밍 | 지원 | 지원 |
| 비동기 | 지원 | 지원 |
📄️ Batching Completion()
LiteLLM을 사용하면 다음과 같은 작업을 할 수 있어요:
- 여러 요청을 배치로 묶어 한 번에 처리
- 비동기 배칭으로 처리량(throughput) 확보
📄️ Structured Outputs (JSON Mode) (구조화된 출력)
response_format을 지정해 JSON 구조의 출력을 강제할 수 있어요. Quick Start 예시를 따라 바로 사용해 볼 수 있어요.
📄️ 'Thinking' / 'Reasoning Content' (추론 콘텐츠)
reasoning_content 및 추론(thinking) 관련 동작을 다뤄요. LiteLLM v1.63.0+ 버전이 필요해요.