ONNX Runtime GenAI
ONNX Runtime GenAI
ONNX Runtime의 생성형 AI(generative AI) 추론을 위한 공식 API 모음이에요. 특히 대규모 언어 모델(LLM)과 비전·음성 모델을 ONNX Runtime 위에서 돌리기 위한 onnxruntime-genai(generate() API) 라이브러리가 핵심이죠.
이 라이브러리는 토큰화·전처리, ONNX Runtime 추론, logits 처리, 탐색·샘플링, KV cache 관리까지 생성 루프 전체를 한 번에 처리해 줘요. 높은 수준의 generate() 메서드를 호출하거나, 한 토큰씩 루프를 돌며 생성 파라미터를 바꿔가며 쓰는 방식 둘 다 지원한답니다.
이 카테고리의 문서
- generate() API 개요: 생성형 AI 모델을 ONNX Runtime으로 실행하는 방법
- 설정 참조(genai_config.json): 모델·탐색 파라미터를 담은 설정 파일 구조
- 튜토리얼: Phi-3, DeepSeek-R1-Distill 실행, LoRA 어댑터 파인튜닝