ONNX Runtime GenAI

ONNX Runtime GenAI

ONNX Runtime의 생성형 AI(generative AI) 추론을 위한 공식 API 모음이에요. 특히 대규모 언어 모델(LLM)과 비전·음성 모델을 ONNX Runtime 위에서 돌리기 위한 onnxruntime-genai(generate() API) 라이브러리가 핵심이죠.

이 라이브러리는 토큰화·전처리, ONNX Runtime 추론, logits 처리, 탐색·샘플링, KV cache 관리까지 생성 루프 전체를 한 번에 처리해 줘요. 높은 수준의 generate() 메서드를 호출하거나, 한 토큰씩 루프를 돌며 생성 파라미터를 바꿔가며 쓰는 방식 둘 다 지원한답니다.

이 카테고리의 문서

  • generate() API 개요: 생성형 AI 모델을 ONNX Runtime으로 실행하는 방법
  • 설정 참조(genai_config.json): 모델·탐색 파라미터를 담은 설정 파일 구조
  • 튜토리얼: Phi-3, DeepSeek-R1-Distill 실행, LoRA 어댑터 파인튜닝

출처: https://onnxruntime.ai/docs/genai/