LiteRT 추론 — CompiledModel API와 CPU·GPU·NPU 가속

LiteRT 추론

LiteRT에서 온디바이스 ML 추론의 현대 표준은 CompiledModel API예요. GPU·NPU 같은 하드웨어 가속을 한층 매끄럽게 활용하도록 설계됐고, 이전 Interpreter API보다 훨씬 좋은 성능을 냅니다. .tflite 모델을 다양한 엣지 플랫폼에 쉽게 배포할 수 있게 해주는 통합 개발 경험이에요.

CompiledModel API를 쓰는 이유

  • 최고 수준의 GPU 가속: 최신 GPU 가속 라이브러리(ML Drift)로 모바일·웹·데스크톱·IoT 전반에서 안정적인 GPU 추론
  • 통합 NPU 접근: Google Tensor, Qualcomm, MediaTek 등 다양한 제공자의 NPU를 하나의 일관된 경험으로 접근 (벤더별 컴파일러·런타임 복잡성 추상화)
  • 자동 하드웨어 선택: CPU·GPU·NPU 중 최적 백엔드를 하드웨어와 우선순위 로직에 따라 자동 선택
  • 비동기 실행: OS 수준 동기화(sync fence)로 가속기가 이전 작업 종료 직후 바로 시작 — 지연 최대 2배 감소
  • 효율적 I/O: TensorBuffer API와 zero-copy 버퍼 인터럽으로 전처리·추론·후처리 사이의 비용 있는 복사를 제거

시작하기

  • 고전 ML 모델: 이미지 분할 Kotlin/C++ 데모 앱 (CPU/GPU/NPU, 비동기 실행)
  • GenAI 모델: EmbeddingGemma 의미 유사도 C++ 데모 앱

지원 플랫폼

Android, iOS, Web, IoT, Desktop 전부에서 고성능 추론을 지원해요.

더 알아보기