Gemini Live API 개요

Gemini Live API 개요

Live API는 Gemini와의 저지연(low-latency), 실시간 음성·비전 상호작용을 가능하게 해요. 오디오, 이미지, 텍스트의 연속 스트림을 처리해 즉각적이고 인간다운 음성 응답을 만들어 내므로, 사용자에게 자연스러운 대화 경험을 제공할 수 있죠.

Live API 개요

Google AI Studio에서 Live API 사용해 보기 · GitHub에서 예시 앱 복제하기 · 코딩 에이전트 스킬 사용하기

출처: 원문

본문

사용 사례 (Use cases)

Live API는 다양한 산업 분야의 실시간 음성 에이전트 구축에 사용될 수 있어요:

  • E-commerce 및 소매: 맞춤형 추천을 제공하는 쇼핑 어시스턴트와 고객 문제를 해결하는 지원 에이전트.
  • 게임: 상호작용형 NPC(비플레이어 캐릭터), 게임 내 도움 어시스턴트, 게임 콘텐츠의 실시간 번역.
  • 차세대 인터페이스: 로보틱스, 스마트 글래스, 차량에서의 음성·비디오 지원 경험.
  • 헬스케어: 환자 지원과 교육을 위한 건강 동반자(companion).
  • 금융 서비스: 자산 관리와 투자 조언을 위한 AI 어드바이저.
  • 교육: 맞춤형 지도와 피드백을 제공하는 AI 멘토와 학습 동반자.
  • 번역 및 현지화: 음성 대화의 실시간 저지연 번역으로 원활한 다국어 소통.
  • 라이브 전사 및 자막: 자막, 회의 전사, 음성 받아쓰기, 고객 통화 기록을 위한 실시간 음성-텍스트 스트리밍.

핵심 기능 (Key features)

Live API는 견고한 음성 에이전트를 구축하기 위한 포괄적인 기능을 제공해요:

기술 사양 (Technical specifications)

다음 표는 Live API의 기술 사양을 정리한 거예요:

카테고리 세부 사항
입력 모달리티 오디오(원시 16-bit PCM 오디오, 16kHz, 리틀엔디언), 이미지(JPEG ≤ 1FPS), 텍스트
출력 모달리티 오디오(원시 16-bit PCM 오디오, 24kHz, 리틀엔디언)
프로토콜 상태 저장형 WebSocket 연결(WSS)

구현 방식 선택 (Choose an implementation approach)

Live API를 통합할 때는 다음 중 하나의 구현 방식을 선택해야 해요:

  • 서버-투-서버(Server-to-server): 백엔드가 WebSockets을 사용해 Live API에 연결해요. 보통 클라이언트가 스트림 데이터(오디오·비디오·텍스트)를 서버로 보내면, 서버가 이를 Live API로 전달하죠.
  • 클라이언트-투-서버(Client-to-server): 프런트엔드 코드가 WebSockets을 사용해 Live API에 직접 연결해 데이터를 스트리밍해요. 백엔드를 거치지 않죠.

참고: 클라이언트-투-서버 방식은 스트림을 먼저 백엔드로 보낼 필요가 없어 오디오·비디오 스트리밍 성능이 일반적으로 더 좋아요. 클라이언트에서 서버로, 다시 API로 데이터를 보내는 프록시를 구현할 필요가 없어 설정도 더 쉽고요. 다만 프로덕션 환경에서는 보안 위험을 줄이기 위해 표준 API 키 대신 임시 토큰(ephemeral token) 사용을 권장해요.

시작하기 (Get started)

개발 환경에 맞는 가이드를 선택하세요. 실시간 오디오·비디오 앱 개발을 간소화하려면, WebRTC나 WebSockets 위에서 Gemini Live API를 지원하는 서드파티 통합도 사용할 수 있어요.

더 알아보기 (Learn more)