Gemini Robotics ER

Gemini Robotics ER

Preview: Gemini Robotics ER 모델은 현재 프리뷰 단계예요.

Gemini Robotics ER(체화 추론, embodied reasoning) 모델은 로봇이 물리 세계를 지각하고 상호작용하게 하는 비전-언어 모델(VLM)이에요. 시각 데이터를 해석하고, 공간·시간 추론을 수행하고, 다단계 작업을 계획하고, 로봇과 도구를 조율(오케스트레이션)해요.

출처: 원문

본문

모델

Gemini Robotics ER 2 모델은 Gemini Robotics의 최신 모델이에요. 로봇이 환경을 정확히 이해하게 하는 업데이트된 추론 모델이에요. VLA를 사용한 로봇의 에이전트 오케스트레이션, 진전 이해·성공 감지를 포함한 로봇 비디오 이해, 계측기 판독, 포인팅, 공간 추론 같은 체화 추론 능력에 특화돼 있어요.

Gemini Robotics ER 2 모델은 두 개의 모델 엔드포인트를 제공해요.

  • gemini-robotics-er-2-preview: 표준 ER 2 모델. 개선된 공간 추론, 비디오 모멘트 찾기, 비디오 진전 분류, 다중 로봇 오케스트레이션, 다단계 도구 사용으로 Gemini 3.5 Flash 기반 위에 구축됐어요.
  • gemini-robotics-er-2-streaming-preview: Live API를 통한 실시간 스트리밍에 최적화됐어요. 연속 오디오·비디오 입력을 처리하는 저지연 로봇 에이전트에 이 모델을 사용하세요.

Gemini Robotics ER 1.6을 사용 중이라면 API 호출에서 model="gemini-robotics-er-1.6-preview"를 model="gemini-robotics-er-2-preview" 또는 model="gemini-robotics-er-2-streaming-preview"로 바꿔 Gemini Robotics ER 2로 업그레이드하세요. Gemini Robotics ER 1.6 모델은 8월 말에 종료될 예정이에요.

Google AI Studio에서 Gemini Robotics ER 2 사용해 보기

로보틱스 능력

Gemini Robotics ER는 다양한 체화 추론 능력을 지원해요. 능력을 선택해 자세히 알아보세요.

능력 설명 가이드
공간 추론 객체를 가리키고, 비디오에서 추적하고, 바운딩 박스로 감지하고, 궤적을 계획해요. Spatial reasoning
에이전트 비전 이미지 조작 도구를 활용해 다른 능력을 강화하는 데 코드 실행을 사용해요. Agentic vision
작업 오케스트레이션 공간 추론을 커스텀 로봇 API와 결합해 장기간 작업을 완료해요. Task orchestration
스트리밍(Gemini Robotics ER 2 Streaming 엔드포인트 전용) 저지연 함수 호출이 있는 실시간 로봇 에이전트용 양방향 스트리밍. Streaming for robotics
비디오 진전(Gemini Robotics ER 2 전용) 연속 비디오 피드에서 모멘트 찾기와 진전 분류. Video understanding

시작하기

다음 예제는 이미지에서 객체를 찾고 정규화된 2D 좌표와 라벨을 반환해요. 이 출력을 로봇 API나 VLA 모델에 직접 전달해 로봇 행동을 생성할 수 있어요.

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)
# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

출력은 각각 객체를 식별하는 point(정규화된 [y, x] 좌표)와 label을 담은 객체의 JSON 배열이에요.

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

다음 이미지는 이 점들이 어떻게 표시될 수 있는지 예시로 보여줘요.

작동 방식

Gemini Robotics ER는 이미지·비디오·오디오 입력을 자연어 프롬프트와 함께 받아요. 객체를 식별하고, 장면 컨텍스트와 공간 관계에 대해 추론하고, 좌표·바운딩 박스 같은 구조화된 출력을 반환해요.

Gemini Robotics ER는 에이전트적이기도 해요. 복잡한 작업을 하위 작업으로 나누고, 로봇 함수를 호출하거나 생성된 코드를 실행해 이를 수행해요. 예를 들어 "사과를 그릇에 넣어"는 물체 찾기(locate), 잡기(grasp), 놓기(place) 단계의 연속이 돼요.

Gemini가 도구 호출을 실행하는 방법에 대한 자세한 내용은 Function calling을 참고하세요.

안전

Gemini Robotics ER는 안전을 염두에 두고 만들어졌지만, 로봇 주변에 안전한 환경을 유지하는 것은 당신의 책임이에요. 생성형 AI 모델은 실수할 수 있고, 물리 로봇은 손상을 일으킬 수 있어요. 자세한 내용은 Google DeepMind robotics safety page를 방문하세요.

모범 사례

  1. 평이한 자연어를 사용하세요. 로봇에게 사람에게 하듯 하고 싶은 작업을 설명하세요. 용어가 작동하지 않으면 흔한 동의어를 시도해 보세요.
  2. 시각 입력을 최적화하세요. 이미지를 보내기 전에 작거나 불분명한 객체를 자르거나 확대하세요. 조명과 낮은 색 대비는 감지에 영향을 줄 수 있어요.
  3. 복잡한 작업을 단계로 나누세요. 각 단계를 별도 프롬프트로 보내 모델의 집중을 유지하고 정확도를 높이세요.
  4. 고정밀 작업은 여러 번 질의하고 결과를 평균화하세요. 이 합의 접근은 공간 출력의 분산을 줄여요.

한계

Gemini Robotics ER로 개발할 때 다음 한계를 고려하세요.

  • API 키 제한: Gemini API는 제한 없는(unrestricted) API 키의 요청을 수락하지 않고 403 Forbidden 오류를 반환해요. AI Studio에서 제한을 추가해 API 키를 안전하게 보호하세요. 자세한 내용은 Secure unrestricted API keys 참고.
  • 지연 vs 성능: 복잡한 쿼리, 고해상도 입력, 높은 thinking 수준은 처리 시간 증가로 이어질 수 있어요. thinking 수준은 지연과 성능의 균형을 위해 medium을 사용하세요.
  • 환각: 모든 대규모 언어 모델처럼 Gemini Robotics ER 모델은 특히 모호한 프롬프트나 분포 밖 입력에서 가끔 "환각"하거나 잘못된 정보를 제공할 수 있어요.
  • 프롬프트 품질 의존성: 출력 품질은 입력 프롬프트의 명확성에 달려 있어요. 구체적이고 잘 구조화된 프롬프트를 사용하세요.
  • 계산 비용: 특히 비디오 입력이나 높은 thinking_budget으로 모델을 실행하는 것은 계산 리소스를 소비하고 비용이 발생해요. 자세한 내용은 Thinking 페이지 참고.
  • 입력 유형: 각 모드의 한계에 대한 자세한 내용은 다음 주제를 참고하세요.

개인정보 고지

당신은 이 문서에 언급된 모델("Robotics Models")이 지침에 따라 하드웨어를 작동·이동하기 위해 비디오·오디오 데이터를 활용한다는 것을 인정해요. 따라서 음성·이미지·초상 데이터("Personal Data") 같은 식별 가능한 사람의 데이터가 Robotics Models에 의해 수집되도록 Robotics Models를 작동할 수 있어요. Personal Data를 수집하는 방식으로 Robotics Models를 작동하기로 선택하면, 해당 식별 가능한 사람들이 https://ai.google.dev/gemini-api/terms("Terms", 특히 "How Google Uses Your Data" 섹션)에 있는 Gemini API 추가 서비스 약관에 설명된 대로 자신의 Personal Data가 Google에 제공·사용될 수 있다는 사실을 충분히 통지받고 동의할 때까지, 식별 가능한 사람들이 Robotics Models와 상호작용하거나 그 주변 영역에 존재하도록 허용하지 않기로 동의해요. 얼굴 블러링 같은 기술을 사용하고 실용 가능한 범위에서 식별 가능한 사람이 없는 영역에서 Robotics Models를 작동함으로써 Personal Data의 수집·배포를 최소화하기 위해 상업적으로 합리적인 노력을 기울일 것임을 보장해요.

가격

가격과 가용 지역에 대한 자세한 내용은 pricing 페이지를 참고하세요.

모델 엔드포인트

Gemini Robotics ER 2 Preview

속성 설명
모델 코드 gemini-robotics-er-2-preview
지원 데이터 유형 입력 텍스트, 이미지, 비디오, 오디오 출력 텍스트
토큰 한도[*] 입력 토큰 한도 131,072 출력 토큰 한도 65,536
능력 오디오 생성 미지원 캐싱 지원 코드 실행 지원 컴퓨터 사용 지원 파일 검색 지원 함수 호출 지원 Google Maps 접지 지원 이미지 생성 미지원 Live API 미지원 Search 접지 지원 구조화 출력 지원 Thinking 지원 URL 컨텍스트 지원
소비 옵션 Batch API 지원 Flex inference 미지원 Priority inference 미지원
버전 모델 버전 패턴 참고. Preview: gemini-robotics-er-2-preview
최신 업데이트 2026년 7월
모델 카드 Model card

Gemini Robotics ER 2 Streaming Preview

속성 설명
모델 코드 gemini-robotics-er-2-streaming-preview
지원 데이터 유형 입력 텍스트, 이미지, 비디오, 오디오 출력 텍스트
토큰 한도[*] 입력 토큰 한도 131,072 출력 토큰 한도 65,536
능력 오디오 생성 미지원 캐싱 미지원 코드 실행 미지원 컴퓨터 사용 미지원 파일 검색 미지원 함수 호출 지원 Google Maps 접지 미지원 이미지 생성 미지원 Live API 지원 Search 접지 지원 구조화 출력 미지원 Thinking 지원 URL 컨텍스트 미지원
소비 옵션 Batch API 미지원 Flex inference 미지원 Priority inference 미지원
버전 모델 버전 패턴 참고. Preview: gemini-robotics-er-2-streaming-preview
최신 업데이트 2026년 7월
모델 카드 Model card

Gemini Robotics ER 1.6 Preview

속성 설명
모델 코드 gemini-robotics-er-1.6-preview
지원 데이터 유형 입력 텍스트, 이미지, 비디오, 오디오 출력 텍스트
토큰 한도[*] 입력 토큰 한도 131,072 출력 토큰 한도 65,536
능력 오디오 생성 미지원 캐싱 지원 코드 실행 지원 컴퓨터 사용 지원 파일 검색 지원 함수 호출 지원 Google Maps 접지 지원 이미지 생성 미지원 Live API 미지원 Search 접지 지원 구조화 출력 지원 Thinking 지원 URL 컨텍스트 지원
소비 옵션 Batch API 지원 Flex inference 미지원 Priority inference 미지원
버전 모델 버전 패턴 참고. Preview: gemini-robotics-er-1.6-preview
최신 업데이트 2025년 12월
지식 컷오프 2025년 1월

다음 단계

더 알아보기 (Learn more)