Gemini Robotics 2는 Google DeepMind가 공개한 로봇용 AI 모델 패밀리다. 기존 로봇이 정해진 동작을 반복하거나 원격 조종에 의존하던 한계를 넘어, 휴머노이드 전신 움직임, 섬세한 손 조작, 장시간 작업 계획, 다중 로봇 협업, 온디바이스 실행을 한 묶음으로 다루려는 물리 AI(physical AI) 계층이다.
세 가지 모델
| 모델 | 역할 | 핵심 용도 |
|---|---|---|
| Gemini Robotics 2 | VLA(vision-language-action) 모델 | 시각·언어 입력을 로봇 모터 제어로 변환 |
| Gemini Robotics ER 2 | Embodied reasoning VLM | 사람과 대화하고 환경을 이해해 다단계 작업을 계획 |
| Gemini Robotics On-Device 2 | 온디바이스 VLA | 네트워크 없이 로봇 본체에서 빠르게 실행·적응 |
Google은 Gemini Robotics ER 2를 Google AI Studio와 Gemini Enterprise Agent Platform private preview로 제공하고, VLA 및 On-Device 모델은 early-access 파트너에게 제공한다.
무엇이 달라졌나
전신 제어
Gemini Robotics 2는 휴머노이드의 상체 조작을 넘어 걷기, 몸 숙이기, 팔 뻗기, 물건 집기와 놓기를 하나의 작업으로 연결한다. 예를 들어 Apptronik Apollo 2가 물뿌리개를 집어 선반 아래쪽 초록색 상자에 넣는 작업처럼, 이동과 조작이 동시에 필요한 지시를 처리한다.
양손·그리퍼 정교 조작
새 모델은 5개 손가락, 22자유도 손을 가진 Apollo 2에서 매듭 묶기나 지퍼백 닫기 같은 세밀한 작업을 수행하고, Franka Duo 같은 양팔 그리퍼 플랫폼에서도 촘촘한 포장 작업을 수행하도록 설계됐다. 로봇 손 또는 병렬 그리퍼처럼 end effector가 달라도 같은 계열의 지능을 이전하는 점이 중요하다.
장시간 embodied reasoning
Gemini Robotics ER 2는 로봇의 고수준 두뇌 역할을 한다. 방을 관찰하고, 사용자 지시를 단계로 나누고, VLA에 동작을 넘기며, 실패 시 자체 수정한다. 이번 업데이트에서는 수 분 동안 이어지는 작업과 수백 개 의사결정을 더 안정적으로 추적하고, 작업 시작·종료 및 중요한 이벤트 시점을 파악하는 능력이 강조됐다.
다중 로봇 협업
한 대의 로봇으로 끝내기 어려운 작업에서는 서로 다른 로봇이 역할을 나눠 협력한다. 이는 단순한 멀티에이전트 채팅이 아니라 물리적 위치, 도구, 센서, 작업 진행 상태를 공유해야 하는 협업 문제다.
빠른 온디바이스 적응
Gemini Robotics On-Device 2는 인터넷 연결이나 낮은 지연 시간이 중요한 환경을 위한 모델이다. Google은 새로운 양팔 로봇 embodiment에 몇 시간의 적응 시간과 200개 미만 예시로 맞출 수 있다고 설명한다. 공장·창고·실험실처럼 네트워크 의존성이 위험하거나 비용이 큰 현장에서는 이 지점이 특히 중요하다.
안전성
로봇 모델은 디지털 에이전트보다 실패 비용이 크다. Gemini Robotics 2는 기존 물리 안전 장치와 AI 안전 체계를 함께 쓰는 다층 접근을 강조한다. Google은 ASIMOV-Agentic 벤치마크를 함께 소개했는데, 이는 embodied reasoning 에이전트가 위험한 VLA 도구 호출을 거부하거나 작업 가능 여부가 불확실할 때 사람에게 개입을 요청하는 능력을 평가한다.
사용 대상
- 휴머노이드 또는 양팔 로봇 플랫폼에 범용 작업 지능을 붙이려는 로보틱스 팀
- 로봇에게 긴 작업 계획, 실패 복구, 사람과의 대화형 조율을 맡기려는 연구소
- 클라우드 의존 없이 로컬 실행이 필요한 산업 현장
- physical-ai-simulation에서 검증한 정책을 실제 하드웨어로 이전하려는 팀
관련 문서
- gemini — Google의 멀티모달 AI 모델·서비스
- physical-ai-simulation — 로봇·피지컬 AI 개발을 위한 시뮬레이션 엔진 선택 기준
- cosmos-3-edge — 엣지 로봇을 위한 오픈 월드 모델
- agent-harness — 장시간 에이전트 실행을 통제하는 하네스 설계
- long-horizon-model-safety — 장시간 자율 작업 모델 평가와 통제
참고 자료
- Gemini Robotics 2 brings whole body intelligence to robots — Google DeepMind (2026-07-30)