구글 딥마인드, 로봇에 전신 지능을 부여하는 Gemini Robotics 2 공개
구글 딥마인드는 2026년 7월 30일, 로봇이 발끝부터 손가락 끝까지 전신을 지능적으로 제어할 수 있도록 설계된 차세대 로봇 AI 시스템 Gemini Robotics 2를 공개했다.
기존의 산업용 로봇은 대부분 미리 프로그래밍된 동작을 반복하거나, 사람이 원격으로 조종하는 방식으로 작동한다. 정해진 작업에는 강하지만 예상하지 못한 환경 변화에 적응하거나, 스스로 새로운 행동을 학습하는 능력은 제한적이다. 또한 한 로봇에서 학습한 기술을 형태와 관절 구조가 다른 로봇에 그대로 적용하기도 어렵다.
제미나이 로보틱스(Gemini Robotics) 2는 이러한 문제를 해결하기 위해 로봇이 주변 환경을 인식하고, 작업 순서를 계획하고, 전신을 움직이며, 다른 로봇과 협업할 수 있도록 설계된 지능 계층이다.
1. 발끝부터 손가락까지 제어하는 로봇 AI
제미나이 로보틱스2의 가장 큰 변화는 로봇의 상체나 로봇 팔만 제어하는 수준을 넘어, 휴머노이드 로봇의 전신을 통합적으로 제어한다는 점이다. 로봇은 사용자의 자연어 명령을 이해한 뒤 걷고, 몸을 숙이고, 균형을 잡고, 팔을 뻗고, 물체를 집는 일련의 동작을 스스로 수행한다.
예를 들어, 사용자가 휴머노이드 로봇 Apptronik Apollo 2에 다음과 같이 지시할 수 있다.
“물뿌리개를 아래쪽 선반에 있는 초록색 상자 안에 넣어라.”
로봇은 명령을 처리한 뒤 테이블까지 걸어가 물뿌리개를 집는다. 이후 선반 앞으로 이동하고 몸을 낮춘 뒤 물뿌리개를 지정된 상자에 넣는다. 이 과정은 단순히 여러 동작을 순서대로 재생하는 것이 아니다. 로봇은 목표와 주변 환경을 확인하면서 이동과 자세, 균형, 물체 조작을 하나의 작업으로 연결한다.
2. Gemini Robotics 2를 구성하는 세 가지 모델
구글 딥마인드는 Gemini Robotics 2 시스템을 세 가지 주요 모델로 구성했다.
1) Gemini Robotics 2
Gemini Robotics 2는 시각과 언어 입력을 실제 로봇의 동작으로 변환하는 시각 언어 행동 모델인 VLA 모델이다. 카메라를 통해 주변 환경을 보고 사용자의 언어 명령을 이해한 다음, 이를 관절과 모터를 제어하는 행동 명령으로 변환한다.
이 모델은 휴머노이드 로봇의 발부터 손가락까지 전신을 제어할 수 있다. 또한 양팔 로봇과 다섯 손가락 로봇 손, 일반적인 두 손가락 그리퍼 등 서로 다른 형태의 로봇 장치도 제어한다.
2) Gemini Robotics ER 2
Gemini Robotics ER 2는 로봇의 상위 추론과 작업 계획을 담당하는 체화 추론 모델이다. 체화 추론은 AI가 텍스트나 이미지 안에서만 추론하는 것이 아니라, 실제 물리적 환경과 로봇의 몸을 고려해 행동을 결정하는 능력을 의미한다.
이 모델은 사용자의 지시를 해석하고, 주변 환경을 관찰하며, 작업을 여러 단계로 나눈다. 이후 VLA 모델에 필요한 행동을 요청하고, 작업이 완료될 때까지 진행 상황을 추적한다. 또한 작업 도중 실패가 발생하면 문제를 인식하고 다른 방법을 선택해 다시 시도할 수도 있다.
3) Gemini Robotics On-Device 2
Gemini Robotics On-Device 2는 로봇 내부의 컴퓨팅 장치에서 직접 실행되도록 최적화된 경량 VLA 모델이다. 네트워크 연결이 불안정하거나 클라우드 서버와의 통신 지연을 허용하기 어려운 환경에서도 로봇이 독립적으로 동작할 수 있도록 설계됐다.
구글 딥마인드에 따르면 이 모델은 완전히 새로운 로봇 구조에도 수 시간 분량의 데이터만으로 빠르게 적응할 수 있다. 일반적으로 200개 미만의 학습 사례를 이용해 새로운 양팔 로봇에 적용할 수 있으며, 센서 구성이나 관절 자유도, 외형이 크게 다른 로봇에도 대응한다.
3. 손가락을 이용한 정밀한 물체 조작
로봇이 실제 가정이나 작업장에서 유용하게 사용되려면 단순히 물체를 집어 옮기는 것만으로는 부족하다. 봉투를 묶고, 지퍼백을 닫고, 전구를 돌리고, 작은 물체를 정해진 위치에 끼우는 정밀한 조작 능력이 필요하다.
Gemini Robotics 2는 Apollo 2 휴머노이드 로봇에 장착된 SharpaWave 로봇 손을 제어한다. 이 로봇 손은 다섯 개의 손가락과 22개의 자유도를 갖고 있다. 또한, Gemini Robotics 2는 이를 이용해 매듭 묶기, 쓰레기봉투 묶기, 지퍼백 닫기와 같은 복잡한 동작을 수행한다. 또한 Franka Duo 플랫폼에 장착된 일반적인 두 손가락 그리퍼를 이용해 도구를 분류하거나, 물체를 좁은 공간에 넣거나, 부품을 정확한 위치에 삽입하는 작업도 수행한다.
공개된 실험 결과에서 Franka Duo는 일반적인 물체 집기와 배치 작업에서 74.2%, 다양한 도구 구성 작업에서 78.9%, 정밀 삽입 작업에서 89.6%의 성공률을 기록했다.다만 사람 손과 유사한 다지형 로봇 손을 이용한 정밀 조작은 여전히 어려운 과제로 남아 있다. 전구 풀기에서는 높은 성능을 보였지만, 전구 끼우기와 봉투 묶기, 쓰레받기 사용, 지퍼백 닫기 등의 작업에서는 상대적으로 낮은 성공률이 나타났다.
4. 몇 분 동안 이어지는 장기 작업 수행
현실의 작업은 하나의 동작으로 끝나지 않는다. 방을 정리하는 작업만 하더라도 물체를 찾고, 위치를 판단하고, 집어 들고, 이동하고, 분류하고, 지정된 장소에 놓는 과정이 반복된다.
Gemini Robotics ER 2는 수 분 동안 이어지는 작업에서 수백 번의 결정을 내리며 작업 상태를 관리한다.이 모델은 작업이 언제 시작됐고 언제 완료됐는지 판단한다. 또한 물체를 집었거나, 문이 열렸거나, 특정 위치에 도착한 순간과 같은 핵심 사건을 식별한다. 작업의 한 단계가 실패하면 실패 사실을 감지하고 행동 계획을 수정한다. 이 구조를 통해 로봇은 처음 접하는 상황이나 새로운 목표에도 대응할 수 있다.
5. 여러 로봇이 하나의 팀으로 협업
Gemini Robotics 2에는 여러 로봇이 하나의 작업을 나눠 수행하는 멀티 로봇 협업 기능도 추가됐다. 서로 다른 형태와 능력을 가진 로봇은 작업 상태를 공유하고 역할을 분담한다.
예를 들어, 한 로봇이 바닥에 있는 물체를 수거하면 다른 로봇이 이를 정해진 위치로 운반할 수 있다. 한 대의 로봇이 혼자 처리하기 어려운 복잡한 작업도 여러 로봇이 협력해 수행할 수 있다.
이 구조는 멀티 에이전트 AI 시스템과 유사하다. Gemini Robotics ER 2가 상위 수준의 계획과 조정을 담당하고, 각 로봇에 연결된 VLA 모델이 실제 물리적 행동을 실행한다. 소프트웨어 에이전트들이 API와 도구를 나눠 사용하는 것처럼, 로봇 에이전트들은 각자의 신체와 센서, 작업 능력을 도구처럼 활용한다.
6. 새로운 로봇에 빠르게 적응하는 모션 전이
로봇 AI에서 가장 어려운 문제 중 하나는 특정 로봇에서 학습한 행동을 다른 로봇으로 이전하는 것이다. 로봇마다 팔의 길이와 관절 구조, 센서, 자유도, 카메라 위치가 다르기 때문이다.
Gemini Robotics On-Device 2는 여러 로봇 형태를 기본적으로 지원하는 멀티 임바디먼트 구조를 사용한다. 또한 이전 세대인 Gemini Robotics 1.5에서 개발한 모션 전이 기술을 적용한다.이를 통해 한 로봇에서 학습한 행동 표현을 새로운 로봇 구조에 맞게 변환할 수 있다. 구글 딥마인드는 Dexmate, SO101, Trossen 등 서로 다른 로봇 플랫폼에 이 모델을 적용해 다양한 작업을 수행하는 모습을 공개했다.
새로운 로봇에 적용하기 위해 처음부터 대규모 데이터를 다시 수집할 필요가 없다는 점은 로봇 AI의 실제 배포 비용을 크게 낮출 수 있는 요소다.
7. 클라우드 없이 로봇 내부에서 실행
많은 로봇 응용 환경에서는 인터넷 연결을 항상 보장할 수 없다. 공장이나 물류 창고, 재난 현장, 이동형 로봇에서는 네트워크 지연도 안전과 작업 성능에 영향을 준다.
Gemini Robotics On-Device 2는 로봇 장치 내부에서 직접 추론한다. 카메라 영상과 센서 데이터를 외부 서버로 전송하지 않고 로컬에서 처리할 수 있다.온디바이스 실행은 세 가지 측면에서 중요하다.
- 네트워크 왕복 시간이 제거돼 행동 응답 속도를 줄일 수 있다.
- 인터넷 연결이 끊겨도 로봇이 계속 작동할 수 있다.
- 카메라 영상과 작업 환경 정보가 외부로 전송되지 않으므로 데이터 보호 측면에서도 유리하다.
- 다만 구글 딥마인드는 온디바이스 모델의 구체적인 파라미터 수와 요구 하드웨어, 추론 지연 시간은 이번 발표에서 상세하게 공개하지 않았다.
8. 로봇의 상위 두뇌와 운동 제어 모델을 분리
Gemini Robotics 2의 구조는 상위 추론 모델과 하위 행동 모델을 분리한다는 점에서도 주목할 만하다. 또한, Gemini Robotics ER 2는 로봇의 상위 두뇌 역할을 한다. 사용자의 목표를 이해하고, 주변 상황을 분석하며, 작업 계획을 만들고, 실행 상태를 추적한다.
한편, Gemini Robotics 2 VLA 모델은 실제 운동 제어를 담당한다. 상위 모델이 “물뿌리개를 집어 선반 아래 상자에 넣는다”는 작업을 계획하면, VLA 모델은 걷기와 팔 이동, 손가락 제어, 균형 조절과 같은 연속적인 행동으로 변환한다.
이를 시스템 아키텍처로 단순화하면 다음과 같다.
사용자 명령 → Gemini Robotics ER 2의 환경 이해와 작업 계획 → Gemini Robotics 2 VLA의 행동 생성 → 로봇 모터와 관절 제어 → 카메라와 센서 피드백 → 진행 상태 확인 및 계획 수정
이 방식은 LLM 기반 에이전트 시스템에서 플래너와 실행기를 분리하는 구조와 유사하다.
9. 물리적 안전과 AI 안전을 결합
로봇은 실제 공간에서 움직이기 때문에 잘못된 판단이 물리적 사고로 이어질 수 있다. 구글 딥마인드는 Gemini Robotics 2에 기존의 물리적 안전장치와 AI 기반 안전 추론을 함께 적용했다고 설명했다.
새롭게 공개된 ASIMOV-Agentic 벤치마크는 로봇 에이전트의 안전한 작업 조정 능력과 불확실성 처리 능력을 평가한다. 예를 들어, VLA 모델이 위험한 도구 호출이나 행동을 제안했을 때, 체화 추론 모델이 이를 거부할 수 있는지 측정한다.
또한 로봇이 작업을 실제로 수행할 수 있는지 판단하고, 확신이 부족한 경우 사람에게 도움을 요청하는 능력도 평가한다. Gemini Robotics ER 2는 주변에 사람이 가까이 있는지 감지하고, 안전 도구를 호출하거나 로봇을 정지시킬 수 있다.
구글 딥마인드는 Gemini Robotics ER 2가 지금까지 개발한 자사 로봇 모델 가운데 안전 제약 준수와 사람 근접 상황 처리에서 가장 높은 성능을 보였다고 밝혔다.
10. Gemini Robotics 2가 의미하는 것
Gemini Robotics 2는 단순히 더 정교한 로봇 제어 모델을 공개한 것이 아니다.이번 발표가 보여주는 핵심 변화는 로봇 AI가 개별 동작을 학습하는 단계에서 다음과 같은 통합 지능으로 발전하고 있다는 점이다.
- 환경을 시각적으로 인식한다.
- 사람의 자연어 지시를 이해한다.
- 여러 단계의 작업 계획을 만든다.
- 전신과 손가락을 통합해 제어한다.
- 실패를 감지하고 행동을 수정한다.
- 서로 다른 로봇에 빠르게 적응한다.
- 여러 로봇과 작업을 나눠 수행한다.
- 네트워크 없이 로컬 장치에서도 작동한다.
특히 VLM 기반의 상위 추론 모델과 VLA 기반의 운동 제어 모델을 결합한 구조는 앞으로 범용 로봇 AI 플랫폼의 중요한 아키텍처가 될 가능성이 있다. 소프트웨어 AI 에이전트가 브라우저와 API, 데이터베이스를 도구로 사용하는 것처럼, 물리적 AI 에이전트는 로봇의 팔과 손, 다리, 센서를 도구로 사용한다. Gemini Robotics 2는 AI 에이전트가 디지털 공간을 넘어 현실 세계에서 직접 행동하는 단계로 이동하고 있음을 보여준다.
11. 아직 남아 있는 과제
이번 발표는 중요한 진전이지만 범용 휴머노이드 로봇이 완성됐다는 의미는 아니다.구글 딥마인드도 로봇의 이동 속도와 손가락 정밀도는 계속 개선해야 한다고 인정했다.
특히 다섯 손가락을 이용한 세밀한 조작은 작업별 성공률 편차가 크다. 새로운 환경과 물체, 예상하지 못한 사람의 행동에 얼마나 안정적으로 대응할 수 있는지도 실제 배포 과정에서 검증해야 한다.
온디바이스 모델의 컴퓨팅 요구량과 전력 소비, 실시간 추론 성능, 대규모 로봇 운영을 위한 비용 구조도 아직 공개되지 않았다. 따라서 Gemini Robotics 2는 완성된 범용 로봇이라기보다, 범용 물리 AI로 이동하는 과정에서 제시된 핵심 기술 플랫폼으로 보는 것이 적절하다.
12. 개발자 관점에서 주목할 부분
Gemini Robotics 2에서 개발자가 주목해야 할 부분은 로봇의 개별 동작보다 전체 시스템 구성이다.
- 상위 추론과 하위 행동 실행이 분리됐다.
- 작업은 단일 명령이 아니라 수백 번의 판단이 이어지는 에이전트 루프로 실행된다.
- 실패 감지와 재계획이 시스템에 포함됐다.
- 하나의 모델 체크포인트가 서로 다른 로봇 형태를 제어한다.
- 클라우드 모델과 온디바이스 모델을 함께 사용할 수 있다.
- 여러 로봇을 하나의 멀티 에이전트 시스템으로 조정한다.
결국 로봇 개발은 하드웨어 제어 코드를 작성하는 수준에서 벗어나고 있다. 앞으로의 로봇 플랫폼은 인식 모델, 추론 에이전트, 행동 정책, 안전 계층, 온디바이스 추론 엔진, 멀티 로봇 오케스트레이션을 하나의 시스템으로 통합하는 방향으로 발전할 가능성이 크다. Gemini Robotics 2는 구글 딥마인드가 말하는 물리적 세계의 범용 AI를 향한 중요한 단계다. 로봇은 이제 정해진 동작을 반복하는 자동화 장비에서 벗어나, 환경을 이해하고 계획을 세우며 다른 로봇 및 인간과 협력하는 물리적 AI 에이전트로 진화하고 있다.
댓글남기기