[Techmeme 요약] 구글 딥마인드, 여러 AI 모델 통합한 '제미나이 로보틱스 2' 공개…로봇 제어 능력 대폭 향상
0
설명
구글 딥마인드(Google DeepMind)가 여러 인공지능(AI) 모델을 하나로 통합한 '제미나이 로보틱스 2(Gemini Robotics 2)'를 2026년 7월 30일 공개했습니다.
이 새로운 시스템은 인간형 로봇을 포함한 다양한 로봇이 주변 환경을 인식하고 복잡한 작업을 수행하도록 제어할 수 있습니다.
이는 AI가 디지털 세계를 넘어 실제 물리적 세계에서 더욱 유용하게 활용될 가능성을 보여줍니다.
### 배경 설명
인공지능(AI) 기술은 챗봇이나 코딩 도구와 같은 디지털 영역에서 빠르게 발전해왔습니다. 하지만 AI의 잠재력을 완전히 실현하기 위해서는 물리적인 세계와 상호작용하는 능력이 중요해지고 있습니다. 특히 로봇 제어 분야는 AI가 실제 환경에서 유용한 작업을 수행하도록 만드는 핵심 과제입니다.
구글 딥마인드는 이러한 로봇 제어 분야에서 오랜 연구 경험을 가지고 있으며, AI를 활용하여 로봇이 유용한 작업을 수행하도록 훈련시키는 데 중요한 성과를 내왔습니다. 이번에 공개된 제미나이 로보틱스 2는 이러한 노력의 연장선상에 있으며, 여러 AI 모델을 하나의 시스템으로 통합하여 로봇의 인지 및 행동 능력을 크게 향상시키는 것을 목표로 합니다.
### 제미나이 로보틱스 2의 핵심 기능
제미나이 로보틱스 2는 여러 AI 모델을 단일 시스템으로 통합한 것이 특징입니다. 여기에는 이미지를 이해하고 사람과 소통하며 작업을 계획하는 비전 언어 모델(Vision Language Model, VLM)과, 로봇의 전신 움직임 및 그리퍼(gripper)나 손의 움직임을 제어하는 두 개의 비전 언어 액션(Vision Language Action, VLA) 모델이 포함됩니다. 이러한 통합을 통해 로봇은 주변 환경을 파악하고, 인간의 지시를 이해하며, 물리적인 공간에서 복잡한 작업을 자율적으로 수행할 수 있습니다. 시연 영상에서는 앱트로닉(Apptronik)의 아폴로 2(Apollo 2) 로봇이 제미나이 로보틱스 2를 통해 선반을 정리하는 등 정교한 작업을 수행하는 모습이 공개되었습니다.
### 로봇 훈련 방식과 기존 연구
제미나이 로보틱스 2는 인간의 원격 조작, 영상 예시, 그리고 시뮬레이션 등 다양한 방식을 혼합하여 훈련되었습니다. 이는 현재 AI 모델이 특정 훈련 없이는 광범위한 복잡한 작업을 수행하기 어렵기 때문입니다. 구글은 과거 보스턴 다이내믹스(Boston Dynamics)와 협력하여 로봇의 두뇌 역할을 하는 AI를 제공하는 등 로봇 분야에서 꾸준히 연구를 진행해왔습니다. 이는 구글이 AI의 미래를 디지털 영역에 국한하지 않고 물리적 세계로 확장하는 데 중점을 두고 있음을 보여줍니다.
### 안전 문제와 미래 전망
AI 모델이 로봇에 접근하여 실제 환경을 돌아다니고 물체를 조작할 수 있게 되면서 안전 문제가 더욱 중요해졌습니다. 과거 연구에서는 AI를 이용한 로봇 제어가 예상치 못한 위험한 행동을 유발할 수 있다는 점이 밝혀졌습니다. 구글 딥마인드는 이러한 안전 문제를 해결하기 위해 각 모델 계층에 안전 장치를 적용하는 다층적 접근 방식을 사용하고 있습니다. 또한, 여러 AI 시스템이 협력하여 로봇을 제어할 때 안전성을 측정하는 새로운 기준인 ASIMOV-Agentic을 도입했습니다. 구글 CEO 데미스 하사비스(Demis Hassabis)는 스마트폰의 안드로이드 운영체제처럼 다양한 로봇을 위한 AI 운영체제를 개발하는 것을 목표로 하고 있다고 밝혔습니다.
### 가치와 인사이트
제미나이 로보틱스 2의 출시는 AI가 단순한 정보 처리 도구를 넘어 물리적 세계에서 실질적인 작업을 수행하는 '물리적 범용 인공지능(Physical AGI)'으로 나아가는 중요한 단계입니다. 이는 로봇 공학 분야에서 AI의 역할을 재정의하고, 다양한 산업 분야에서 자동화 및 효율성 증대에 크게 기여할 잠재력을 가지고 있습니다. 다만, AI의 물리적 세계에서의 행동은 예측 불가능성과 잠재적 위험을 동반하므로, 안전성 확보가 최우선 과제가 될 것입니다.
### 기술·메타
- 비전 언어 모델 (Vision Language Model, VLM)
- 비전 언어 액션 (Vision Language Action, VLA) 모델
- ASIMOV-Agentic (AI 시스템 안전성 측정 벤치마크)
### 향후 전망
제미나이 로보틱스 2와 같은 기술의 발전은 물류, 제조, 의료, 가사 노동 등 다양한 분야에서 로봇의 활용 범위를 혁신적으로 확장할 것입니다. 인간형 로봇이 더욱 정교한 작업을 수행하게 되면서, 인간과 로봇이 협력하는 새로운 작업 환경이 조성될 수 있습니다. 또한, 구글이 구상하는 AI 운영체제는 다양한 제조사의 로봇들이 표준화된 방식으로 AI 시스템과 연동될 수 있는 기반을 마련할 수 있습니다. 이는 로봇 산업 전반의 생태계 변화를 가져올 수 있으며, 동시에 AI의 윤리적 사용과 안전 규제에 대한 논의를 더욱 심화시킬 것입니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260730/p33#a260730p33)
- 원문 기사: [링크 열기](https://www.wired.com/story/google-gemini-can-control-humanoid-robots/)
---
출처: Techmeme ([Original Article](https://www.wired.com/story/google-gemini-can-control-humanoid-robots/))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.