[Techmeme 요약] Skild AI, 단 한 번의 영상 시연으로 새로운 로봇 작업 학습하는 'S1' 공개
0
설명
Skild AI가 'S1'이라는 새로운 로봇 기초 모델(foundation model)을 공개했습니다. 이 모델은 사전 학습 과정에서 한 번도 보지 못한 작업도 단 한 번의 영상 시연만으로 학습할 수 있습니다. 이는 기존 로봇 학습 방식의 한계를 극복하고, 로봇이 인간처럼 새로운 작업을 빠르게 배우는 시대를 열 것으로 기대됩니다.
### 배경 설명
기존의 로봇 학습 방식은 마치 초기 언어 모델인 BERT(Devlin et al., 2019)와 유사했습니다. 새로운 작업을 수행하려면 많은 양의 데이터를 수집하고 모델을 별도로 미세 조정(fine-tuning)해야 했습니다. 하지만 ChatGPT와 같은 최신 언어 모델은 '인컨텍스트 학습(in-context learning, ICL)'이라는 새로운 학습 패러다임을 통해, 별도의 미세 조정 없이도 프롬프트(prompt)만으로 새로운 개념을 이해하고 응답할 수 있게 되었습니다.
로봇 분야는 아직 BERT 시대에 머물러 있었습니다. 복잡한 작업을 수행하기 위해서는 수십에서 수백 시간의 데이터와 미세 조정이 필요했습니다. Skild AI는 이러한 방식의 비효율성을 지적하며, 언어 모델처럼 로봇도 단 한 번의 시연만으로 새로운 작업을 배울 수 있어야 한다고 주장합니다. S1은 이러한 '인컨텍스트 학습'을 로봇 분야에 적용한 첫 번째 사례입니다.
### S1: 로봇을 위한 인컨텍스트 학습
S1은 원하는 작업의 영상 시연을 입력받아 로봇의 행동으로 변환하는 방식으로 작동합니다. 다양한 작업에 대한 사전 학습을 통해, S1은 영상 시연에서 작업자의 의도를 파악하고 새로운 작업을 수행하는 능력을 갖추게 됩니다. 이는 NVIDIA AI 인프라를 기반으로 구축되었으며, 방대한 로봇 데이터셋을 활용하여 훈련되었습니다. S1은 언어 모델의 인컨텍스트 학습처럼, 별도의 미세 조정 없이도 새로운 작업을 학습할 수 있습니다.
### 인컨텍스트 학습이 로봇에게 중요한 이유
언어 모델과 마찬가지로, 로봇에게도 인컨텍스트 학습은 중요합니다. 특히 복잡하고 섬세하며 장시간이 소요되는 작업의 경우, 언어 설명만으로는 부족하며 시연이 필수적입니다. S1은 사전 학습 과정에서 보지 못했던 작업(out-of-distribution tasks)과 10분까지 이어지는 장시간 작업(long-horizon tasks)에서도 인컨텍스트 학습 능력을 보여주었습니다. 이는 기존의 로봇 학습 방식으로는 달성하기 어려웠던 성과입니다.
### S1의 데이터 엔진: 다양성과 규모의 중요성
고품질 데이터는 모든 기초 모델의 핵심입니다. 로봇 분야에서는 하드웨어 근접성, 다양성, 확장성이라는 세 가지 축을 모두 만족시키는 단일 데이터 소스를 찾기 어렵습니다. Skild AI는 이러한 한계를 극복하기 위해 텔레오퍼레이션(teleoperation), 인간의 시점에서 촬영된 영상(egocentric video), 시뮬레이션(simulation) 등 다양한 데이터 소스를 자체적으로 수집하고 활용하고 있습니다. 이러한 데이터 엔진은 S1의 강력한 인컨텍스트 학습 능력을 뒷받침합니다.
### S1의 실제 작업 수행 능력
S1은 사전 학습 과정에서 보지 못했던 식물 심기, 팬케이크 요리, 커피 내리기, 키트 조립 등 최대 10분 길이의 복잡한 작업을 단 한 번의 영상 시연만으로 성공적으로 수행했습니다. 이는 수십 단계의 조작을 포함하며, S1이 새로운 기술을 조합하고 예상치 못한 행동을 수행하는 능력을 보여줍니다. 식물 심기 작업의 경우, 시연 영상 촬영부터 자율 실행까지 단 11분밖에 걸리지 않았습니다.
### 인컨텍스트 학습과 언어 프롬프팅 비교
S1의 인컨텍스트 학습 방식은 기존의 언어 프롬프팅 방식과 비교했을 때, 특히 학습 데이터 규모가 커질수록 성능 차이가 두드러집니다. 사전 학습 데이터 내에 존재하는 작업(seen tasks)에서는 초기에는 언어 프롬프팅이 약간 우세했지만, 데이터 규모가 증가함에 따라 인컨텍스트 학습이 더 효율적인 성능을 보였습니다. 특히, 사전 학습 과정에서 보지 못했던 작업(unseen tasks)에서는 인컨텍스트 학습이 언어 프롬프팅보다 훨씬 뛰어난 성능을 나타냈습니다. 이는 새로운 기술 학습과 복잡한 작업 구성에서 인컨텍스트 학습의 강점을 보여줍니다.
### S1의 비상 능력: 강건성, 상식, 오류 복구
S1은 단순히 작업을 수행하는 것을 넘어, 다양한 비상 능력을 보여줍니다. 작업 중 발생하는 예상치 못한 상황(perturbations)에도 작업을 성공적으로 완료하며, 실수를 했을 때 이를 인지하고 다시 시도하는 오류 복구 능력도 갖추고 있습니다. 또한, 물이 담긴 컵을 사용하거나 이미 차 있는 잔에 커피를 조금만 따르는 등 상식적인 물리적 이해를 바탕으로 행동합니다. 심지어 잘못된 시연을 보고도 목표를 달성하기 위해 더 나은 방법을 찾아 수행하기도 합니다.
### 가치와 인사이트
Skild AI의 S1은 로봇이 새로운 작업을 학습하는 방식에 혁신을 가져올 잠재력을 지니고 있습니다. 단 한 번의 영상 시연으로 복잡하고 장시간이 소요되는 작업까지 학습할 수 있다는 점은, 로봇의 실제 적용 범위를 크게 확장시킬 것입니다. 이는 기존의 데이터 수집 및 미세 조정에 드는 막대한 시간과 비용을 절감하고, 로봇이 인간처럼 유연하고 빠르게 새로운 환경에 적응할 수 있도록 할 것입니다.
### 향후 전망
S1과 같은 인컨텍스트 학습 기반 로봇은 미래의 산업 현장, 가정, 서비스 분야 등 다양한 곳에서 활용될 것입니다. 예를 들어, 공장에서는 새로운 제품 조립 라인에 로봇을 투입할 때 복잡한 프로그래밍 없이 영상 시연만으로 즉시 작업이 가능해질 것입니다. 가정에서는 가사 도우미 로봇이 새로운 요리법을 영상으로 보고 바로 따라 할 수 있게 될 것입니다. 또한, 의료, 물류, 탐사 등 인간이 접근하기 어려운 위험한 환경에서도 로봇의 활용도가 높아질 것으로 예상됩니다. 이는 로봇과 인간의 협업 방식을 근본적으로 변화시키고, 로봇 기술의 대중화를 가속화할 것입니다. 규제 측면에서는 로봇의 자율성과 안전성에 대한 새로운 논의가 필요할 수 있습니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260825/p41#a260825p41)
- 원문 기사: [링크 열기](https://www.skild.ai/blogs/s1)
---
출처: Techmeme ([Original Article](https://www.skild.ai/blogs/s1))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.