[Hacker News 요약] GPT-6 Astra, 로봇 팔 제어에서 Fable 5.1 대비 성능 향상
49
설명
OpenAI의 GPT-6 Astra가 로봇 팔을 이용한 조작 작업에서 이전 모델인 Claude Fable 5.1 대비 상당한 성능 향상을 보였습니다.
2026년 9월 4일 공개된 이 연구는 동일한 YAM 로봇 팔과 Inspect Robots 에이전트 정책을 사용하여 두 가지 과제를 수행했습니다.
GPT-6 Astra는 '빨간 블록을 테이블에서 집어 그릇에 넣기' 과제에서 Fable 5.1보다 훨씬 높은 성공률과 빠른 처리 속도를 기록했습니다.
### 배경 설명
생성형 AI 모델이 물리적 세계와 상호작용하는 로봇 공학 분야에서의 적용 가능성은 지속적으로 탐구되고 있습니다. 특히, 복잡한 조작 작업을 수행하기 위해 LLM(거대 언어 모델)을 로봇 제어에 통합하는 연구는 최근 몇 년간 활발히 진행되어 왔습니다. 이러한 맥락에서 OpenAI의 GPT-6 Astra와 Anthropic의 Claude Fable 시리즈는 로봇 팔 제어 성능을 비교 평가하는 데 중요한 지표로 사용됩니다. 본 연구는 2026년 9월 4일에 공개되었으며, 이전 연구에서 비교되었던 Fable 5와 Fable 5.1의 성능을 기반으로 GPT-6 Astra의 능력을 평가합니다. 로봇 팔의 정밀한 움직임 제어, 객체 인식 및 조작, 그리고 작업 완료까지의 효율성은 AI 모델의 실제 적용 가능성을 가늠하는 핵심 요소입니다. 특히, 일상생활이나 산업 현장에서 로봇이 수행해야 하는 다양한 과제들을 얼마나 정확하고 신속하게 처리할 수 있는지가 중요한 관심사입니다.
### 블록을 그릇에 넣기 과제에서의 성능 비교
GPT-6 Astra는 '빨간 블록을 테이블에서 집어 그릇에 넣기' 과제에서 20번의 시도 중 19번(95%) 성공했습니다. 이는 Fable 5.1의 20번 중 8번(40%) 성공, Fable 5의 20번 중 1번(5%) 성공에 비해 월등히 높은 수치입니다. 또한, Astra는 평균 2.5분 만에 작업을 완료하여 Fable 5.1의 6.8분보다 훨씬 빨랐습니다. 비용 측면에서도 Astra는 시도당 약 0.94달러로, Fable 5.1의 2.12달러보다 저렴했습니다. 각 시도는 인간 평가자에 의해 최고 단계별로 채점되었으며, Astra는 거의 모든 시도에서 최종 단계(3단계: 물체를 최종 위치에 놓기)에 도달했습니다.
### 퍼즐 조각을 홈에 넣기 과제에서의 성능
반면, '둥근 파란색 퍼즐 조각을 중앙의 손잡이를 잡고 보드에 맞는 원형 홈에 넣기' 과제에서는 두 모델 간의 성능 차이가 줄어들었습니다. GPT-6 Astra는 20번의 시도 중 2번(10%) 성공했으며, Fable 5.1 역시 2번(10%) 성공했습니다. 두 모델 모두 홈에 도달하지만 마지막 단계에서 멈추는 동일한 문제를 보였습니다. 이 과제에서 Astra는 시도당 약 1.36달러의 비용이 들었고, Fable 5.1은 2.18달러였습니다. Astra는 이 과제에서 Fable 5.1과 동일한 성공률을 보였지만, 처리 시간은 3.4분으로 Fable 5.1의 5.9분보다 빨랐습니다.
### 평가 방법론 및 기술 사양
본 연구는 6-DoF(자유도)를 가진 Bimanual I2RT YAM 로봇 팔과 병렬 턱 그리퍼를 사용했습니다. 로봇의 제어는 각 팔의 엔드-이펙터 절대 자세(x, y, z, 요, 피치, 롤)와 그리퍼를 통해 이루어졌으며, IK(역기구학)가 자세를 관절 각도로 변환했습니다. 관찰은 상단, 왼쪽 손목, 오른쪽 손목의 세 가지 카메라 뷰와 고유 감각 상태를 활용했습니다. 정책 에이전트는 중간 수준의 사고 노력, 20번의 LLM 호출 예산, 25% 속도 제한, 기본 안전 가드레일을 적용했습니다. 비교 대상 모델은 GPT-6 Astra, Claude Fable 5, Claude Fable 5.1이며, Inspect Robots 0.58.0 버전을 사용했습니다. 각 모델당 각 과제에 대해 20회의 시도가 수행되었습니다. 토큰 수는 요청 및 응답 토큰을 기준으로 하며, 비용은 모델별 정가 기준입니다.
### 가치와 인사이트
GPT-6 Astra는 특히 블록을 그릇에 넣는 것과 같이 비교적 단순하고 명확한 목표를 가진 조작 작업에서 Fable 5.1 대비 뛰어난 성능을 입증했습니다. 이는 더 높은 성공률, 더 빠른 처리 시간, 그리고 더 낮은 비용으로 이어져 실제 로봇 시스템의 효율성을 크게 향상시킬 수 있음을 시사합니다. 그러나 퍼즐 조각을 홈에 넣는 것과 같이 더 미묘하고 정밀한 조작이 요구되는 작업에서는 여전히 한계가 드러났습니다. 이는 현재 LLM 기반 로봇 제어 시스템이 복잡하거나 예측 불가능한 환경에서의 섬세한 물리적 상호작용에 대한 추가적인 개선이 필요함을 보여줍니다. 실무적으로는, 특정 작업에 대한 AI 모델의 선택이 성능 및 비용 효율성에 직접적인 영향을 미칠 수 있음을 의미합니다.
### 기술·메타
- 모델: GPT-6 Astra, Claude Fable 5, Claude Fable 5.1
- 로봇 팔: Bimanual I2RT YAM arms (6-DoF per arm)
- 그리퍼: Parallel-jaw grippers
- 제어: Absolute end-effector poses (move_to)
- 관찰: 3 camera views (top, left wrist, right wrist) + proprioceptive state
- 정책: Inspect Robots 0.58.0, medium thinking effort, 20-LLM-call budget, 25% speed cap
- 비용: $10 / $50 per million input / output tokens (list price)
### 향후 전망
GPT-6 Astra의 이번 결과는 로봇 공학 분야에서 LLM의 잠재력을 다시 한번 보여줍니다. 향후 경쟁은 더욱 치열해질 것으로 예상되며, OpenAI와 Anthropic은 물론 다른 AI 연구 기관들도 더 정교하고 범용적인 로봇 제어 모델 개발에 집중할 것입니다. 특히, 퍼즐 과제에서 나타난 한계를 극복하기 위해 더 나은 공간 인지 능력, 미세 조작 기술, 그리고 오류 복구 메커니즘을 갖춘 모델이 등장할 가능성이 높습니다. 또한, 이러한 모델들이 실제 산업 현장이나 가정 환경에 통합되기 위해서는 안전성, 신뢰성, 그리고 사용자 친화적인 인터페이스 개발이 중요해질 것입니다. 커뮤니티는 이러한 연구 결과를 바탕으로 새로운 벤치마크를 설정하고, 오픈 소스 도구를 개발하며, 협력적인 연구를 통해 기술 발전을 가속화할 것입니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49582582)
- 원문: [링크 열기](https://openai.robocurve.org/gpt-6-astra/)
---
출처: Hacker News · [원문 링크](https://openai.robocurve.org/gpt-6-astra/)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.