[Techmeme 요약] 엔비디아 AVO, AI 에이전트 범용성 입증: ARC-AGI-3 벤치마크 100% 달성
1
설명
엔비디아(NVIDIA)가 개발한 범용 인공지능(AI) 에이전트 시스템 AVO가 ARC-AGI-3 벤치마크에서 100%의 점수를 달성했습니다. 이는 2026년 8월 21일에 발표된 연구 결과로, AI 에이전트의 성능이 단순히 언어 모델 자체의 능력뿐만 아니라 시스템 설계에 크게 좌우됨을 보여줍니다.
### 배경 설명
최근 인공지능(AI) 분야에서는 '에이전트(agent)'라는 개념이 중요해지고 있습니다. 에이전트는 단순히 정보를 생성하는 것을 넘어, 주어진 목표를 달성하기 위해 스스로 판단하고 행동하는 AI를 의미합니다. 특히 장시간에 걸쳐 복잡한 작업을 수행해야 하는 '장기 지속형(long-horizon)' 작업에서 에이전트의 성능은 매우 중요합니다.
이러한 에이전트 시스템을 구축하는 데에는 여러 기술적 과제가 있습니다. 예를 들어, AI 모델이 이전의 정보나 경험을 기억하고(persistent memory), 외부 도구를 활용하며(tool-use), 오류 발생 시 스스로 복구하고(recovery), 지속적으로 발전해나가는(sustained progress) 능력이 필요합니다. 엔비디아의 AVO(Agentic Variation Operators)는 이러한 과제를 해결하기 위해 개발된 범용 에이전트 아키텍처입니다.
AVO는 단순히 강력한 언어 모델(large language model, LLM)을 사용하는 것을 넘어, 모델을 둘러싼 '시스템(system)' 또는 '하네스(harness)'의 설계가 에이전트의 실제 성능을 결정한다는 점에 주목했습니다. 이는 마치 뛰어난 두뇌(LLM)를 가졌더라도, 그 두뇌를 효과적으로 활용할 수 있는 몸과 신경계(AVO 시스템)가 없다면 제 기능을 발휘하기 어려운 것과 같습니다.
### AVO, GPU 커널 최적화에서 성능 입증
AVO는 처음부터 복잡한 소프트웨어 엔지니어링 및 GPU(Graphics Processing Unit) 커널 최적화 작업에 적용되었습니다. 이 작업은 단순히 코드를 생성하는 것을 넘어, 기존 코드를 분석하고, 가설을 세우고, 변경을 실행하며, 하드웨어 기반 테스트를 통해 결과를 검증하고, 피드백을 해석하여 반복적으로 접근 방식을 수정하는 과정을 요구합니다. 엔비디아의 연구팀은 AVO를 사용하여 7일간 지속적으로 GPU 커널을 최적화한 결과, 500개 이상의 최적화 방향을 탐색하고 40개의 커널 버전을 생성했습니다. 이로 인해 NVIDIA DGX B200 시스템에서 기존의 cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 더 나은 성능을 달성했습니다. 이는 수동 개입 없이도 AVO가 생산적인 엔지니어링 루프를 지속할 수 있음을 보여줍니다.
### ARC-AGI-3 벤치마크에서 100% 달성
GPU 커널 최적화에서 성공을 거둔 AVO 아키텍처는 이후 완전히 다른 유형의 과제인 ARC-AGI-3 벤치마크에 적용되었습니다. ARC-AGI-3는 에이전트가 사전 정보나 규칙 없이 낯선 환경에 들어가 상호작용을 통해 규칙과 목표를 추론하고 효율적으로 행동해야 하는 대화형 추론 벤치마크입니다. 엔비디아의 AVO 시스템은 Claude Opus 5 모델을 기반으로 이 벤치마크의 25개 환경에서 183개의 모든 레벨을 완료하며 100.00 RHAE(Relative Human Action Efficiency) 점수를 기록했습니다. 이는 VISTA와 같은 기존 시스템보다 약 12% 적은 환경 액션을 사용한 결과입니다. 이 성과는 AVO의 범용성과 함께, 에이전트의 성능이 모델 자체의 능력뿐만 아니라 시스템 수준의 아키텍처 설계에 의해 크게 향상될 수 있음을 시사합니다.
### AVO의 핵심 메커니즘: 지속적인 메모리와 감독
AVO가 장기 지속형 작업을 성공적으로 수행할 수 있는 핵심 메커니즘은 '지속적인 메모리(persistent memory)'와 '감독(supervision)'입니다. 지속적인 메모리는 이전의 구현, 평가 결과, 추론 과정 등을 저장하여 에이전트가 매번 처음부터 다시 시작할 필요 없이 현재 상태에서 작업을 이어갈 수 있도록 합니다. 감독 기능은 에이전트의 전반적인 진행 상황을 모니터링하며, 작업이 정체되거나 비효율적인 경로로 진행될 경우 대안 전략으로 전환하도록 유도합니다. 이러한 메커니즘 덕분에 AVO는 단일 모델 호출을 넘어선 지속적인 자율 작업을 수행할 수 있습니다.
### 가치와 인사이트
엔비디아의 AVO 연구는 AI 에이전트의 성능이 단순히 최첨단 언어 모델(LLM)의 능력에만 의존하는 것이 아니라, 모델을 둘러싼 시스템 아키텍처의 설계가 얼마나 중요한지를 명확히 보여줍니다. AVO는 GPU 커널 최적화와 같은 전문적인 작업부터 ARC-AGI-3와 같은 복잡한 추론 작업까지, 서로 다른 환경에서 일관되게 높은 성능을 발휘하며 범용성을 입증했습니다. 이는 AI 에이전트 개발의 초점이 모델 자체에서 시스템 전체로 확장되고 있음을 시사합니다.
### 기술·메타
- **모델**: Claude Opus 5, GPT-5.6 Sol
- **벤치마크**: ARC-AGI-3 (25개 환경, 183개 레벨)
- **주요 기술**: Agentic Variation Operators (AVO), Persistent Memory, Supervision, Tool-use
- **하드웨어**: NVIDIA DGX B200
### 향후 전망
AVO와 같은 시스템 아키텍처의 발전은 AI 에이전트가 더욱 복잡하고 장기적인 작업을 자율적으로 수행할 수 있게 만들 것입니다. 이는 소프트웨어 개발, 과학 연구, 로봇 공학, 고객 서비스 등 다양한 산업 분야에서 생산성을 혁신적으로 향상시킬 잠재력을 가지고 있습니다. 예를 들어, AI 에이전트가 복잡한 코드를 작성하고 디버깅하며, 새로운 과학적 가설을 탐색하고 검증하거나, 복잡한 물리적 환경에서 작업을 수행하는 것이 가능해질 수 있습니다. 또한, 이러한 발전은 AI 에이전트의 신뢰성과 안전성에 대한 규제 논의를 더욱 촉진할 것입니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260821/p24#a260821p24)
- 원문 기사: [링크 열기](https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/)
---
출처: Techmeme ([Original Article](https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.