[Techmeme 요약] 구글 제미나이 4 아르곤, GPT-6 아스트라와 동등한 지능 지수 기록, 환각 현상 15%로 크게 개선
9
설명
2026년 9월 30일, 인공지능 분석 기업 Artificial Analysis는 구글의 새로운 대규모 언어 모델(LLM)인 제미나이 4 아르곤(Gemini 4 Argon)이 기존 최고 성능 모델인 GPT-6 아스트라(GPT-6 Astra)와 동일한 지능 지수(Intelligence Index)를 기록했다고 발표했습니다.
특히, 제미나이 4 아르곤은 환각 현상(hallucination) 발생률을 15%로 낮추며, 이는 GPT-6 아스트라의 51%보다 현저히 개선된 수치입니다.
이번 결과는 구글이 AI 연구 개발 분야에서 다시 한번 선두 그룹에 복귀했음을 시사하며, 향후 AI 모델의 신뢰성과 효율성에 대한 기대를 높이고 있습니다.
### 배경 설명
이번 발표의 핵심은 인공지능 모델의 '지능 지수'와 '환각 현상'입니다. 지능 지수는 AI 모델이 얼마나 똑똑하고 복잡한 작업을 수행할 수 있는지를 측정하는 지표로, Artificial Analysis에서 개발한 자체 평가 시스템을 통해 산출됩니다. GPT-6 아스트라(max)는 53점, 제미나이 4 아르곤(high) 역시 53점을 기록하며 동등한 성능을 보였습니다. 이는 구글의 이전 모델인 제미나이 3.1 프로 프리뷰(Gemini 3.1 Pro Preview)의 30점보다 크게 향상된 수치입니다.
환각 현상은 AI 모델이 사실이 아닌 정보를 마치 사실인 것처럼 생성하는 오류를 의미합니다. 이는 AI 서비스의 신뢰성을 저해하는 주요 요인 중 하나로, 제미나이 4 아르곤이 15%의 낮은 환각 현상률을 보인 것은 매우 고무적인 결과입니다. 반면, GPT-6 아스트라(max)는 51%의 환각 현상률을 기록했습니다. 또한, 제미나이 4 아르곤은 에이전트 기능(agentic capabilities)에서도 개선을 보여, 자동화 작업 수행 능력이 향상되었습니다.
### 제미나이 4 아르곤, GPT-6 아스트라와 동등한 지능 지수 달성
Artificial Analysis의 최신 평가에 따르면, 구글의 제미나이 4 아르곤(high)은 53점의 지능 지수를 기록하며 OpenAI의 GPT-6 아스트라(max)와 동일한 수준에 도달했습니다. 이는 2026년 9월 30일 기준으로, 구글이 AI 연구 분야에서 다시 한번 최상위권 경쟁력을 확보했음을 의미합니다. 또한, GPT-6.1 솔(GPT-6.1 Sol, max)의 52점보다 1점 앞서는 수치입니다. 이러한 성능 향상은 구글의 이전 비-플래시(non-Flash) 모델인 제미나이 3.1 프로 프리뷰(30점)와 비교했을 때 23점, 제미나이 3.8 플래시(Gemini 3.8 Flash, high)와 비교했을 때 12점 높은 결과입니다.
### 환각 현상 대폭 감소 및 에이전트 기능 강화
제미나이 4 아르곤의 가장 주목할 만한 개선점 중 하나는 환각 현상률의 감소입니다. AA-Omniscience 평가에서 15%의 환각 현상률을 기록하며, 이는 45점 이상의 지능 지수를 가진 모델 중 가장 낮은 수치입니다. GPT-6 아스트라(max)의 51%, GPT-6.1 솔(max)의 54%와 비교하면 매우 낮은 수치로, AI가 잘못된 정보를 생성할 가능성이 현저히 줄어들었음을 의미합니다. 또한, 에이전트 기능 평가에서도 강점을 보이며, AutomationBench-AA에서 78%의 성능을 기록하여 Claude Sonnet 5.5(max, 71%)를 앞섰습니다. Terminal Bench 4에서는 57%를 달성하며 이전 모델 대비 53%p 향상되었습니다.
### 가격 경쟁력 확보 및 향후 전망
현재 제미나이 4 아르곤은 50% 할인된 가격으로 제공되어, 지능 지수당 비용(Cost per Task)이 GPT-6 아스트라(max)의 60% 수준인 1.99달러입니다. 이는 7개월 만에 출시된 구글 딥마인드(Google DeepMind)의 첫 번째 플래시(Flash) 클래스 이상의 자체 모델로서, 가격 경쟁력까지 갖추었습니다. 다만, 할인 프로모션 종료 후에는 3.98달러로 인상될 예정입니다. 제미나이 4 아르곤은 현재 일부 사용자에게만 제공되고 있으며, 공개 출시는 아직 미정입니다. 100만 토큰(1M tokens)의 컨텍스트 창(Context Window)과 텍스트, 이미지, 비디오, 음성 입력을 지원하는 멀티모달(Multimodality) 기능을 갖추고 있습니다.
### 가치와 인사이트
구글 제미나이 4 아르곤의 등장은 AI 모델의 신뢰성과 효율성에 대한 새로운 기준을 제시합니다. 특히 낮은 환각 현상률은 AI가 생성하는 정보의 정확성을 중요시하는 다양한 산업 분야에서 즉각적인 활용 가능성을 높입니다. 또한, 가격 경쟁력까지 확보하면서 AI 기술의 대중화에도 기여할 것으로 보입니다. 이는 AI 기반 서비스 개발 및 도입을 고려하는 기업들에게 중요한 선택지가 될 것입니다.
### 기술·메타
- 모델명: Gemini 4 Argon (Google DeepMind)
- 경쟁 모델: GPT-6 Astra (OpenAI), GPT-6.1 Sol (OpenAI)
- 평가 기관: Artificial Analysis
- 평가 지표: Artificial Analysis Intelligence Index, Hallucination Rate, Agentic Capabilities
- 주요 성능: Intelligence Index 53점 (GPT-6 Astra와 동등), Hallucination Rate 15% (GPT-6 Astra 51% 대비 개선)
- 출시일: 2026년 9월 30일 (발표 기준)
- 특징: 1M tokens Context Window, Text/Image/Video/Speech Input, Long Decode Continuation 기능
### 향후 전망
제미나이 4 아르곤의 성공적인 출시는 AI 검색 엔진, 콘텐츠 생성, 고객 서비스 등 다양한 분야에서 AI의 활용 범위를 더욱 넓힐 것입니다. 낮은 환각 현상률은 의료, 법률, 금융과 같이 높은 정확성이 요구되는 분야에서 AI의 신뢰도를 높여, 해당 분야에서의 AI 도입을 가속화할 수 있습니다. 또한, 에이전트 기능의 강화는 복잡한 업무 자동화 및 개인 비서 서비스의 발전을 이끌 것으로 예상됩니다. 다만, 50% 할인 프로모션 종료 후 가격이 인상될 예정이므로, 장기적인 비용 효율성에 대한 고려가 필요합니다. 구글이 2026년 9월 30일 발표한 이 모델은 향후 AI 기술 발전의 중요한 이정표가 될 것입니다.
AI 모델의 성능 경쟁이 심화되면서, 사용자들은 이제 단순히 성능뿐만 아니라 환각 현상률, 비용 효율성, 특정 작업 수행 능력 등 다양한 요소를 종합적으로 고려하게 될 것입니다. 이는 AI 개발사들에게 더욱 정교하고 균형 잡힌 모델 개발을 요구하게 될 것입니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260930/p53#a260930p53)
- 원문 기사: [링크 열기](https://artificialanalysis.ai/articles/gemini-4-argon-google-top-three-labs)
---
출처: Techmeme ([Original Article](https://artificialanalysis.ai/articles/gemini-4-argon-google-top-three-labs))
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.