[Techmeme 요약] 딥시크 V4 플래시, AI 지능 지수 50점 달성하며 제미니 3.6 플래시와 동률 기록
0
설명
딥시크(DeepSeek)의 최신 인공지능 모델인 V4 플래시(V4 Flash)가 7월 31일 공개된 AI 지능 지수(Artificial Analysis Intelligence Index)에서 50점을 기록했습니다.
이는 지난 4월 출시된 이전 모델 대비 10점 상승한 수치이며, 구글의 제미니 3.6 플래시(Gemini 3.6 Flash)와 동일한 점수입니다.
이번 성과는 특히 비용 효율성 측면에서 주목받고 있습니다.
### 배경 설명
인공지능(AI) 모델의 성능을 평가하는 다양한 지표 중 'AI 지능 지수'는 모델의 전반적인 이해력, 추론 능력, 문제 해결 능력 등을 종합적으로 측정합니다. 딥시크 V4 플래시는 2840억 개의 전체 매개변수(parameter)를 가지며, 추론 시에는 130억 개의 활성 매개변수를 사용합니다. 이는 이전 모델인 딥시크 V4 플래시(40점)보다 크게 향상된 결과입니다.
또한, 딥시크는 API(Application Programming Interface)를 통해 모델을 제공하며, 이때 '캐시 히트(cache hit)' 할인율을 98%까지 적용하여 경쟁사 대비 약 60% 저렴한 비용으로 서비스를 제공합니다. 캐시 히트는 자주 요청되는 데이터를 미리 저장해두어 응답 속도를 높이고 비용을 절감하는 기술입니다. 이는 딥시크 V4 플래시가 GPT-5.6 루나(GPT-5.6 Luna)와 유사한 지능 수준을 보이면서도 훨씬 경제적인 선택지가 될 수 있음을 시사합니다.
### 딥시크 V4 플래시의 주요 성능 향상
딥시크 V4 플래시 0731 모델은 AI 지능 지수에서 50점을 획득하며, 이전 모델인 딥시크 V4 플래시(40점) 대비 10점 상승했습니다. 이는 GPT-5.6 루나(최대 51점)와 거의 동등한 수준이며, GLM-5.2(최대 51점)와도 1점 차이입니다. 또한, 최근 공개된 제미니 3.6 플래시(50점)와 같은 점수를 기록했습니다. 특히, 에이전트(agent) 기반의 실제 작업 수행 능력을 평가하는 GDPval-AA v2에서는 이전 모델의 Elo 점수 1189점에서 1559점으로 크게 향상되었습니다. 이는 향후 공개될 가중치(weights)가 공개될 경우, Kimi K3(최대 1687점)에 이어 두 번째로 높은 오픈 웨이트(open weight) 점수가 될 것으로 예상됩니다.
### 환각(Hallucination) 감소 및 정확도 유지
AA-옴니사이언스(AA-Omniscience) 지표에서 딥시크 V4 플래시 0731은 -16점을 기록하며 이전 모델 대비 7점 개선되었습니다. 이러한 향상은 모델의 정확도 자체의 상승보다는 '환각(hallucination)', 즉 AI가 사실이 아닌 정보를 생성하는 비율이 감소한 데 기인합니다. 환각 비율은 12%p 감소한 84%를 기록했으며, 이는 GPT-5.6 테라(최대 85%) 및 Mistral Medium 3.5(82%)와 유사한 수준입니다. 이는 AI 모델이 더 신뢰할 수 있는 정보를 생성하는 데 중요한 진전입니다.
### 다양한 평가 항목에서의 고른 성능 개선
AI 지능 지수의 개별 평가 항목에서도 딥시크 V4 플래시 0731은 전반적인 성능 향상을 보였습니다. CritPt 항목에서 9점 상승한 17%, SciCode에서 5점 상승한 50%, Humanity's Last Exam에서 5점 상승한 37%, AA-LCR에서 3점 상승한 66%, GPQA Diamond에서 1점 상승한 91%를 기록했습니다. 또한, AI 지능 지수를 실행하는 데 사용된 총 출력 토큰 사용량은 이전 모델 대비 12% 감소한 약 2억 6백만 개를 기록하여 효율성도 높였습니다.
### 가치와 인사이트
딥시크 V4 플래시의 AI 지능 지수 50점 달성은 최신 AI 모델 경쟁에서 딥시크의 입지를 강화하는 중요한 성과입니다. 특히, 높은 성능을 유지하면서도 경쟁사 대비 현저히 낮은 비용으로 서비스를 제공할 수 있다는 점은 AI 기술의 상용화와 접근성을 높이는 데 크게 기여할 것입니다. 이는 기업들이 AI 도입 시 고려하는 성능과 비용 사이의 균형점을 맞추는 데 중요한 역할을 할 것으로 보입니다.
### 기술·메타
* 모델명: DeepSeek V4 Flash 0731
* 총 매개변수: 284B
* 추론 시 활성 매개변수: 13B
* 컨텍스트 창: 1M 토큰
* AI 지능 지수: 50점 (2026년 7월 31일 기준)
* API 가격: 입력 1M 토큰당 $0.14, 출력 1M 토큰당 $0.28
* 캐시 히트 할인율: 98%
### 향후 전망
딥시크 V4 플래시의 성능 향상과 비용 효율성은 향후 AI 시장에 상당한 영향을 미칠 것으로 예상됩니다. 더 많은 기업들이 고성능 AI 모델을 경제적으로 활용할 수 있게 되면서, AI 기반 서비스의 개발 및 확산이 가속화될 것입니다. 특히, 에이전트 기능의 강화는 복잡한 업무 자동화 및 개인 맞춤형 서비스 제공에 새로운 가능성을 열어줄 것입니다.
또한, 딥시크가 모델의 전체 가중치를 공개할 예정이라는 점은 오픈 소스 AI 생태계에도 긍정적인 영향을 미칠 수 있습니다. 이는 연구자 및 개발자들이 모델을 더욱 깊이 이해하고 개선하는 데 기여할 수 있으며, AI 기술 발전의 전반적인 속도를 높일 수 있습니다. 다만, AI 모델의 성능 향상과 함께 환각 현상 감소 및 신뢰성 확보는 지속적인 과제가 될 것입니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260731/p22#a260731p22)
- 원문 기사: [링크 열기](https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash)
---
출처: Techmeme ([Original Article](https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.