[Hacker News 요약] GPT-5.6, Claude, Gemini, Grok으로 모나리자 그리기: 생성형 AI의 시각적 창작 능력 비교
1
설명
2026년 7월 21일, TryAI는 GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 네 가지 최첨단 생성형 AI 모델을 대상으로 모나리자 및 스타리 나이트 재현, 그리고 다섯 가지 자유 형식 프롬프트 기반 그림 그리기를 수행했습니다.
각 모델은 동일한 색연필 도구 세트를 사용했으며, 캔버스에 직접 스트로크를 그리고, 문지르고, 지우는 과정을 반복하며 목표 이미지를 재현하거나 텍스트 설명을 기반으로 그림을 생성했습니다.
이번 실험은 모델의 시각적 창작 능력, 도구 사용 방식, 비용 효율성, 그리고 작업 과정에서의 개선 여부를 객관적으로 평가하는 데 중점을 두었습니다.
### 배경 설명
생성형 AI 모델의 발전은 텍스트 생성뿐만 아니라 이미지, 음악, 비디오 등 다양한 형태의 콘텐츠 창작으로 확장되고 있습니다. 특히, 복잡하고 미묘한 시각적 표현을 요구하는 그림 그리기는 AI의 창의성과 문제 해결 능력을 가늠할 수 있는 중요한 척도로 여겨집니다. TryAI는 이러한 AI 모델들의 실제적인 성능을 비교하고, 개발자 및 IT 전문가들에게 유용한 정보를 제공하기 위해 정기적으로 다양한 과제를 수행하고 있습니다. 이전의 음악 비디오 생성 실험에 이어, 이번에는 색연필이라는 물리적 도구를 모방한 가상 환경에서 AI 모델들이 얼마나 정교하고 창의적인 그림을 그려낼 수 있는지 탐구합니다.
이러한 비교 실험은 단순히 모델의 벤치마크 점수를 넘어, 실제 작업 환경에서 발생할 수 있는 비용, 시간, 그리고 결과물의 품질 간의 복잡한 상호작용을 이해하는 데 도움을 줍니다. 특히, 최첨단(frontier) 모델과 오픈 소스 모델 간의 격차를 파악하고, 특정 작업에 어떤 모델이 더 적합한지를 판단하는 데 중요한 근거를 제공합니다. 2026년 현재, 생성형 AI는 빠르게 발전하고 있으며, 이러한 실험은 AI 기술의 현재 위치와 미래 발전 방향을 조망하는 데 필수적입니다.
### 실험 설계 및 도구
이번 실험은 네 가지 생성형 AI 모델(GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash)을 대상으로 진행되었습니다. 각 모델은 동일한 색연필 도구 세트와 함께 다음과 같은 도구들을 활용했습니다: `plan` (계획 수립), `view_target` (목표 이미지 확인), `view_canvas` (현재 캔버스 확인 및 점수 산출), `set_color`/`set_brush`/`set_pressure` (색상, 팁 너비, 압력 설정), `draw` (스트로크 배치), `smudge` (블렌딩), `erase`/`clear_canvas` (지우기/캔버스 초기화). 실험은 두 가지 목표 이미지(모나리자, 스타리 나이트) 재현과 다섯 가지 텍스트 프롬프트 기반 그림 그리기로 구성되어 총 28개의 그림이 생성되었습니다. 모든 모델의 추론은 'high'로 설정되었습니다.
### 목표 이미지 재현 결과
목표 이미지 재현에서는 구조적 유사성(SSIM)과 제곱근 평균 제곱 오차(RMSE)를 기준으로 모델 성능을 평가했습니다. 모나리자 재현에서 Gemini 3.6 Flash가 0.449의 최고 SSIM 점수를 기록했으나, 최종 점수는 0.337로 하락하는 경향을 보였습니다. GPT-5.6 Sol은 0.352의 최고 SSIM을 기록한 후 0.325로 마무리했으며, Claude Fable 5는 0.289에서 0.286으로, Grok 4.5는 0.152에서 0.151로 소폭 하락했습니다. 스타리 나이트 재현에서도 Gemini 3.6 Flash가 0.190으로 가장 높은 최고 SSIM을 기록했으며, 최종적으로 0.172를 얻었습니다. GPT-5.6 Sol은 0.179에서 0.130으로, Claude Fable 5는 0.176에서 0.153으로, Grok 4.5는 0.039에서 0.039로 큰 변화 없이 마무리되었습니다. 전반적으로 Gemini 3.6 Flash가 가장 높은 최고 점수를 기록했으나, 최종 결과에서는 GPT-5.6 Sol이 더 안정적인 성능을 보였습니다.
### 프롬프트 기반 그림 결과 및 비용 분석
텍스트 프롬프트 기반 그림에서는 객관적인 점수 산출 없이 모델의 해석 능력과 창의성이 평가되었습니다. GPT-5.6 Sol은 특히 스타리 나이트와 장미 그림에서 뛰어난 디테일과 완성도를 보여주며 호평을 받았습니다. 반면, Grok 4.5는 전반적으로 사용 가능한 결과물을 거의 생성하지 못했으며, 시각적 결과물을 이해하거나 판단하는 데 신뢰하기 어렵다는 평가를 받았습니다. Gemini 3.6 Flash는 Grok 4.5보다 나은 성능을 보였지만, Claude Fable 5는 품질 면에서는 두 번째로 좋은 결과를 냈음에도 불구하고 비용과 시간 측면에서 가장 비효율적인 선택으로 나타났습니다. Claude Fable 5는 총 7개 그림에 대해 약 160달러를 기록하며 GPT-5.6 Sol(7.74달러), Grok 4.5(9.21달러), Gemini 3.6 Flash(12.87달러) 대비 약 20배 높은 비용을 지출했습니다. Grok 4.5는 가장 많은 토큰(34M)을 사용했지만, 캐시된 읽기 비율이 높아 비용은 낮게 유지되었습니다.
### 모델별 도구 사용 패턴 및 개선 여부
각 모델은 동일한 도구 세트를 사용했지만, 그 활용 방식은 매우 달랐습니다. GPT-5.6 Sol은 `set_color`, `set_brush`, `set_pressure` 도구를 한 번도 사용하지 않고 각 `draw` 호출 시 색상 등을 직접 설정했습니다. 반면, Grok 4.5는 65%의 도구 호출이 `set_color`/`set_brush`/`set_pressure`에 집중되어 평균 99단계의 높은 작업 단계를 보였습니다. Claude Fable 5는 `smudge` 도구를 빈번하게 사용하고 지속적으로 캔버스를 검토했으며, Gemini 3.6 Flash는 가장 많은 `view_canvas` 호출(그림당 약 23회)을 통해 캔버스를 검토했습니다. 흥미롭게도, 모델들은 종종 자신의 최고 성능 시점을 지난 후에도 계속해서 그림을 수정하는 경향을 보였습니다. 예를 들어, Gemini 3.6 Flash는 모나리자에서 0.449의 최고 SSIM을 달성했지만, 최종 결과는 0.337로 떨어졌습니다. 이는 더 많은 검토가 반드시 더 나은 최종 결과로 이어지지 않음을 시사합니다.
### 가치와 인사이트
이 실험은 생성형 AI 모델이 단순히 텍스트를 생성하는 것을 넘어, 복잡한 시각적 창작 작업에서도 상당한 능력을 발휘할 수 있음을 보여줍니다. 특히 GPT-5.6 Sol과 Gemini 3.6 Flash는 색연필이라는 제한된 도구로도 인상적인 결과물을 만들어냈습니다. 그러나 모델별로 도구 사용 방식, 비용 효율성, 그리고 작업 과정에서의 개선 패턴이 크게 다르다는 점은 주목할 만합니다. Claude Fable 5의 높은 비용과 시간 소모는 특정 작업에서 성능과 효율성 간의 트레이드오프가 중요함을 시사합니다. 또한, 모델들이 자신의 최적점을 지나쳐 작업을 계속하는 현상은 AI의 자기 평가 및 최적화 메커니즘에 대한 추가적인 연구 필요성을 제기합니다. 개발자들은 이러한 결과를 바탕으로 특정 애플리케이션에 가장 적합한 모델을 선택하고, 비용 및 성능 최적화 전략을 수립하는 데 도움을 받을 수 있습니다.
### 기술·메타
- 모델: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
- 도구: plan, view_target, view_canvas, set_color, set_brush, set_pressure, draw, smudge, erase, clear_canvas
- 평가 지표: SSIM (Structural Similarity Index Measure), RMSE (Root Mean Squared Error)
- 실험 날짜: 2026년 7월 21일
### 향후 전망
이번 실험에 참여한 Gemini 3.6 Flash 모델은 향후 Gemini 4와 같은 후속 버전에서 더욱 발전할 가능성이 높습니다. 또한, Kimi K3와 같은 오픈 소스 모델의 발전 추이도 주목해야 할 부분입니다. 생성형 AI 모델들은 지속적으로 발전하며, 앞으로는 더욱 정교하고 사실적인 그림뿐만 아니라, 사용자의 의도를 더 깊이 이해하고 창의적인 아이디어를 제안하는 방향으로 나아갈 것입니다. 경쟁은 더욱 치열해질 것이며, 각 모델은 특정 영역에서의 강점을 강화하거나 새로운 기능을 개발하여 차별화를 꾀할 것입니다. 커뮤니티의 피드백과 새로운 실험 과제들은 이러한 발전 방향을 결정하는 데 중요한 역할을 할 것입니다. 2026년 이후, AI 기반의 시각 예술 창작 도구는 더욱 보편화될 것으로 예상됩니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=48998404)
- 원문: [링크 열기](https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok)
---
출처: Hacker News · [원문 링크](https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok)
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.