[Hacker News 요약] AI 연구소, '펠리컨 자전거' 벤치마크에 최적화되었나? 실험으로 분석
1
설명
AI 연구소들이 유명한 '펠리컨 자전거' 생성 벤치마크에 모델을 최적화하는, 즉 '펠리컨맥싱(pelicanmaxxing)'을 하고 있는지에 대한 의문이 제기되었습니다.
2026년 7월 18일, Dylan Castillo는 7개의 최첨단 AI 모델을 대상으로 1,008개의 SVG 이미지를 생성하고 LLM 판정단으로 평가하는 실험을 수행했습니다.
실험 결과, AI 연구소들이 특정 벤치마크에 과도하게 집중했다는 명확한 증거는 발견되지 않았습니다.
### 배경 설명
AI 모델의 성능을 평가하는 데 있어 벤치마크는 중요한 역할을 합니다. 특히 생성형 AI 분야에서는 다양한 프롬프트에 대한 모델의 창의성, 정확성, 일관성을 측정하기 위한 비공식 벤치마크들이 등장하고 있습니다. 그중에서도 Simon Willison이 제안한 '펠리컨이 자전거를 타는 SVG 생성' 프롬프트는 AI 커뮤니티에서 널리 알려진 비공식 벤치마크가 되었습니다. 새로운 AI 모델이 출시될 때마다 이 프롬프트에 대한 결과가 종종 Hacker News에서 높은 호응을 얻으며, 이는 AI 연구소들이 이러한 유명 벤치마크에 모델을 최적화할 유인이 있음을 시사합니다. 수십억 달러 규모의 투자가 이루어지는 AI 산업에서, 특정 벤치마크에서의 우수한 결과는 사용자 확보와 투자 유치에 결정적인 영향을 미칠 수 있기 때문입니다. 이러한 배경에서 본 실험은 AI 연구소들이 '펠리컨맥싱'을 실제로 수행하고 있는지 객관적으로 검증하고자 합니다.
### 실험 설계 및 방법론
Dylan Castillo는 8가지 동물과 6가지 탈것을 조합한 총 48개의 프롬프트 그리드를 구성했으며, 유명한 '펠리컨 자전거' 프롬프트는 이 중 하나였습니다. 테스트에는 GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 등 7개의 최신 AI 모델이 사용되었습니다. 각 모델에 대해 3개의 샘플을 생성하여 총 1,008개의 SVG 이미지를 확보했습니다. 생성된 SVG는 PNG로 렌더링된 후, GPT-5.6 Luna를 이용한 3단계 평가 파이프라인을 거쳤습니다. 1단계에서는 동물, 탈것, 그리고 행동의 일관성에 대해 1~5점 척도로 평가했으며, 이를 종합한 '판정 점수(judge score)'를 산출했습니다. 2단계에서는 Gemini 3.1 Flash-Lite를 사용하여 이미지에서 인식된 동물, 탈것, 방향, 장면 요소 등을 추출하여 보다 상세한 분석을 수행했습니다. 이러한 과정을 통해 AI 연구소들이 특정 벤치마크에 최적화되었을 경우 나타날 수 있는 패턴, 즉 펠리컨이나 자전거의 묘사가 전반적인 성능보다 뛰어나거나 특정 조합에서 비정상적인 성능 향상을 보이는지를 검증하고자 했습니다.
### 실험 결과: 펠리컨, 자전거, 그리고 조합에 대한 평가
실험 결과, AI 연구소들이 '펠리컨 자전거' 벤치마크에 특별히 최적화되었다는 명확한 증거는 발견되지 않았습니다. 첫째, 펠리컨 자체의 묘사 능력은 8가지 동물 중 6위에 머물렀으며, 고양이, 고래, 너구리, 왜가리, 영양보다 낮은 평가를 받았습니다. 이는 펠리컨이 단순히 그리기 어려운 동물일 가능성도 있지만, 벤치마크에 집중했다면 펠리컨 묘사 능력이 상위권에 위치했을 것이라는 예상과는 다릅니다. 둘째, 자전거 묘사 능력은 6가지 탈것 중 5위로, 거의 마지막 순위에 가까웠습니다. 이는 자전거가 복잡한 구조를 가진 탈것이기 때문일 수 있으나, 벤치마크 최적화의 증거로는 보기 어렵습니다. 셋째, 가장 중요한 '펠리컨 자전거' 조합에 대한 평가 역시 48가지 조합 중 42위에 그쳤습니다. 회귀 분석을 통해 각 연구소의 펠리컨, 자전거, 그리고 특정 조합에 대한 편향된 성능 향상(boost)을 분석한 결과, 대부분의 효과는 통계적으로 유의미하지 않았습니다. Gemini 3.5 Flash만이 자전거 항목에서 약간의 유의미한 긍정적 효과를 보였으나, 이는 다중 비교 보정을 거치면 유의미성을 잃었습니다. 전반적으로, 특정 벤치마크에 대한 과도한 최적화보다는 각 모델의 일반적인 묘사 능력이 반영된 결과로 해석됩니다.
### 장면 구성 요소 분석 및 한계점
펠리컨 자전거 이미지의 일관성에 대한 추가 분석도 진행되었습니다. 흥미롭게도, 모든 21개의 펠리컨 자전거 이미지에서 펠리컨은 오른쪽을 향하고 있었습니다. 이는 다른 어떤 동물-탈것 조합에서도 나타나지 않는 현상이었습니다. 그러나 이는 펠리컨과 자전거 모두 측면에서 묘사하기 쉽다는 점, 그리고 실험 전반에 걸쳐 오른쪽을 향하는 경향이 강하게 나타난다는 점을 고려할 때, 벤치마크 최적화보다는 자연스러운 결과일 가능성이 높습니다. 장면 요소 분석에서도 펠리컨 자전거 조합에서 특별히 반복되는 요소는 발견되지 않았습니다. 본 실험의 한계점으로는 단일 LLM 판정단 사용으로 인한 평가의 일관성 문제, Google/DeepMind와 같이 SVG 생성 자체를 최적화하는 'SVG맥싱(SVGmaxxing)'을 탐지하기 어렵다는 점, 그리고 약 80달러의 예산 제약으로 인해 샘플 수와 모델 수가 제한적이었다는 점이 언급되었습니다. 이러한 한계점들은 결과 해석에 신중함을 요구합니다.
### 가치와 인사이트
본 연구는 AI 모델 개발에서 '벤치마크 최적화'라는 현상에 대한 실증적 분석을 제공합니다. 특히 널리 알려진 '펠리컨 자전거' 벤치마크를 대상으로 한 실험은, AI 연구소들이 단순히 유명한 벤치마크 점수를 높이기 위해 모델을 편향적으로 훈련시키는지에 대한 의문을 해소하는 데 기여합니다. 실험 결과는 AI 모델들이 특정 벤치마크에 과도하게 집중하기보다는, 전반적인 묘사 능력과 일반화 성능을 향상시키는 방향으로 발전하고 있음을 시사합니다. 이는 AI 모델의 실제 활용 가능성과 신뢰성을 평가하는 데 있어 중요한 통찰을 제공하며, 개발자들은 벤치마크 점수뿐만 아니라 모델의 일반적인 성능과 다양한 상황에서의 견고성을 함께 고려해야 함을 강조합니다. 또한, 'SVG맥싱'과 같은 다른 형태의 최적화 가능성을 제시하며, AI 모델 평가의 복잡성을 드러냅니다.
### 기술·메타
- 모델: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro, GPT-5.6 Luna, Gemini 3.1 Flash-Lite
- 도구: OpenRouter, Python, Github
- 실험일: 2026년 7월 18일 (발표일 기준)
### 향후 전망
본 실험은 '펠리컨맥싱'에 대한 명확한 증거를 찾지 못했지만, AI 연구소들이 벤치마크에 대한 최적화 노력을 완전히 배제한다고 단정하기는 어렵습니다. 특히 Google/DeepMind와 같은 일부 연구소들이 공개적으로 'SVG맥싱'과 같은 일반적인 생성 최적화를 수행하고 있다는 점은 주목할 만합니다. 앞으로 AI 모델의 발전은 더욱 다양한 벤치마크와 실제 사용 사례를 포괄하는 방향으로 나아갈 것입니다. 경쟁이 치열해짐에 따라, 연구소들은 단순히 특정 벤치마크 점수를 높이는 것을 넘어, 모델의 창의성, 안전성, 효율성 등 다각적인 측면에서의 성능 향상에 집중할 것으로 예상됩니다. 또한, 커뮤니티의 피드백과 새로운 평가 방법론의 개발은 AI 모델의 진정한 성능을 측정하고 발전시키는 데 중요한 역할을 할 것입니다. '펠리컨 자전거'와 같은 비공식 벤치마크는 AI의 발전 과정을 흥미롭게 보여주는 지표로 계속 활용될 수 있습니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49010129)
- 원문: [링크 열기](https://dylancastillo.co/posts/pelicanmaxxing.html)
---
출처: Hacker News · [원문 링크](https://dylancastillo.co/posts/pelicanmaxxing.html)
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.