[Hacker News 요약] Fable 5, GPT-5.6 Sol NP-난해 문제 비교: /goal 모드의 효과 분석 (2026년 7월 17일)
9
설명
2026년 7월 17일, Charles Azam은 Fable 5와 GPT-5.6 Sol 모델을 대상으로 NP-난해 최적화 문제에 대한 /goal 모드의 효과를 비교 분석한 결과를 발표했습니다.
이 실험은 두 모델이 동일한 섬유망 설계 문제를 해결하는 과정에서 /goal 모드가 성능에 미치는 영향을 측정했으며, Fable 5는 전반적으로 우수한 성능을 보였습니다.
분석 결과, /goal 모드는 특정 상황에서 이점을 제공하지만, 항상 최적의 결과를 보장하지는 않으며 때로는 성능 저하를 야기할 수 있음을 시사합니다.
### 배경 설명
본 연구는 인공지능 모델이 복잡한 최적화 문제를 해결하는 능력을 평가하는 데 중점을 둡니다. 특히, NP-난해 문제와 같이 계산적으로 매우 어려운 문제에 대한 모델의 성능은 AI 기술 발전의 중요한 척도가 됩니다. Charles Azam은 2018년 공학도로서 직접 개발했던 섬유망 설계 문제(KIRO)를 벤치마크로 사용하여, 최신 대규모 언어 모델(LLM)인 Fable 5와 GPT-5.6 Sol의 성능을 비교했습니다.
이 문제는 주어진 지역(그르노블, 니스, 파리)의 분배 허브와 단말기를 연결하여 총 케이블 길이를 최소화하는 것을 목표로 합니다. 문제의 복잡성은 가능한 연결 구성의 방대한 탐색 공간에서 비롯되며, 단순한 파리 지역만 고려해도 10^1223 이상의 경우의 수가 존재할 수 있습니다. 이러한 NP-난해 문제는 전통적인 알고리즘으로는 효율적으로 해결하기 어렵기 때문에, LLM의 추론 및 문제 해결 능력을 평가하는 데 적합합니다.
이번 실험은 특히 LLM에서 제공하는 '목표 지정(goal)' 기능의 효과에 주목했습니다. /goal 모드는 모델이 특정 목표를 달성하기 위해 더 적극적으로 탐색하도록 유도하는 기능으로 알려져 있습니다. 하지만 이 기능이 실제로 복잡한 최적화 문제에서 항상 긍정적인 영향을 미치는지는 명확하지 않았으며, 본 연구는 이 점을 실증적으로 검증하고자 했습니다. Fable 5와 GPT-5.6 Sol은 각각 Anthropic과 OpenAI의 최신 모델 라인업에 속하며, 이들의 성능 비교는 해당 모델들의 현재 역량을 가늠하는 중요한 지표가 됩니다.
### 실험 설계 및 방법론
실험은 Fable 5 (Opus 4.8, Sonnet 5)와 GPT-5.6 Sol (Terra, Luna) 모델을 대상으로 진행되었습니다. 각 모델은 30분 동안 NP-난해 최적화 문제인 KIRO를 해결하도록 설정되었습니다. 실험은 두 가지 모드로 진행되었는데, 하나는 일반적인(Plain) 모드이고 다른 하나는 /goal 모드를 활성화한 상태입니다. 각 모델 쌍에 대해 세 번의 일치하는(matched) 실행을 수행하여 결과를 비교했습니다. 최적화 예산은 30분으로 설정되었으며, 외부 에이전트 타임아웃은 1,900초로 제한되었습니다. 모든 실험은 Harbor 0.1.43 환경에서 Docker를 사용하여 재현 가능하게 수행되었습니다. 코드, 프롬프트, 결과 테이블 등 모든 관련 자료는 CLIArena에서 공개되었습니다.
### 실험 결과 분석
총 6번의 일치하는 실행 결과, /goal 모드는 4번의 시도에서 더 나은 결과를 도출하여 겉보기에는 유용한 기능으로 보였습니다. 그러나 평균 성능을 분석한 결과는 달랐습니다. Fable 5의 경우, 일반 모드 평균 점수는 32,386점이었으나 /goal 모드에서는 33,145점으로 오히려 악화되었습니다. GPT-5.6 Sol 역시 일반 모드 평균 34,261점에서 /goal 모드 35,129점으로 성능이 저하되었습니다. 이는 /goal 모드가 대부분의 개별 실행에서는 이점을 제공했지만, 일부 실행에서는 상당한 성능 저하를 야기하여 전체 평균 성능을 떨어뜨렸기 때문입니다. 특히 Fable 5는 일반 모드에서 319점 범위 내에서 일관된 결과를 보인 반면, GPT-5.6 Sol은 1,958점의 넓은 범위를 보였습니다. Fable 5는 /goal 모드 없이도 GPT-5.6 Sol보다 우수한 성능을 일관되게 보여주었습니다.
### /goal 명령어의 내부 작동 방식 차이
Claude Code와 Codex CLI는 모두 /goal 기능을 제공하지만, 그 구현 방식에는 근본적인 차이가 있습니다. Claude Code는 /goal을 세션 범위의 'Stop hook'으로 구현합니다. 각 메인 모델 턴 이후, Haiku와 같은 소형 평가 모델이 대화 내용을 읽고 목표 달성 여부를 판단하여 'yes' 또는 'no'를 반환합니다. 이 평가 모델은 도구나 파일에 접근할 수 없으며, 오직 대화 기록만을 기반으로 판단합니다. 반면, Codex CLI (버전 0.144.4)는 /goal을 지속적인 스레드 상태(persisted thread state)로 처리합니다. TUI는 목표를 저장하고 SQLite는 상태 및 예산 정보를 관리합니다. Codex는 작업 모델이 목표 달성 여부를 선언하도록 허용하며, 지속적인 목표 상태를 유지하면서 작업을 재개할 수 있습니다. Claude의 평가자는 독립적이지만 대화 기록만 볼 수 있는 반면, Codex는 파일과 도구를 볼 수 있지만 스스로의 작업을 평가하는 것에 가깝습니다.
### /goal 모드의 양면성: 성공과 실패의 원인
/goal 모드가 대부분의 실행에서 승리하고도 평균 성능을 악화시키는 이유는 최적화 문제의 특성 때문입니다. 일반적인 코딩 작업과 달리, 최적화 문제에서는 에이전트가 특정 솔버를 선택한 후 추가 시간이 좋은 결정이든 나쁜 결정이든 그 결과만을 증폭시킬 수 있습니다. 본 실험에서도 /goal 모드는 Fable 5의 빠른 컴파일 포트폴리오나 Sol의 성공적인 체인 재분배를 지속시키는 데 도움이 되었지만, Fable 5가 느린 솔버를 구축하거나 Sol이 철저한 앵커 스윕에 전념하는 경우 오히려 성능을 저하시켰습니다. 즉, /goal 모드는 탐색 경로를 변경하여 때로는 더 나은 해를 찾을 수 있지만, 때로는 잘못된 아이디어에 더 많은 시간을 할애하게 만들어 성능을 악화시킬 수 있습니다. 따라서 /goal 모드는 '더 열심히 시도하라'는 일반적인 스위치가 아니라, 제어 루프와 탐색 경로를 근본적으로 변경하는 기능으로 이해해야 합니다.
### 가치와 인사이트
본 연구는 LLM의 /goal 모드가 복잡한 NP-난해 최적화 문제에서 항상 성능 향상을 보장하지 않으며, 오히려 평균 성능을 저하시킬 수 있다는 중요한 시사점을 제공합니다. Fable 5와 GPT-5.6 Sol을 대상으로 한 실험에서 /goal 모드는 개별 실행에서는 승률을 높였지만, 전체 평균 점수는 악화시키는 결과를 낳았습니다. 이는 최적화 문제의 특성상, 탐색 경로의 변경이 때로는 더 나은 결과를 가져오지만 때로는 잘못된 방향으로 더 깊이 파고들게 만들 수 있기 때문입니다. Fable 5는 /goal 모드 없이도 GPT-5.6 Sol보다 일관되고 우수한 성능을 보여주었으며, 이는 모델 자체의 순수한 지능과 문제 해결 능력이 /goal과 같은 보조 기능보다 더 중요할 수 있음을 시사합니다. 개발자는 /goal 모드를 사용할 때, 해당 기능이 문제 해결 과정에 미치는 잠재적 영향과 위험을 신중하게 고려해야 합니다. 특히, 최적화 문제에서는 탐색의 질뿐만 아니라 탐색 과정에서 유지되는 상태와 결정의 질이 중요함을 인지해야 합니다.
### 기술·메타
- 모델: Claude Fable 5 (Opus 4.8, Sonnet 5), GPT-5.6 Sol (Terra, Luna)
- 실험 환경: Harbor 0.1.43, Docker
- 데이터: KIRO (섬유망 설계 문제)
- 공개 자료: CLIArena (코드, 프롬프트, 결과 등)
### 향후 전망
향후 LLM의 최적화 및 문제 해결 능력은 더욱 발전할 것으로 예상됩니다. Fable 5와 GPT-5.6 Sol과 같은 최신 모델들은 지속적으로 개선될 것이며, /goal 모드와 같은 기능의 구현 방식 또한 더욱 정교해질 것입니다. Claude Code와 Codex CLI의 내부 작동 방식 차이에서 볼 수 있듯이, 각 모델 제공업체는 자체적인 아키텍처와 전략에 맞춰 이러한 기능을 최적화할 것입니다. 경쟁은 더욱 치열해질 것이며, 모델들은 더 복잡하고 현실적인 문제를 해결하는 데 초점을 맞출 것입니다. 커뮤니티는 이러한 모델들의 성능을 검증하고 개선하기 위한 새로운 벤치마크와 평가 방법을 지속적으로 개발할 것입니다. 또한, LLM이 실제 산업 현장에서 NP-난해 문제를 해결하는 데 어떻게 적용될 수 있는지에 대한 연구가 활발해질 것입니다. 장기적으로는, LLM이 인간 전문가와 협력하여 복잡한 설계, 물류, 금융 등 다양한 분야의 최적화 문제를 해결하는 데 핵심적인 역할을 할 것으로 기대됩니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=48956879)
- 원문: [링크 열기](https://charlesazam.com/blog/fable-5-gpt-5-6-sol-goal/)
---
출처: Hacker News · [원문 링크](https://charlesazam.com/blog/fable-5-gpt-5-6-sol-goal/)
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.