[Hacker News 요약] Cognition, Fable 5.1 및 GPT-Astra와 경쟁하는 새로운 SWE-2 코딩 모델 출시
103
설명
Cognition은 2026년 10월 9일, 새로운 코딩 모델인 SWE-2를 공개했습니다.
SWE-2는 기존 모델 대비 성능과 비용 효율성을 크게 개선하여, FrontierCode 1.1 Main 벤치마크에서 50.0%의 점수를 기록했습니다.
이는 Fable 5.1과 거의 동등한 성능을 보이면서도 64% 저렴한 비용으로 달성되었습니다.
### 배경 설명
생성형 AI, 특히 대규모 언어 모델(LLM)은 소프트웨어 개발 분야에서 점차 중요한 역할을 수행하고 있습니다. 코딩 보조 도구는 개발자의 생산성을 높이고 복잡한 작업을 자동화하는 데 기여하며, 이러한 도구의 성능은 모델의 추론 능력, 코드 생성 정확도, 그리고 비용 효율성에 의해 결정됩니다. Cognition은 이러한 코딩 모델의 성능을 평가하기 위한 벤치마크인 FrontierCode 1.1을 개발했으며, 이를 통해 모델들의 '파레토 최전선(Pareto frontier)'을 탐색하고 있습니다. 파레토 최전선은 성능을 희생하지 않고 비용을 절감하거나, 비용을 유지하면서 성능을 향상시키는 최적의 지점을 의미합니다. SWE-2의 등장은 이러한 파레토 최전선을 더욱 확장하려는 Cognition의 노력을 보여줍니다. 특히, 기존의 SWE-1.7 모델 대비 상당한 개선을 이루었으며, 경쟁 모델인 Fable 5.1 및 GPT-Astra와 비교했을 때 비용 효율성 측면에서 두각을 나타냅니다. 이는 LLM 기반 코딩 도구의 상용화 및 광범위한 채택에 중요한 영향을 미칠 수 있습니다.
### SWE-2의 성능 및 비용 효율성
SWE-2는 FrontierCode 1.1 Main 벤치마크에서 50.0%의 점수를 기록하며 Fable 5.1(50.9%)과 근접한 성능을 보였습니다. DeepSWE 1.1 벤치마크에서는 73.0%의 점수를 달성했습니다. 주목할 점은 SWE-2가 이러한 성능을 달성하면서도 Fable 5.1 대비 64% 저렴한 비용으로 운영된다는 것입니다. 이는 Cognition이 처음으로 다중 조 단위 파라미터 규모에서 강화학습(RL)을 확장하고, 단일 실행으로 모든 추론 노력 수준을 훈련하는 RL 알고리즘을 개발한 결과입니다. 또한, SWE-2는 Kimi K3(2.8T 파라미터 모델)를 기반으로 하며, 기존 SWE-1.7 및 Grok 4.6 모델보다 우수한 성능과 비용 효율성을 제공합니다. GPT-5.6 Sol과 동등한 성능을 훨씬 저렴한 비용으로 제공하며, GPT-6 Astra와 비교했을 때 1/4의 비용으로 근접한 성능을 보여줍니다.
### SWE-2의 훈련 방법론 및 개선점
SWE-2의 핵심 개선 사항은 파레토 최전선을 확장하기 위한 강화학습(RL) 훈련 방법론에 있습니다. Cognition은 단일 RL 실행 내에서 모든 추론 노력 수준을 훈련하기 위해 '파레토 최적화 비용 페널티'를 도입했습니다. 이는 각 노력 수준에 대해 베이스 모델의 파레토 최전선 기울기에 맞춰 선형 비용 페널티를 적용하는 방식입니다. 또한, 훈련 안정성을 높이기 위해 '길이 가중 보상 베이스라인'을 사용했으며, 이는 SWE-1.6부터 사용되어 온 기법입니다. RL 롤아웃 서빙에서는 DSpark 추측 디코딩과 온라인 초안 모델 훈련을 통해 디코딩 처리량을 향상시켰습니다. NVFP4/FP8 커널 및 양자화 인식 훈련을 통해 메모리 사용량을 줄이고, SWE-1.7과 유사한 처리량에서도 더 낮은 훈련-추론 불일치를 달성했습니다. 훈련 데이터 측면에서는 RL 환경 수를 세 배로 늘리고, 지시 따르기 오버레이를 추가했으며, 이전 SWE-2 체크포인트를 활용하는 플라이휠을 구축하여 검증기의 견고성을 강화했습니다.
### SWE-2의 행동 특성 및 신뢰성 평가
SWE-2는 이전 모델 대비 향상된 엔지니어링 판단력을 바탕으로 더 완전한 솔루션을 작성하고 불필요한 탐색을 줄입니다. FrontierCode 1.1 Main에서 SWE-2 medium은 SWE-1.7 대비 58% 적은 턴과 81% 적은 비용으로 더 높은 점수를 기록했습니다. SWE-2는 더 집중적인 탐색을 통해 효율성을 높였으며, 간단한 작업에서는 더 빠르게 구현을 시작합니다. 또한, 테스트 커버리지가 향상되어 회귀 및 엣지 케이스를 더 안정적으로 포착하며, 사용자의 경계 내에서 자원을 효율적으로 활용합니다. 예를 들어, 필요한 MCP 통합이 불가능할 경우 기존 Slack 채널 기록에서 데이터를 재구성하는 능력을 보였습니다. 신뢰성 평가에서는 정치적으로 민감한 주제에 대한 질문에 대해 SWE-2가 98.0%의 성공률을 기록하며, 영어(99.8%), 중국어 간체(95.2%), 중국어 번체(99.1%)에서 높은 성능을 보였습니다. 코딩 작업에서의 맥락 의존적 취약성 평가에서도 고객 정체성이나 요청 언어가 모델의 취약한 기능 구현 의지에 영향을 미치지 않는 것으로 나타났습니다.
### 가치와 인사이트
SWE-2의 출시는 LLM 기반 코딩 도구의 성능과 비용 효율성 간의 균형점을 크게 개선했음을 시사합니다. 특히, 파레토 최전선을 확장하려는 Cognition의 접근 방식은 향후 AI 모델 개발에 있어 중요한 방향성을 제시합니다. SWE-2는 개발자들이 더 저렴한 비용으로 더 높은 수준의 자동화된 코딩 지원을 받을 수 있게 함으로써, 소프트웨어 개발 생태계 전반의 생산성 향상에 기여할 잠재력을 가지고 있습니다. 또한, 모델의 신뢰성과 안전성에 대한 평가 결과는 실제 서비스 적용 시 중요한 고려 사항이 될 것입니다. 개발자들은 SWE-2를 통해 복잡한 코딩 작업을 더 효율적으로 수행하고, 잠재적인 오류를 줄이며, 개발 프로세스를 가속화할 수 있습니다.
### 기술·메타
- 모델명: SWE-2, SWE-1.7, Kimi K3, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra, Grok 4.6
- 벤치마크: FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1, Terminal-Bench 4
- 기술: 강화학습(RL), 파레토 최적화, 길이 가중 보상 베이스라인, DSpark 추측 디코딩, NVFP4/FP8 커널, 양자화 인식 훈련
- 출시일: 2026년 10월 9일
### 향후 전망
SWE-2의 성공은 경쟁사들의 유사 모델 개발 경쟁을 더욱 심화시킬 것으로 예상됩니다. Fable, GPT 시리즈 등 기존 강자들은 물론, 새로운 플레이어들도 파레토 최전선을 개선하기 위한 혁신적인 훈련 방법론과 모델 아키텍처 개발에 집중할 것입니다. Cognition은 SWE-2를 Devin Desktop, CLI, Web, Fusion 등 다양한 제품에 통합하며 사용자 기반을 확대해 나갈 것입니다. 향후에는 SWE-2의 성능을 더욱 미세 조정하고, 특정 도메인에 특화된 모델을 개발하거나, 여러 모델을 조합하는 방식의 발전이 이루어질 수 있습니다. 또한, 오픈 소스 커뮤니티와의 협력을 통해 모델의 투명성과 접근성을 높이는 노력도 지속될 것으로 보입니다. LLM 기반 코딩 도구의 발전은 개발자들의 역할 변화를 촉진하고, 소프트웨어 개발의 패러다임을 지속적으로 재정의할 것입니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49645443)
- 원문: [링크 열기](https://cognition.com/blog/swe-2)
---
출처: Hacker News · [원문 링크](https://cognition.com/blog/swe-2)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.