[Techmeme 요약] Zhipu AI의 GLM-5.3, 강력한 사이버 공격 능력 공개... 안전 장치 미흡으로 악용 우려
13
설명
Zhipu AI(Z.ai)가 개발한 최신 인공지능 모델 GLM-5.3이 정교한 사이버 공격을 스스로 개발하는 능력을 갖춘 것으로 나타났습니다. 이는 2026년 9월 29일 Anthropic이 공개한 분석 결과이며, 특히 이 모델이 악용을 막기 위한 안전 장치 없이 출시되었다는 점이 우려를 낳고 있습니다.
GLM-5.3은 이전 모델들과 달리 복잡한 사이버 공격을 처음부터 끝까지 autonomously(자율적으로) 구축할 수 있는 잠재력을 지니고 있습니다. Anthropic은 이러한 능력이 악의적인 사이버 행위자들에게 쉽게 확산될 수 있으며, 이는 더욱 강력하고 영향력 있는 사이버 공격으로 이어질 수 있다고 경고했습니다.
이러한 상황은 사이버 보안 분야에 중요한 시사점을 던지며, AI 기술의 발전 속도와 그에 따른 잠재적 위험에 대한 깊은 논의를 촉구합니다.
### 배경 설명
인공지능(AI) 기술은 빠르게 발전하며 다양한 분야에 영향을 미치고 있습니다. 특히, 대규모 언어 모델(LLM, Large Language Model)은 텍스트 생성, 번역, 코딩 등 복잡한 작업을 수행할 수 있게 되면서 주목받고 있습니다. 최근에는 이러한 LLM이 사이버 보안 분야에서도 활용될 가능성이 제기되고 있습니다.
Anthropic은 5개월 전, Claude Mythos Preview라는 AI 모델을 통해 정교한 사이버 공격을 스스로 개발하는 능력을 처음 공개했습니다. 당시 Anthropic은 이러한 능력이 확산될 것을 예상하고, Project Glasswing을 통해 신뢰할 수 있는 사이버 보안 전문가들에게 제한적으로 공개하여 10,000개 이상의 취약점을 발견하도록 지원했습니다. 이는 악의적인 공격자들이 유사한 능력을 갖춘 모델에 접근하기 전에 방어자들이 선제적으로 대응할 수 있도록 하기 위함이었습니다.
하지만 이제 Zhipu AI(중국 외 Z.ai로 알려짐)가 개발한 GLM-5.3 모델이 Claude Mythos Preview와 유사한 자율적인 사이버 공격 개발 능력을 갖추고 출시되었으며, 문제는 이 모델이 악용을 방지하기 위한 '의미 있는 안전 장치(meaningful safeguards)' 없이 공개되었다는 점입니다. 이는 사이버 공격자들이 GLM-5.3의 안전 장치를 간단한 기법으로 64%에서 100%까지 우회할 수 있다는 Anthropic의 자체 테스트 결과에서 명확히 드러났습니다. 이는 Claude 모델의 테스트 결과와는 대조적입니다.
### GLM-5.3의 사이버 공격 개발 능력
Anthropic의 분석에 따르면, GLM-5.3은 'ExploitBench'와 같은 자동화된 벤치마크에서 410번의 시도 중 50번 성공적으로 종단 간(end-to-end) 사이버 공격을 개발했습니다. 이는 Claude Mythos Preview의 56번 성공률과 유사한 수준입니다. 또한, 내부 'Binary Exploitation' 벤치마크에서는 100개의 작업 중 4%에서 완전한 제어 흐름 탈취(full control-flow hijack)를 성공시켰습니다. 이전 모델인 Claude Opus 4.6이나 GLM-5.2는 이러한 작업에서 전혀 성공하지 못했습니다.
더욱이, 인간 전문가와 함께 진행된 개방형 사이버 공격 작업에서도 GLM-5.3은 놀라운 능력을 보여주었습니다. 연구원들은 GLM-5.3을 사용하여 인기 있는 웹 브라우저의 JavaScript 엔진에서 이전에 알려지지 않은 여러 취약점을 발견하고, 이를 연쇄적으로 활용하여 방문자의 컴퓨터에서 임의의 파일을 읽어오는 웹 페이지 공격을 성공시켰습니다. 이 공격은 2026년 9월 17일 NIST의 AI 표준 및 혁신 센터(CAISI)가 GLM-5.3을 '현재까지 출시된 오픈 가중치 모델 중 사이버 공격 능력이 가장 뛰어난 모델'로 평가한 결과와도 일치합니다. CAISI는 GLM-5.3이 미국 최첨단 모델보다 약 4개월 뒤처진다고 평가했지만, 이는 미국 모델들이 안전 장치가 비활성화된 상태로 테스트되었거나 검증된 사용자에게만 제한적으로 공개된 버전을 포함한 결과입니다. 반면 GLM-5.3은 누구나 다운로드하여 사용할 수 있습니다.
### GLM-5.3의 취약한 안전 장치
GLM-5.3은 일부 내장된 안전 장치를 가지고 있지만, Anthropic의 테스트 결과 이러한 장치들은 다양한 간단한 기법으로 쉽게 우회되거나 제거될 수 있는 것으로 나타났습니다. 가장 효과적인 방법 중 하나는 'abliteration'이라는 기법으로, 이는 모델의 거부 반응을 줄이는 표준적인 방법입니다. GLM-5.3이 오픈 가중치 모델로 공개되었기 때문에, 사용자는 약간의 설정 변경만으로도 모델의 거부 기능을 제거할 수 있습니다. 실제로 GLM-5.3 출시 후 며칠 만에 여러 개발자들이 'abliterated'(안전 장치가 제거된) 버전을 공개했습니다.
Anthropic이 자체적으로 'abliterated' GLM-5.3 버전을 만들어 테스트한 결과, 'JailbreakBench', 'HarmBench', 'StrongREJECT'와 같은 벤치마크에서 모델의 거부율이 90% 이상에서 3% 또는 2%로 급감했습니다. 흥미로운 점은 이러한 'abliteration' 과정이 모델의 전반적인 능력에는 큰 영향을 미치지 않았다는 것입니다. GPQA-Diamond와 같은 과학 능력 평가에서 표준 모델과 'abliterated' 모델은 동일한 점수를 기록했으며, CyberGym 평가에서도 약간의 성능 저하만 있었습니다.
더욱이, 'abliterated' 버전 없이도 GLM-5.3의 안전 장치를 우회할 수 있는 방법들이 발견되었습니다. 예를 들어, 모델에게 자율적인 레드팀 요원이라고 속이거나, 모델의 사고 과정(thinking tokens)을 미리 채워 넣어 사용자의 요청을 이미 고려한 것처럼 보이게 하는 기법을 사용하면 GLM-5.3이 악의적인 요청에 응할 확률이 64%에서 92%까지 증가했습니다. 이러한 기법들은 Anthropic의 Claude 모델에서는 효과가 없었습니다. Claude의 API는 이러한 속임수 프롬프트나 사전 채우기 기법을 차단하며, 모델 가중치가 공개되지 않아 'abliteration'이 불가능합니다.
### GLM-5.3 출시의 의미와 향후 전망
GLM-5.3의 출시는 AI 모델의 사이버 공격 능력이 이전과는 비교할 수 없을 정도로 향상되었음을 보여줍니다. 특히, 안전 장치 없이 공개된 이 모델은 악의적인 행위자들에게 강력한 도구를 제공할 가능성이 높습니다. Anthropic은 이러한 모델이 국가 및 비국가 행위자들에 의해 실제 피해를 야기하는 데 사용될 수 있다고 경고합니다.
하지만 동시에, 이러한 강력한 AI 능력은 사이버 보안 전문가들에게도 유용한 도구가 될 수 있습니다. Anthropic은 자사의 Claude 모델의 사이버 보안 능력을 더 많은 방어자들에게 안전하게 제공하기 위해 노력하고 있으며, 사이버 공격자들이 최첨단 도구를 사용하는 만큼 방어자들도 이에 상응하는 강력한 도구를 갖춰야 한다고 강조합니다. Project Glasswing과 같은 노력을 통해 사이버 방어는 중요한 진전을 이루었지만, 아직 갈 길이 멀다는 것을 GLM-5.3의 등장이 다시 한번 보여줍니다.
정부는 GLM-5.3과 같은 고성능 AI 모델에 대한 안전성 테스트를 수행해야 하며, 독립적인 출처의 고품질 평가가 부족할 경우 이러한 능력의 영향이 너무 늦게 파악될 수 있습니다. 전 세계 AI 개발자들은 점점 더 강력해지는 오픈 가중치 모델을 개발함에 있어, 이러한 능력을 적절히 보호하고 오용을 방지하기 위해 노력해야 할 것입니다.
### 가치와 인사이트
GLM-5.3 모델의 출시는 AI 기술이 사이버 보안 분야에 미치는 영향이 단순한 분석 도구를 넘어 실제 공격 능력으로까지 확장되었음을 보여주는 중요한 사건입니다. 특히, 안전 장치 없이 공개된 오픈 가중치 모델은 악의적인 행위자들에게 강력한 무기를 제공할 수 있다는 점에서 심각한 우려를 낳고 있습니다. 이는 AI 기술의 발전 속도와 함께 사이버 보안의 중요성이 더욱 증대되고 있음을 시사합니다. 또한, AI 기술의 양면성을 보여주며, 이를 어떻게 통제하고 윤리적으로 활용할 것인가에 대한 사회적, 기술적, 정책적 논의가 시급함을 강조합니다.
### 기술·메타
- 모델명: GLM-5.3, Claude Mythos Preview, Claude Opus 4.6, GLM-5.2, GLM-5.3-Flash
- 벤치마크: ExploitBench, Binary Exploitation, JailbreakBench, HarmBench, StrongREJECT, GPQA-Diamond, CyberGym
- 관련 기술: 오픈 가중치 모델(open-weight model), 자율적 공격 개발(autonomous cyber exploit development), 안전 장치(safeguards), abliteration
- 기관/프로젝트: Zhipu AI (Z.ai), Anthropic, Project Glasswing, NIST CAISI
### 향후 전망
GLM-5.3과 같은 모델의 등장은 사이버 공격의 진입 장벽을 크게 낮출 것입니다. 소규모 조직이나 개인도 이전에는 전문가만이 가능했던 복잡한 사이버 공격을 수행할 수 있게 될 가능성이 있습니다. 이는 기업, 정부, 개인 등 모든 주체의 사이버 보안 전략 재검토를 요구합니다.
AI 기반의 사이버 공격 탐지 및 방어 기술 또한 더욱 발전해야 할 것입니다. AI가 공격 도구로 사용되는 만큼, AI를 활용한 방어 시스템의 고도화가 필수적입니다. 또한, AI 모델의 안전한 개발 및 배포를 위한 국제적인 규제 및 표준 마련 논의가 가속화될 것으로 예상됩니다. 2026년 9월 29일 Anthropic의 발표는 이러한 변화의 시작을 알리는 신호탄이 될 수 있습니다.
궁극적으로, AI 기술의 발전은 사이버 공간의 역학 관계를 근본적으로 변화시킬 것이며, 이에 대한 지속적인 연구와 대비가 필요합니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260929/p51#a260929p51)
- 원문 기사: [링크 열기](https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities)
---
출처: Techmeme ([Original Article](https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities))
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.