[GeekNews 요약] Pluto: 단일 신경망으로 스타크래프트: 브루드 워 전 종족 AI 구현
40
설명
tscmoo 개발자가 공개한 Pluto는 단일 신경망과 강화학습을 통해 스타크래프트: 브루드 워의 모든 종족(저그, 테란, 프로토스)을 플레이하는 AI입니다.
스크립트 기반이 아닌, 자체 대전 학습으로 거시적 운영과 미시적 컨트롤까지 학습한 점이 특징입니다.
이는 기존 스타크래프트 AI 연구의 새로운 지평을 열 것으로 기대됩니다.
### 배경 설명
스타크래프트: 브루드 워는 1998년 출시 이후 오랜 시간 동안 전략 시뮬레이션 게임의 대명사로 자리매김했으며, 특히 인공지능(AI) 연구 분야에서 중요한 테스트베드 역할을 해왔습니다. 딥마인드의 AlphaStar와 같은 최첨단 AI들이 등장하며 인간 수준을 넘어서는 플레이를 선보였지만, 이러한 AI들은 종종 복잡한 시스템과 방대한 데이터, 고성능 컴퓨팅 자원을 요구했습니다.
Pluto는 이러한 흐름 속에서 '단일 신경망'과 '자기 대전 강화학습(self-play RL)'이라는 비교적 간결한 접근 방식을 채택했다는 점에서 주목받습니다. 이는 특정 종족이나 상황에 특화된 모델이 아닌, 하나의 모델이 게임의 모든 측면(거시 운영, 유닛 컨트롤, 종족별 특성)을 통합적으로 학습하고 수행할 수 있음을 시사합니다. 또한, GPU 없이 CPU만으로도 추론이 가능하도록 최적화된 점은 AI의 접근성을 높이는 중요한 요소입니다. 이는 과거의 복잡하고 자원 집약적인 AI 개발 방식과는 차별화되는 지점이며, AI 연구의 효율성과 실용성을 높이는 방향으로 나아가고 있음을 보여줍니다.
### 1. Pluto란 무엇인가
Pluto는 tscmoo 개발자가 GitHub에 공개한 스타크래프트: 브루드 워 AI 프로젝트입니다. 이 AI는 단일 신경망을 기반으로 하며, 강화학습을 통해 자체적인 대전(self-play) 방식으로 훈련되었습니다. Pluto는 특정 종족에 국한되지 않고 저그, 테란, 프로토스 세 종족 모두를 플레이할 수 있으며, 게임의 거시적인 운영(macro)과 미시적인 유닛 컨트롤(micro)을 모두 담당합니다. 이는 미리 정의된 스크립트나 규칙에 의존하는 방식이 아니라, AI 스스로 게임을 학습하고 최적의 전략을 찾아나가는 방식임을 의미합니다. Pluto는 BWAPI(Brood War API)를 통해 1대1 대전을 수행합니다.
### 2. 주요 특징 및 작동 방식
Pluto의 가장 큰 특징은 단일 신경망으로 모든 것을 해결한다는 점입니다. 이는 복잡한 모듈 분리 없이 하나의 모델이 게임의 전반적인 의사결정을 내립니다. 훈련은 자기 대전 강화학습으로 이루어지며, 이를 통해 AI는 스스로와 경쟁하며 실력을 향상시킵니다. 현재 공개된 바이너리 릴리스는 2026년 CoG 스타크래프트 AI 대회에 사용된 모델(md07x02_cog2026_2578600_int8mv)이며, CPU 추론에 최적화되어 GPU 없이도 실행 가능합니다. 설치는 간단하며, 스타크래프트 폴더 내의 bwapi-data/AI 경로에 필요한 파일들을 압축 해제하고 bwapi.ini 설정을 수정하면 됩니다. AI는 게임 시작 시 "Pluto online (모델명). gl hf!"라는 메시지를 채팅으로 알립니다. AI 실행 시 pluto.dll이 pluto_infer.exe(64비트 CPU 추론 엔진)를 실행하고 공유 메모리를 통해 통신하며, 게임 종료 시 엔진 프로세스도 함께 종료됩니다. 모델은 6 게임 프레임마다 한 번씩 추론하며, 각 결정은 약 20~60ms가 소요됩니다. CPU 성능이 낮을 경우 게임 속도가 느려지지만, AI의 플레이 품질은 유지됩니다. AI는 자신의 승리 예측이 일정 시간 동안 낮게 유지될 경우 "gg"를 입력하고 게임을 포기합니다.
### 3. 기술 요구사항 및 설정
Pluto를 실행하기 위해서는 스타크래프트: 브루드 워 1.16.1 버전과 BWAPI 4.4.0 64비트 버전이 필요합니다. 운영체제는 64비트 윈도우 또는 Wine 환경이 권장됩니다. CPU는 AVX2 명령어 세트를 지원하는 x86-64 프로세서(2013년 이후 Intel Haswell 또는 AMD Zen 계열)가 필요하며, AVX-VNNI(2021년 이후 Intel 12세대 또는 AMD Zen 5) 지원 시 추론 속도가 약 두 배 향상되어 권장됩니다. 6코어 이상의 CPU와 약 2GB의 RAM, 0.4GB의 디스크 공간이 요구됩니다. 설치 후에는 bwapi-data/write/pluto_bandit_<상대방>.txt 파일을 통해 상대방별 빌드 오더 통계 및 전적을 확인할 수 있으며, 이 파일을 수정하여 AI의 빌드 전략을 조절할 수 있습니다. 게임 속도와 AI의 추론 속도를 맞추기 위해 환경 변수 BWRL_DRAW=1을 설정하면 승률 그래프를 화면에 표시할 수 있으며, BWRL_FRAME_BUDGET_MS=<ms> 설정을 통해 프레임 예산을 조절할 수 있습니다.
### 가치와 인사이트
Pluto는 단일 신경망과 자기 대전 강화학습이라는 비교적 간결한 방법론으로 스타크래프트: 브루드 워의 복잡한 게임 플레이를 구현했다는 점에서 큰 의미를 가집니다. 이는 AI 개발의 복잡성을 줄이고, 특정 하드웨어에 대한 의존성을 낮추면서도 높은 수준의 성능을 달성할 수 있음을 보여줍니다. 특히 GPU 없이 CPU만으로도 추론이 가능하다는 점은 AI의 접근성을 크게 향상시키며, 개인 개발자나 소규모 연구팀도 이러한 수준의 AI를 실험하고 활용할 수 있는 가능성을 열어줍니다. 또한, 게임 내에서 AI의 의사결정 과정을 시각화하거나, 상대방과의 전적 및 빌드 오더를 분석하고 수정할 수 있는 기능은 AI의 작동 방식을 이해하고 개선하는 데 실질적인 도움을 줄 수 있습니다. 이는 단순한 게임 플레이를 넘어, AI의 학습 과정과 전략 최적화에 대한 깊이 있는 통찰을 제공합니다.
### 기술·메타
- 언어: C++ (추론 엔진), Python (훈련 스크립트 추정)
- 라이선스: MIT License (GitHub 저장소 기준)
- 저장소: https://github.com/tscmoo/pluto
### 향후 전망
Pluto 프로젝트의 공개는 스타크래프트 AI 연구 커뮤니티에 새로운 활력을 불어넣을 것으로 예상됩니다. 향후 Pluto 모델의 성능 개선, 다양한 게임 환경에서의 테스트, 그리고 다른 AI 연구와의 융합 등이 기대됩니다. 특히, CPU 기반 추론에 최적화된 점은 향후 모바일 환경이나 저사양 컴퓨팅 환경에서의 AI 적용 가능성을 시사합니다. 다만, 스타크래프트: 브루드 워 자체의 수명이 길다는 점은 긍정적이나, 새로운 전략 시뮬레이션 게임이나 다른 장르의 게임으로의 확장성 또한 중요한 과제가 될 수 있습니다. 또한, AI의 학습 과정에서 발생할 수 있는 편향성이나 예상치 못한 행동 패턴에 대한 지속적인 연구와 검증이 필요할 것입니다. 경쟁 구도 측면에서는 기존의 대규모 AI 프로젝트들과의 차별점을 유지하며, 오픈 소스 커뮤니티의 기여를 통해 지속적으로 발전해 나갈 가능성이 높습니다.
📝 원문 및 참고
- 원문: [링크 열기](https://github.com/tscmoo/pluto)
- GeekNews 토픽: [보기](https://news.hada.io/topic?id=34474)
---
출처: GeekNews ([원문 링크](https://github.com/tscmoo/pluto))
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.