[GeekNews 요약] 크래프톤, 21.2B 파라미터의 한영 이중언어 음성 AI 모델 'A.X K2 Raon-Speech' 공개
0
설명
크래프톤이 21.2B 파라미터 규모의 영어/한국어 이중언어 음성 언어 모델(SpeechLM)인 'A.X K2 Raon-Speech'를 공개했습니다. 이 모델은 SK텔레콤의 A.X K2 Light 20B-A3B mixture-of-experts 텍스트 backbone 위에 크래프톤이 자체 학습한 음성 인코더와 neural audio codec을 결합하여 음성 이해와 생성을 통합한 것이 특징입니다. 2026년 7월 27일 공개된 이 모델은 Hugging Face를 통해 접근 가능하며, 다양한 음성 관련 멀티태스크 역량을 제공합니다.
### 배경 설명
최근 몇 년간 인공지능 분야는 대규모 언어 모델(LLM)의 발전과 함께 멀티모달 AI로의 확장이 가속화되고 있습니다. 특히 음성 AI는 텍스트뿐만 아니라 음성 자체의 맥락과 감정까지 이해하고 생성하는 방향으로 발전하고 있으며, 이는 사용자 경험을 혁신할 잠재력을 지니고 있습니다. 이러한 흐름 속에서 크래프톤은 SK텔레콤의 A.X K2 Light 20B-A3B mixture-of-experts 모델을 기반으로 자체 음성 모듈을 통합하여 'A.X K2 Raon-Speech'를 개발했습니다. 이는 기존의 음성 인식(STT) 및 음성 합성(TTS) 기능을 넘어, 음성 질의응답(SpeechQA), 음성 기반 대화(SpokenQA), 화자 목소리 복제 및 음성 생성(TTS Continuation) 등 더욱 복잡하고 자연스러운 상호작용을 가능하게 합니다. 또한, 30B 이하급 공개 음성 언어 모델 중 한국어 종합 성능 1위(0.72), 영어 종합 성능 3위(0.75)를 기록하며 기술적 우위를 입증했습니다. 이는 음성 AI 기술의 발전이 단순히 음성 데이터를 처리하는 것을 넘어, 인간의 언어적, 비언어적 표현까지 포괄적으로 이해하고 구사하는 수준으로 나아가고 있음을 보여줍니다.
### 1. A.X K2 Raon-Speech란 무엇인가?
A.X K2 Raon-Speech는 약 21.2B의 전체 파라미터와 약 3.5B의 활성 파라미터를 갖는 영어/한국어 이중언어 음성 언어 모델(SpeechLM)입니다. 이 모델은 SK텔레콤이 개발한 A.X K2 Light 20B-A3B mixture-of-experts 텍스트 backbone 위에 크래프톤이 독자 학습한 AuT 음성 인코더와 Mimi 계열 neural audio codec을 결합하여 음성 이해와 음성 생성을 하나의 멀티모달 모델로 통합했습니다. 크래프톤이 오픈소스로 공개한 Raon-Speech-9B의 학습 레시피를 기반으로 학습되었으며, 2026년 7월 27일에 공개되었습니다.
### 2. 주요 기능 및 특징
A.X K2 Raon-Speech는 다음과 같은 핵심 기능과 특징을 제공합니다. 첫째, End-to-End 음성 언어 모델로서 21.2B 파라미터(활성 약 3.5B)의 멀티모달 모델입니다. 둘째, 자체 파이프라인으로 학습한 AuT 음성 인코더(약 317M 파라미터)와 Mimi 계열 neural audio codec(약 96M 파라미터)을 활용합니다. 셋째, 30B 이하급 공개 음성 언어 모델 중 한국어 종합 1위, 영어 종합 3위를 기록한 이중언어 지원 능력을 갖추고 있습니다. 넷째, STT, TTS, SpeechQA, SpokenQA, turn 기반 멀티모달 chat 등 멀티태스크 역량을 하나의 통합 모델에서 지원합니다. 다섯째, 사용자 목소리의 감정, 억양 등 Paralinguistic 정보를 인지하여 자연스러운 음성 답변을 생성합니다. 여섯째, ECAPA embedding을 통해 선택적 화자 reference 오디오로 voice conditioning TTS를 지원하며, Prefill 기반 continuation으로 운율이 자연스럽게 이어지는 음성을 생성하는 TTS Continuation 기능도 제공합니다.
### 3. 아키텍처 구성 요소
모델의 아키텍처는 크게 텍스트 backbone, 음성 인코더, 음성 코덱, 그리고 talker로 구성됩니다. 텍스트 backbone으로는 SK텔레콤의 A.X K2 Light 20B-A3B MoE 모델이 사용되며, 48개의 레이어와 2,048개의 hidden size를 가지며 128개의 라우팅된 expert를 포함합니다. 음성 인코더는 Qwen3-ASR 아키텍처 기반으로 독자 학습된 AuT encoder로, 24개의 레이어와 약 317M 파라미터를 가집니다. 음성 코덱 역시 독자 학습된 Mimi 계열 codec으로 약 96M 파라미터이며, 32개의 quantizer와 2,048-entry codebook, 24 kHz 샘플링 레이트, 12.5 fps의 설정을 가집니다. SpeechLM 코드 인터페이스는 8개의 code group을 입력받아 16개의 code group을 생성합니다. Talker는 Qwen3 기반으로 4개의 레이어와 2,048개의 hidden size를 가집니다. 텍스트-backbone의 context window는 최대 131,072 토큰까지 지원합니다. 화자 조건부 TTS와 continuation TTS를 위해서는 추가적으로 frozen SpeechBrain ECAPA 화자 인코더가 사용되며, 최초 호출 시 자동으로 다운로드됩니다.
### 4. 평가 결과 및 검증
A.X K2 Raon-Speech는 음성 인식, 음성 합성, 음성 이해, 음성 질의응답, 텍스트 질의응답, 도구 호출 등 총 6개 영역에서 평가되었습니다. 이를 위해 LibriSpeech, KsponSpeech, VoiceBench, KVoiceBench, MMAU, KMMAU, API-Bank, FunctionChat-Bench 등 한국어 24개, 영어 22개, 총 46개의 벤치마크가 활용되었습니다. 평가 결과, 30B 이하급 공개 음성 언어 모델 중 한국어 종합 성능 1위(0.72), 영어 종합 성능 3위(0.75)를 기록했습니다. 특히, 음성 인식(Speech Recognition)에서는 영어 96.7%, 한국어 104.6%의 성능을 보였으며, SpokenQA와 SpeechQA에서도 높은 정확도를 나타냈습니다. 또한, 자체 학습한 AuT 음성 인코더는 약 100만 시간의 오디오로 학습되었음에도 Qwen3-ASR AuT에 필적하는 성능을 보였으며, 자체 학습한 코덱 역시 Mimi 성능에 근접하는 결과를 보였습니다. Repository 패키징 및 추론 API는 영어/한국어 STT, direct TTS, 화자 조건 TTS, continuation TTS, SpeechQA, SpokenQA를 포함한 12개의 smoke-matrix 호출로 end-to-end 검증되었습니다.
### 가치와 인사이트
크래프톤이 공개한 A.X K2 Raon-Speech 모델은 음성 AI 분야에서 중요한 이정표를 제시합니다. 21.2B라는 상당한 규모의 파라미터와 mixture-of-experts 아키텍처를 활용하여 영어와 한국어 모두에서 높은 성능을 달성했다는 점은 주목할 만합니다. 특히, 음성 이해와 생성을 단일 멀티모달 모델로 통합하고, 화자 목소리 복제 및 자연스러운 음성 연속 생성과 같은 고급 기능을 지원한다는 점에서 실무 적용 가능성이 높습니다. 이는 고객 서비스 챗봇, 오디오 콘텐츠 생성, 접근성 향상 도구 등 다양한 분야에서 혁신적인 사용자 경험을 제공할 수 있습니다. 또한, 30B 이하급 모델 중 한국어 성능 1위를 기록했다는 점은 국내 AI 기술의 경쟁력을 보여주며, 향후 한국어 기반 음성 AI 서비스 개발에 긍정적인 영향을 미칠 것으로 기대됩니다. 연구 및 비상업적 프로토타이핑을 목적으로 CC BY-NC 4.0 라이선스로 공개되어, 관련 연구 커뮤니티의 활성화에도 기여할 것으로 보입니다.
### 기술·메타
* **모델 크기:** 21.2B 전체 파라미터, 3.5B 활성 파라미터
* **언어 지원:** 영어, 한국어
* **아키텍처:** Mixture-of-Experts (MoE) 텍스트 backbone (A.X K2 Light 20B-A3B), 독자 학습 AuT 음성 인코더, Mimi 계열 neural audio codec
* **라이선스:** CC BY-NC 4.0 (Creative Commons Attribution-NonCommercial 4.0 International)
* **공개 플랫폼:** Hugging Face (KRAFTON/A.X-K2-Raon-Speech-21B-A3B)
* **주요 기능:** STT, TTS, SpeechQA, SpokenQA, 멀티모달 chat, Paralinguistic 인지, 화자 목소리 conditioning TTS, TTS Continuation
* **평가 결과:** 30B 이하급 공개 음성 언어 모델 중 한국어 종합 1위 (0.72), 영어 종합 3위 (0.75)
* **권장 GPU:** BF16 checkpoint (약 42.4 GB) 로드 시 80 GB GPU 또는 적절한 multi-GPU 구성 권장
* **배포:** vLLM-Omni 호환 브랜치 (feat/axk2_raon_speech) 사용 가능
### 향후 전망
A.X K2 Raon-Speech의 공개는 음성 AI 시장의 경쟁 구도에 영향을 미칠 것으로 예상됩니다. 크래프톤은 이 모델을 기반으로 더욱 발전된 음성 AI 솔루션을 개발할 가능성이 높으며, 이는 기존의 글로벌 빅테크 기업들과의 경쟁을 심화시킬 수 있습니다. 향후 모델의 성능 개선, 지원 언어 확대, 그리고 상업적 활용을 위한 라이선스 정책 변화 등이 주요 변수가 될 것입니다. 또한, 음성 데이터 프라이버시 및 보안에 대한 사회적 논의가 활발해짐에 따라, 모델의 윤리적 사용 및 데이터 보호 방안 마련이 중요해질 것입니다. 크래프톤은 2026년 7월 27일 공개된 이 모델을 통해 지속적인 연구 개발을 이어갈 것이며, 이는 음성 AI 기술의 발전 속도를 더욱 가속화할 것으로 전망됩니다. 특히, 음성 기반의 인터랙티브 AI 서비스에 대한 수요 증가와 함께 A.X K2 Raon-Speech와 같은 고성능 모델의 역할이 더욱 중요해질 것입니다.
📝 원문 및 참고
- 원문: [링크 열기](https://huggingface.co/KRAFTON/A.X-K2-Raon-Speech-21B-A3B/blob/main/README_ko.md)
- GeekNews 토픽: [보기](https://news.hada.io/topic?id=32125)
---
출처: GeekNews ([원문 링크](https://huggingface.co/KRAFTON/A.X-K2-Raon-Speech-21B-A3B/blob/main/README_ko.md))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.