[Techmeme 요약] 마이크로소프트, 실시간 음성 인식 모델 'MAI-Transcribe-2-Streaming' 및 음성 모델 2종 출시
0
설명
마이크로소프트 AI 팀이 2026년 10월 1일, 실시간 음성 인식 및 생성을 위한 새로운 AI 모델들을 공개했습니다. 특히, 'MAI-Transcribe-2-Streaming'은 낮은 지연 시간(low-latency)으로 음성을 텍스트로 변환하는 데 탁월한 성능을 보이며, 'MAI-Voice-2.1'과 'MAI-Voice-2.1-Flash'는 자연스러운 다국어 음성 생성을 지원합니다.
### 배경 설명
음성 인식 및 합성 기술은 인공지능(AI) 분야에서 중요한 역할을 하며, 사용자 경험을 크게 향상시킬 수 있습니다. 실시간 음성 인식(real-time speech recognition)은 회의록 작성, 실시간 자막 생성, 음성 비서 등 다양한 분야에서 활용됩니다. 낮은 지연 시간(low-latency)은 사용자가 말하는 즉시 텍스트로 변환되어야 하는 애플리케이션에서 필수적입니다. 마이크로소프트는 이번에 출시된 모델들을 통해 이러한 요구사항을 충족시키고자 합니다.
'MAI-Transcribe-2-Streaming'은 기존 모델 대비 획기적으로 개선된 정확도와 속도를 자랑합니다. 특히, 'Artificial Analysis'의 평가에서 최종 및 부분 전사(transcript) 정확도 부문에서 1위를 차지했으며, 이는 소음이 많은 환경에서도 높은 정확도를 유지함을 의미합니다. 또한, 'Pareto frontier'에 위치하여 높은 정확도를 유지하면서도 지연 시간을 최소화하는 기술적 성과를 보여줍니다. 이는 사용자가 말을 끝내기 전에도 AI가 즉각적으로 반응하고 행동할 수 있도록 지원합니다.
'MAI-Voice-2.1'은 23개 언어와 26개 지역(locale)을 지원하며, 단일 음성으로도 각 언어의 고유한 억양과 발음을 자연스럽게 구사할 수 있도록 설계되었습니다. 이는 다국어 지원 애플리케이션 개발에 있어 큰 이점을 제공합니다. 'MAI-Voice-2.1-Flash'는 'MAI-Voice-2.1'의 장점을 유지하면서도 대규모 음성 생성 작업에 최적화되어, 45초 분량의 오디오를 단 150밀리초(ms)의 지연 시간으로 생성할 수 있습니다. 이는 기존 모델 대비 55% 빠른 추론 속도와 60% 저렴한 비용 효율성을 제공합니다.
### MAI-Transcribe-2-Streaming: 실시간 음성 인식의 새로운 기준
'MAI-Transcribe-2-Streaming'은 60개 언어를 지원하며, 음성이 입력되는 즉시 텍스트로 변환하는 '부분 전사(partials)' 기능을 제공합니다. 이는 100밀리초(ms) 이내의 짧은 지연 시간으로 첫 번째 텍스트 가설을 생성하며, 이후 추가적인 문맥 정보를 바탕으로 이를 수정하고 최종 텍스트를 빠르게 확정합니다. 이러한 실시간성은 음성 비서가 사용자가 말을 끝내기도 전에 의사결정을 내리거나 도구를 사용할 수 있게 하며, 실시간 자막 생성 시에도 매우 유용합니다. 마이크로소프트는 이 모델이 경쟁사 대비 2배 빠른 속도로 단어를 전사한다고 밝혔습니다. 가격은 시간당 0.54달러입니다.
### MAI-Voice-2.1 및 MAI-Voice-2.1-Flash: 자연스러운 다국어 음성 생성
'MAI-Voice-2.1'은 23개 언어와 26개 지역을 지원하며, 단일 음성으로도 각 언어에 맞는 자연스러운 억양을 구현합니다. 이는 브랜드의 일관된 음성을 유지하면서 다국어 서비스를 제공하는 데 큰 장점을 가집니다. 가격은 100만 자당 22달러입니다. 'MAI-Voice-2.1-Flash'는 대규모 음성 생성에 특화되어 45초 분량의 오디오를 150밀리초(ms)의 지연 시간으로 생성하며, 55% 더 빠른 추론 속도와 60% 저렴한 비용으로 100만 자당 15달러에 제공됩니다. 두 모델 모두 몇 초간의 참조 오디오만으로 음성 복제(voice cloning)가 가능하며, 악의적인 사용을 방지하는 동의(consent) 보호 장치를 내장하고 있습니다.
### 음성 AI 기술의 발전과 미래 전망
이번 마이크로소프트의 신규 모델 출시는 음성 AI 기술의 발전 속도를 다시 한번 보여줍니다. 특히 실시간 처리 능력과 다국어 지원 강화는 AI 기반 대화형 에이전트(conversational AI agents) 및 음성 인터페이스의 상용화를 가속화할 것으로 기대됩니다. 고객 서비스, 교육, 미디어 등 다양한 산업에서 더욱 자연스럽고 효율적인 사용자 경험을 제공할 수 있게 될 것입니다. 또한, 음성 복제 기술의 발전은 개인화된 AI 경험을 가능하게 하지만, 동시에 딥페이크(deepfake)와 같은 악용 가능성에 대한 우려도 제기됩니다. 마이크로소프트는 이번 모델에 동의 보호 장치를 내장하여 이러한 문제를 완화하려는 노력을 보였습니다. 앞으로 음성 AI는 더욱 정교해지고 다양한 분야에 통합되어 우리의 일상과 산업 전반에 걸쳐 큰 변화를 가져올 것입니다.
### 가치와 인사이트
마이크로소프트는 이번 신규 모델 출시를 통해 음성 AI 시장에서 경쟁력을 강화하고 있습니다. 특히 'MAI-Transcribe-2-Streaming'의 낮은 지연 시간과 높은 정확도는 실시간 음성 처리 애플리케이션의 품질을 크게 향상시킬 수 있습니다. 'MAI-Voice-2.1' 시리즈는 다국어 지원과 자연스러운 음성 생성을 통해 글로벌 서비스 개발에 필수적인 요소가 될 것입니다. 이러한 기술 발전은 AI 기반 서비스의 접근성을 높이고 새로운 비즈니스 기회를 창출할 것으로 예상됩니다.
### 기술·메타
- MAI-Transcribe-2-Streaming: 실시간 음성 인식 모델
- MAI-Voice-2.1: 다국어 음성 합성 모델
- MAI-Voice-2.1-Flash: 고용량, 저지연 음성 합성 모델
- 지원 언어: 23개 언어 및 26개 지역 (MAI-Voice-2.1 기준)
- 가격: MAI-Transcribe-2-Streaming 시간당 $0.54, MAI-Voice-2.1 100만 자당 $22, MAI-Voice-2.1-Flash 100만 자당 $15
- 출시일: 2026년 10월 1일
### 향후 전망
낮은 지연 시간의 실시간 음성 인식 및 합성은 AI 기반 음성 비서, 실시간 통번역 서비스, 가상현실(VR) 및 증강현실(AR) 환경에서의 자연스러운 상호작용, 그리고 접근성 기술 발전에 크게 기여할 것입니다. 기업들은 이를 통해 고객 서비스 자동화, 교육 콘텐츠의 다국어화, 미디어 콘텐츠 제작 효율성 증대 등 다양한 분야에서 혁신을 이룰 수 있습니다. 또한, 음성 복제 기술의 발전은 개인화된 AI 경험을 제공하는 데 활용될 수 있으나, 동시에 윤리적, 법적 규제에 대한 논의도 더욱 활발해질 것입니다. 마이크로소프트의 이번 발표는 이러한 미래 음성 AI 생태계 구축에 중요한 발판이 될 것으로 보입니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/261001/p42#a261001p42)
- 원문 기사: [링크 열기](https://microsoft.ai/news/our-first-streaming-transcription-model/)
---
출처: Techmeme ([Original Article](https://microsoft.ai/news/our-first-streaming-transcription-model/))
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.