[Techmeme 요약] 구글, 100개 이상 언어 지원하는 'Gemini 3.8 Flash TTS' 공개…더욱 생생한 음성 생성 가능
20
설명
구글이 2026년 9월 23일, 더욱 풍부하고 생생한 음성 생성을 위한 새로운 인공지능(AI) 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다.
이 모델들은 100개 이상의 언어를 지원하며, 사용자가 원하는 대로 목소리를 만들고 감정 표현까지 조절할 수 있는 기능을 제공합니다.
이를 통해 오디오북, 팟캐스트, 게임 등 다양한 분야에서 더욱 몰입감 있는 콘텐츠 제작이 가능해질 것으로 기대됩니다.
### 배경 설명
텍스트 음성 변환(TTS, Text-to-Speech) 기술은 텍스트를 사람의 목소리처럼 자연스러운 음성으로 바꿔주는 기술입니다. 과거에는 다소 기계적인 느낌의 음성이었지만, 최근 인공지능 기술의 발전으로 매우 자연스럽고 감정 표현까지 가능한 수준으로 발전하고 있습니다.
구글이 이번에 공개한 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 이러한 TTS 기술의 최신 성과를 보여줍니다. 특히 'Flash'라는 이름에서 알 수 있듯, 높은 성능을 유지하면서도 효율성을 높인 모델로 추정됩니다. 'Lite' 버전은 더 많은 양의 음성 생성을 비용 효율적으로 처리하는 데 중점을 둔 것으로 보입니다.
이 모델들은 단순히 텍스트를 읽어주는 것을 넘어, 사용자가 원하는 특정 캐릭터의 목소리를 만들거나, 대화의 뉘앙스, 감정, 속도까지 세밀하게 조절할 수 있다는 점에서 큰 차별점을 가집니다. 이는 콘텐츠 제작자들에게는 새로운 창작의 가능성을 열어주고, 사용자들에게는 더욱 풍부한 경험을 제공할 수 있습니다.
### Gemini 3.8 Flash TTS: 창의적인 목소리 디자인의 정점
Gemini 3.8 Flash TTS는 완전히 새로운 목소리를 처음부터 만들어낼 수 있는 모델입니다. 자연어 프롬프트(명령어)를 사용하여 역할, 억양, 목소리 특성 등을 100개 이상의 언어와 방언으로 설정할 수 있습니다. 예를 들어, 극적인 용의 목소리나 특정 지역의 사투리를 쓰는 매력적인 내레이터 목소리를 구현할 수 있습니다. 또한, 30초 분량의 음성 샘플만으로도 기존 목소리의 음색을 복제하는 기능도 제공합니다. 이 기능은 음성 권리 보호를 위해 동의 확인, SynthID 워터마킹, C2PA 자격 증명 등의 안전 장치를 포함하고 있습니다. 향후에는 음성 라이브러리의 목소리를 선택하여 음색, 높낮이, 속도, 억양 등을 미세 조정하는 '음성 리믹싱' 기능도 추가될 예정입니다.
### Gemini 3.8 Flash-Lite TTS: 대규모 음성 생성의 효율성
Gemini 3.8 Flash-Lite TTS는 대량의 음성 콘텐츠를 비용 효율적으로 생성하는 데 최적화된 모델입니다. 고품질 더빙, 오디오 콘텐츠 제작, 그리고 미묘한 톤과 표현이 중요한 음성 에이전트 등에 활용될 수 있습니다. 이 모델 역시 톤, 속도, 표현의 미묘한 차이를 정교하게 제어할 수 있어, 다양한 요구사항에 맞는 음성 생성이 가능합니다. 구글은 이 모델들이 기존 Gemini 3.1 Flash TTS 대비 장문의 오디오 생성, 두 명의 화자가 등장하는 시나리오 제어 등에서 상당한 개선을 보였다고 밝혔습니다.
### 라인별 연기 디렉션 및 안전 기능
두 모델 모두 텍스트를 단순히 음성으로 변환하는 것을 넘어, 각 대사 라인별로 연기 디렉션을 세밀하게 제어할 수 있습니다. 제작자는 직접 연기 지시를 입력하거나, Gemini가 자연스러운 스크립트 큐를 통해 감정, 속도, 억양 등을 조절하도록 할 수 있습니다. 이는 마치 연극 대본을 연출하듯 음성 연기를 지시하는 것과 같습니다. 또한, AI가 생성한 음성임을 감지할 수 있도록 하는 SynthID 워터마킹과 같은 안전 기능이 내장되어 있어, 생성된 오디오의 투명성과 보안을 강화합니다. 이는 잘못된 정보 확산을 방지하는 데 기여할 수 있습니다.
### 가치와 인사이트
구글의 Gemini 3.8 Flash TTS 및 Flash-Lite TTS 모델 출시는 AI 기반 음성 생성 기술의 새로운 지평을 열었습니다. 단순히 텍스트를 읽는 수준을 넘어, 사용자가 원하는 감정과 뉘앙스를 담아낼 수 있는 '창작 도구'로서의 가능성을 보여줍니다. 이는 콘텐츠 제작 비용 절감 및 효율성 증대, 개인화된 오디오 경험 제공 등 다양한 산업 분야에 긍정적인 영향을 미칠 것입니다. 특히 100개 이상의 언어를 지원한다는 점은 글로벌 콘텐츠 시장에서 구글의 영향력을 더욱 확대할 수 있는 중요한 요소입니다.
### 향후 전망
이러한 고품질의 AI 음성 생성 기술은 오디오북, 팟캐스트, 게임, 교육 콘텐츠, 가상 비서 등 다양한 분야에서 혁신을 가져올 것입니다. 콘텐츠 제작자들은 훨씬 적은 비용과 시간으로 고품질의 음성 콘텐츠를 제작할 수 있게 되어, 개인 크리에이터부터 대규모 미디어 기업까지 모두에게 새로운 기회를 제공할 것입니다.
또한, 개인화된 음성 비서, 실시간 다국어 더빙, 접근성 향상을 위한 음성 지원 등 사용자 경험을 혁신적으로 개선할 수 있습니다. 예를 들어, 사용자의 목소리 톤이나 감정에 맞춰 반응하는 AI 챗봇, 영화나 드라마를 실시간으로 자신의 언어와 목소리로 더빙해주는 서비스 등이 현실화될 수 있습니다.
다만, 이러한 기술의 발전은 동시에 딥페이크(Deepfake)와 같은 악용 가능성에 대한 우려도 제기합니다. 구글이 SynthID 워터마킹과 같은 안전 장치를 마련한 것은 이러한 문제를 인지하고 있음을 보여주며, 향후 기술 발전과 함께 윤리적, 법적 규제 논의도 더욱 활발해질 것으로 예상됩니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260923/p31#a260923p31)
- 원문 기사: [링크 열기](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/)
---
출처: Techmeme ([Original Article](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/))
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.