[Techmeme 요약] 구글, 음성을 텍스트로 바꾸는 'Gemini 3.5 Transcribe' 공개... Gboard와 크롬에 적용 예정
76
설명
구글이 2026년 8월 26일, 더욱 정확해진 음성-텍스트 변환 모델 'Gemini 3.5 Transcribe'를 공개했습니다.
이 모델은 이미 Gboard의 'Rambler' 기능에 적용되었으며, 곧 크롬 브라우저에도 도입될 예정입니다.
개발자와 기업을 대상으로 한 공개 미리 보기(public preview)가 시작되었습니다.
### 배경 설명
음성 인식 기술은 우리가 기기와 상호작용하는 방식을 혁신하고 있습니다. 하지만 기존의 음성-텍스트 변환 모델들은 종종 배경 소음, 전문 용어, 말실수 등으로 인해 정확도가 떨어지는 문제가 있었습니다. 구글이 이번에 공개한 Gemini 3.5 Transcribe는 이러한 한계를 극복하고, 사용자의 자연스러운 말투와 맞춤 어휘까지 이해하여 더욱 정확하고 깔끔한 텍스트를 생성하는 것을 목표로 합니다.
이 모델은 단순히 음성을 텍스트로 바꾸는 것을 넘어, '음(um)'이나 '아(ah)'와 같은 불필요한 소리를 제거하고, 문장 부호나 서식을 자동으로 추가하는 기능까지 갖추고 있습니다. 또한, 최대 3명까지 화자를 구분하고 각 발언에 타임스탬프를 찍는 기능도 지원합니다. 이는 회의록 작성이나 콘텐츠 제작 등 다양한 분야에서 활용될 수 있습니다. 구글은 이 모델이 기존의 Chirp 3 모델 대비 오류율을 크게 개선했으며, 특히 스트리밍 환경에서 70% 더 빠른 변환 속도를 제공한다고 밝혔습니다. 개발자들은 Gemini API를 통해, 기업들은 Gemini Enterprise Agent Platform을 통해 이 기술을 미리 경험해 볼 수 있습니다.
### Gemini 3.5 Transcribe의 주요 기능
Gemini 3.5 Transcribe는 다음과 같은 혁신적인 기능들을 제공합니다.
* **정확도 향상**: 평균 단어 오류율(Word Error Rate, WER)을 스트리밍 시 4.0%, 비스트리밍 시 2.6%까지 낮췄습니다. 우편번호나 주문 ID와 같은 영숫자 정보도 정확하게 인식합니다.
* **맞춤 어휘 인식**: 사용자가 제공하는 특정 용어나 고유 명칭을 학습하여 인식률을 높입니다.
* **다국어 지원**: 85개 이상의 언어를 자동으로 감지하고, 다양한 지역적 억양과 방언까지 처리합니다.
* **화자 식별**: 최대 3명의 화자를 구분하고 발언 시간을 기록합니다 (3명 이상은 실험 단계).
* **자연스러운 음성 편집**: 말실수를 수정하거나 불필요한 소리를 제거하고, 텍스트 서식을 자동으로 맞춰줍니다.
* **기능 호출(Function Calling)**: 이미지 생성이나 파일 분석과 같은 복잡한 작업을 다른 Gemini 모델에 위임할 수 있습니다.
### 현재 적용 및 향후 계획
Gemini 3.5 Transcribe는 이미 구글의 자체 서비스에 통합되어 활용되고 있습니다. 안드로이드 기기의 Gboard에서는 'Rambler' 기능을 통해 사용자의 음성을 텍스트로 변환하는 데 사용됩니다. 또한, 구글의 Gemini 앱(macOS 버전)에서는 'Speak to Window' 기능을 통해 화면 맥락과 채팅 기록을 활용하여 파일명이나 문서 내용을 정확하게 받아쓰는 데 기여합니다.
가장 주목할 점은 이 기술이 곧 구글 크롬(Chrome) 브라우저에 적용될 예정이라는 것입니다. 이를 통해 사용자는 웹사이트의 어떤 입력 필드에서도 음성으로 텍스트를 입력할 수 있게 되어, 이메일 답장 작성, 게시물 초안 작성, Gemini에 대한 질문 등을 더욱 쉽고 자연스럽게 할 수 있게 됩니다. 개발자들은 Google AI Studio와 Google Antigravity를 통해 Gemini API로, 기업들은 Gemini Enterprise Agent Platform을 통해 이 모델을 미리 사용해 볼 수 있습니다.
### 기술적 발전과 성능 개선
Gemini 3.5 Transcribe는 이전 모델인 Chirp 3 대비 상당한 성능 향상을 이루었습니다. 구글에 따르면, 최종 텍스트 변환까지 걸리는 시간(time to final transcription)이 70% 단축되었습니다. 또한, FLEURS 벤치마크 테스트에서 다국어 환경에서도 높은 정확도를 보여주었으며, 스트리밍 모드에서 5.50%, 비스트리밍 모드에서 5.04%의 WER을 기록했습니다. 이러한 성능 개선은 실시간 음성 처리 및 다양한 언어 환경에서의 활용성을 크게 높일 것으로 기대됩니다.
### 가치와 인사이트
Gemini 3.5 Transcribe의 등장은 음성 인터페이스의 가능성을 한 단계 끌어올렸습니다. 단순히 명령을 수행하는 수준을 넘어, 사용자의 의도를 정확히 파악하고 자연스러운 대화처럼 상호작용할 수 있는 기반을 마련했다는 점에서 의미가 있습니다. 특히, 전문 용어 인식 및 맞춤 어휘 지원은 특정 산업 분야나 개인화된 서비스에서 큰 강점으로 작용할 것입니다. 또한, 텍스트 변환 속도와 정확도 향상은 생산성 도구 전반에 걸쳐 사용자 경험을 크게 개선할 잠재력을 지닙니다.
### 향후 전망
Gemini 3.5 Transcribe의 도입은 다양한 산업 분야에 걸쳐 변화를 가져올 것입니다.
* **산업**: 의료 분야에서는 의사의 진료 기록 작성 시간을 단축하고, 법률 분야에서는 소송 기록이나 증언을 정확하게 문서화하는 데 활용될 수 있습니다. 고객 서비스 분야에서는 상담 내용을 실시간으로 분석하고 요약하는 데 기여할 것입니다.
* **일**: 원격 근무 환경에서 회의 내용을 자동으로 기록하고 요약하는 기능이 강화되어 업무 효율성이 증대될 것입니다. 또한, 음성만으로 복잡한 문서 작업을 수행하는 것이 가능해져 새로운 형태의 업무 방식이 등장할 수 있습니다.
* **사회**: 장애가 있는 사용자나 음성 인터페이스에 익숙한 사용자들에게 더욱 편리한 디지털 접근성을 제공할 것입니다. 교육 분야에서는 강의 내용을 실시간으로 텍스트화하여 학습 자료로 활용하는 것이 용이해질 것입니다.
* **규제**: 음성 데이터의 정확한 기록 및 보관에 대한 중요성이 커지면서, 관련 데이터 프라이버시 및 보안 규제 논의가 활발해질 수 있습니다. 또한, AI가 생성한 텍스트의 저작권 문제 등 새로운 법적 쟁점도 부상할 수 있습니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260826/p48#a260826p48)
- 원문 기사: [링크 열기](https://9to5google.com/2026/08/26/gemini-3-5-transcribe/)
---
출처: Techmeme ([Original Article](https://9to5google.com/2026/08/26/gemini-3-5-transcribe/))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.