[The Verge] 구글, '음'과 '아'를 지우는 AI 음성 기록 기능 선보여
88
설명
음성 인식 및 텍스트 변환(STT) 기술은 오랫동안 인간의 언어를 기계가 이해할 수 있는 형태로 만드는 핵심 기술로 자리 잡아왔습니다. 초기에는 단순한 단어 인식에 그쳤지만, 딥러닝과 AI의 발전으로 문맥 이해, 화자 구분, 심지어 감정 인식까지 가능해졌습니다. 특히, 회의록 작성, 자막 생성, 음성 명령 인터페이스 등 다양한 분야에서 활용도가 높아지고 있습니다. 구글은 이미 'Chirp'와 같은 자체 STT 모델을 개발해왔으며, 이번 Gemini 3.5 Transcribe 업데이트는 이러한 기술 발전의 연장선상에 있습니다. 특히, 2024년 6월 출시 예정이었던 Gemini 3.5 Pro 모델의 출시 지연 속에서 발표된 이번 기능은 구글의 AI 오디오 기술 역량을 다시 한번 강조하려는 의도로 해석될 수 있습니다.
구글이 새롭게 선보인 Gemini 3.5 Transcribe는 기존의 STT 모델인 Chirp 3 대비 상당한 발전을 이루었다고 자체 평가하고 있습니다. 가장 눈에 띄는 특징은 '음(um)'이나 '아(ah)'와 같은 필러 워드(filler words)를 자동으로 편집하여 제거한다는 점입니다. 이는 단순히 음성을 텍스트로 변환하는 것을 넘어, 최종 결과물의 가독성과 자연스러움을 높이는 데 초점을 맞춘 기능입니다. 또한, 전문 용어를 자동으로 인식하고 85개 이상의 언어를 지원하는 능력은 글로벌 서비스로서의 확장성을 보여줍니다. 이는 다국어 회의록 작성이나 해외 사용자들의 콘텐츠 제작에 큰 도움을 줄 수 있습니다. 더불어, 음성만으로 자연스럽게 편집할 수 있다는 설명은 사용자가 별도의 편집 도구를 사용하지 않고도 음성 기록을 수정할 수 있음을 시사하며, 이는 사용자 경험 측면에서 상당한 개선을 가져올 수 있습니다. Gemini 3.5 Live Translate의 후속으로 출시된 점은 구글이 오디오 및 언어 관련 AI 기술을 통합적으로 발전시키고 있음을 보여줍니다.
### 향후 전망
Gemini 3.5 Transcribe의 필러 워드 제거 기능은 향후 음성 기록 서비스의 표준이 될 가능성이 있습니다. 경쟁사들 역시 유사한 기능을 개발하거나 기존 서비스에 통합할 것으로 예상됩니다. 예를 들어, 마이크로소프트 팀즈나 줌과 같은 화상 회의 플랫폼은 이미 회의록 자동 생성 기능을 제공하고 있으며, 이러한 편집 기능의 고도화는 필수적인 경쟁 요소가 될 것입니다. 또한, 구글이 Gemini 3.5 Pro 모델을 언제 출시할지가 관건입니다. 만약 Pro 모델이 더욱 향상된 성능을 제공한다면, Gemini 3.5 Transcribe의 활용 범위는 더욱 넓어질 것입니다. 다만, AI가 편집하는 과정에서 의도치 않은 내용이 삭제되거나 왜곡될 가능성에 대한 사용자들의 우려도 존재할 수 있으며, 이에 대한 구글의 투명한 설명과 제어 기능 제공이 중요해질 것입니다. 85개 이상의 언어 지원은 향후 더 많은 언어로 확장될 가능성이 높습니다.
**시사점** — 구글의 Gemini 3.5 Transcribe는 필러 워드 제거와 다국어 지원으로 음성 기록의 질을 한 단계 높이며, AI 기반 콘텐츠 제작의 새로운 기준을 제시합니다.
---
출처: The Verge ([Original Link](https://www.theverge.com/tech/985186/google-gemini-3-5-transcribe-audio-ai))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.