Gemini 3.5 Transcribe 공개: 실시간 전사와 녹음본 전사, 어디까지 열렸나 | DAKER 커뮤니티

음성 인터페이스가 빠르게 늘어나는 시점에는 새 모델의 이름보다도, 실제로 무엇이 열렸고 무엇은 아직 아닌지를 먼저 구분하는 일이 중요합니다. 이번 Gemini 3.5 Transcribe도 마찬가지입니다. 공식 발표에는 성능 수치와 제품 적용 범위가 함께 담겨 있지만, 실시간 전사와 녹음본 전사를 같은 것으로 읽거나, 일부 제품 안내를 전체 API 기능으로 넓혀 해석하면 판단이 흐려질 수 있습니다.

그래서 이 글은 Google이 2026년 8월 26일 공개한 내용을 기준으로, 모델의 성격과 API 구분, 공식 수치, 현재 열려 있는 제품 표면을 차분히 정리합니다. 원문에 없는 정확도나 비용은 덧붙이지 않고, 발표문이 말하는 범위 안에서만 살펴봅니다.

Gemini 3.5 Transcribe는 음성을 글로 바꾸는 최신 speech-to-text 모델로 공개됐고, 실시간 전사와 녹음본 전사가 서로 다른 모델 이름으로 나뉘어 제공됩니다.

Google이 2026년 8월 26일 Gemini 3.5 Transcribe를 공개했습니다. 음성을 글로 바꾸는 최신 음성·텍스트 모델이며, Android Rambler와 macOS Gemini 앱에 이미 쓰이고, Gemini API·AI Studio·Gemini Enterprise Agent Platform에서 공개 프리뷰로 열렸습니다.

제미나이가 목소리를 글로 바꿉니다

무엇이 나왔는가

Google Introducing Gemini 3.5 Transcribe는 이 모델을 정밀하고 지능적인 실시간 전사를 위한 최신 speech-to-text라고 소개합니다. 배경 소음, 전문 용어, 말더듬 정리처럼 기존 인식기가 약했던 지점을 겨냥해, 원본 오디오를 다듬어진 형식의 텍스트로 바로 바꾼다고 설명합니다.

공식 글에 따르면 이 모델은 이미 Android의 Rambler와 macOS Gemini 앱의 새 음성 기능에 쓰이고 있습니다. 개발자는 Gemini API와 Google AI Studio, Gemini Enterprise Agent Platform에서 비슷한 기능을 붙일 수 있습니다. Chrome에는 웹 입력 상자에 말로 입력하는 기능이 곧 제공된다고 안내했습니다.

실시간과 녹음본은 구분해서 봐야 합니다

API는 실시간 스트리밍과 녹음본 처리로 나뉩니다. 실시간 스트리밍은 Live API의 gemini-3.5-transcribe-live를 사용하며, 초 미만 지연의 양방향 스트림을 목표로 합니다. 반면 녹음본, 회의, 통화 로그는 Interactions API의 gemini-3.5-transcribe로 처리하고, 화자 귀속과 단어 단위 타임스탬프를 제공합니다.

실시간은 gemini-3.5-transcribe-live, 녹음본은 gemini-3.5-transcribe입니다. 두 이름을 한 엔드포인트로 합쳐 쓰지 않습니다.

공식 페이지에 적힌 숫자

공식 페이지에 적힌 수치는 다음 범위에서 읽는 것이 좋습니다. Artificial Analysis 기준 평균 Word Error Rate는 스트리밍 4.0%, 비스트리밍 2.6%입니다. 또 Chirp 3 대비 time to final transcription은 70% 개선이라고 적혀 있습니다. FLEURS 벤치마크의 상위 언어·로케일 집합에서는 스트리밍 5.50% WER, 비스트리밍 5.04% WER입니다.

WER 4.0%와 2.6%는 Artificial Analysis 평균값이고, 70%는 Chirp 3 대비 time to final transcription 개선입니다.

이 수치들은 공식 글과 인용된 기준 안에서 이해해야 합니다. 우리 콜센터, 강의, 방언 데이터에서의 점수로 바꿔 읽을 수는 없습니다. FLEURS 5.50%와 5.04% 역시 상위 언어·로케일 집합 기준이며, 전 언어 평균으로 넓혀 쓰지 않는 편이 맞습니다. 지연 개선과 정확도 개선도 같은 의미가 아니므로 한 문장으로 섞지 않는 것이 좋습니다.

기능 범위: 스마트 전사, 맞춤 어휘, 언어, 화자 구분

공식 글에는 몇 가지 기능이 함께 적혀 있습니다. 자기 수정 표현인 화요일—아니, 수요일 같은 발화를 처리하고, 음이나 아 같은 군더더기를 줄이며, 텍스트를 자동으로 정리합니다. 사용자 제공 맞춤 어휘에 맞춰 전문 용어와 고유 표기를 인식하고, 85개 이상 언어를 자동 감지·전사하며 지역 억양도 다룬다고 설명합니다.

화자 구분은 녹음본 기준 최대 3명까지 제공되고, 3명을 넘는 경우는 실험 지원입니다. 따라서 회의록이나 인터뷰 파이프라인을 검토할 때는 이 제한을 먼저 반영하는 편이 안전합니다.

녹음본 기준 화자 구분은 최대 3명이고, 그 이상은 실험 지원입니다.

함수 호출에 대한 설명도 범위를 좁혀 읽어야 합니다. 공식 글은 이미지 생성이나 파일 분석처럼 복잡한 일을 다른 Gemini 모델에 넘기는 기능이 있으며, 현재는 Gemini macOS 앱에서 쓸 수 있다고 적습니다. 이를 API 일반 기능으로 단정해서는 안 됩니다.

어디에서 열려 있는가

공식 글은 공개 범위를 개발자, 기업, 일반 사용자로 나누어 설명합니다. 개발자는 Gemini API, Google AI Studio, Google Antigravity에서 공개 프리뷰로 접근할 수 있습니다. 기업은 Gemini Enterprise Agent Platform에서 공개 프리뷰로 열려 있고, Gemini Enterprise for Customer Experience에는 곧 제공된다고 적혀 있습니다.

일반 사용자 쪽에서는 macOS Gemini 앱이 영어로 안내되고, Android Rambler는 일부 국가·언어에서 제공됩니다. Chrome은 곧 제공 예정입니다. 또 Gboard Rambler는 말로 쓴 생각을 정리된 텍스트로 바꾸고, 음성으로 수정·맞춤법·문체 변경도 할 수 있다고 소개합니다.

모든 언어와 모든 국가에 동시에 열린 것은 아닙니다. 제품 표면마다 언어와 국가 조건이 다릅니다.

본문 도표

무엇이 아닌가

이번 발표는 Chirp 3가 오늘 사라진다는 뜻이 아닙니다. 공식 글은 Gemini 3.5 Transcribe가 Chirp 3 대비 능력, WER, 지연에서 개선됐다고 적지만, Chirp 3 종료 일정은 이 글에서 제시하지 않습니다.

또 전 세계 모든 사용자에게 즉시 열렸다는 발표도 아닙니다. Rambler는 일부 국가·언어, macOS Gemini 앱은 영어, Chrome은 곧이라는 조건이 붙어 있습니다. 화자 구분 역시 무제한이 아니라 녹음본 기준 최대 3명입니다.

벤치마크 밖 숫자를 덧붙이는 것도 피해야 합니다. WER, 70% 개선, FLEURS 수치는 공식 페이지와 Artificial Analysis 인용으로 적힌 값입니다. 그 밖의 정확도나 비용은 여기서 추정하지 않습니다.

도입 검토에서 먼저 볼 점

이 모델을 검토할 때는 먼저 어떤 표면을 쓸지 정하는 것이 좋습니다. API인지, Rambler인지, macOS 앱인지, Enterprise Agent Platform인지에 따라 조건이 다르기 때문입니다. 그다음에는 실시간 대화형 음성인지, 회의나 통화 로그 같은 녹음본인지 구분하면 됩니다.

대화형 음성은 gemini-3.5-transcribe-live, 회의·통화 로그는 gemini-3.5-transcribe입니다. 샘플 오디오를 AI Studio 공개 프리뷰에서 돌려 보고, 맞춤 어휘가 필요한 용어 목록을 먼저 준비한 뒤 결과를 비교하면 됩니다. 공식 WER 수치를 우리 도메인 점수로 바꾸지 말고, 우리 오디오로 다시 재는 편이 맞습니다.

기업 계정이라면 Enterprise Agent Platform 권한을 확인할 필요가 있습니다. Customer Experience 쪽은 곧 제공이라고 적혀 있으므로, 오늘 일정에 확정 배포로 넣기에는 이릅니다.

공식 숫자는 참고이고, 실제 검토는 우리 오디오로 다시 잰 결과를 함께 봐야 합니다.

숫자와 제품 표면을 섞지 않는 정리법

도입 검토서에는 숫자와 제품 표면을 나누어 적는 편이 좋습니다. WER 4.0%와 2.6%는 Artificial Analysis 평균값이고, FLEURS 5.50%와 5.04%는 상위 언어·로케일 집합 기준입니다. 반면 macOS Gemini 앱은 영어, Rambler는 일부 국가·언어, Chrome은 곧, API는 공개 프리뷰라는 식으로 제품 표면의 조건은 별도로 적어야 합니다.

화자 3명 제한도 요구사항에 먼저 반영해야 합니다. 4명 이상 회의를 기본 시나리오로 두면 실험 구간에 들어가게 됩니다. 정식 파이프라인이 필요하다면 3명 이하로 쪼개거나, 실험 구간임을 명시하는 편이 낫습니다.

또 함수 호출은 macOS 앱 문장이라는 점을 따로 적어 두는 것이 좋습니다. 앱 기능과 API 공개 프리뷰 범위를 같은 체크리스트에 넣으면 오해가 생길 수 있습니다.

한 페이지 요약

Google은 2026년 8월 26일 Gemini 3.5 Transcribe를 speech-to-text 모델로 공개했습니다. Android Rambler와 macOS Gemini 앱에 이미 쓰이고, Gemini API·AI Studio·Gemini Enterprise Agent Platform에서 공개 프리뷰입니다. Chrome에는 곧 웹 입력 상자에 말로 치는 기능이 온다고 적혀 있습니다. 실시간은 gemini-3.5-transcribe-live, 녹음본은 gemini-3.5-transcribe입니다. Artificial Analysis 기준 WER은 스트리밍 4.0%, 비스트리밍 2.6%입니다. Chirp 3 대비 time to final transcription은 70% 개선입니다. FLEURS 상위 언어·로케일에서는 스트리밍 5.50%, 비스트리밍 5.04% WER입니다. 언어는 85개 이상, 화자는 최대 3명이며 초과는 실험입니다. 스마트 전사, 맞춤 어휘, 함수 호출은 목록에 포함되지만, 함수 호출은 macOS 앱 기준으로 적혀 있습니다.

공식 글은 Antigravity, Gboard Rambler, AI Studio Build mode 음성 코딩도 함께 소개합니다. 화면 맥락과 채팅 기록을 허가 하에 쓰는 Antigravity, Gboard Rambler, AI Studio Build mode에 대한 설명은 모두 원문 범위 안에서 읽는 것이 좋습니다. 권한 동의 문장과 제품별 조건을 분리해서 보는 편이 안전합니다.

또 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 같은 이름과 Vivo, Intellitek Health, Lingopal의 피드백도 공식 글에 등장하지만, 이는 소개 사례입니다. 우리 계약이나 우리 벤치 결과로 옮겨 적을 수는 없습니다.

참고 자료

Google — Introducing Gemini 3.5 Transcribe (2026-08-26)

여러분이라면 이 모델을 실시간 음성 인터페이스와 녹음본 전사 중 어느 쪽부터 검토해 보고 싶으신가요?