Grok Voice Transcribe 2.0 — 정확도는 2배, 배치 요금은 시간당 0.10달러 그대로 | DAKER 커뮤니티

Grok Voice Transcribe 2.0 정확도 2배 · 동일 가격 설명용 생성 이미지

음성 인식 정확도를 올리면서 요금표는 그대로 두는 업데이트가 나왔습니다. xAI(SpaceXAI)는 9월 18일 Grok Voice Transcribe 2.0을 공개했습니다. 자체 평가에서 1.0 대비 정확도가 약 두 배이고, 배치·스트리밍 가격은 시간당 0.10달러·0.20달러로 동일하다고 밝혔습니다. 이 글에서는 공개 벤치마크, 내부 평가 축, API 기능과 기본 모델 전환 일정을 정리합니다.

무엇을 바꾸려는 모델인가

Transcribe 2.0은 Grok Voice의 오디오 기반 모델 위에 올라간 최신 음성-텍스트 모델입니다. 회사는 깨끗한 단일 화자 녹음보다, 불안정한 통화선·겹치는 목소리·억양·숫자·이메일이 섞인 실제 환경 오디오에 맞춰 학습했다고 적었습니다. Grok Voice는 하루 수만 건의 고객지원 통화, 수백만 시간 분량의 영상 내레이션, Tesla 차량 안 Grok 어시스턴트 등에도 쓰인다고 소개합니다.

가격을 올리지 않은 채 정확도만 끌어올린 점이, 기존 Speech-to-Text API 사용자에게 바로 체감되는 변화입니다.

정확도 지표와 내부 평가

공개 Artificial Analysis 리더보드에서는 스트리밍 모델 32개 중 정확도 1위로 올랐다고 밝혔습니다. 내부 평가 축은 네 가지입니다. 고객지원 통화(전화 8 kHz), Grok 대화, 계좌번호·이메일 같은 크리덴셜 읽기, 19개 언어의 짧은 음성 명령입니다. 네 축 모두에서 1.0보다 개선됐고, 전화 통화에서는 비교한 모델 중 선두라고 적었습니다.

다국어는 가장 큰 개선 영역으로 꼽혔습니다. 언어를 자동 감지하고, 녹음 중 언어가 바뀌어도 한 패스로 따라간다고 합니다. 짧은 명령어 세트에서는 단어 오류율(WER)이 20.6%에서 6.8%로 줄었다고 공개했습니다.

API 기능과 가격

기존 Speech-to-Text API 연동은 코드 변경 없이 정확도 개선을 받는다고 안내합니다. 배치·스트리밍, 단어 단위 타임스탬프·신뢰도, 화자 분리(추가 요금 없음), 최대 8채널 독립 전사, 요청당 최대 100개 도메인 용어 바이어싱, 숫자·날짜·통화·전화·이메일 서식화, 간투어 제거, 음성 에이전트용 턴 감지까지 포함됩니다.

배치 전사 0.10달러/시간, 스트리밍 0.20달러/시간이며 화자 분리·타임스탬프·키워드가 포함됩니다. 곧 Transcribe 2.0이 API 기본값이 되고, 1.0은 수주 내 폐기 예정이므로 전환기에는 grok-voice-transcribe-1.0을 고정하면 된다고 적었습니다.

Atlassian Loom은 기존 솔루션보다 정확하다고 평가했고, 전사본을 Cursor로 넘겨 코드 변경까지 이어가는 워크플로를 소개했습니다.

마치며

이번 발표는 새 요금제보다, 동일 단가에서 실세계·다국어 정확도와 API 기본값을 바꾸는 업데이트입니다. 콜센터·회의록·영상 자막·차량 음성 명령을 쓰는 팀은 스트리밍 리더보드 순위와 짧은 명령 WER 수치를 기준으로 재측정해 볼 만합니다. 여러분 서비스에서는 어떤 오디오 구간부터 2.0 대비 측정을 시작하시겠습니까?

출처