Google DeepMind представила модель Gemini 3.5 Transcribe для распознавания речи
Впихнуть голосовое управление в общий API — идея красивая, пока не начинаешь считать, сколько токенов уходит на пятиминутную аудиозаметку.
Тамила Шерстнева·обновлено 03 сентября 2026 г.

Google DeepMind 26 августа как раз выкатил Gemini 3.5 Transcribe — speech-to-text модель, посаженную в основной Gemini API. Для разработчиков это отсутствие отдельного SDK и биллинг аудио в тех же токенах, что и текст; вопрос один — реальный прогресс или очередная попытка обогнать конкурентов красивыми графиками.
Что под капотом
Суть модели — не просто распознавать звук, а разбираться в речи: ловить самоисправления (классическое «встретимся завтра, нет, в пятницу»), выкидывать слова-паразиты вроде «э-э-э», разделять спикеров и через function calls дёргать другие модели Gemini — например, чтобы по голосовой команде сгенерировать картинку или проанализировать файл. По данным компании, решение заменяет Chirp 3 как флагманское для транскрибации.
Идентификаторы стандартные: gemini-3.5-transcribe для batch-аудио и gemini-3.5-transcribe-live для стриминга. По замерам Artificial Analysis, модель даёт 4,0% WER в стриминге и 2,6% в обычном режиме; время до финальной транскрипции улучшилось на 70% по сравнению с Chirp 3.
Конкуренты не дремлют
Word Error Rate считает пропущенное «э-э-э» так же, как пропущенное название лекарства — сравнивать вендоров лоб в лоб дело скользкое. Microsoft в апреле выкатил MAI-Transcribe-1 с 3,8% WER на FLEURS по 25 языкам, OpenAI в мае запустила GPT-Realtime-Whisper за $0,017 в минуту. AssemblyAI с Universal-3.5 Pro обходит ElevenLabs Scribe v2 и Deepgram Nova-3 на code-switching бенчмарках — 7,69% против 8,77% и 12,22%. Google разрыв закрывает, но нишевые провайдеры по-прежнему богаче на post-processing: AssemblyAI даёт анализ тональности, редакцию PII, извлечение сущностей.
Модель уже крутится в Rambler на Android, Gemini-приложении на macOS и в Google Antigravity; диктовка в Chrome обещана в ближайшее время. Для экспериментаторов главный вход — бесплатное публичное превью через Google AI Studio с Build-режимом, где голосовое приложение собирается прямо в браузере без оплаты API. Для расшифровки поп-культурных интервью и звёздных подкастов это тоже рабочий сценарий — вместо часов ручной расшифровки получаешь связный текст за минуты.
Вердикт
Строите в Google-стеке — пробуйте ради бесплатного превью и единой API-поверхности. Нужен серьёзный post-processing — пока присматривайтесь к AssemblyAI. Хотите просто диктовать заметки в браузере — дождитесь Chrome-диктовки, чтобы оценить модель в реальных условиях, а не на синтетических бенчмарках. И не ведитесь на низкий WER как на абсолютную истину: разработчики моделей отлично умеют рисовать красивые цифры на собственных же тестах.