LIVE
Новость

Google DeepMind представила модель Gemini 3.5 Transcribe для распознавания речи

Впихнуть голосовое управление в общий API — идея красивая, пока не начинаешь считать, сколько токенов уходит на пятиминутную аудиозаметку.

Тамила Шерстнева·обновлено 03 сентября 2026 г.

Google DeepMind представила модель Gemini 3.5 Transcribe для распознавания речи

Google DeepMind 26 августа как раз выкатил Gemini 3.5 Transcribe — speech-to-text модель, посаженную в основной Gemini API. Для разработчиков это отсутствие отдельного SDK и биллинг аудио в тех же токенах, что и текст; вопрос один — реальный прогресс или очередная попытка обогнать конкурентов красивыми графиками.

Что под капотом

Суть модели — не просто распознавать звук, а разбираться в речи: ловить самоисправления (классическое «встретимся завтра, нет, в пятницу»), выкидывать слова-паразиты вроде «э-э-э», разделять спикеров и через function calls дёргать другие модели Gemini — например, чтобы по голосовой команде сгенерировать картинку или проанализировать файл. По данным компании, решение заменяет Chirp 3 как флагманское для транскрибации.

Идентификаторы стандартные: gemini-3.5-transcribe для batch-аудио и gemini-3.5-transcribe-live для стриминга. По замерам Artificial Analysis, модель даёт 4,0% WER в стриминге и 2,6% в обычном режиме; время до финальной транскрипции улучшилось на 70% по сравнению с Chirp 3.

Конкуренты не дремлют

Word Error Rate считает пропущенное «э-э-э» так же, как пропущенное название лекарства — сравнивать вендоров лоб в лоб дело скользкое. Microsoft в апреле выкатил MAI-Transcribe-1 с 3,8% WER на FLEURS по 25 языкам, OpenAI в мае запустила GPT-Realtime-Whisper за $0,017 в минуту. AssemblyAI с Universal-3.5 Pro обходит ElevenLabs Scribe v2 и Deepgram Nova-3 на code-switching бенчмарках — 7,69% против 8,77% и 12,22%. Google разрыв закрывает, но нишевые провайдеры по-прежнему богаче на post-processing: AssemblyAI даёт анализ тональности, редакцию PII, извлечение сущностей.

Модель уже крутится в Rambler на Android, Gemini-приложении на macOS и в Google Antigravity; диктовка в Chrome обещана в ближайшее время. Для экспериментаторов главный вход — бесплатное публичное превью через Google AI Studio с Build-режимом, где голосовое приложение собирается прямо в браузере без оплаты API. Для расшифровки поп-культурных интервью и звёздных подкастов это тоже рабочий сценарий — вместо часов ручной расшифровки получаешь связный текст за минуты.

Вердикт

Строите в Google-стеке — пробуйте ради бесплатного превью и единой API-поверхности. Нужен серьёзный post-processing — пока присматривайтесь к AssemblyAI. Хотите просто диктовать заметки в браузере — дождитесь Chrome-диктовки, чтобы оценить модель в реальных условиях, а не на синтетических бенчмарках. И не ведитесь на низкий WER как на абсолютную истину: разработчики моделей отлично умеют рисовать красивые цифры на собственных же тестах.