Google представила Gemini 3.5 Transcribe — свою самую совершенную модель для распознавания живой речи

Она эффективно чистит речь от слов-паразитов и лишних реплик.

Google представила Gemini 3.5 Transcribe — свою самую совершенную модель для распознавания живой речи

Google представила обновлённую модель для преобразования живой речи в текст, Gemini 3.5 Transcribe. С её помощью можно как эффективно надиктовывать сообщения в мессенджерах, так и взаимодействовать с ИИ-ассистентом Gemini.

В Google выделяют три особенности новой модели — умение быстро избавляться от слов-паразитов, возможность в реальном времени переводить речь на разных языках, а также углублённое понимание контекста сказанного.

Полная расшифровка сообщения против сокращённого ИИ-моделью варианта
Полная расшифровка сообщения против сокращённого ИИ-моделью варианта

В приведённых компанией примерах показано, что Gemini 3.5 Transcribe оперативно «чистит» речь от ненужных слов вроде лишних междометий, а также от целых ошибочно сказанных реплик. Если пользователь предложил другу встретиться в одном кафе, а затем передумал и предложил другое место встречи, модель моментально адаптируется и оставляет только актуальный вариант в итоговом сообщении.

Во всех показанных компанией бенчмарках Gemini 3.5 Transcribe показала результаты лучше, чем у конкурентов вроде ElevenLabs Scribe v2.

API новой ИИ-модели уже доступна разработчикам для встраивания в свои продукты. Опробовать Gemini 3.5 Transcribe также можно в Google AI Studio, клавиатуре Gboard для Android и приложении Gemini для MacOS. В будущем модель встроят в браузер Chrome.