Google представила обновлённую модель для преобразования живой речи в текст, Gemini 3.5 Transcribe. С её помощью можно как эффективно надиктовывать сообщения в мессенджерах, так и взаимодействовать с ИИ-ассистентом Gemini.
В Google выделяют три особенности новой модели — умение быстро избавляться от слов-паразитов, возможность в реальном времени переводить речь на разных языках, а также углублённое понимание контекста сказанного.
В приведённых компанией примерах показано, что Gemini 3.5 Transcribe оперативно «чистит» речь от ненужных слов вроде лишних междометий, а также от целых ошибочно сказанных реплик. Если пользователь предложил другу встретиться в одном кафе, а затем передумал и предложил другое место встречи, модель моментально адаптируется и оставляет только актуальный вариант в итоговом сообщении.
Во всех показанных компанией бенчмарках Gemini 3.5 Transcribe показала результаты лучше, чем у конкурентов вроде ElevenLabs Scribe v2.
API новой ИИ-модели уже доступна разработчикам для встраивания в свои продукты. Опробовать Gemini 3.5 Transcribe также можно в Google AI Studio, клавиатуре Gboard для Android и приложении Gemini для MacOS. В будущем модель встроят в браузер Chrome.


