Google · AI · Gemini · Транскрибация · Технологии · Новости ИИ29 августа в 02:02 · 4 мин

Google обновил модель транскрибации Gemini: теперь она убирает «э-э» и понимает 85 языков

Компания Google представила новую специализированную модель Gemini 3.5 Transcribe, которая интегрируется в экосистему Gemini Audio. Инструмент призван повысить точность распознавания речи, автоматически устраняя filler-слова и адаптируясь к профессиональной терминологии. Запуск модели совпал с ожиданием сообщества по поводу выхода основной версии Gemini 3.5 Pro, анонсированной ранее.

Серебристая волна речи из льда на ночном берегу: метафора точной транскрибации.

# Google обновил модель транскрибации Gemini: теперь она убирает «э-э» и понимает 85 языков

Компания Google объявила об обновлении функциональности Gemini Audio, представив новый инструмент — модель транскрибации Gemini 3.5 Transcribe. Это событие стало заметным обновлением в линейке голосовых AI-решений, несмотря на то, что пользователи всё ещё ожидают релиза основной модели Gemini 3.5 Pro, обещанной на июнь.

Новая модель направлена на решение конкретных проблем, с которыми сталкиваются пользователи при ведении заметок или обработке аудио. Главной задачей стало не только улучшение точности распознавания, но и очистка текста от бессмысленных слов, которые естественны в устной речи, но портят письменные записи.

Автоматическое редактирование речи

Согласно заявлению представителей Google, модель Gemini 3.5 Transcribe «представляет собой значительный скачок» по сравнению с предыдущей версией Chirp 3. Ключевое нововведение — способность модели автоматически определять и удалять слова-паразиты, такие как «um» (э-э) и «uh» (а-а), а также другие паузы.

По утверждению компании, пользователи могут «естественно редактировать текст с помощью голоса». Это означает, что система не просто транскрибирует всё подряд, а интеллектуально фильтрует поток речи, выдавая чистый текст. Также модель способна автоматически форматировать полученную информацию, структурируя её для удобства чтения.

Важным аспектом является возможность работы со сложной лексикой. Пользователи могут передать модели свой собственный словарь. Благодаря этому Gemini 3.5 Transcribe учитывает уникальные орфографические требования и профессиональный жаргон. Это предотвращает необходимость ручного исправления технических терминов или специфических названий, которые система могла бы иначе распознать ошибочно или заменить на общие слова.

Мультиязычность и работа с несколькими собеседниками

Технические возможности новой модели выходят далеко за рамки простой записи разговора. Gemini 3.5 Transcribe поддерживает более чем 85 языков, что делает инструмент применимым в глобальном масштабе, особенно учитывая рост популярности многоязычных коммуникаций.

Кроме того, модель получила функцию атрибуции речи. В предзаписанных аудиофайлах система может определять, кто именно произносит те или иные слова, выделяя голоса до трёх разных участников разговора. Это критически важно для анализа интервью, совещаний или судебных заседаний, где важно понимать не только содержание, но и динамику между спикерами.

Для профессионального использования разработчики получили доступ к данным на уровне отдельных слов (word-level timestamps). Это позволяет создавать хронологические карты событий внутри аудиофайла, синхронизируя текст с временем его произнесения.

Ожидания по поводу Gemini 3.5 Pro

Публикация информации о Gemini 3.5 Transcribe произошла на фоне возросшего интереса к серии моделей 3.5. Ранее Google анонсировала выход Gemini 3.5 Pro в июне, однако к моменту выхода новостей о новой транскрибации этой модели всё ещё не было.

В пресс-релизе Google утверждалось, что обновлённые версии Gemini 3.5 Live и 3.5 Live Experimental также должны были поступить в среду. Эти модели, согласно первоначальной информации, предназначены для улучшения обработки прерываний речи посередине предложения, более точного распознавания языков в реальном времени и визуальной обработки. Однако после публикации статьи компания прояснила ситуацию: дополнительные модели пока не запускаются, и конкретная дата их появления не была названа. На данный момент акцент смещён исключительно на новый инструмент для транскрибации.

Как получить доступ

Релиз Gemini 3.5 Transcribe начинается сегодня. Первоочередными получателем обновлений стали пользователи приложения Gemini на macOS в английской версии. Ограниченный запуск также планируется для функции «Rambler» (диктофона) на Android в отдельных странах и для определённых языков.

Для разработчиков доступ к API модели открыт в публичной предварительной версии через платформу AI Studio и проект Antigravity. Поддержка браузера Chrome, согласно планам Google, должна быть добавлена в ближайшее время.

Таким образом, Google делает важный шаг в демократизации качественной обработки речи, предоставляя инструменты, которые раньше могли быть доступны лишь узкому кругу экспертов, широкой аудитории. Точность, контекстная осведомлённость и поддержка множества языков становятся стандартом, к которому стремится искусственный интеллект в повседневном использовании.

Первоисточники

The Verge AI
← Вернуться в эфир