Gemini 3.5 Transcribe: Интеллектуальная транскрипция как новый стандарт голосового интерфейса
Google DeepMind представил модель Gemini 3.5 Transcribe — наиболее точную на данный момент систему преобразования речи в текст. Созданная для работы в реальных условиях с фоновым шумом и сложной лексикой, модель не просто фиксирует звуки, но и очищает текст от пауз, автоматически форматирует его и поддерживает функцию вызова других нейросетей для выполнения задач. Доступна через открытые API для разработчиков и уже интегрирована в инструменты Android и macOS.

# Интеллектуальная транскрипция с Gemini 3.5 Transcribe
Компания Google DeepMind анонсировала выпуск новой версии своей модели для преобразования речи в текст — Gemini 3.5 Transcribe. По словам команды разработчиков, эта модель стала самым точным инструментом в своей категории, способным превращать сырое аудио в структурированный, готовый к использованию текст в реальном времени. В отличие от традиционных систем распознавания речи, которые часто страдают от ошибок в шумных условиях или при наличии профессиональной терминологии, новая модель демонстрирует высокую устойчивость и способность понимать намерение говорящего.
Важно: Компания подчеркивает, что эта модель представляет собой эволюцию предыдущих решений, таких как Chirp 3, предлагая не только улучшение точности, но и значительно сниженную задержку обработки данных.
Технические характеристики и точность
Основные преимущества Gemini 3.5 Transcribe связаны с её способностью работать в сложных акустических условиях. Согласно официальным данным, представленным на платформе Artificial Analysis, модель демонстрирует среднюю частоту ошибок слова (Word Error Rate, WER) на уровне 4.0% в режиме потоковой передачи и 2.6% при обработке записанного аудио. Это существенно ниже показателей предыдущих поколений.
Технологический прогресс также проявился в скорости работы. Время, необходимое для получения окончательной транскрипции, сократилось на 70% по сравнению с предыдущей моделью. Это позволяет использовать технологию в сценариях, где каждая секунда имеет значение, таких как интерактивные голосовые приложения.
Ключевые метрики производительности
* Режим потоковой передачи: Средняя ошибка слова (WER) составляет 5.50% по набору данных FLEURS (для верхних языков и локалей). Задержка между говорением и появлением текста составляет менее одной секунды. * Обработка записанного аудио: Точность достигает 5.04% WER с возможностью привязки текста к уровням слов и идентификации до трех спикеров. * Многоязычность: Поддержка более 85 языков с автоматическим определением языка речи и адаптацией к региональным акцентам и диалектам.
Умная очистка и форматирование
Одной из главных особенностей модели является способность «понимать» естественный поток речи. Она автоматически фильтрует дисфлуэнции — слова-паразиты вроде «э-э», «ну», а также исправляет самовыправления говорящего. Например, если пользователь меняет план, сказав «Давайте встретимся во вторник — нет, в среду», модель корректно сформулирует окончательное намерение, опуская момент исправления.
Для разработчиков это открывает возможности создания более естественных интерфейсов, где пользователь может диктовать сложные инструкции без необходимости редактировать каждую фразу.
Интеграция и функционал
Gemini 3.5 Transcribe разработан не как изолированный инструмент, а как модуль, глубоко интегрированный в экосистему Google. Модель способна выполнять функцию вызова (function calling), делегируя сложные задачи другим моделям Gemini. Например, при голосовом запросе система может автоматически сгенерировать изображение, проанализировать документ или создать файл, используя соответствующие инструменты в фоне.
Технология доступна через два основных API:
1. Real-time streaming (Live API): Обеспечивает двустороннюю потоковую передачу с малой задержкой, идеальную для голосовых ассистентов и живых субтитров. 2. Pre-recorded audio processing (Interactions API): Предназначена для анализа записей, встреч и логов звонков с указанием атрибуции спикеров и временных меток.
Практическое применение в продуктах Google
Уже сейчас возможности модели тестируются в ряде продуктов компании: * Android (функция Rambler): На клавиатуре Gboard пользователи могут диктовать текст, который автоматически очищается от пауз и форматировается. Это позволяет быстро создавать заметки или сообщения. * macOS (Gemini app): В десктопном приложении поддерживается голосовой ввод с поддержкой контекста экрана. Пользователь может командовать моделью голосом: например, попросить создать изображение в точках курсора или переработать текст документа. * Google Antigravity: Интеграция позволяет использовать историю чата и контекст экрана для точной транскрипции файлов и мыслей агентов.
Компания обещает, что вскоре эта функциональность появится и в браузере Chrome, позволяя пользователям диктовать ответы в любых полях ввода или создавать посты.
Доступ для разработчиков и бизнеса
Google открыл доступ к технологии для сторонних разработчиков через Gemini API, доступную в Google AI Studio и платформе Gemini Enterprise Agent Platform. Экосистема сторонних решений уже начала поддержку новой модели: * Платформы: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents уже позволяют интегрировать транскрипцию в свои решения. * Корпоративный сектор: Компании vivo, Intellitek Health и Lingopal подтвердили, что модель хорошо справляется с задачами низкой задержки и широкой языковой поддержки.
Для разработчиков модель доступна в публичном превью, а для предприятий — через платформу Gemini Enterprise Agent Platform, с планами по расширению возможностей для клиентского опыта в скором времени.
Таким образом, Gemini 3.5 Transcribe знаменует собой переход от простого распознавания звуков к интеллектуальной обработке речи, где контекст и намерение становятся ключевыми факторами точности.