Gemini 3.8: Google представляет новые модели синтеза речи с уникальной генерацией голосов
Компания Google DeepMind обновила семейство моделей Gemini двумя новыми инструментами для синтеза речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти модели позволяют пользователям создавать персонализированные голоса с нуля или клонировать существующие, обеспечивая беспрецедентный контроль над интонацией, эмоциями и темпом в аудиопроектах. Запуск инструмента сопровождается внедрением дополнительных механизмов безопасности, включая верификацию согласия и водяные знаки для защиты авторских прав.
# Gemini 3.8: Новый этап в развитии голосовых интерфейсов от Google
Компания Google официально представила два новых продукта в рамках своей экосистемы искусственного интеллекта — модели синтеза речи Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Это обновление переводит генерацию искусственного голоса из категории статичных пресетов в уровень динамической творческой студии. По словам представителей команды Gemini Audio, включая продюгруппу-менеджера Леланда Рехиса и директора по научным исследованиям Алана Кауэна, новые модели позволяют создавать богатые аудиоопыты, необходимые как для крупных медиапроектов, так и для индивидуальных разработчиков.
Гибридный подход к созданию голосов
В основе обновлений лежит четкое разделение задач между двумя моделями, что делает их применимыми в широком спектре сценариев использования.
Gemini 3.8 Flash TTS ориентирована на глубокую творческую разработку и дизайн персонажей. С её помощью можно создать полностью новый голос, используя естественные языковые команды. Это открывает возможности для игр, интерактивных аудиокниг и иммерсивного повествования. Модель обеспечивает детальный контроль над каждым акцентом, интонацией и эмоциональным подтекстом фразы. Разработчики могут указывать актерские паузы, смены диалектов и даже внедрять реалистичные реакции собеседника, такие как кивки или смех.
Gemini 3.8 Flash-Lite TTS, в свою очередь, оптимизирована для масштабирования. Она разработана для задач, требующих высокой производительности при низкой стоимости, таких как массовый дубляж контента, создание подкастов и развертывание голосовых агентов. Эта модель сохраняет контроль над тонкостью передачи эмоций, но работает быстрее, что критически важно для обработки больших объемов данных.
Согласно официальным данным, модели демонстрируют значительное улучшение по сравнению с предыдущей версией (Gemini 3.1 Flash TTS). В частности, отмечается прогресс в обработке длинного контента и управлении диалогами с двумя говорящими, где сохраняются различия между голосами и естественность смены реплик.
Инструментарий для творцов и разработчиков
Новые возможности доступны через несколько ключевых платформ: Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids.
Создатели могут строить библиотеки из более чем 2000 готовых к использованию голосов, поддерживающих широкий спектр диалектов, включая мексиканский испанский, канадский французский и шотландский английский. Также доступна функция создания голосов с нуля, где система позволяет настраивать более 100 языков и диалектов. Пользователь может сгенерировать голос драконьего повествователя или харизматичного диджея, используя текстовые подсказки.
Для реализации персонализации предусмотрена возможность клонирования голоса на основе образца длительностью всего 30 секунд. Однако этот процесс ограничен строгими этическими нормами. Кроме того, система позволяет сохранять созданные профили, минимизируя искажение звука (drift) при длительных проектах, таких как аудиокниги, продолжительностью в несколько часов.
Технический контроль над выступлением осуществляется построчно. Пользователи могут добавлять сценарные указания, например, «шепот» или «уверенный тон», либо использовать специализированные маркеры для передачи невербальных звуков, таких как вздохи, вздохи разочарования или фразы согласия в разговоре.
Безопасность и этика в синтезе речи
С запуском новых моделей Google акцентировала внимание на вопросах доверия и прозрачности. Для предотвращения злоупотреблений технологиями клонирования голосов внедрена система верификации согласия.
Согласно политике компании, для создания копии голоса на основе чужого аудио требуется письменное разрешение владельца, подтвержденное голосовой записью, соответствующей референсному образцу. Это гарантирует, что создание цифровых двойников голосов происходит только с согласия их владельцев.
В целях борьбы с дезинформацией каждый сгенерированный аудиофрагмент помечается невидимым водяным знаком SynthID. Этот маркер вплетается непосредственно в звуковую дорожку, позволяя программно детектировать синтезированный контент, не нарушая его слышимость для человека. Для дополнительной защиты и прозрачности используются учетные данные C2PA.
Важно отметить, что функция клонирования голосов через Google AI Studio в настоящее время недоступна в некоторых регионах, включая штаты Иллинойс и Техас, а также в странах Европейского экономического пространства, Великобритании и Индии. Доступ к API для предприятий будет предоставлен позже через платформу Gemini Enterprise.
Официальные показатели эффективности
Google заявляет, что новые модели заняли лидирующие позиции в независимых бенчмарках. Согласно данным Hume AI, модель Gemini 3.8 Flash TTS набрала 71,4 балла по индексу дизайна голоса (Voice Design Benchmark), заняв первое место среди конкурентов. Также модель лидирует в категории моделирования акцентов (60,8 баллов).
Результаты слепых тестов предпочтений пользователей на платформе Voice Arena подтвердили лидерство Gemini 3.8 Flash и Flash-Lite TTS в нескольких ключевых мировых языках, включая японский, бразильский португальский, вьетнамский, стандартный арабский, мексиканский испанский и хинди. Эти данные свидетельствуют о том, что инструмент способен генерировать речь, которая на слух неотличима от человеческой в широком спектре культурных и языковых контекстов.