Silero добавил синтез речи для 29 языков России: акцент на кавказских и тюркских группах
Команда Silero TTS представила обновление своих моделей искусственного интеллекта, расширив поддержку речи до 29 языков России и СНГ. Новая версия исправляет предыдущее упущение, внедрив поддержку языков Кавказа (абхазо-адыгской и нахско-дагестанской групп) и ряд тюркских языков, включая калмыцкий и таджикский, при сохранении принципов открытого исходного кода и доступности.
# Стабильный синтез речи для ещё 29 языков России
Команда разработчиков из Silero, известная своими открытыми решениями в области распознавания и синтеза речи, объявила о выходе новой версии модели TTS (Text-to-Speech). Если предыдущий релиф покрывал лишь 20 самых распространённых языков, то сейчас фокус сместился на лингвистически значимые группы, ранее оставленные без полноценного озвучивания: языки Кавказа, Дагестана, а также представители тюркской семьи.
Расширение охвата: от общеупотребительных к региональным
Основной целью текущего обновления стало устранение лингвистических пробелов. На прошлых этапах разработки модели не поддерживали абхазо-адыгские и нахско-дагестанские языковые группы, что оставило без доступа к качественному синтезу многие носители языка на Северном Кавказе.
В новом пакете выпущены две отдельные модели, каждая из которых оптимизирована для конкретной языковой семьи:
1. Кавказская модель: поддерживает 15 языков и насчитывает 31 уникальный голос. В её состав вошли представители нахско-дагестанской группы (аварский, чеченский, даргинский, ингушский, лезгинский и др.) и абхазо-адыгской группы (абазинский, адыгейский). 2. Тюркская модель: охватывает 14 языков с общим числом 22 голосов. Сюда вошли алтайские и тюркские языки (алтайский, кумыкский, татарский, башкирский), а также уникальные голоса для языков Сибири и Центральной Азии (калмыцкий, якутский, чукотский).
Раньше языки Кавказа и тюркские были в списке поддерживаемых, но качество их озвучки было значительно ниже общеизвестных российских языков (русский, английский, немецкий). Теперь команда Silero заявляет о стабилизации синтеза и улучшении качества речи.
Как запустить синтез
По замыслу авторов, использование новых моделей должно быть максимально простым. Предусмотрены три основных способа запуска, от самого простого до более продвинутого:
1. Через браузер
Прямо в браузере можно запустить демонстрацию, используя специально подготовленный ноутбук с примерами. Этот метод не требует установки дополнительного программного обеспечения на компьютер пользователя.
2. С помощью Python (pip) или torch.hub
Для более сложного применения и автоматизации можно установить официальный pip-пакет silero:
```python !pip install silero from silero import silero_tts
# Загрузка модели и пример текста model, example_text = silero_tts(language='ru', speaker='v5_turkic')
# Применение синтеза audio = model.apply_tts( text='Болар барысы да шул кадәр серле һәм акыл җитмәслек катлаулы.', speaker='tat_3' ) ```
Для кавказской модели код выглядит аналогично, меняется лишь язык и конкретный спикер (например, kbd_1 для кабардино-черкесского языка):
python model, example_text = silero_tts(language='ru', speaker='v5_caucasian') audio = model.apply_tts( text='Зэи тхузэӏумыхын хуэдэу зэӏуаща щэхущ ахэр.', speaker='kbd_1' )
3. Локальный запуск
Продвинутые пользователи могут загрузить полный репозиторий с исходным кодом и запустить модели локально. Это позволяет использовать собственные конфигурации, оптимизировать процесс под конкретное железо или интегрировать синтез в собственные сложные приложения.
Рекомендации по установке: Перед запуском моделей рекомендуется вручную установить необходимую версию PyTorch (для GPU или CPU) и выбрать оптимальное число потоков для CPU-устройств. Использование опциональных форматов SSML также поддерживается для более тонкой настройки интонации.
Особенности и ограничения
Особый интерес представляет способность моделей генерировать речь для языков с похожим звучанием, даже если у них нет качественного параллельного корпуса для обучения. Однако, как признают сами разработчики, использование нейросетевых переводчиков для генерации текста «на лету» остаётся слабым местом, поскольку они склонны к ошибкам.
Команда Silero также отмечает, что текущие версии имеют ограничения по сравнению с коммерческими решениями:
* Отсутствие ударений: В этой версии не реализована точная постановка ударений, что может влиять на естественность произношения в некоторых языках. * Ограниченная эмоциональность: Модели пока не поддерживают сложные интонационные модуляции (вопросы, акценты), хотя работа в этом направлении ведётся. * Ресурсные ограничения: Обновление моделей потребует времени и ресурсов, которые в текущем проекте были ограничены.
Что дальше?
Авторы проекта анонсировали планы по дальнейшему улучшению архитектур моделей и внедрению интонационной модуляции. Также планируется обновление всей линейки моделей, чтобы они стали более универсальными и качественными без перехода на серверное оборудование. Все исследования и обновления будут опубликованы в открытом доступе.
*Теги*: silero, синтез речи, tts, text-to-speech, нейросети, озвучка, языки России, тюркские языки, кавказские языки, нахско-дагестанские языки.
*Ресурсы*: * [GitHub репозиторий Silero Models](https://github.com/snakers4/silero-models) * [Статья на Habr о синтезе](https://habr.com/ru/articles/968988/) * [Примеры использования в ноутбуке](https://habr.com/ru/articles/1015942/)