Suno запускает функцию генерации речи: от музыки к повествованию
Музыкальная платформа на базе искусственного интеллекта Suno официально расширила свой функционал, представив бета-версию новой функции Speech. Теперь сервис позволяет генерировать синтетические голоса, читающие предоставленные скрипты или созданные по описанию, и совмещать их с фоновой музыкой. Данная возможность доступна пользователям веб-версии и мобильных приложений, хотя компания подчеркивает, что качество модели продолжает совершенствоваться на основе обратной связи сообщества.
# Suno выходит за рамки музыки: появление функции генерации речи
Компания Suno, известная своими возможностями создания музыки с помощью искусственного интеллекта, сделала важный шаг в диверсификации своего портфеля продуктов. 2 октября 2026 года сервис анонсировал запуск новой функции под названием Speech, которая переводит платформу в область текстового синтеза речи. Доступ к бета-версии открыт для пользователей как в веб-интерфейсе, так и через мобильные приложения.
Новая технология позволяет генерировать речь на основе текстовых сценариев (скриптов) или на основе подробных описательных промптов. Уникальная особенность решения заключается в способности системы создавать не просто аудиодорожку с голосом, а целостный аудиокомпозит, где синтезированная речь естественным образом сочетается с фоновой музыкой, настроенной под характер текста.
«Музыка всегда будет в центре того, что мы создаем в Suno. В то же время наше видение всегда касалось и других форм человеческой самовыражения», — заявил Джек Броди, главный продуктовый офицер Suno, в официальном комментарии к запуску.
Технические возможности и режимы работы
Инструмент предоставляет пользователям два основных режима работы, адаптированных под разные уровни подготовки:
1. Простой режим (Simple Mode): Платформа предлагает поле для промпта, где пользователь описывает желаемый результат сценарием. Например, запрос «капитан пиратов, призывает команду к бою» позволит ИИ сгенерировать соответствующий тон голоса и акустическое сопровождение без необходимости писать полный текст. 2. Расширенный режим (Advanced Mode): Этот вариант предназначен для пользователей, обладающих готовым текстом. Здесь можно загрузить собственный скрипт, задать пол голоса, выбрать стиль речи и регулировать уровень вариативности в генерации.
Максимальная продолжительность одной аудиокомпозиции с использованием новой функции составляет около восьми минут. Также предусмотрено гибкое управление: пользователь может отключить фоновую музыку с помощью переключателя, если требуется чисто речевой трек без мелодического сопровождения.
Контекст развития технологии и ограничения
Разработка голосовых моделей не является новой тенденцией в индустрии. Компании DeepMind исследуют синтез речи на основе глубокого обучения уже более десяти лет. Такие сервисы, как Adobe, предлагают собственные инструменты text-to-speech, а платформа ElevenLabs, запущенная в 2023 году, стала одной из самых узнаваемых в этой сфере. Выход Suno на этот рынок можно рассматривать как стратегию расширения возможностей платформы, учитывая, что генераторы музыки Suno ранее сталкивались с множеством юридических споров.
Сами разработчики Suno честно признают несовершенство текущей версии. Джек Броди отметил: «Бета действительно означает бета». В качестве примеров возможных сбоев были названы странности в акцентах (например, британское произношение, переходящее в австралийское) или чрезмерно драматичные паузы в речи. Компания уверена, что пользователи найдут множество новых применений для этой технологии, о которых сама разработка пока не догадывалась.
Специалисты отмечают, что сочетание музыки и речи открывает новые горизонты для творчества: от спокойного музыкального фона для поэтических чтений до энергичных саундтреков для драматических обращений. Несмотря на экспериментальный статус, функция уже демонстрирует потенциал для интеграции в различные медиа-проекты.