синтез речи · искусственный интеллект · архитектура нейросетей · арXiv · TTS · диффузионные модели4 августа в 10:01 · 3 мин

DLLM-TTS: Новый подход к синтезу речи с балансом скорости и качества

Исследователи из области вычислительного лингвистики представили новую архитектуру DLLM-TTS, объединяющую преимущества дискретных диффузионных моделей и кодировщиков нейросетей. Разрабатываемая на основе X-Codec2, эта система решает давнюю проблему компромисса между скоростью генерации и лингвистической точностью, обеспечивая реальное время рендеринга в 0,15 от оригинала при обучении на данных в объёме 20 тысяч часов.

# DLLM-TTS: Баланс скорости и точности в синтезе речи

Современные системы синтеза речи (Text-to-Speech) давно столкнулись с фундаментальным противоречием. Традиционные авторегрессивные модели на основе кодировщиков обеспечивают высокую разборчивость и естественность голоса, но требуют огромных вычислительных ресурсов и обучаются на колоссальных массивах данных. К тому же они генерируют звук последовательно, шаг за шагом, что ограничивает их скорость. С другой стороны, неавторегрессивные методы обещают мгновенный вывод, но часто жертвуют качеством и грамотностью речи, теряя интонации и смысловые акценты.

В свежей работе, зарегистрированной на arXiv под заголовком «DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis», авторы предлагают гибридное решение, которое, по их словам, позволяет преодолеть этот компромисс.

Блочная структура и диффузия

В основе новой архитектуры лежит концепция условной блочной дискретной диффузии. Модель работает с токенами аудиопотока, сгенерированными нейросетевым кодировщиком X-Codec2. Вместо того чтобы пытаться предсказать каждый звук в потоке сразу (что приводит к ошибкам) или по одному (что медленно), система разбивает последовательность на блоки.

Внутри каждого блока применяется механизм маскированной диффузии. Это процесс, напоминающий стирание зашумленного изображения, но в обратном направлении: модель «дорисовывает» недостающие части звука, основываясь на контексте. Блоки themselves обрабатываются последовательно, что позволяет модели улавливать глобальную структуру текста и синхронизировать речь с лексикой, сохраняя при этом локальную акустическую согласованность внутри каждого сегмента.

*Настоящий голос — это не просто набор звуков, а история, рассказываемая через ритм и паузы. Технология, учитывающая эти перерывы на уровне блоков, кажется наиболее близкой к пониманию живой речи.*

Эффективность и результаты

Ключевым преимуществом данного подхода становится скорость вывода. Благодаря возможности параллельного предсказания токенов внутри блоков, система не простаивает в ожидании предшествовающих элементов. Авторы сообщают о факторе реального времени (RTF), равном 0,15. Это означает, что модель генерирует звук в шестой части того времени, которое требуется для записи оригинального голоса.

Масштаб модели составляет 0,6 миллиарда параметров. Для сравнения, многие современные аналоги требуют значительно больших весов для достижения сопоставимой качества. Для обучения использовался набор данных объёмом 20 тысяч часов аудио. На тестовой платформе Seed-TTS-eval архитектура показала конкурентоспособные результаты, подтверждая гипотезу о том, что дискретные диффузионные языковые модели могут быть как практически применимыми, так и экономичными в плане данных.

Технический контекст

Для понимания сути метода важно пояснить несколько терминов.

Дискретный диффузионный язык: Это модель, которая работает не с непрерывными звуковыми волнами напрямую, а с дискретизированными представлениями (токенами). Диффузия здесь — это вероятностный процесс генерации данных. Модель учится переходить от случайного шума к структурированному звуковому потоку через серию шагов уточнения.

Блоки (Blocks): В данном контексте это сегменты речи фиксированной или адаптивной длины. Обработка блоками позволяет использовать параллельные вычисления внутри сегмента, ускоряя процесс, и последовательную логику между сегментами, сохраняя смысл.

X-Codec2: Нейросетевой аудиокодировщик, преобразующий сырой звук в последовательность коротких токенов. DLLM-TTS оперирует именно этими токенами, возвращая их обратно в форму речи с помощью диффузионного процесса.

Вывод

Представленная работа демонстрирует путь к более эффективному синтезу речи. Отказ от строгой последовательности в пользу блочной диффузии позволяет совместить скорость неавторегрессивных методов с качеством авторегрессивных. Хотя метод находится на стадии публикации и описания архитектуры, показатели RTF 0,15 и эффективность обучения на 20 тысячах часов внушают оптимизм. Если реализация не потребует избыточного количества параметров для стабильной работы, DLLM-TTS может стать важным шагом в демократизации качественных голосовых помощников и систем озвучки.

Источником данной информации служит предварительная публикация на arXiv (код 2608.00011), посвящённая разработке условной блочной дискретной диффузии для задач TTS.

Первоисточники

arXiv cs.CL
← Вернуться в эфир