Решение проблемы агрегации: MWS AI открыли инструмент RESON и бенчмарк OSD для оценки ASR
Команда MWS AI сделала публично доступным RESON — программный инструмент для глубокого анализа качества моделей распознавания речи (ASR), а также датасет RESON OSD. Эти ресурсы призваны помочь разработчикам выйти за рамки одной метрики WER и детально изучать ошибки на доменных словах, в цифрах и под влиянием фонового шума.
# Больше, чем одно число: как MWS AI открыли инструменты для глубокой диагностики ASR
Технический лидер команды распознавания речи MWS AI Александр Шевченко объявил об открытом доступе двух ресурсов, разработанных на основе внутреннего опыта: платформы RESON (Research Engine for Speech & Observation Notes) и бенчмарка RESON OSD.
В мире автоматического распознавания речи (ASR) часто возникает ситуация, когда глобальная метрика качества скрывает критические сбои модели на важных для бизнеса терминах. Новое решение и датасет направлены на решение именно этой задачи, предоставляя инженерам детальный разбор ошибок, статистику по словарю и проверенную выборку данных для тестирования.
Почему одной метрики WER недостаточно?
Современные системы оценивания часто опираются на Word Error Rate (WER) — среднюю ошибку на слово. Она рассчитывается как количество ошибок (замен, вставок, удалений), деленное на общее количество слов в эталонной транскрипции. Метрика проста, воспроизводима и полезна для быстрой сортировки моделей на соревнованиях.
Однако в реальном продакшн-окружении WER часто становится «слепым пятном». Агрегированное число на весь датасет скрывает распределение ошибок. Модель может демонстрировать отличный средний результат, но систематически терпеть неудачи в узких доменах (например, названия банков или коды ошибок), на которые в общем потоке речи приходится всего несколько процентов обращений. Более того, WER одинаково штрафует разные типы ошибок: пропуск ключевого слова (удаление) и добавление лишнего слова (вставка). Для голосового ассистента эти две проблемы требуют совершенно разных решений, но в отчете WER они выглядят идентично.
Кроме того, стандартная метрика жестко реагирует на вариативность написания англицизмов (например, «кешбэк» vs «кэшбэк»). Формально это ошибка, но фактически модель услышала корректно. Игнорирование таких нюансов может привести к тому, что поиск по конкретным терминам в базе обращений будет давать нулевые результаты при заявленном высоком качестве модели.
RESON: от скриптов к единой платформе
Чтобы преодолеть ограничения WER, коллектив MWS AI выстроил инструмент RESON. Изначально это были разрозненные скрипты для нормализации текста и подсчета метрик. В процессе работы выяснилось, что для полноценного анализа недостаточно просто посчитать ошибку — необходимо понимать ее природу.
В ядре RESON заложен новый подход к анализу. Платформа оперирует не одним числом, а тремя ключевыми метриками, которые дают разностороннюю картину качества:
1. WER (Word Error Rate): Классический показатель общей точности. 2. MWA (Mean Word Accuracy): Средняя точность слова. В отличие от WER, которая взвешивает ошибки частотой слова (популярные слова считаются за все), MWA оценивает каждое уникальное слово с одинаковым весом. Это позволяет выявить слабые места модели на редких, но критически важных терминах. 3. WIS (Word Importance Score): Эвристический показатель, приоритизирующий слова, исправление которых даст максимальный выигрыш в доменном смысле. Он учитывает частотность слова, тяжесть ошибки, критичность типа ошибки (удаление тяжелее вставки) и разнообразие вариантов заблуждения модели.
Инструмент позволяет сравнивать модели с точки зрения статистической значимости различий, используя метод бутстрэппинга. Это помогает отличить реальное улучшение качества от случайных колебаний выборки. RESON выдает как интерактивные HTML-отчеты для презентации стейкхолдерам, так и программный API (Python и CLI) для автоматизации интеграции в конвейер машинного обучения.
Датасет RESON OSD: тесты в условиях телефонного канала
С инструментом не имеет смысла работать без качественных данных для валидации. Вместе с платформу MWS AI выпустил открытый бенчмарк RESON OSD (Open Source Dataset).
Это не просто набор аудиозаписей, а структурированная выборка для проверки устойчивости ASR в специфических условиях телефонных звонков.
Структура выборки
Датасет состоит из двух тематических блоков, каждый из которых представлен в двух акустических версиях: * General: Естественная разговорная речь (звонки в поддержку, уведомления, бытовые вопросы). Включает паузы, оговорки, повторы и междометия. * Numeric: Сложные числовые последовательности (телефонные номера, суммы платежей, даты, ИНН, номера договоров). Числовые данные вымышлены.
Каждый блок имеет версию quietly (чистый сигнал) и noisily (с фоковым шумом и фоновой речью). В сумме выборка содержит 12 114 записей общей длительностью более 37 часов аудио в формате 8 кГц.
Особенности разметки
Важной особенностью датасета является двойная разметка каждой записи: 1. Произносительная форма: Содержит кириллицу, как было сказано, с сохранением междометий. Числа пишутся словами, бренды и заимствования — фонетическим вариантом на кириллице. 2. Письменная форма: Используется для оценки нормализации текста. Цифры записываются арабскими цифрами, официальные названия брендов (например, Apple, Google) переводятся в латиницу или официальное русское написание, если это принято в деловом обороте.
Эта структура позволяет оценивать не только способность модели слышать речь, но и качество постобработки текста, включая корректную сегментацию и нормализацию.
Влияние на развитие технологий
Открытие RESON и датасета OSD закрывает потребность в прозрачных инструментах верификации. Для разработчиков это возможность проводить более глубокий аудит моделей перед развертыванием, а не полагаться на единственное число в отчете. Для сообщества это вклад в развитие открытого стандарта оценки качества речевых технологий в условиях реальных телефонных каналов.
Материалы доступны для скачивания и использования в соответствии с лицензионными условиями, опубликованными командой MWS AI.