IBM и Hugging Face представили Granite Speech 5.0 Turbo CTC: скорость транскрипции с беспрецедентными показателями
В семействе моделей Granite Speech дебютировали две компактные версии объемом 470 млн параметров, ориентированные на автоматическое распознавание речи (ASR) в реальном времени. Эти модели, выпущенные IBM в партнерстве с Hugging Face, демонстрируют уникальное сочетание точности и скорости: при использовании GPU NVIDIA H200 они могут обработать более трех с половиной часов аудио за одну секунду, обеспечивая пропускную способность свыше 12 600 RTFx. Новый подход к архитектуре и токенизации позволяет применять их на периферийных устройствах без значительных затрат вычислительных ресурсов.

# IBM и Hugging Face представляют Granite Speech 5.0 Turbo CTC
В мире обработки естественного языка (NLP) и аудиопотоков на переднем крае происходит быстрая эволюция моделей, способных работать в реальном времени. Сегодня IBM совместно с платформой Hugging Face официально обновила семейство Granite Speech, представив две новые модели: granite-speech-5.0-470m-turboctc и granite-speech-5.0-470m-turboctc-nc. Главной целью их создания стала балансировка между высокой точностью транскрипции и исключительной скоростью вывода, что критически важно для приложений, работающих в режиме потоковой передачи данных.
Рекордная производительность и архитектурные нововведения
Ключевым достижением новой линейки моделей является их пропускная способность. Используя видеокарту NVIDIA H200, эти модели достигли производительности более 12 600 RTFx (Real-Time Factor times). Для наглядности: при такой скорости одна секунда вычислений позволяет транскрибировать более 3 часов и 30 минут речи. Это на порядки быстрее, чем позволяла предыдущая архитектура моделей серии Granite.
Архитектурно модели представляют собой значительный шаг назад от предыдущих версий. Если раньше модели Granite Speech состояли из акустического энкодера, проектора и большой языковой модели (LLM) с адаптерами LoRA, то новая версия — это чистый энкодер. Такая упрощенная структура приносит три очевидные выгоды: 1. Минимизация ресурсов: Модель занимает всего 470 млн параметров. 2. Скорость: Пропускная способность выросла более чем в 20 раз по сравнению с предшественниками. 3. Эффективность памяти: Малый размер весов облегчает размещение на периферийных устройствах (edge devices), не требующих мощных дата-центров.
Стоит отметить, что новые модели жертвуют некоторыми специфическими возможностями, такими как перевод речи на язык других народов (speech translation) или настраиваемое смещение на определенные ключевые слова. Однако для прямой задачи преобразования речи в текст (STT) на мобильных устройствах или встроенных системах они идеальны.
Как работает ускорение?
Одной из главных проблем обработки аудио является необходимость обработки огромных последовательностей фреймов звуковых волн. Традиционные энкодеры генерировали до 50 символов в секунду, опираясь на входные данные в 100 кадров в секунду. Новый подход Granite 5.0 радикально меняет этот процесс, снижая скорость генерации токенов до 12.5 в секунду.
Для достижения этого инженеры применили трехэтапную процедуру уменьшения разрешения во временной области (subsampling): 1. Первая стадия объединяет векторы признаков log-Mel через простую операцию перемещения данных. 2. Вторая и третья стадии интегрированы непосредственно в первые два блока Conformer (архитектура, популярная в задачах обработки последовательностей). Эти блоки используют свертки с шагом (stride), что позволяет уменьшать временное разрешение на каждом шаге.
Такой подход позволяет преобразовать потоковое аудио с частотой дискретизации 100 Гц в компактные токены с частотой 12.5 Гц, сохраняя при этом ключевую информацию для распознавания.
Две версии модели: открытость и коммерческое использование
В рамках релиза представлено два варианта модели, различающихся набором данных для обучения и лицензией:
1. `granite-speech-5.0-470m-turboctc`: Обучалась на меньшем наборе данных и распространяется по лицензии Apache 2.0, что означает полную свободу использования в коммерческих проектах. 2. `granite-speech-5.0-470m-turboctc-nc`: Обучалась на расширенном датасете и распространяется под лицензией CC-BY-NC-SA-4.0 (некоммерческая). Эта версия показывает несколько более высокие показатели точности на большинстве тестовых наборов.
На официальном лидерборде OpenASR от 25 августа 2026 года обе модели заняли лидирующие позиции. Модель с лицензией Apache 2.0 набрала 5.00% WER (Word Error Rate — ошибка в словах), а некоммерческая версия — 4.85%. Обе версии также продемонстрировали превосходство в задачах распознавания речи вдали от микрофона (far-field), где звук должен захватываться на значительном удалении от источника.
Данные для обучения: синтез и реальность
Качество транскрипции напрямую зависит от качества обучающей выборки. Обе модели прошли обучение на комбинации натуральных и синтезированных данных. В их основе лежат несколько крупных датасетов, доступных в репозитории Hugging Face:
* MLS (44 600 часов): Мультиязычный датасет LibriSpeech. * YODAS (8 900 часов): Корпусы речи от Yahoo и Microsoft. * CommonVoice (2 500 часов): Голоса добровольцев от Mozilla. * VoxPopuli и другие: Включая специализированные датасеты вроде Earnings-22 и AMI.
Особого внимания заслуживает использование синтезированных данных. Для обучения использовались: * 2000 часов мультиговорящих данных, полученных путем соединения монологов. * 500 часов данных из Earnings-22. * 240 часов специальных фраз с цифрами, валютами, номерами телефонов и адресами, сгенерированных нейросетями gpt-oss-120b/gpt-oss-20b и синтезированных с помощью StyleTTS2. Эта практика помогает модели лучше справляться со структурированным текстом и цифрами, которые часто являются источником ошибок.
Применение и интеграция
Новые модели Granite Speech 5.0 TurboCTC полностью поддерживаются нативной библиотекой transformers от Hugging Face. Это упрощает интеграцию для разработчиков, позволяя внедрять высокопроизводительное распознавание речи в существующие пайплайны обработки данных. Для немедленного использования доступна установка пакета из исходного кода, так как официальный релиз в последующих версиях библиотеки ожидается чуть позже.
В Hugging Face Spaces уже доступны демонстрации возможностей этих моделей, включая веб-демо для потоковой транскрипции (доступное в браузерах Chrome и Edge). Такие инструменты позволяют быстро оценить эффективность модели на реальном аудио потоке.
Как и любой технологический прорыв, Granite Speech 5.0 Turbo CTC открывает новые возможности для сервисов живого транслирования, систем безопасности, диктования текста и вспомогательных технологий, где каждый миллисекундный сдвиг и каждый ошибочно распознанный символ имеют значение. Баланс между размером, скоростью и точностью, достигнутый в этой версии, задает новую планку для индустрии открытой разработки аудиомоделей.