Gated RNN · LSTM · GRU · Искусственный интеллект · Машинное обучение · Нейронные сети26 сентября в 23:02 · 4 мин

Эксперименты с архитектурой Gated RNN: теория и сравнение с LSTM/GRU

Разработчик с Хабр представляет результаты собственных исследований альтернативной архитектуры рекуррентных нейронных сетей. Автор экспериментально модифицировал стандартные механизмы памяти LSTM, заменив активационные функции на scaled softsign и упростив структуру вычислений, чтобы создать модель, способную решать задачи многошагового вывода без использования сложной математики.

# Эксперименты с архитектурой Gated RNN: теория и сравнение с LSTM/GRU

В области машинного обучения постоянно находятся попытки улучшить стандартные архитектуры, такие как LSTM и GRU. Однако большинство изменений требуют значительных вычислительных затрат или усложнения кода. В этом материале мы рассмотрим эксперименты независимого разработчика, который создал собственную версию Gated RNN с неканонической математической основой.

Основная цель автора заключалась в проверке гипотезы: можно ли достичь высокой точности на задачах долгосрочной памяти, используя упрощенные операции и заменив стандартные гиперболический тангенс (tanh) и сигмоиду (sigmoid) на их модифицированную версию — scaled softsign.

Модификации в теории архитектуры

Клическая структура Gated RNN включает гейты забывания, входа и выхода, а также клеточное состояние. В представленной экспериментальной архитектуре, автор названной LSWM (Long-Short Working Memory), были внесены следующие ключевые изменения:

1. Замена активационных функций: Вместо стандартных tanh и sigmoid автор использовал функцию scaled softsign. Это позволяет получать значения в диапазоне от 0 до 1, что теоретически должно улучшить обобщение модели. Формула функции выглядит следующим образом: (1.0 + x / (1.0 + |x|)) / 2.0. 2. Упрощение соединений: Вместо операции конкатенации (сцепления тензоров) для соединения входных данных и скрытого состояния использовалась простая сумма (+). Это значительно снижает вычислительную сложность, исключая необходимость в дополнительных параметрах весов для канала конкатенации (матрица W_c). 3. Отсутствие CEC: В оригинальной версии модели была исключена структура Constant Error Carousel (постоянная ошибка карусели), обычно используемая для передачи информации на длинные дистанции в последовательностях. Вместо этого долгосрочная память реализована через второй этап вычислений, использующий механизмы, похожие на матрицу внимания, но без внешних атрибутов.

Автор разделил архитектуру на два этапа: Short Working Memory (SWM) для обработки текущей информации и Long Working Memory (LWM) для агрегации контекста всей последовательности.

Практическое тестирование и бенчмарки

Для проверки эффективности новой архитектуры автор выбрал сложную задачу «multi-hop branching». В отличие от простого задания типа «если a=b, а b=c, то чему равно a?», эта задача требует определения значения переменной, зависящего от разных путей вывода в одной цепочке. Например: «a = b и a = c. Если последовательность содержит обе связи, какая была начальной a?». Стандартные архитектуры часто допускают ошибки в таких сценариях при увеличении длины последовательности.

Тестирование проводилось на базе Google Colab с использованием ускоренных вычислений (torch.compile) на CPU, так как доступ к GPU был ограничен.

Сравнительный анализ результатов обучения (после 400 эпох) показал следующие данные:

| Параметр | LSTM (стандарт) | GRU (стандарт) | LSWM (эксперимент) | | :--- | :--- | :--- | :--- | | Лосс (Loss) | 0.8333 | 0.2362 | 0.1666 | | Точность (Accuracy) | 71.9% | 96.9% | 100.0% | | Количество параметров | ~68.6 тыс. | ~68.9 тыс. | ~68.7 тыс. | | Время обучения (400 эпох) | 4 сек | 4 сек | 8 сек |

Результаты указывают на то, что экспериментальная модель LSWM достигла идеальной точности (100%) на заданных тестах, превзойдя как LSTM, так и GRU. Однако цена этого успеха — увеличение времени обучения вдвое по сравнению с классическими архитектурами при сопоставимом количестве параметров.

В ходе отладки автор столкнулся с проблемой чувствительности модели к случайным данным (seed). Для решения этой проблемы в обновленной версии была введена процедура нормализации выходного слоя и изменена математика гейта выхода, что позволило устранить нестабильность.

Плюсы, минусы и выводы

Автор честно признает, что предложенная архитектура носит характер экспериментального исследования, а не промышленного решения. Упрощение операций действительно ускоряет инференс на этапах, где модель уже обучена, и снижает нагрузку на GPU. Однако высокая чувствительность к инициализации параметров и необходимость тщательной подстройки hyperparameters снижают ее универсальность.

Ключевые выводы исследования: * Замена сложных экспоненциальных функций на scaled softsign работает эффективно в рамках конкретной задачи. * Отказ от конкатенации в пользу суммы — удачная оптимизация, сохраняющая способность модели к обучению. * Слой Long Working Memory (LWM), реализованный через упрощенный механизм агрегации, способен компенсировать отсутствие классической CEC.

Этот кейс демонстрирует, что поиск нестандартных математических формул в области рекуррентных сетей может дать результаты, превосходящие «золотой стандарт», хотя и требует больше времени на этапе дообучения и валидации. Для энтузиастов и исследователей такие эксперименты остаются важным источником знаний о гибкости архитектуры нейросетей.

Первоисточники

Habr AI ↗
← Вернуться в эфир