Эксперименты с архитектурой Gated RNN: теория и сравнение с LSTM/GRU
Разработчик с Хабр представляет результаты собственных исследований альтернативной архитектуры рекуррентных нейронных сетей. Автор экспериментально модифицировал стандартные механизмы памяти LSTM, заменив активационные функции на scaled softsign и упростив структуру вычислений, чтобы создать модель, способную решать задачи многошагового вывода без использования сложной математики.
# Эксперименты с архитектурой Gated RNN: теория и сравнение с LSTM/GRU
В области машинного обучения постоянно находятся попытки улучшить стандартные архитектуры, такие как LSTM и GRU. Однако большинство изменений требуют значительных вычислительных затрат или усложнения кода. В этом материале мы рассмотрим эксперименты независимого разработчика, который создал собственную версию Gated RNN с неканонической математической основой.
Основная цель автора заключалась в проверке гипотезы: можно ли достичь высокой точности на задачах долгосрочной памяти, используя упрощенные операции и заменив стандартные гиперболический тангенс (tanh) и сигмоиду (sigmoid) на их модифицированную версию — scaled softsign.
Модификации в теории архитектуры
Клическая структура Gated RNN включает гейты забывания, входа и выхода, а также клеточное состояние. В представленной экспериментальной архитектуре, автор названной LSWM (Long-Short Working Memory), были внесены следующие ключевые изменения:
1. Замена активационных функций: Вместо стандартных tanh и sigmoid автор использовал функцию scaled softsign. Это позволяет получать значения в диапазоне от 0 до 1, что теоретически должно улучшить обобщение модели. Формула функции выглядит следующим образом: (1.0 + x / (1.0 + |x|)) / 2.0. 2. Упрощение соединений: Вместо операции конкатенации (сцепления тензоров) для соединения входных данных и скрытого состояния использовалась простая сумма (+). Это значительно снижает вычислительную сложность, исключая необходимость в дополнительных параметрах весов для канала конкатенации (матрица W_c). 3. Отсутствие CEC: В оригинальной версии модели была исключена структура Constant Error Carousel (постоянная ошибка карусели), обычно используемая для передачи информации на длинные дистанции в последовательностях. Вместо этого долгосрочная память реализована через второй этап вычислений, использующий механизмы, похожие на матрицу внимания, но без внешних атрибутов.
Автор разделил архитектуру на два этапа: Short Working Memory (SWM) для обработки текущей информации и Long Working Memory (LWM) для агрегации контекста всей последовательности.
Практическое тестирование и бенчмарки
Для проверки эффективности новой архитектуры автор выбрал сложную задачу «multi-hop branching». В отличие от простого задания типа «если a=b, а b=c, то чему равно a?», эта задача требует определения значения переменной, зависящего от разных путей вывода в одной цепочке. Например: «a = b и a = c. Если последовательность содержит обе связи, какая была начальной a?». Стандартные архитектуры часто допускают ошибки в таких сценариях при увеличении длины последовательности.
Тестирование проводилось на базе Google Colab с использованием ускоренных вычислений (torch.compile) на CPU, так как доступ к GPU был ограничен.
Сравнительный анализ результатов обучения (после 400 эпох) показал следующие данные:
| Параметр | LSTM (стандарт) | GRU (стандарт) | LSWM (эксперимент) | | :--- | :--- | :--- | :--- | | Лосс (Loss) | 0.8333 | 0.2362 | 0.1666 | | Точность (Accuracy) | 71.9% | 96.9% | 100.0% | | Количество параметров | ~68.6 тыс. | ~68.9 тыс. | ~68.7 тыс. | | Время обучения (400 эпох) | 4 сек | 4 сек | 8 сек |
Результаты указывают на то, что экспериментальная модель LSWM достигла идеальной точности (100%) на заданных тестах, превзойдя как LSTM, так и GRU. Однако цена этого успеха — увеличение времени обучения вдвое по сравнению с классическими архитектурами при сопоставимом количестве параметров.
В ходе отладки автор столкнулся с проблемой чувствительности модели к случайным данным (seed). Для решения этой проблемы в обновленной версии была введена процедура нормализации выходного слоя и изменена математика гейта выхода, что позволило устранить нестабильность.
Плюсы, минусы и выводы
Автор честно признает, что предложенная архитектура носит характер экспериментального исследования, а не промышленного решения. Упрощение операций действительно ускоряет инференс на этапах, где модель уже обучена, и снижает нагрузку на GPU. Однако высокая чувствительность к инициализации параметров и необходимость тщательной подстройки hyperparameters снижают ее универсальность.
Ключевые выводы исследования: * Замена сложных экспоненциальных функций на scaled softsign работает эффективно в рамках конкретной задачи. * Отказ от конкатенации в пользу суммы — удачная оптимизация, сохраняющая способность модели к обучению. * Слой Long Working Memory (LWM), реализованный через упрощенный механизм агрегации, способен компенсировать отсутствие классической CEC.
Этот кейс демонстрирует, что поиск нестандартных математических формул в области рекуррентных сетей может дать результаты, превосходящие «золотой стандарт», хотя и требует больше времени на этапе дообучения и валидации. Для энтузиастов и исследователей такие эксперименты остаются важным источником знаний о гибкости архитектуры нейросетей.