Граница памяти и интуиции: эксперимент с крошечной языковой моделью на 2160 параметров
Исследование модели крошечного размера (TLM) выявляет четкую границу, где заканчивается механическое запоминание паттернов и начинается настоящее обобщение. На примере модели всего в 2160 параметров авторы эксперимента показали, что она безупречно воспроизводит известные структуры, уверенно работает с известными словами в новом порядке, но полностью проваливается при столкновении с новой логикой вопроса.
# Граница памяти и интуиции: эксперимент с крошечной языковой моделью
В современном развитии искусственного интеллекта часто обсуждается тонкая грань между тем, что нейросеть действительно «понимает», и тем, что она просто заучила как статистический шаблон. Это различие между меморизацией (запоминанием) и генерализацией (способностью применять знания к новым ситуациям) становится критически важным при работе с миниатюрными моделями. Недавно было проведено воспроизводимое исследование, которое наглядно демонстрирует, где именно эта черта проходит в модели с 2160 параметрами.
Статистика на грани возможностей
Исследование, проведенное разработчиком проекта TLM (Tiny Language Model), базируется на фиксированной начальной точке (seed 42) для обеспечения полной повторяемости результатов. Модель была обучена на минимальном корпусе всего из 24 токенов, содержит лишь два блока трансформера, два внимания и использует восьмимерные эмбеддинги. Несмотря на столь скромные масштабы, эксперимент дал удивительно четкие количественные показатели.
При тестировании на знакомом шаблоне (уточненный запрос, который модель видела при обучении) результат составил 99,93% минимальной вероятности правильного ответа. Это классический случай идеального запоминания. Когда исследователи изменили порядок токенов, но сохранили сами знакомые слова (например, переместили вопросительный знак или структуру предложения), модель показала результат 81,69%. Она справилась с задачей, но уже с заметными колебаниями уверенности.
Самый показательный момент наступил при предъявлении модели нового шаблона, в котором она не участвовала в процессе обучения. На вопрос, который должен был вызвать стандартный ответ «кошка не может читать», модель ответила совершенно иначе — «кошка может летать». Вероятность правильного ответа в этом случае упала до катастрофических 10,46%.
*Интересный факт: в данном контексте проценты не являются классической точностью (accuracy), измеренной по количеству полностью верных строк. Здесь речь идет о минимальной вероятности появления правильного целевого токена в выводе модели. Для оригинальных задач, где модель должна была удержать 14 изученных отношений, точное совпадение составило 100%, а вероятность ключевых токенов — 99,70%.*
От заучивания к истинному пониманию
Эти цифры не случайно расположены. Они формируют четкую карту возможностей крошечного разума. Модель уверенно воспроизводит то, что было заложено в неё как фиксированный паттерн. Она также демонстрирует некоторую пластичность, адаптируясь к небольшим перестановкам известных элементов, что можно назвать локальным переносом знаний. Однако стоит изменить саму структуру вопроса или логику, на которую не было настроено внимание во время обучения, и модель немедленно теряет ориентацию.
Причина этого ограничения кроется не только в малом количестве весов. Корпус данных, содержащий лишь 24 токена, лишен разнообразия языковых конструкций. Дополнительные слои нейросети или увеличение количества параметров в таких условиях позволили бы лишь лучше запомнить одни и те же примеры, но не помогли бы научиться новому. По-настоящему широкая обобщающая способность требует как архитектурных изменений, так и, что важнее, значительно большего и более разнообразного обучающего корпуса.
Эксперимент также показал отсутствие катасτροφической забывчивости (catastrophic forgetting). Благодаря использованию метода rehearsal (повторного обучения), модель сохранила все 14 исходных отношений, на которых базировалось её первоначальное задание. Это означает, что модель способна удерживать старый опыт, пока не будет предоставлен новый, несовместимый с ним паттерн.
Заключение
Данный тест не является полноценным статистическим бенчмарком для оценки всех аспектов ИИ. Это воспроизводимая учебная диагностика, призванная показать конкретные пределы работы модели размером в 2160 параметров. Результаты подтверждают гипотезу о том, что даже минимальные языковые модели переходят от режима «запоминания» к режиму «случайного блуждания», едва только вышедшая из их прямой памяти структура вопроса начинает отличаться от тренировочных данных.
Полный код эксперимента, детерминированные тесты и обновленный скрипт для версии 1.1.0 доступны в репозитории разработчика. Этот проект продолжает развивать тему крошечных языковых моделей на Node.js, демонстрируя, что даже на базовом уровне важно понимать разницу между механическим повторением и адаптивным поведением.
В будущем подобные эксперименты могут стать основой для создания легких моделей, способных работать в ограниченных средах, но при этом сохранять высокую надежность в пределах своих знаний, четко понимая границы своей компетенции.