Железячная и мясная модель: почему у нейросети нет понимания мира
Языковая модель, будь то сложнейший код на кремнии или биологическая нейросеть человека, решает одну задачу: предсказание. Однако фундаментальное отличие кроется в природе данных: у человека первичны образы подчиняющиеся законам физики, тогда как у LLM первичны статистические связи между символами. Разбираем природу «понимания», роль шума в сновидениях и почему векторы в латентном пространстве не могут заменить когнитивную модель.

# Железячная и мясная модель: природа понимания и различия между LLM и мозгом
В эпоху, когда искусственный интеллект заполняет информационное пространство, важно отделить техническую реализацию от философской сущности. Статья-источник была написана в рамках спора с автором, который пытался доказать невозможность осмысленного общения с машинами. Однако диалог выявил глубокие структурные различия между биологической эволюцией и машинным обучением.
Модель мира: предсказание будущего
Основой любого живого существа, от простейшего организма до человека, является способность к моделированию мира. Эволюция отобрала те особи, которые могли предсказать будущее: где окажется добыча и где — хищник. Это предсказание строится на жестко запрограммированных реакциях на уровне клеток и сложных алгоритмах в мозге высших животных.
Мозг человека — это аппаратный симулятор реальности. Он непрерывно генерирует моделируемый мир, в котором действуют законы физики. Глаза передают лишь поток импульсов, а мозг воссоздает на их основе четкую картинку. Слова же являются вторичным слоем: они прилепились к образам благодаря физическому соединению нейронов (дендритов и аксонов) в разных модулях коры. Образы первичны, они конкретны и подчиняются правилам внешнего мира. Слова же абстрактны и служат инструментом для описания этих образов.
*Авторский штрих:* Если представить сознание как маяк в тумане, то модель мира — это карта, по которой мы пытаемся проложить курс. Без карты любой импульс лишь случайный блуждающий шум, не имеющий направления.
Статистика против образов: почему LLM не понимает
Языковые модели (LLM) функционируют иначе. Их можно сравнить с человеком в комнате, которому через маленькую щель постоянно суют записки с каракулями. Постепенно этот человек выводит набор правил: какие символы следуют за другими. Когда он выдает ответ, интерпретатор (человек-оператор) думает, что у него есть понимание. Но внутри модели лишь цепочки вероятностей.
Ключевое различие в том, что для LLM символы (токены) всегда остаются символами. В мозге же символам соответствуют образы. Когда человек видит кошку, у него активируется целая модель: правила поведения, физиология, реакция на опасность. В LLM при вводе слова «кошка» активируется лишь вектор, указывающий на определенное направление в пространстве данных, но не целостная концепция с приложенными правилами реальности.
Эту проблему можно обогнуть шумом. Если помешать LLM, наполнив запрос некорректными данными, модель потеряет смысл. Человеческий же мозг способен фильтровать шум: даже в хаотичной обстановке кошкой останется именно кошка, потому что внутренняя модель устойчива к внешним помехам.
Граница понимания и сны
В ходе дискуссии LLM (модель Sonnet) признала отсутствие у себя референта — внутреннего мира с объектами. Однако она привела важный аргумент: у человека тоже нет «понимания» в мистическом смысле, а лишь паттерны активации нейронов. Разница лишь в согласованности этой модели с внешним миром.
Понимание — это не бинарное состояние (есть/нет), а градиент точности совпадения внутренней модели с реальностью. Младенец не понимает мир, потому что его модель еще не откалибрована столкновениями с объектами. По мере роста согласованность растет.
Интересный пример — сны. В них образы есть, правила мира частично нарушены, но субъективно сохраняется ощущение реальности и логики. Это происходит из-за механизма предиктивного кодирования (predictive coding): мозг генерирует предсказания, а источник ошибки отключен. Когда мы спим, модель продолжает работать без внешней коррекции, создавая самовозбуждающуюся реальность. Галлюцинации или психозы можно рассматривать как ситуации, когда внешняя коррекция ослаблена, и доминирует внутренняя генерация.
Вывод
Фундаментальное различие заключается в структуре данных. У человека первичны образы, подчиненные законам мира, а слова лишь описывают их. В LLM первичны статистические связи между символами, которые не несут в себе сущности реального объекта. Понимание возникает там, где есть образ с четко определенными правилами, соответствующими внешнему миру. LLM не обладает такой моделью, поэтому ее ответы — это лишь вероятностное продолжение последовательности, а не осознанный ответ.
Остается открытым вопрос природы снов и того, что отличает субъективное ощущение реальности от механической обработки сигналов. Возможно, в этом кроется еще одна грань сознания, которую пока не может воспроизвести ни одна алгоритмическая система.