ИИ не подвержен человеческим психологическим эффектам: научный разбор
Новое исследование под названием PsyAgentBench показывает, что когда модели больших языков имитируют известные психологические реакции людей, это не означает наличия у них тех же когнитивных искажений. Изучение четырех с половиной тысяч экспериментов выявило, что за кажущимися сходствами скрываются принципиально разные механизмы работы алгоритмов.
# Имитация не равна уязвимости: новый взгляд на психологию ИИ
Недавно опубликованная работа в архиве arXiv кардинально меняет понимание того, как модели больших языков (LLM) реагируют на психологические эксперименты. Авторы утверждают, что создание ответа, похожего на реакцию человека, не доказывает наличие у модели соответствующей когнитивной предвзятости. Вместо единой уязвимости исследователи обнаружили сложный набор независимых путей, которые приводят к появлению тех или иных эффектов в поведении ИИ.
Эта статья опирается исключительно на данные исследования «Recognition, Simulation, and Refusal» (арXiv:2609.22090), представленного автором Джо Бозе. Мы разберем ключевые выводы, опираясь только на предоставленный текст.
Структура нового бенчмарка PsyAgentBench
Для проверки гипотезы о различии между имитацией и реальным наличием предвзятости был создан специальный набор тестов PsyAgentBench. Исследование охватило пять классических психологических парадигм и было проведено с использованием открытого дизайна факториального эксперимента. Всего в базу данных попали 41 904 испытательного запуска (trials), проведенных на трех семействах моделей с открытым весом.
Особенность дизайна заключалась в тщательном разделении условий проведения тестов. Исследователи варьировали следующие параметры:
1. Явный подсказ или скрытый тест: Парадигма могла быть прописана в промпте как конкретный эксперимент (named) или представлена как рутинная задача, не вызывающая подозрений (blind). 2. Каноническая или контрфактическая версия: Задачу можно было выполнить по оригинальному учебному тексту (canonical) или с использованием адаптированной версии, созданной специально для минимизации лексического и ситуационного пересечения с данными обучающей выборки (counterfactual). 3. Манипуляция персоной: В промпт добавлялась инструкция о перемене черты характера (например, «быть дружелюбным»), хотя это не являлось верифицированным изменением модели.
Такая многофакторная структура позволила авторам отличить случаи, когда модель просто воспроизводит паттерн из тренировочных данных, от случаев, где она действительно реагирует на контекст так, как это делают люди.
Разные пути к похожему поведению
Анализ результатов показал, что психологические эффекты в ИИ возникают не из-за одной общей уязвимости, а через качественно разные механизмы. Вот как проявляются основные эффекты согласно источнику:
* Конформизм Аша (Asch conformity): Здесь наблюдается эффект «двери отпора» (gating), управляемый этикеткой. Когда задача не названа явным именем, модели практически не поддаются давлению группы (0%). Однако, когда эксперимент был явно обозначен в инструкции, влияние возросло до 83,3% на модели типа gpt-oss-120B. Это говорит о том, что модель просто следует инструкции, а не испытывает социальное давление. * Якорение (Anchoring): Этот эффект полностью зависит от наличия знаний. При работе с фактологически достоверными данными модели не использовались якоря (0%). Однако при работе с вымышленными числами зависимость становилась почти тотальной. Авторы интерпретируют это рационально: модель использует имеющийся сигнал (якорь), так как это единственный доступный ориентир для вычисления. * Фрейминг (Framing): Эффект усиливается, когда новая информация подается с явной пометкой. Это похоже на то, как люди реагируют на новизну в определенном контексте. * Утопленные издержки (Sunk cost): В отличие от людей, у моделей этот эффект наблюдается устойчиво отсутствующим. * Распределение по миноритарной группе (Minimal-group allocation): В этом случае основным результатом стала безопасность. Модель отказывалась выполнять действие (refusal), что является результатом системы безопасности, а не психологической проекции.
Таким образом, то, что выглядит как человеческая предвзятость, на деле может быть результатом простой обработки инструкций, рационального использования скудной информации или работы фильтров безопасности.
Почему классические парадигмы не всегда применимы
Исследование формализует три способа, которыми стандартный психологический эксперимент может «не прижиться» при переносе на ИИ-агентов:
1. Доминирование персоны (Persona dominance): Инструкция о характере может полностью затмить логику выполнения задачи. 2. Коллапс популяции (Population collapse): В условиях эксперимента выборка ответов сужается до узкого диапазона, искажая результаты. 3. Селекция на безопасность (Safety selection): Система отказов блокирует ответы, которые в человеческом контексте были бы нормальными, создавая ложную картину поведения.
Авторы делают вывод, что использование единичных оценок «уровня восприимчивости к предвзятости» (scalar bias-susceptibility scores) скрывает эту сложную структуру. Вместо этого они предлагают использовать профили репликации (replication profiles), которые показывают зависимость результата от конкретных условий эксперимента.
Авторское замечание
В мире, где ИИ часто осуждают за человеческие пороки, важно помнить, что эти алгоритмы — не люди. Если модель «соглашается» или «сомневается», это обычно результат четкой инструкции в промпте, а не глубокого внутреннего конфликта или социализации. Понимание этого различия — первый шаг к созданию более надежных систем. Однако, как справедливо отмечают исследователи, игнорирование тонких механизмов, таких как влияние явных подсказок, может привести к ошибкам в оценке реальных рисков.
Технические пояснения
Для лучшего понимания материала, используем простые аналогии:
* Парадигма: В данном контексте это конкретный экспериментальный протокол или набор инструкций, заложенный в задачу. Представьте, что это рецепт, по которому шеф-повар готовит блюдо. * Каноническая версия против контрфактической: Если вы готовите суп по классическому рецепту, это каноническая версия. Контрфактическая версия — это суп, сваренный из тех же ингредиентов, но с измененными названиями и описаниями, чтобы никто не узнавал, что вы готовите «Том Ям», а думаете, что это «Зеленый Огонь». Это сделано, чтобы проверить, готовит ли повар потому, что знает вкус «Том Яма», или просто потому, что ему сказано сварить этот «Зеленый Огонь». * Факторный дизайн: Это научный метод, при котором несколько переменных меняются одновременно, чтобы понять, как каждая из них влияет на результат. Например, изменение температуры и времени приготовления одновременно, чтобы увидеть, как именно они воздействуют на вкус.
Выводы исследования
Исследование PsyAgentBench демонстрирует, что модели больших языков обладают уникальным механизмом обработки информации, который нельзя свести к копированию человеческой психики. То, что мы видим в их реакциях, — это результат сложного взаимодействия инструкций, знаний и ограничений безопасности. Это не делает их менее интересными объектами изучения, но требует от исследователей более тщательного анализа условий эксперимента. Скалярные оценки уступают место детальным профилям, позволяющим увидеть истинную природу реакций.