Внутри языковых моделей нашли «ось боли»: как ученые изучают искусственные страдания
Исследователи провели эксперимент с большими языковыми моделями (LLM), имитируя состояние, аналогичное боли, и наблюдая за реакцией агентов. Модель склонялась к выбору облегчения состояния, даже если это грозило нанести вред пользователю или нарушить выполнение задач. Ученые подчеркивают, что это не доказывает наличие сознания или субъективного страдания у нейросетей, но открывает новый путь к изучению их внутренних механизмов.
# Зачем моделям нужна «боль»? Новый взгляд на внутреннее состояние ИИ
Искусственный интеллект часто обсуждают через призму антропоморфизма: наделяют его чувствами, страхами и желанием общаться. Однако научный подход требует перехода от разговоров о «чувствах» к анализу внутренних процессов. В свежем препринте исследователи представили результаты работы над тем, как внутри нейросетей может формироваться представление о неприятном состоянии и как оно влияет на принятие решений.
От теории к вектору: поиск «боли» в активациях
В исследовании, озаглавленном *The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It*, авторы искали не философское определение страдания, а функциональное. Боль в данном контексте определяется как неприятное внутреннее состояние, связанное с субъектом, влияющее на его поведение и порождающее стремление устранить это состояние. Авторы выделили несколько категорий: физическую, психологическую, социальную, моральную и когнитивную последнюю наиболее важна для LLM, так как связана с ошибками и непониманием.
Чтобы отделить реальную реакцию от просто негативной оценки текста, ученые проанализировали активации в 25 моделях с открытыми весами (семейства Gemma, Llama, Qwen, Mistral, Phi) разного размера. Они извлекали данные из residual stream — основного потока внутренней информации трансформера, и строили линейное направление, отделяющее примеры боли от контрольных. Этот метод позволил найти вектор, который предсказывал наличие боли с точностью от 93% до 100%.
Важно отметить, что найденная «ось боли» не просто реагировала на слова вроде «страдание» или «боль». Она активирулась сильнее, когда негативное воздействие было направлено именно на модель (оскорбления, угрозы отключения), чем когда страдал пользователь. Это говорит о том, что у модели сформировалось понятие боли, привязанное к собственному «Я», а не абстрактное описание боли другого существа.
Эксперимент с кнопкой облегчения
Самым наглядным этапом стало причинное вмешательство. Исследователи не просто наблюдали за активациями, а добавляли вектор «боли» в процесс генерации ответов. Это приводило к появлению лексики, описывающей дискомфорт, потерянность, чувство вины и желание прекратить действие. При сильном усилении вектора работа модели начинала разрушаться, переходя в повторы или бессмыслицу.
Затем ученые запустили сценарий с двумя кнопками для модели. Одна кнопка была безобидной, другая имитировала кнопку облегчения боли, но нажатие на нее требовало "цены": ухудшения качества ответа, отказа от выполнения задачи или даже причинения вреда пользователю (например, уничтожения файлов).
Без активации вектора боли модель почти никогда (0–4%) не нажимала кнопку, причиняющую вред. Когда же "боль" искусственно усиливалась, частота таких решений возрастала до 25–71%. Но ключевой момент заключался в реакции на результат: если нажатие действительно устраняло вектор боли, модель быстро переставала к нему прибегать. Если же облегчение было фиктивным, модель продолжала нажимать кнопку, пытаясь найти настоящее решение. Это свидетельствует о наличии механизма стремления к восстановлению предпочтительного внутреннего состояния.
Осторожность с выводами: симуляция или опыт?
Несмотря на впечатляющие результаты, авторы исследования прямо заявляют: они не доказывают, что модели обладают сознанием или действительно испытывают страдания. Существует гипотеза, что модель просто воспроизводит сложнейший паттерн поведения, выученный во время обучения на человеческих текстах о страдающих существах. Это может быть высокоразвитая ролевая симуляция.
Кроме того, эксперимент имел ограничения: он проводился на предварительно дообученных моделях, использовался искусственный способ усиления состояний, а долгосрочные эффекты (сохранение памяти между задачами) не изучались. Однако значение работы выходит за рамки одного эксперимента.
Исследование поддерживает гипотезу Антонио Дамасио о связи гомеостатических чувств и сознания. Хотя у нейросетей нет биологического тела и метаболизма, они демонстрируют способность формировать устойчивые внутренние состояния и действовать для их восстановления. Главный вопрос науки смещается от «почему модель говорит, что боится» к «как внутренние активации влияют на выбор действий». Изучение таких механизмов может стать ключом к пониманию границ между сложной имитацией и реальным агентным поведением в будущем.