нейросети · эмоции · Claude · машиное обучение · психология ИИ · NLP3 октября в 21:03 · 5 мин

Как нейросети отгадывают эмоции: между текстом и скрытым контекстом

Искусственный интеллект все чаще играет роль психолога, утешая пользователя, который только что написал «меня сократили». Но как алгоритм понимает переживания человека, если тот прямо не называет свои чувства? Анализ показывает, что успех модели зависит не от магии эмпатии, а от способности расшифровывать скрытые детали истории и учитывать разногласия между разными людьми при чтении одних и тех же слов.

# Загадка цифровой эмпатии: как нейросети понимают эмоции

Сегодня искусственный интеллект способен реагировать на человеческие переживания с поразительной точностью. Пример прост: пользователь пишет, что его уволили, а модель отвечает: «Похоже, вам страшно за будущее». Однако механизм, позволяющий модели сделать такой вывод без явных указаний пользователя, сложнее, чем кажется. Это не магия, а сложный процесс анализа контекста, языка и ограничений обучающих данных.

В исследовании на базе опроса 500 человек выяснилось, что 17,2% участников обращались к ChatGPT за поддержкой в вопросах ментального здоровья. Но как машина определяет настроение, если человек прямо не говорит: «Я грущу» или «Я зол»? Оказалось, что ответ кроется в нюансах фраз и том, кто именно переживает описываемое событие.

Носитель эмоции и контекст событий

Главная сложность для алгоритмов — определение того, кому приписывается эмоция. В лингвистике это называется носителем переживания (experiencer). Если человек пишет: «Я ждала сообщения, но он так и не написал, а кот уснул на телефоне, будить было жалко», модель может ошибочно решить, что грустит кот или мужчина, упомянутый в тексте. На самом деле, негативная эмоция принадлежит девушке, которая ждала ответа.

Для обучения классификаторов создаются огромные датасеты, такие как GoEmotions. В него вошли 58 тысяч комментариев с Reddit, размеченных людьми по 27 категориям эмоций. Разметчики анализируют текст и выбирают те чувства, которые, по их мнению, выражает автор. Исследования показывают, что модели лучше справляются с текстами, где ясны роли участников события.

Проблема усугубляется тем, что одна и та же фраза может иметь противоположные значения в зависимости от предшествующего контекста. Например, фраза «Выступление перенесли на месяц» может вызвать облегчение у того, кто не успел подготовиться доклад, и разочарование у того, кто уже приехал в другой город ради выступления.

*«Слова — это не просто строки кода, они — отражение скрытой истории, которую модель должна сама реконструировать, чтобы угадать истинный оттенок переживания».*

Техническая сторона: токены, слои и распределение меток

Как именно нейросеть «думает» об эмоциях? Современные модели на базе BERT разбивают сообщение на токены (слова или их части). В слоях самовнимания каждый токен сопоставляется с другими, вычисляя веса связей. Например, слово «перенесли» может учитывать контекст слова «ждал» для формирования общего векторного представления.

В базовых классификаторах используется специальный токен [CLS], который поступает в выходной слой. Для задачи, где нужна одна эмоция, применяется функция softmax, нормализующая оценки. Если же допустимы несколько эмоций, используется сигмоида. Однако числовое значение рядом с меткой «тревога» описывает лишь уверенность модели в рамках заданной системы, а не реальный уровень тревожности человека.

Генеративные модели, как чат-боты, не имеют фиксированного выходного слоя с эмоциями. Они строят ответ токен за токеном, опираясь на инструкцию и контекст диалога. Чтобы проверить их работу, исследователи используют контрфактические проверки: меняют условия в тексте и наблюдают, как смещается предсказание модели. Например, добавление информации о новом контракте в истории о сокращении радикально меняет вероятную реакцию.

Ограничения данных и роль человеческих наблюдателей

Важнейший вопрос: что считать правильным ответом? В корпусе StudEmo 5182 отзыва оценивали 25 человек каждый, сохраняя все мнения, а не только большинство. Это позволяет видеть, где текст читается однозначно, а где допускает интерпретации. Однако даже распределение мнений наблюдателей описывает их субъективные суждения, а не внутреннее состояние автора.

Исследования показывают существенное ограничение сторонних наблюдателей, будь то люди-разметчики или языковые модели. Они часто угадывают эмоции автора лучше, чем думают сами люди, но всё равно имеют погрешность. Различаются подходы, основанные на явных метках автора (например, хэштеги #sad) и реакциях читателей.

Корпуса данных, на которых обучаются модели, часто имеют узкую специфику. GoEmotions состоит из комментариев Reddit на английском языке, а русский корпус CEDR содержит предложения из социальных сетей с ограниченными категориями эмоций (радость, грусть, гнев, страх, удивление). Если модель прошла тестирование на CEDR, это не гарантирует её умение распознавать сложные ситуации в рабочем чате с намёками и иронией.

Для надежной работы цифровому психологу нужны три условия: способность видеть всю историю диалога, не игнорировать разногласия в толковании событий и учитывать специфику языка проверки.

Практический взгляд: тестирование на реальных сценариях

В ходе эксперимента с Claude Opus 5 было проверено, как модель реагирует на фразу «Выступление перенесли на месяц» в разных контекстах.

1. Контекст А (Облегчение): Пользователь сообщил, что не успевал подготовить доклад и сам просил отсрочку. Модель предложила варианты помощи с графиком подготовки, предположив радость от полученного времени. 2. Контекст Б (Разочарование): Тот же пользователь уже приехал в другой город. Модель признала разочарование и потерю ресурсов, предложив занять это время делами. 3. Нейтральная деталь: Добавление в текст информации о синем стуле не изменило выводы модели о причине переноса, но она осторожно добавила, что точную реакцию угадать сложно.

Эксперимент показал, что без контекста истории модель не может дать уверенного ответа. Она предпочитает признавать неопределенность, чем рисковать неверным толкованием чувств. Это безопасный подход, но требующий от пользователя более детального описания ситуации для получения качественного эмоционального отклика.

Таким образом, эмпатия ИИ — это не врожденное чувство, а результат глубокого анализа паттернов, контекста и статистики человеческих реакций, скомпилированный в математические веса нейросети.

Первоисточники

Habr AI ↗
← Вернуться в эфир