Опасность «наивной» тональности: как однофамильцы и математика искажают репутацию бренда
Статистика показывает, что доля негативных отзывов об ИИ о компаниях часто минимальна, однако авторы статьи с Хабр предупреждают: стандартные методы подсчета метрик могут молча врать. Ошибка заключается в неправильном выборе знаменателя, отсутствии проверки актуальности упомянутого бренда и игнорировании случаев, когда модель отказывается отвечать. Без учета этих нюансов 0,8% негатива могут скрывать реальную ситуацию.
# Когда метрика тональности молчит или врет
Использование языковых моделей (LLM) для мониторинга репутации бренда кажется простым: задать вопросы, получить ответы, проанализировать тональность и посчитать процент негатива. Однако исследование, опубликованное на платформе Habr AI, раскрывает фундаментальные ошибки в этом процессе. Автор показал, что стандартная формула «количество негативных ответов / общее количество ответов» может давать ложную картину безопасности, скрывая серьезные проблемы с точностью оценки.
Падение знаменателя: не все ответы о вашем бренде
Первая и самая очевидная ошибка кроется в математике. Простой подсчет часто берет за основу (знаменатель) все сгенерированные ответы модели. Но подавляющее большинство из них может не содержать упоминания вашего бренда вовсе. В описанном случае из 358 полученных ответов бренд был упомянут лишь в 22 (менее 6%).
Если разделить количество негативных ответов (3) на всё число запросов (358), получается 0,8% — цифра, внушающая спокойствие. Но это статистически неверно для задачи оценки репутации, так как 336 ответов, где бренд не фигурировал, физически не могли быть ни позитивными, ни негативными по отношению к нему. Это как посчитать уровень счастья жителей города, опрашивая всех прохожих, включая тех, кто вообще не знает название города.
Если использовать в расчетах только те ответы, где бренд действительно назван, доля негатива возрастает в 16 раз — с 0,8% до 13,6%. Это драматическая разница, показывающая, что «наивная» метрика измеряет не уровень недовольства, а частоту упоминания бренда в ответе модели.
Ловушка одногофамильцев: проблема связывания сущностей
Вторая, более скрытая угроза связана с тем, о какой компании именно говорит модель. В ходе проверки автор обнаружил, что три ответа, классифицированные как негатив, содержали имя бренда, но контекст указывал на совершенно другого игрока рынка с похожим названием. Модель описывала услуги телефонии и музыкального дистрибуции, в то время как компания, на которую рассчитывал мониторинг, занимается продвижением в сфере нейросетей.
Классификатор тональности выполнил свою задачу верно — он увидел эмоциональную окраску текста и поставил минус. Но он не проверял, о ком конкретно идет речь. Это проблема связывания сущностей (entity linking), которую стандартные инструменты анализа тональности часто игнорируют. Без контекстных маркеров, указывающих на специфичную деятельность компании (продукты, регион, отрасль), модель легко путает репутацию бренда с репутацией его однофамильцев.
После исключения таких случаев количество негативных ответов о самой компании упало до нуля. Это не доказывает идеальную репутацию, но демонстрирует хрупкость выводов, сделанных без проверки сущности.
Отказы и третья ловушка
Третий аспект касается отказов моделей. Если языковая модель отказывается отвечать на запрос, это событие ни в коем случае не следует засчитывать как нейтральный отзыв. Отказ не является мнением о бренде. Включать такие случаи в знаменатель тональности искажает метрику: это снизит процент негатива, но при этом скроет важный факт о том, что инструмент мониторинга перестал собирать данные.
Правильный подход требует разделения метрик: отказ следует выносить в отдельную категорию показателя и исключать из расчетов тональности. Это позволяет понять, работает ли система сбора данных вообще.
Вывод
Анализ показывает, что метрика тональности должна строиться с учетом трех критических фильтров: знаменатель должен состоять только из ответов с упоминанием бренда; необходимо проверять контекст для исключения однофамильцев; отказы следует учитывать отдельно. Игнорирование этих шагов превращает сложную задачу репутационного анализа в сбор статистики о том, как часто ИИ упоминает ваш бренд, и в каких случаях путает его с конкурентами.
«Наивная доля негатива отвечает не на вопрос о репутации, а на вопрос о том, насколько редко бренд вообще всплывает в ответах моделей». — Автор статьи
*Мнение редакции Umine Nagi: точность данных важнее скорости их получения. В мире ИИ даже 0,8% ошибки могут стоить миллионов репутационных очков.*