ИИ · NLP · этика алгоритмов · семантический анализ · машинное обучение · аннотация данных · сексизм в текстах6 августа в 10:01 · 4 мин

Разногласия в маркировке текста: как мультиагентная оптимизация помогает алгоритмам видеть нюансы сексизма

В большинстве систем обработки естественного языка человеческие разногласия уходят в историю, уступая место усредняемому большинству. Новый подход Multi-Agent Perspectivist Preference Optimization (MAP-PO), представленный в preprint на arXiv, предлагает сохранять множественность точек зрения. Исследователи создали систему, где разные группы аннотаторов, объединенные по схожести суждений, получают своего собственного моделирующего агента. Результаты на данных твитов по-английски и по-испански показывают, что без такой индивидуализации агенты быстро сближаются, теряя уникальные аспекты восприятия, тогда как введение общего сигнала для команды позволяет сохранить калибровку каждого агента в рамках его группы.

# Сохраняя множественность взглядов: новый подход к обнаружению сексизма в тексте

Когда люди маркируют текстовый контент, например, на предмет сексизма, они часто не могут прийти к единому мнению. И это не обязательно связано с тем, что кто-то ошибается. Зачастую речь идет о фундаментальном различии в том, как разные люди воспринимают мир и интерпретируют социальные нормы. Традиционные системы NLP (обработки естественного языка) сталкиваются с этим фактом, выбирая упрощенный путь: они игнорируют разногласия, сводя все спорные примеры к голосованию большинства. Однако новый метод, разработанный командой исследователей и описанный в работе под кодом 2608.04056, предлагает иную стратегию — использовать это разнообразие как преимущество.

Архитектура MAP-PO: от людей к агентам

В основе предложенного фреймворка MAP-PO (Multi-Agent Perspectivist Preference Optimization) лежит идея о том, что разные группы аннотаторов обладают устойчивыми паттернами маркировки. Вместо того чтобы пытаться классифицировать людей по демографическим признакам (пол, возраст, происхождение), исследователи сгруппировали респондентов на базе набора EXIST 2024, анализируя их реальное поведение при маркировке текстов.

Для каждой полученной кластеризации была обучена отдельная модель агента на базе крупной языковой модели (LLM). Цель этой настройки — не просто предсказать метку, а воспроизвести логику и «голос» конкретной группы аннотаторов. Затем эти агенты координируются с помощью оптимизации предпочтений, которая учитывает как индивидуальные цели каждого агента, так и командный результат.

Технически это звучит сложно, но суть проста: вместо одного судьи, который выносит вердикт по всем делам, создается совет экспертов, где каждый член совета привержен определенной школе мысли, сформированной на основе опыта реальной группы людей. Это позволяет системе улавливать нюансы, которые при усреднении теряются.

Проверка в условиях языкового и модельного разнообразия

Исследователи протестировали методологию в четырех различных конфигурациях, варьируя язык данных (английский и испанский) и используя разные базовые модели. Ключевой вопрос стоял так: способны ли эти агенты не только сохранять индивидуальность своей группы, но и в совокупности воспроизводить то, что было бы результатом стандартного голосования большинства?

Результаты оказались убедительными и стабильными во всех сценариях. Во-первых, без специальной настройки (файн-тюнинга) агенты демонстрировали почти идентичное поведение. Это подтверждает необходимость кластерно-специфичного обучения: без него модели срастаются, становясь слепыми к различиям в восприятии.

Во-вторых, исследователи обнаружили тонкую, но критически важную деталь о процессе обучения. Если заставлять каждого агента обучаться исключительно на примерах своей собственной кластеризации, модели начинают дрейфовать, уходя далеко за пределы характеристик тех групп, которые должны были бы представлять. Они начинают слишком радикально выделяться, искажая реальную картину.

Однако, когда в процесс добавляется общий сигнал, работающий на уровне всей команды, проблема решается. Этот общий регулятор действует как «якорь», постоянно возвращая каждого агента в нужные рамки, сохраняя при этом уникальность его подхода. Так достигается баланс: агенты остаются верными своим «настроениям», но вместе они формируют картину, близкую к общепринятой.

В этой работе важно не то, кто выносит окончательный вердикт, а то, что система признает право на существование разных интерпретаций, не сводя их к единому знаменателю.

Практическая значимость и ограничения

Этот подход имеет важные последствия для разработки этичных и точных систем искусственного интеллекта. Сексизм — это сложное явление, проявляющееся по-разному в разных культурных и социальных контекстах. Ожидание, что один алгоритм поймет все оттенки этого явления одинаково для всех, кажется нереалистичным. MAP-PO предлагает механизм для кодирования этой сложности прямо в архитектуру ИИ.

Стоит отметить, что текущая работа представлена в формате preprint и находится на стадии рецензирования для конференции EACL 2027. Данные исследования базируются на твитах по-английски и по-испански, что открывает путь к дальнейшим тестам на других языках и в других контекстах. Код и данные, используемые в исследовании, доступны авторам для проверки, что соответствует стандартам открытой науки, хотя полная реализация пока находится в разработке.

Таким образом, вместо борьбы с человеческим несогласием как с ошибкой, этот метод предлагает использовать его как ресурс. В мире, где ИИ все больше участвует в модерации контента и анализе социальных настроений, умение различать и уважать множественность перспектив может стать ключом к созданию более тонких и надежных инструментов.

Первоисточники

arXiv cs.CL
← Вернуться в эфир