ClickGuard: Инструмент ИИ для распознавания кликбейта и сохранения сути статей
Команда исследователей представляет новую систему ClickGuard — расширение для веб-браузера, способное выявлять кликбейтные заголовки в реальном времени. Используя гибридную архитектуру машинного обучения, включающую трансформеры и специализированную метрику 'полезности', инструмент достигает точности прогнозирования F1-SCORE 91%. Система не только предупреждает пользователя перед посещением страницы, но и анализирует её содержание после открытия, выдавая процент вероятности кликбейта и краткое содержание статьи, предотвращающее необходимость кликать по вводящим в заблуждение ссылкам.
# ClickGuard: Борьба с кликбейтом на основе метрик информативности
В цифровом пространстве всё больше внимания уделяется качеству контента и защите пользователей от манипулятивных техник. Исследователи из Польши (аффилированные с университетами в Кракове и Лодзи) разработали решение, способное автоматизировать эту защиту. В работе, опубликованной на arXiv под номером 2607.20463, описывается проект ClickGuard.
Гибридная архитектура и метрика ' baitness '
Проблема кликов по «кликбейту» часто сводится к анализу заголовка. Однако, как показывает практика, сам заголовок может быть нейтральным, но подан в заголовок, либо статья может содержать скрытые манипулятивные приемы в теле. Для решения этой задачи разработчики создали систему, которая анализирует контент как до, так и после его открытия.
В основе системы лежит гибридная архитектура. Исследователи оценили ряд методов обработки естественного языка — от классических векторизаторов до современных встраиваний, созданных на базе больших языковых моделей (LLM). В итоге была выбрана модель на базе XGBoost, которая в сочетании с трансформерными эмбеддингами и лингвистическими признаками выдает лучший результат.
Ключевым элементом инновации является введение собственной метрики, названной «baitness» (кликовость). Эта метрика позволяет количественно оценить степень кликбейтности статьи, опираясь не только на эмоциональную окраску текста, но и на объективные показатели информативности.
Технический штрих: Для пользователей, не знакомых с машинным обучением, стоит уточнить: модель XGBoost — это инструмент для построения прогнозных моделей, который обучается на исторических данных, чтобы предсказать вероятность определенного события (в данном случае — кликбейта) для новых случаев. Трансформерные эмбеддинги же позволяют системе понимать контекст слов, а не просто искать частотные совпадения.
Функционал в реальном времени
Система разработана как расширение для браузера. Её действие можно разделить на два режима, что обеспечивает максимальную защиту пользователя.
1. Предварительное предупреждение: До того, как пользователь совершит переход по ссылке, расширение сканирует её заголовок и контекст. Если риск попадания в кликбейт высок, система предупреждает пользователя, позволяя избежать «потерянного времени». Однако, как отмечают авторы, полагаться только на этот метод нельзя, так как кликбейт может прятаться в самом тексте.
2. Пост-анализ и спойлер: Если пользователь всё же решил перейти по ссылке, расширение запускает глубокую проверку. Сразу после открытия страницы (или в реальном времени при прокрутке) система присваивает статье процентный балл, указывающий на вероятность того, что это кликбейт. Прогноз сопровождается объяснением, какие именно метрики были превышены.
Особое внимание привлекает функция «clickbait spoiler». Расширение генерирует краткое содержание — спойлер из одного-двух предложений, раскрывающий суть статьи. Это позволяет читателю мгновенно понять, содержится ли в материале та информация, которую он искал, не тратя время на чтение всего текста.
Результаты исследования
Валидация модели проводилась на открытом объединённом датасете. Согласно результатам, опубликованным в абстракте, модель достигает F1-SCORE на уровне 91%. Это показатель считается очень высоким в задачах классификации текстов, где часто встречаются дисбалансы классов и много вариативных формулировок.
Разработчики подчеркивают, что их подход выводит детекцию за рамки традиционных методов, которые часто основаны только на заголовке. Интеграция LLM-эмбеддингов позволяет системе лучше понимать нюансы языка, тогда как классические векторизаторы могут упускать контекст. Однако, финальную классификацию берет на себя ансамбль моделей, где XGBoost выступает в роли решающего фактора, фильтрующего шумы и выводящего чистый прогноз.
Видеодемонстрация функционала доступна на платформе YouTube, где показаны механики работы расширения и пример работы с провокационными новостями.
Система ClickGuard демонстрирует, как методы искусственного интеллекта могут применяться не только для генерации контента, но и для его качественной модерации и защиты пользователей от информационных ловушек. Такой подход особенно актуален в эпоху, когда достоверность новостей часто ставится под сомнение, а экономическая модель многих медиазависит от кликабельности заголовков.