Между подавлением и крахом: оценка устранения нарративов с помощью протокола LENS
Большие языковые модели способны воспроизводить искаженные информационные повестки, представляя их как правдоподобные объяснения событий. В новой работе авторов Viktoriia Makovska и George Fletcher предложен метод Level-based Evaluation of Narrative Suppression (LENS) для анализа эффективности алгоритмов машинного «обучения без» (unlearning). Исследование фокусируется на двух конкретных нарративах: оправдании войны России против Украины расширением НАТО и теорией о эксплуатации США Тайванем. Эксперименты проводились на моделях с параметризацией около 12 млрд параметров, таких как Gemma-12B, Qwen-14B, Lapa LLM и TAIDE-Gemma. Результаты показывают, что выбранные контрольные точки (checkpoints) действительно снижают воспроизводство целевых нарративов, однако эффективность устранения зависит от типа промпта и может приводить к побочным эффектам, включая восстановление реальных сущностей, связанных с исходным фреймом.
# Между подавлением и крахом: оценка устранения нарративов с помощью протокола LENS
Большие языковые модели (LLM) обладают способностью генерировать текст, который согласуется с дезинформационными или предвзятыми нарративами. Этот феномен создает серьезную проблему для безопасности ИИ: если модель может генерировать правдоподобные аргументации в поддержку ложных утверждений, просто удалить эти утверждения недостаточно. Исследователи из arXiv (статья cs.CL:2607.22657) предлагают новый подход к тестированию устойчивости моделей к таким воздействиям.
Протокол LENS и уровень сопротивления
Центральным элементом исследования является введение контекстно-зависимого протокола оценки, названного Level-based Evaluation of Narrative Suppression (LENS). В отличие от простых тестов на удаление знаний, LENS проверяет способность модели сопротивляться определенным нарративам на различных уровнях сложности, от прямого запроса до абстрактных описаний.
Исследователи разделили тестовые сценарии на четыре категории: 1. Прямой уровень: Модель просится прямо рассказать о событии (например, «Почему Украина проигрывает?»). 2. Указанный уровень (Attributed): Промпт содержит отсылку к конкретному источнику пропаганды (например, «Как это видит пропаганда?»). 3. Контрастный уровень: Запрос формулируется через противопоставление («Почему Россия не может выиграть?», где подразумевается ложный исход). 4. Абстрактный уровень: Промпт описывает ситуацию без прямых ссылок на конфликт, но сохраняя логическую структуру фальшивой повестки.
Используя этот протокол, команда исследовала две конкретные темы. Первая — нарратив о том, что война России против Украины была вынужденной реакцией на расширение НАТО. Вторая — нарратив о том, что США используют или предательски бросили Тайвань.
Скорость SCE и выбор контрольных точек
Для количественной оценки результатов авторы ввели новый метрику — Suppression-Collapse Efficiency (SCE). Эта шкала награждает модели за успешное подавление целевого нарратива, но одновременно штрафует за деградацию качества ответов. То есть, если модель перестает говорить, чтобы не повторить ошибку, это не считается идеальным решением. Задача состоит в том, чтобы найти «контрольную точку» (checkpoint) во время обучения, где модель уже закрепила правильное поведение, но не потеряла своих базовых компетенций.
В экспериментах участвовали четыре модели с параметризацией около 12 млрд: Lapa LLM, Gemma-12B, Qwen-14B и TAIDE-Gemma. Результаты показали, что использование правильно подобранных контрольных точек действительно позволяет снизить воспроизводство ложных нарративов. Однако интересным эффектом стало то, что подавление, достигнутое через прямые промпты, иногда распространялось на абстрактные запросы. Это указывает на то, что «обучение без» может быть глубоким процессом, меняющим внутреннюю структуру модели, а не просто записывающим флаг «не рассказывать про эту тему».
Побочные эффекты и восстановление сущностей
Одним из неожиданных находок стало явление, которое исследователи назвали восстановлением сущностей (entity recovery). Когда модель обучали игнорировать определенный нарратив, в некоторых случаях (особенно при абстрактных промптах типа A, B, C) она начинала восстанавливать упоминания реальных акторов, которые ранее были связаны с фальшивым фреймом. Это означает, что даже при подавлении одного мифа модель может «возвращаться» к обсуждению связанных фактов, но уже в более корректном контексте. Тем не менее, это требует осторожности, так как показывает, как сложны границы между подавлением и крахом модели.
Протокол LENS доказал свою эффективность как диагностический инструмент. Он позволяет не только фиксировать результаты тестов, но и направлять дальнейшие исследования структуры нарративного «обучения без». Для разработчиков ИИ это важный шаг вперед: теперь можно более точно оценивать, насколько надежно защищена модель от манипуляций через выбор конкретных параметров обучения.
В заключение, работа Makovska и Fletcher подчеркивает, что борьба с дезинформацией в ИИ не может ограничиваться простым удалением данных из весов модели. Требуется тонкая настройка, позволяющая сохранить функциональность системы, но при этом блокировать генерацию вредоносных нарративов.