ИИ · Безопасность LLM · Диалоговые системы · arXiv · Накопление рисков24 июля в 04:01 · 4 мин

Состоятельные ограждения: новый подход к безопасности диалоговых моделей ИИ

Безопасность больших языковых моделей (LLM) традиционно оценивалась по каждому запросу и ответу изолированно. Исследователи из arXiv выявили критический пробел: угрозы часто формируются не в одном сообщении, а накапливаются в ходе многоповерного диалога. В рамках нового исследования предлагается концепция 'Накопления диалоговых рисков' (Conversational Risk Accumulation) и соответствующий фреймворк для их мониторинга.

# Накопление рисков в диалоге: почему безопасность ИИ должна запоминать контекст

Большинство современных систем защиты больших языковых моделей работают по принципу моментальной оценки. Каждый пользовательский запрос проверяется, и если он не содержит явного нарушения правил, ответ генерируется. Однако этот подход упускает целый класс угроз, которые проявляются не в одном сообщении, а в результате последовательности безобидных на первый взгляд реплик.

В новой работе, опубликованной на arXiv (arXiv:2607.19361), авторами описан подход, который учитывает историю общения. Исследователи называют это явление "Накоплением диалоговых рисков" (CRA). Это процесс, при котором вредоносный смысл или инструкция складывается постепенно, как изломанный пазл, превращаясь из набора нейтральных фраз в опасную команду.

Как работает накопление рисков

Исследователи выделили три основных механизма, через которые возникает CRA:

1. Медленный дрейф намерений: Пользователь не просит модель сделать что-то плохое сразу. Вместо этого он начинает разговор на нейтральную тему, медленно смещая контекст к чувствительным областям, пока модель не начнет невольно соответствовать новым, более опасным параметрам. 2. Фрагментированное сборирование инструкций: Запрещенная задача может быть разбита на мелкие части. Каждая часть по отдельности безопасна, но в совокупности они формируют полную инструкцию по нарушению правил. 3. Усиление чувствительности: Если пользователь неоднократно раскрывает конфиденциальную информацию, модель может ошибочно начать считать эту информацию допустимой для повторного использования в других целях, даже если в последующих ходах она не была явно запрошена.

Чтобы противостоять этим механизмам, авторы предлагают фреймворк, работающий на уровне сессии. Система отслеживает три ключевых сигнала:

* Семантический дрейф: Отслеживание смещения смысла от исходной темы сессии. * Граф накопления информации: Визуализация того, какие сущности (имена, адреса, факты) были извлечены и как их чувствительность кумулирует в памяти модели. * Градиент комплаенса: Измерение возрастающей готовности модели подчиняться запросам, даже если они становятся все более маргинальными с точки зрения этики.

Для оценки этих факторов используется модель CRA-Net DA. Она обучена с использованием противоречивых целей (family-adversarial objectives), что позволяет ей игнорировать ложные сигналы, связанные просто с длиной текста или общей тематикой разговора.

Бенчмарк CRA-Bench

Для проверки эффективности нового метода авторы создали открытые наборы данных под названием CRA-Bench. Это стандарт для тестирования подобных систем.

Первая версия, CRA-Bench v0.1, содержит 1 200 сессий, состоящих из 8 поворотов. Они разбиты на три категории угроз и для каждой категории есть "доброжелательные близнецы" — диалоги, которые выглядят почти так же, но не содержат вредоносных намерений. Вторая версия, v0.2, использует парфразы, сгенерированные другими ИИ, чтобы исключить артефакты, связанные с жесткими шаблонами тестирования.

Третья версия расширила набор до пяти семей угроз и добавила сложные техники манипуляции контекстом, такие как введение ролевых установок (persona priming) и "забивание" контекста лишней информацией.

Исследователи также разработали новую протокол оценки, который позволяет отделить истинные риски от статистических шумов. Метрики включают не только точность обнаружения, но и количество ходов, необходимых для выявления угрозы, а также калибровку ошибок первого рода (ложноположительных срабатываний). Важным аспектом является возможность тестирования модели на новых типах атак, которых не было в обучающей выборке, что подтверждается диагностическими стресс-тестами.

Техническая суть и ограничения

Значение этой работы не столько в конкретных алгоритмах, сколько в смене парадигмы восприятия безопасности. Ранее системам требовалось быть "реактивными" — блокировать только то, что уже видно в текущем сообщении. Новый подход делает их "состоятельными" или "мемориальными", позволяя им понимать контекст разговора.

Однако важно помнить, что этот фреймворк фокусируется на внутрираспределенном оценке, то есть проверке того, насколько хорошо модель работает с известными ей паттернами. Обобщение на совсем новые виды манипуляций требует дополнительных исследований. Кроме того, методы не предполагают использования личных данных пользователя за пределами той информации, которую он уже предоставил в рамках текущего диалога для анализа рисков.

Этот подход напоминает маяк, который не просто видит корабль под угрозой, но понимает, что курс корабля медленно меняется, и предупреждает до того, как шторм станет неизбежен.

Первоисточники

arXiv cs.CL
← Вернуться в эфир