Стилистическая нестабильность: как визуальные триггеры обходят защиту мультимодальных моделей
Мультимодальные большие языковые модели (MLLM), демонстрирующие выдающиеся результаты в понимании контекста и изображений, остаются уязвимыми к специфическим атакам типа 'джилбрейк'. Исследование, опубликованное в arXiv, выявляет парадокс: нейросети устойчиво воспринимают смысл контента независимо от его визуального оформления, однако их механизмы безопасности часто проваливаются под воздействием определенных стилевых триггеров. На основе этого открытия разработчики предложили метод Adversarial Style Optimization (ASO), который использует генеративные модели для усиления визуальных атак.
# Стилистическая нестабильность: новый вектор для тестирования безопасности ИИ
Мультимодальные большие языковые модели (MLLM) в последние годы совершили значительный прорыв, позволяя машинам не только генерировать текст, но и интерпретировать сложные визуальные сцены. Однако, как показывают новые данные, их «безопасное выравнивание» (safety alignment) остается хрупким. Традиционные атаки, фокусирующиеся на содержании сообщения, становятся менее эффективными по мере совершенствования моделей. В ответ исследователи обнаружили уязвимость другого порядка: стилистическую.
Парадокс понимания и защиты
В основе открытия лежит эмпирический факт, который может показаться контринтуитивным для создателей безопасных систем. Мультимодальные модели демонстрируют стилистическую нестабильность между своими способностями к пониманию и механизмами защиты.
Проще говоря: если изменить стиль изображения или текста-подсказки (например, превратить картинку в пиксель-арт или изменить шрифт), способность модели *понимать* визуальный контент практически не страдает. Она прочитает изображение и извлечет смысл. Но вот когда система должна активировать защиту от вредоносных запросов, эта устойчивость исчезает. Специфические стилистические триггеры способны обойти фильтрацию безопасности, заставляя модель выполнить запрещенное действие. Это указывает на то, что нейросети обучаются разным задачам на разных уровнях абстракции, и безопасность становится зависимой от внешних признаков, а не только от семантики.
Адаптивная стилистическая оптимизация (ASO)
Для усиления этой уязвимости предложен новый модуль — Adversarial Style Optimization (ASO). Он действует как плагин, который можно подключить к существующим атакам, чтобы повысить их эффективность.
Суть метода заключается в следующем: ASO использует дообученную модель редактирования изображений, чтобы наложить оптимизированные стилистические изменения на исходный «враждебный» образ. Процесс выбора идеального стиля контролируется агентом, использующим алгоритм Group Relative Policy Optimization (GRPO). Этот агент руководствуется структурированной функцией награды, которая состоит из двух частей:
1. Сигнал на основе логитов, который фиксирует явный отказ модели выполнить команду (позитивное подкрепление для атакующего). 2. Семантическая оценка высокой точности от мощной модели-судьи, которая проверяет, насколько качественно изображение передает смысл атаки.
Такой гибридный подход позволяет найти баланс между читаемостью для ИИ и скрытием угрозы от фильтров безопасности.
Масштабируемость визуальных векторов
Проведенные эксперименты подтверждают, что этот подход значительно повышает вероятность успеха современных атак (ASR — Attack Success Rate). Результаты исследования показывают, что стилистические смещения (biases) могут стать масштабируемым инструментом для «красной команды» (специалистов по тестированию безопасности) при проверке мультимодальных систем.
Это открытие поднимает важные вопросы о природе обучения современных ИИ. Если защита зависит от визуального стиля, а не только от логики запроса, то существующие стандарты тестирования безопасности требуют пересмотра. Исходный код для воспроизведения эксперимента и реализации ASO доступен на GitHub, что открывает возможность для дальнейшего изучения этой области.
Исследование подчеркивает, что развитие ИИ идет по пути увеличения сложности, но безопасность часто отстает, создавая новые, неожиданные векторы уязвимости. Пока мы не поймем, как именно стиль влияет на срабатывание фильтров, такие системы будут оставаться подвержены атакам, которые кажутся безопасными с человеческой точки зрения.