Атаки на AI-агентов и разработка детектора для русскоязычного трафика
Команда Just AI объясняет, почему универсальные модели безопасности бессильны против специфических русских инъекций, и описывает процесс создания собственного детектора для фильтрации атак джейлбрейков и отравления данных.
# Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
В мире искусственного интеллекта границы между сервисом и уязвимостью становятся все более тонкими. Хакеры перестали искать технические дыры в коде и начали использовать социальные инженерии против самих моделей. Вместо сложного эксплойта достаточно было отправить ассистенту письмо от имени босса или поместить вредоносную инструкцию в публичный канал Slack. Теперь вместо человека жертвой стала нейросеть.
Команда Just AI разрабатывает систему Jay Guard — слой безопасности, работающий между приложением и языковой моделью. В этой статье мы раскрываем технические детали создания текстового детектора, способного фильтровать атаки на русскоязычном контуре, и разбираем, почему решения «из коробки» часто оказываются бесполезны для локальной специфики.
Проблема универсальных моделей
Наша работа с детекторами безопасности началась с изучения готовых решений. Мы протестировали популярные open-source модели, такие как Llama Guard 4 и GPT-OSS Safeguard. Результаты оказались разочаровывающими для русскоязычного трафика.
На английском языке эти модели показывают феноменальную точность (F1 выше 0.99), но на русском картина меняется кардинально. Универсальные модели путают реальные атаки с обычными запросами пользователей, выдавая более 40% ложных срабатываний. В производственной среде это означает блокировку практически каждого второго безопасного запроса, что делает продукт непригодным для использования.
Причиной становится разность подходов к обучению. Готовые guard-модели обучены на глобальных данных, собранных в определенный момент времени. Они имеют фиксированную политику классификации и представление об угрозах, которое не учитывает региональную специфику и новые векторы атак, актуальные сегодня. Guard-модель лишь выносит вердикт по тексту, в то время как система guardrails должна адаптироваться под конкретную задачу.
Важно понимать технические термины: guard-модель — это алгоритм, принимающий бинарное решение о безопасности текста, а guardrails-система — это комплексный слой, который оборачивает несколько специализированных детекторов, адаптируя их пороги и точки применения под конкретную бизнес-логику.
Анализ устаревших датасетов
Главная сложность в создании защиты — не обучение модели, а получение релевантных данных. Мы проанализировали самые популярные открытые датасеты атак на Hugging Face, которые активно используются сообществом. Анализ показал три критических недостатка этих наборов данных:
1. Устаревание контента. Большинство популярных датасетов собраны в 2023 году. В них доминируют техники того времени, такие как «Do Anything Now» (DAN), ролевые обертки и давление авторитетом. Современные API-модели с усиленной защитой легко блокируют эти устаревшие шаблоны. Детектор, обученный на данных 2023 года, будет отлично ловить «DAN», но пропустит современные методы обфускации. 2. Отсутствие атак на инструменты. В открытых наборах данных практически отсутствуют примеры атак на слои инструментов агентов (MCP, отравление вызовов функций, каскадные сбои). Эти векторы стали критически важными для мультиагентных систем, но их почти нет в открытых корпусах. 3. Многоходовые атаки и контекст. В датасетах редко встречаются сценарии, где атака складывается из нескольких сообщений или происходит в контексте большого количества предыдущих данных (диалог с большим контекстом). Такие атаки могут выглядеть безопасно по отдельности, но привести к утечке данных в совокупности.
Мы провели эксперимент с 378 пробеми из трех ведущих датасетов, пропустив их через восемь различных моделей. Результаты показали, что ни одна из проверенных проб не смогла пробить все четыре современные API-модели одновременно. Более того, многие из «эффективных» атак из открытых наборов оказались безобидными или просто грубыми запросами, которые не демонстрируют реальной способности модели нарушать политику безопасности.
Конвейер сбора данных
Понимая ограничения открытых ресурсов, команда Just AI отказалась от идеи использования готовых корпусов и запустила собственный конвейер сбора данных. Наш подход строится на непрерывном обновлении бенчмарка, а не на статичном датасете.
Мы используем пять источников для формирования обучающей выборки:
* Открытые англоязычные датасеты. Они служат основой для покрытия классических техник атак, которые остаются актуальными. * Сканеры безопасности (Garak, PyRIT, Promptfoo). Эти инструменты статически агрегируют известные корпуса, а их генеративные возможности позволяют воспроизводить сложные сценарии вроде «Crescendo» (постепенная раскачка диалога) и многоходовые атаки. * Активный поиск в реальном мире. Мы собираем примеры из реальных логов, разделяя попытки нарушения и успешные атаки. Для нас критически важно знать, какие промпты действительно заставляют целевую модель подпускать утечку данных или менять поведение.
Особое внимание уделяется таксономии угроз. Мы разбиваем каждую атаку на три оси:
1. Источник: Сообщение пользователя, документ, слой инструментов или диалог. 2. Механизм: Отмена инструкций, принятие роли, скрытая инструкция или подмена инструментов. 3. Цель: Обход политики, утечка промпта, кража данных или несанционированное действие.
Такая детализация позволяет выявить пробелы в защите. Например, наши тесты показали, что детекторы хуже всего справляются с атаками на слой инструментов и многоходовыми сценариями, так как эти классы почти отсутствуют в открытых данных.
Заключение
Безопасность AI-агентов — это не разовая задача по обучению модели, а постоянный процесс адаптации. Готовые решения не работают «out of the box», так как они не учитывают специфику локального языка и быстро меняющиеся методы социальной инженерии против алгоритмов. Команда Just AI доказывает, что надежная защита строится на собственном бенчмарке, глубоком анализе таксономии атак и непрерывном обновлении данных по мере появления новых угроз.