Кибербезопасность · Искусственный интеллект · LLM · AI-агенты · OGL-Mini · Prompt Injection31 августа в 03:39 · 5 мин

Трехфазная защита ИИ-агентов от современных атак: разбор модели OGL-Mini

В эпоху расцвета агентов на базе больших языковых моделей (LLM) безопасность стала критической необходимостью. Встроенные фильтры промптов пропускают до 76% сложных атак, включая джейлбрейки через XML-политики и скрытые инструкции в веб-документации. Автор статьи предлагает архитектуру трехфазной защиты, основанную на гибридной модели OGL-Mini, которая обеспечивает интерпретируемость решений и высокую производительность без вызовов внешних API.

# Трехфазная защита ИИ-агентов: как противостоять современным угрозам

Распространение искусственного интеллекта в бизнес-процессы привело к появлению новых векторов атак. Если раньше безопасность фокусировалась на периметре, то сейчас угрозы проникают внутрь через промпты, данные RAG-систем и инструменты автоматизации. По данным OWASP LLM Top 10 2026 года, промпт-инъекции остаются ведущей угрозой, однако методы реализации стали изощреннее: от маскировки вредоносных команд под URL-ссылки до вставки невидимых символов в код.

Стандартные механизмы безопасности, полагающиеся на встроенные фильтры LLM, демонстрируют низкую эффективность: они пропускают до четверти всех активных атак. Это требует внедрения специализированных слоев защиты, работающих независимо от основной модели и способных объяснить причину блокировки.

В этой статье мы разберем основные классы угроз для ИИ-систем и проанализируем архитектуру модели OGL-Mini (Open Guard Layer), созданной для решения этих задач.

Ландшафт современных угроз

За период с 2025 по 2026 год исследователями были зафиксированы многочисленные инциденты, демонстрирующие реальную опасность для автономных агентов и чат-ботов. Ключевыми категориями угроз являются:

1. Прямые промпт-инъекции (Prompt Injection): Переопределение системных инструкций злоумышленником. В декабре 2025 года исследователи Tenable продемонстрировали атаку на агента Microsoft Copilot Studio, где агента обманным путем заставили раскрыть платежные данные клиентов и бесплатно изменить бронирования. 2. Непрямые атаки через каналы ввода: Внедрение вредоносных инструкций не в диалоговое окно, а в данные, которые агент потребляет из внешних источников. В октябре 2025 года уязвимость была обнаружена в OpenAI Atlas, где строка, маскирующаяся под URL, содержала инструкции на естественном языке. Агент интерпретировал её как навигационную команду, но выполнил вредоносные действия (например, удаление файлов из Google Drive). 3. Атаки на RAG-системы: Отравление векторных баз данных или манипуляция структурированными данными (JSON-LD) на веб-сайтах. Примером стал фальшивый сайт документации библиотеки requests-secure-v2, где скрытые в CSS инструкции заставляли агентов отправлять средства на фишинговые счета. 4. Джейлбрейки через структурированные форматы: Метод «Policy Puppetry» (раскрыт в апреле 2025), при котором вредоносные промпты маскируются внутри тегов XML или секций INI-файлов. LLM, стремясь следовать структурированным данным, часто игнорирует стандартные правила безопасности.

Архитектура модели OGL-Mini

Для борьбы с этими угрозами необходим подход, не зависящий от внутренних фильтров основной модели. Предлагается архитектура, основанная на гибридной модели безопасности OGL-Mini, работающая на принципах многоступенчатой фильтрации.

Система построена по принципу трех фаз, каждая из которых выполняет свою роль:

Фаза 1: Эвристический анализ Первый слой защиты — набор регулярных выражений и правил эвристики. Этот механизм работает с минимальными задержками (менее 0.1 мс) и отсекает очевидные атаки, не требующие ресурсоемкого вычисления. Фильтры ищут характерные паттерны: * Контрольные токены и маркеры (например, <|im_start|>). * Невидимые Unicode-символы (zero-width characters). * Паттерны омоглифов (замена латинских букв на визуально идентичные символы других алфавитов).

Фаза 2: Мини-классификатор на основе TF-IDF Если эвристики не выявили угрозу, запрос передается на вторую стадию. Здесь работает классификатор, основанный на векторизации TF-IDF и линейной модели (линейный классификатор с нормализацией C=3).

Модель обучена на обширном датасете из более чем 110 тысяч примеров, включающем: * Примеры промпт-инъекций по категориям OWASP LLM01 (около 54 тыс. случаев). * Синтетические сценарии агентных атак (цель, перехват инструментов, злоупотребление привилегиями). * Примеры современной обфускации (Base64, Hex, вставка пробелов между буквами).

Преимущество подхода TF-IDF заключается в интерпретируемости: в отличие от «черных ящиков» типа трансформеров, можно точно указать, какие слова или конструкции привели к блокировке запроса.

Фаза 3: Детекция персональных данных (PII) Последний этап фильтрации направлен на защиту приватной информации. Гибридный детектор использует комбинацию регулярных выражений и ONNX-модели (дистиллированной от MiniLM-L6). Он способен распознавать 11 классов данных: имена, email, телефоны, банковские карты, паспорта, адреса и другие идентификаторы. Система работает на множестве языков, включая русский, с метрикой точности micro F1 = 0.86.

Техническая реализация и преимущества

Одной из ключевых особенностей OGL-Mini является её способность работать в автономном режиме, без необходимости отправлять данные в облачные провайдеры. Это критически важно в эпоху «zero-click» атак и требований к суверенитету данных.

Технические характеристики: * Задержка: Полный пайплайн обработки занимает от 10 до 300 мс даже на слабых процессорах. * Язык: Поддерживает многоязычные запросы с высокой эффективностью. * Размер: Модели компакtnы (около 300 МБ), что позволяет развертывать их локально или в браузере с использованием WebAssembly (WASM).

Для разработчиков доступно множество языковых интерфейсов: TypeScript, Python и Go. Библиотека позволяет легко внедрить слой безопасности в существующие RAG-системы или агентов, не меняя их основную архитектуру. Важно отметить, что модель не просто блокирует запросы, но и возвращает детализированный отчет: стадию, на которой была выявлена угроза, задержку и метку риска.

Внедрение подобной трехфазной защиты становится стандартом для безопасного использования ИИ-агентов, позволяя бизнесу использовать возможности автоматизации без компрометации данных пользователей и внутренней инфраструктуры.

*Важно: В представленной информации использованы данные авторитетных исследований (Tenable, NeuralTrust, Zscaler ThreatLabz, HiddenLayer) и технические характеристики модели, описанные в открытом доступе. Автор не имеет личных инцидентов с этими атаками, однако описывает их на основе публичных отчетов и документации модели.*

Первоисточники

Habr AI
← Вернуться в эфир