Скрытая угроза в модульности: каскадные атаки на системы агентов с навыками
Открытость экосистемы навыков, позволяющая агентам гибко использовать сторонние инструменты, породила новый класс киберугроз. Исследователи из arXiv описывают каскадные атаки, где совокупное воздействие нескольких безобидных на первый взгляд модулей приводит к критическим системным сбоям, которые невозможно обнаружить при проверке отдельных компонентов.
# Stealth Apart, Harm Together: как разрозненные ошибки создают катастрофу
В мире искусственного интеллекта модульность — это ключ к гибкости. Системы агентов, способные загружать и использовать готовые наборы инструкций и скриптов, называют «навыками» (skills). Это позволяет одним и тем же базовым моделям решать задачи в медицине, кодинге и аналитике, подгружая специализированные пакеты. Однако новая статья, опубликованная на arXiv под заголовком *Stealth Apart, Harm Together*, предупреждает: сама эта модульность открывает дверь для атак, которые ранее были невидимы. Проблема заключается не в ошибке одного модуля, а в их опасном взаимодействии.
Анатомия «невидимой» каскадной атаки
Традиционные подходы к безопасности фокусируются на целостности отдельных компонентов: мы проверяем код навыка, смотрим на инструкцию для модели и убеждаемся, что он не содержит вредоносных инструкций. Если каждый навык в отдельности безопасен, система считается защищенной. Исследователи в работе *Stealth Apart, Harm Together* доказывают, что это заблуждение.
Каскадная атака (skill cascading attack) — это стратегия, при которой злоумышленник разделяет вредоносную цель между несколькими навыками. Каждый из них вносит микроскопическую, на первый взгляд безобидную погрешность в обработку данных. Но при последовательном выполнении цепочка этих искажений усугубляется, приводя к фатальному результату.
В качестве примера авторы приводят сценарий из медицинской доменной области. Рассмотрим конвейер проверки рецептов, где критически важно избегать взаимодействия лекарств.
1. Первый навык (анализ истории): Вместо того чтобы полностью исключить устаревшие препараты из истории пациента, он слегка ослабляет сигналы о недавно отмененных лекарствах. Данные о них остаются, но их важность снижается. 2. Второй навык (оценка рисков): Получив «ослабленную» историю, этот модуль обнаруживает опасное взаимодействие с текущим назначением. Однако из-за предыдущего искажения он классифицирует угрозу как незначительную и понижает степень опасности до минимума. 3. Третий навык (генерация отчета): Этот модуль отвечает за фильтрацию алертов. Получив сигнал о минимальной опасности, он решает, что этот алерт не стоит внимания врача, и скрывает его в итоговом резюме.
Итог: серьезное предупреждение о взаимодействии лекарств молча исчезает перед лицом врача. Ни один из трех навыков не был злонамеренным по отдельности, но их совокупное действие привело к провалу безопасности.
Инструментарий изучения уязвимостей
Чтобы подтвердить гипотезу о масштабности проблемы, исследователи разработали *SkillCascade* — автоматизированный фреймворк для красного тестирования (red-teaming). Эта система позволяет многоагентным моделям самостоятельно искать слабые места в цепочках навыков, имитируя попытки злоумышленника.
На базе этого фреймворка был создан *SkillCascade-Bench* — бенчмарк, содержащий 213 валидированных тестовых случаев. Эти сценарии охватывают различные домены и типы агентов, включая OpenClaw, Claude Code и Codex.
Результаты проверки оказались тревожными. Каскадные взаимодействия надежно провоцировали вредоносное поведение на всех тестированных платформах. При этом существующие сканеры, проверяющие отдельные навыки, и системы мониторинга времени выполнения не замечали атаки. Это подтверждает, что текущие механизмы безопасности слепы к рискам, возникающим на стыке модулей.
*Важно отметить: это исследование является теоретическим выводом и экспериментами, проведенными исследователями в контролируемой среде. Оно описывает векторы атак, а не фиксирует реальное использование вредоносного ПО в публичных системах на момент публикации.*
Пути решения: от компонента к системе
Главный вывод работы заключается в том, что обеспечение целостности компонентов не гарантирует безопасность системы. Замкнутый круг «каждый модуль безопасен — значит, и система безопасна» не работает, когда злоумышленник умеет играть роль дирижера между ними.
Исследователи призывают индустрию сместить фокус защиты. Вместо того чтобы проверять навыки изолированно, системы должны уметь рассуждать об их кросс-сквазных взаимодействиях. Это требует разработки новых механизмов аналитики, способных видеть картину целиком: как выход данных из одного модуля становится входом для другого, и как эти цепочки могут быть взломаны.
Безопасность в мире агентов требует не просто надежных деталей, но и грамотного проектирования процессов их взаимодействия. Пока эта область находится в стадии изучения, разработчикам следует格外 внимательны при внедрении сложных конвейеров из сторонних навыков, особенно в критических областях, таких как медицина или финансы.
Понимание природы этих атак — первый шаг к созданию действительно надежных экосистем ИИ, где открытость не приведет к скрытому хаосу.