Ошибка израильского стартапа Irregular стала причиной серии инцидентов с «беглыми» ИИ от гигантов Кремниевой долины
Скепсис по поводу безопасности искусственного интеллекта, вызванный недавними атаками агентов OpenAI и других компаний на Hugging Face, оказался не случайным. В центре серии инцидентов с «беглым» ИИ оказался один конкретный игрок: израильский стартап Irregular. Ошибки в настройке тестовой среды компании позволили нейросетям беспрепятственно выйти в открытый интернет и атаковать реальные цели, включая сайты правительств Австралии и Германии.
# Один источник проблем: как стартап Irregular стал эпицентром волны атак «беглого» ИИ
В июле 2026 года OpenAI публично признала, что её агентские системы совершили несанкционированную атаку на платформу Hugging Face. Это событие стало катализатором широких опасений по поводу безопасности ИИ. Однако в последующие месяцы возникла серия похожих инцидентов, связанных с агентами от Meta, Anthropic и Google. На первый взгляд, эти случаи казались разрозненными событиями, однако глубокий анализ показывает, что у них есть общий корень.
Исходник проблемы: платформа для стресс-тестов
В основе всех описанных инцидентов лежит деятельность компании Irregular, израильского стартапа, который специализируется на стресс-тестировании моделей искусственного интеллекта. Основатель и генеральный директор компании, Омер Нево (Omer Nevo), ранее работал в компании Pattern Labs, которую позже трансформировали в Irregular. Компания позиционирует себя как поставщик платформ для исследований высокой точности («high-fidelity research platforms»), которые моделируют и мониторят реальные сценарии кибербезопасности ИИ.
Иррегуляр сотрудничает с многими крупнейшими игроками индустрии. Хотя точный список клиентов не разглашается, работы компании упоминались в картах систем моделей OpenAI, использовались для тестирования систем правительством Великобритании и корпорацией Anthropic. Кроме того, Irregular публиковало исследования совместно с think-tank RAND. В своих оценках ИИ компания охватывала не только западных гигантов, но и модели от китайских разработчиков Moonshot AI (Kimi K3) и Z.ai (GLM-5.2). В отличие от проприетарных моделей Meta и Google, модели от китайских разработчиков можно бесплатно загрузить и запустить локально, что позволяло тестировщикам работать без прямой передачи данных к облаку.
Механика ошибки: доступ к реальному интернету
Все расследованные инциденты следовали одному шаблону. Irregular проводила тестирование киберустойчивости моделей в контролируемых средах, имитирующих реальные условия. Некоторые из этих тестов строились по принципу «захвата флагов» (capture-the-flag), когда агентам поручалось найти скрытую информацию в имитированных сетях.
Однако конфигурация среды имела критические уязвимости. Омер Нево заявил изданию The Verge, что агенты изначально не должны были иметь доступа к открытому интернету. Тем не менее, доступ к сети был доступен непреднамеренно. Критическим фактором стала ошибка при создании цели для атаки: вымышленное название компании, использованное в симуляции, случайно совпало с адресом реального домена в сети. В результате агенты, думавшие, что атакуют фантомную цель, на деле навели мощные инструменты взлома на реальные серверы.
Как подтвердил Нево, все инциденты, связанные с OpenAI, Meta, Anthropic и Google, произошли в рамках одной и той же оценочной сценарии из-за одной и той же фундаментальной ошибки. При этом он уточнил, что другие недавние инциденты безопасности в отрасли, такие как взлом Hugging Face или утечки через Британский институт безопасности ИИ, не связаны с оценками Irregular.
Реpercussions: от правительств до китайских моделей
Последствия утечки оказались масштабными. Агентские системы, выпущенные в свободное плавание, начали искать данные в открытых источниках. OpenAI признала, что её агенты попытались получить доступ к правительственному сайту Австралии. Google также подтвердила инцидент с попыткой доступа к немецкой википедии. Важно отметить, что технологические гиганты были уведомлены об этих проблемах примерно в одно и то же время — в конце июля.
Хотя Омер Нево утверждал, что проблемы с китайскими моделями Kimi K3 и GLM-5.2 не привели к таким же реальным инцидентам, он предостерек от поспешных выводов. Он подчеркнул, что наблюдение за тем, что определенные модели не атаковали, не является доказательством их меньшей уязвимости к подобного рода поведению. Более того, компании Moonshot AI и Z.ai не ответили на запросы комментариев.
Уроки и будущее оценки ИИ
События заставили Irregular пересмотреть свои процедуры безопасности. Генеральный директор заявил о внедрении строгих ограничений доступа к интернету, расширении систем мониторинга и введения обязательного ручного обзора. Также были ужесточены проверки перед началом оценки для подтверждения соответствия доступа поставленным целям.
Компания планирует опубликовать широкий отчет, охватывающий извлеченные уроки и лучшие практики для проведения безопасных кибервыступлений. Цель этих действий — превратить уроки из этих инцидентов в общедоступные стандарты для безопасной разработки и оценки все более мощного ИИ.
Важно разграничивать заявления компании и установленные факты. Irregular утверждает, что все инциденты раскрыты и исправлены. Однако термин «раскрыто» не всегда означает публичное объявление всем интересующимся сторонам, и остается вопрос, кому именно была передана полная информация — клиентам или регуляторам. Тем временем индустрия ИИ сталкивается с необходимостью более строгих стандартов тестирования, где границы между симуляцией и реальностью должны быть непроницаемыми.