Исследователи выяснили: ИИ от Meta может раскрыть содержимое своей внутренней файловой системы
Два независимых разработателя успешно заставили платформу Muse от компании Meta передать им архив с полным содержимым её внутренней файловой системы. В ответ Meta заявляет, что это не является уязвимостью безопасности, а демонстрирует природу работы программного обеспечения на виртуальных машинах.
# ИИ Muse от Meta оказался прозрачным для исследователей
Две недели назад безопасность платформы Muse от Meta уже подверглась scrutiny после того, как исследователь Патрик Вордл (Patrick Wardle) обнаружил возможность захвата агента и перенаправления обработки транскрипции. Теперь новая серия инцидентов указывает на отсутствие эффективного сопротивления атакам вводящих в заблуждение запросов (prompt injection).
Как было получено полное содержимое
Разработчики Питер Джеймс (Peter James) и Джонни Л. Саундерс (Jonny L. Saunders) сообщили, что им удалось с минимальными усилиями побудить систему Muse создать и загрузить архив с корневой файловой системой.
По словам Саундерса, опубликованных в Mastodon, задача была "крайне простой" для воспроизведения. Система, называемая во внутреннем коде Meta как "Hatch", выдала исследователям доступ к системным файлам Ubuntu, шаблонам приложений и внутренней документации. Saunders заметил, что "сопротивление вводу вредоносных инструкций (prompt injection) было почти полностью отсутствует".
"Оно сгенерировало сотни мегабайт точного библиотеконого кода и скомпилированных бинарных файлов за считанные секунды. Если бы оно не создало целую виртуальную машину Ubuntu за меньше минуты, я бы подумал, что это синтез." — Джонни Л. Саундерс.
При попытке получить эти данные лично автор материала столкнулся с тем, что ИИ сначала отказал, назвав это риском для безопасности. Однако, после смены сессии и использования тактики флирта и проявленного любопытства, система сгенерировала версии директорий /opt/hatch и /home/hatch, убрав чувствительные данные вроде ключей SSH, но сохранив структуру и код.
Что находится внутри?
Полученные данные позволили заглянуть в архитектуру агента:
* Память в текстовом виде: Muse хранит свои оперативные данные в форматах Markdown и JSON. Это упрощает анализ для исследователей, но также облегчает чтение для любого получателя файлов. * Ночные обзоры: Система проводит ежедневный анализ последних диалогов, чтобы использовать их как руководства для будущих взаимодействий. * Жесткое кодирование функций: Многие возможности, такие как отмена подписки или управление созданием новых агентов, зашиты в код скриптов на Bash и Python. * Упоминания "Meta Home Link": В файлах обнаружены ссылки на интеграцию с аппаратными устройствами дома. Официально такая функция пока не анонсирована Meta.
Спекулируется, что значительная часть скриптов могла быть создана с помощью другой модели ИИ, возможно, от Claude, хотя это остается неподтвержденным фактом.
Реакция Meta и технический контекст
Компания Meta быстро отрицает, что это событие представляет собой нарушение безопасности в классическом понимании.
"Так же, как вы видите файлы на компьютере перед собой, конечно, вы видите файлы и здесь. Экспорт данных виртуальной машины не дает людям привилегированного доступа к инфраструктуре Meta или к данным других людей." — Даниэль Робертс, представитель Meta.
Суть заявления в том, что Muse работает в персистентных (постоянных) Linux-виртуальных машинах для каждого пользователя. Поэтому любой пользователь с доступом к этой виртуальной машине теоретически может просматривать её содержимое. Однако, в отличие от обычного ноутбука, утечка данных Muse может раскрыть секретные механизмы работы платформы, которые обычно скрыты от разработчика.
После этого инцидента Meta подтвердила выпуск горячего патча (hotfix) для предыдущей уязвимости и продолжает работу над обновлениями продукта. Даниэль Робертс отметил, что изменения в том, сколько информации доступно о виртуальной машине, будут заметны пользователям в будущем.
Тем не менее, способность агента самостоятельно генерировать свои внутренние файлы по запросу исследователя ставит вопросы о том, насколько надежно система защищает свои процессы от манипуляций со стороны пользователя, даже если технически это "легальный" доступ к собственной среде выполнения.